人工智能技术飞速发展,企业在开发生成式人工智能模型时,如何负责任地收集和使用个人资料,已成为数据治理领域的重要课题,尤其是在涉及网络数据抓取,或对原本并非为生成式人工智能用途而收集的数据进行重新利用时。

为此,个人资料保护委员会星期一(7月20日)发布《生成式人工智能个人资料使用咨询指导原则》,为企业在开发人工智能(AI)模型过程中应履行的数据保护责任提供明确指引。

1)开发生成式AI模型时,企业使用个人资料一定要征求用户同意吗?

不一定。由于开发生成式AI模型需要大量数据支持,网络数据抓取(web scraping)可以自动提取大量线上公开信息,是企业整理和建立数据集的常见方式。

根据《个人资料保护法令》,开发生成式AI模型的机构可依据“公开可获取资料例外”(Publicly Available Exception)原则,在无须取得当事人同意的情况下,通过网络数据抓取收集公开可获取的个人资料,用于模型开发。

不过,若个人资料设有数码访问限制,例如付费墙或用户注册要求,企业则须谨慎评估有关资料是否仍属于“公开可获取资料”范畴。当将个人资料用于生成式AI模型开发且“公开可获取资料例外”原则不适用 ,企业须向用户发出“AI专属通知”(AI-Specific Notifications)并征得同意。

延伸阅读

特定情况下使用个资训练生成式AI模型 企业须先征求用户同意
特定情况下使用个资训练生成式AI模型 企业须先征求用户同意
国际学校学生和家长资料或外泄 个人资料保护委员会将展开调查
国际学校学生和家长资料或外泄 个人资料保护委员会将展开调查

2)什么是AI专属通知?

AI专属通知的内容不必过于技术化或详尽,但须清楚说明个人资料使用目的、拟使用的数据类型和方式,以及用户如何拒绝或撤回同意。

指导原则强调,这项要求在生成式AI领域尤为关键,因为模型一旦完成训练,后续修正空间有限,且生成式AI模型可能被广泛应用于不同场景。

因此,个人有理由担心某些较为敏感的资料,例如儿童信息、健康数据或信用记录,可能在模型中被暴露、重建(reconstructed)或向第三方披露;又或者个人资料被用于其未曾预料的用途。

3)企业发出AI专属通知后,用户是否必须同意?

不是。企业不得以提供产品或服务为条件,要求用户必须同意其个人资料被用于生成式AI模型开发。

此外,指导原则鼓励各企业在开发生成式AI模型时,尽可能对数据集进行匿名化处理,并遵循数据最小化原则,以降低不必要的数据保护风险。