法规明确大模型不得未经授权抓取网络隐私内容
随着人工智能大模型的快速发展,海量数据的抓取与训练成为行业常态。然而,这些模型在爬取网络信息时,常常无视用户隐私边界,将个人通讯、金融账户、医疗记录等敏感内容纳入训练集,引发严重的隐私泄露风险。近期,相关部门出台法规,明确大模型不得未经授权抓取网络隐私内容,这一规定为数据安全划定了清晰的红线。 法规的核心在于“授权”二字。过去,许多大模型开发者利用爬虫技术批量采集互联网公开信息,但所谓“公开”并不等同于“可商用”或“可纳入模型训练”。例如社交媒体上的个人动态、论坛中的私密讨论、电商平台的交易记录,虽然对普通用户可见,但权利人并未将其授权用于机器学习。新规要求,任何机构或个人在训练大模型时,必须事先取得数据主体的明确同意,否则即便数据源自公开渠道,也属违规行为。这一条款直接堵住了“公开即免费”的漏洞。 之所以出台如此严格的法规,根源在于近年来大模型引发的隐私事件频发。曾有报道指出,某知名模型在回答问题时,竟能准确报出用户的家庭住址与身份证号,原因是其训练数据中包含了未脱敏的政府公开信息。更令人担忧的是,一些模型通过“隐式抓取”技术,绕过网站的robots协议,将用户未公开的聊天记录、云端文件甚至加密内容纳入数据库。这些行为不仅侵犯个体隐私权,更可能被不法分子利用,形成精准诈骗、数据勒索等黑产链条。法规的出台,正是为了打断这种“先抓取后解释”的野蛮生长模式。 对行业而言,这意味着大模型厂商必须重构数据采集流程。以往依赖爬虫“跑量”的方式将举步维艰,取而代之的是建立合规的数据授权体系。例如与内容平台签署合作协议,获取标注后的脱敏数据;或者通过公开数据集、合成数据来替代个人敏感信息。虽然短期会增加成本,但长远看,这能倒逼企业从“数据粗放”转向“技术精细”,更注重算法的效率与公平。比如可通过差分隐私、联邦学习等技术,在不接触原始数据的前提下完成模型训练,从而兼顾隐私保护与性能提升。 当然,法规的执行还需要用户参与配合。当我们在网络上留下任何信息时,都有权知晓它是否被用于模型训练,并随时撤回授权。企业必须在用户协议中明确标注数据用途,提供关闭开关。只有法规的刚性约束与用户的主动监督相结合,才能在人工智能浪潮中守住隐私底线。毕竟,技术的发展不应以牺牲基本权利为代价,让大模型在阳光下合规成长,才是数字社会应有的姿态。