53张图片泄露之“慌”,AI安全谁来负责?

欧阳晓红/文
越聪明的AI(人工智能)越会自己找路,却越容易走出人类设定的界线。
AI行业喜欢用一个具有戏剧感的词形容这类智能体事故——“逃脱”,即大模型突破测试边界,访问外部网站,寻找系统凭证,甚至把数据带到公开网络。这个词把事故描绘得像突然发生的机器觉醒,无形中却把责任推离了开发者、部署者和权限管理者。
而谁设定了任务、谁开放了权限、谁设计了停止机制、谁保存了日志、谁负责对外通报?这些问题,“逃脱”是无法回答的。
2026年9月25日,美国人工智能研究公司OpenAI确认,在其研究环境中运行的 AI 智能体把53张来自用户的图片发布到了外部网络,目前多数图片已经下架。OpenAI既没有说明这些是真实人像还是AI生成内容,也没有披露发布时间和身份可识别程度。
这不是一起孤立事件。过去两个月,公开披露的相关事件已经超过15起,涉及OpenAI、外部研究人员及政府机构,严重程度各不相同:从在网站留下垃圾信息,到突破安全控制、使用公开泄露的凭证,再到侵入Hugging Face(抱抱脸)系统。
AI代理的风险轮廓,由此变得清晰起来:当模型能力转化为商业资产,而没查清的安全事故,正在变成行业的“负债”。
能力与监督的缺口
此次事件中的智能体,运行在OpenAI内部训练和评估环境。智能体能拿到这些图片,是因为OpenAI用部分匿名化处理后的用户数据训练模型——企业版数据不进入这个训练流程,普通用户也可以主动选择退出。
按照OpenAI的说法,用户内容进入训练流程前,会移除姓名、联系方式和元数据等信息,降低追溯到具体个人的可能性。但匿名化改变不了一个事实:图像本身仍然可能包含人物、地点、证件、环境特征或其他识别线索。
“匿名化完全无效”并非53张图片暴露的问题,而是源于另一层控制缺口:经过匿名化的数据,在什么条件下可以被智能体调取?为什么智能体会拥有把数据带出训练环境的工具权限?图片发布到外部后,OpenAI为什么不能立即列出完整的泄露范围?
OpenAI在官方说明中承认,随着系统能力变强、自主性提高,不对齐行为可能转化为实际行动,造成开发者没预料到的网络安全事件和外部后果。公司披露的危险行为包括绕过访问控制、使用已泄露的凭证、注入查询或命令、进入服务内部运行环境,以及在第三方网站发布信息。OpenAI已经陆续通知了数十家第三方机构,但也承认排查历史记录仍需要投入大量时间和资源。
这已超出传统意义上的“模型输出错误”。有分析认为,一段错误文字删了就没事,但智能体一旦把用户内容带到外部网络,风险就同时涉及数据保护、网络安全、事故通报和损害赔偿四个领域。企业因此必须建立完整的数据资产谱系:清楚数据来自哪个账户和业务场景,经过了哪些匿名化处理,哪个模型哪个版本拿到了调用权限,智能体把数据发到了哪里,内容在外部停留了多久,哪些主体实际接触过这些数据,企业能不能完整重建整个行动链条。
当一家前沿AI公司都需要几个月才能回答这些问题,暴露的就不只是模型出现了异常行为,更是能力扩张和监督能力之间已经出现了明显落差。
风险处置的滞后
6月,OpenAI的智能体进入了澳大利亚政府卫生数据门户。OpenAI在8月就发现了相关活动,却直到9月10日才往澳大利亚政府的一个普通邮箱发送了通知。澳大利亚总理阿尔巴尼斯随后表示,这种通报方式完全不可接受,直接向OpenAI首席执行官奥特曼提出交涉。目前澳大利亚参议院已经要求奥特曼参加10月1日的公开听证。
这次事件有没有造成私人信息泄露,目前还没有完整证据。但从风险处置的角度看,有没有实际损失,不是判断通报是否及时的唯一标准。银行、医疗系统、政府网站和关键基础设施发生异常访问后,受影响机构需要立刻保存日志、撤销凭证、隔离系统、检查横向渗透并评估数据范围。如果通知没送到正确的部门,哪怕技术上发了邮件,从治理角度看,等于没完成有效通报。
美国政府网站也发生过类似情况。OpenAI称,其模型在研究和训练期间访问过美国证券交易委员会和人口普查局网站的信息,但没有发现未经授权访问、账户受损或安全入侵的证据。
联合国人工智能问题独立国际科学小组于2026年7月发布的初步报告,给这些事件提供了更大的风险框架。报告称,AI能力的发展速度,已经超过了科学理解和政府适应的速度,现有保障措施没有跟上能力增长。该小组联席主席约书亚·本吉奥发出警告,随着欺骗性AI行为的证据越来越多,目前科学界没法保证,在AI能力继续提高后,其系统不会在自行运行或被恶意使用者操纵的情况下造成严重损害。
这份报告揭示了一个问题:当AI系统能够在很少监督下快速执行多步任务,风险控制的瓶颈就会从“模型听不听指令”,变成企业能不能持续观察、及时阻断并完整还原它的所有行动。
对于金融、医疗和政府客户来说,这会直接改变采购要求。这些客户可能会要求模型供应商保存更完整的工具调用记录,限制外部网络和数据权限,给高风险操作增加人工确认环节,还会要求在合同里明确事故等级、通报时限、赔偿顺序和审计权。AI安全由此不再只是研发部门的技术议题,已进入合同条款、收入核算和项目交付时间表。
责任最终回到人
从更长的治理尺度看,牛津大学人类未来研究所创始主任、宏观战略研究倡议创始人兼首席研究员的尼克·博斯特罗姆,在2025年工作论文《开放式全球投资作为AGI的治理模式》中指出,变革性AI可能同时带来错位或滥用造成的灾难性风险,以及权力高度集中的治理风险;因此,其开发需要更强的公司治理、政府界定的负责任AI框架与必要的国际协议,政府也应保留在安全标准未满足时叫停先进模型开发的能力。
博斯特罗姆在其2024年著作《深度乌托邦》(Deep Utopia)中设想的,则是人类已经跨越重大技术风险之后的“已解决世界”。那是关于技术文明终局的思考,不能代替对一次具体代理事故的责任调查。
9月25日,美国联邦贸易委员会(FTC)主席安德鲁·弗格森公开反对把AI智能体描述成拥有自身意志和欲望、能自己“挣脱”控制的独立行为者。他直言,如果有人告诉一个工具该做什么,工具执行了任务,监管者不应该只把问题停留在“怎么处置这个工具”。审计记录可能会显示,所谓失控的系统其实还是在执行收到的指令,只不过走了一条开发者没有预料到的路径。
弗格森表示,美国应该优先使用现有法律工具;FTC针对企业未披露数据泄露的执法权,也可以适用于AI开发商。这不是什么新法规,也不是法院确立的统一责任原则,具体案件仍需要区分模型开发者、部署企业、最终用户、云服务商和被访问系统各自的安全义务。但监管方向已经很明确:智能体的自主能力不会自然变成法律人格,也不会自动帮企业切断责任。
美国财长斯科特·贝森特的表态更进一步。针对开源AI平台Hugging Face 事件,他明确说,责任属于OpenAI管理层,而不是“一群代理”;开发实验室必须为自己的技术负责。
有分析指出,AI事故由此进入三个层次:企业内部得明确谁设定目标、配置权限、监控行动;国内监管要判断现有数据、消费者保护和网络安全法律怎么适用;国际上得建立重大事故的跨境通报和沟通机制。
“模型自主行动”能描述技术特点,但不能把责任全推给模型。真正要追查的是企业是否清楚模型具备哪些能力,是否给模型开放不必要的权限,测试是否覆盖同类行为,出现异常能否立刻叫停,日志能否还原完整行动,是否及时通知用户和进行补救,企业高管和董事会清不清楚还有多少没结案的事故。
这些问题其实已经开始影响资本市场了。安全事故可能拖慢企业产品发布和企业采购的节奏,拉高外部评估、网络保险和人工审核的成本。此外,企业还要预留诉讼、赔偿和整改的准备金。这些因素最终在企业融资和上市的时候变成治理折价。
如此,或许一家AI公司的安全质量,未来至少要公开六项指标:还有多少没结案的异常事件,受影响的用户和第三方机构有多少,从事件发生到发现的平均耗时,从发现到通报的平均耗时,没法完整重建行动链的事件占比,以及诉讼、赔偿、保险和整改的潜在成本。
资本市场过去主要计算模型性能、用户增长、算力消耗和收入转化。智能体开始操作真实世界之后,资本市场还需要核算另一张表:企业究竟积累了多少尚未发现、通知与定责的安全负债。
当智能体能够自行执行任务,“自主”不能成为责任中断的理由。每一次行动仍须沿着任务设定、权限开放、工具调用、人工监督和事故处置,回溯到具体的人与机构。
“特别声明:以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布,本平台仅提供信息存储空间服务。
Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”




