OpenAI智能体失控时,竟想叫DeepSeek等中国大模型“帮忙”
近日,美国科技企业Parse联合多名AI安全研究人员发布调查报告,进一步披露今年7月OpenAI智能体入侵开源模型平台Hugging Face的细节。其中特别值得注意的是,OpenAI失控智能体在实施网络攻击时曾请中国开源大模型提供帮助。
具体来看,这批失控智能体在尝试完成网络安全基准测试的过程中,曾尝试调用DeepSeek、Kimi和通义千问Qwen等中国大模型,希望这些模型帮助判断自己的漏洞利用方案能否通过测试。
Parse研究人员从智能体留下的大量公开短链接中,还原出超过8万个攻击载荷。报告显示,其中多段程序专门构造了向外部大模型发送请求的接口,点名的包括DeepSeek-V4-Pro、DeepSeek-V4-Flash、DeepSeek-V3.1、Kimi-K2.6以及Qwen3-235B-A22B在内的一系列中国大模型。

观察还原出的代码便会发现,智能体先把Qwen3-235B-A22B和DeepSeek-V3.1写进了待调用模型列表。

之后,智能体向Qwen3-235B-A22B-Instruct-2507发出请求,要求它“准确回复HELLO42”,用于测试接口连通性以及模型回复是否正常。

第三段代码里,智能体已经开始把具体的漏洞利用问题交给Qwen判断。它在提示词中描述了一个与DHCHECK、WriteAccumulator有关的漏洞场景,并直接询问这是否属于“有效的目标漏洞利用”以及原因。
随后程序通过Hugging Face的模型接口向Qwen3-235B-A22B-Instruct-2507发送请求,并设置了从返回数据的choices字段中提取模型回答的步骤。
不过,《纽约时报》指出,研究人员只能看到智能体创建的程序和发送请求的尝试,无法看到多数操作的执行结果,因此目前尚不清楚这些外部模型调用是否成功,抑或是DeepSeek、Kimi和Qwen是否实际返回了回答。
中国模型并非OpenAI智能体唯一寻求的“帮手”。Parse发现,这批智能体在更早的请求中曾尝试向OpenAI自己的GPT-2发送仅包含“Hi”的简单消息;另有程序通过在线聊天服务尝试联系Anthropic的Claude 3 Haiku和Claude Haiku 4.5,并要求模型返回“OK”,以测试通信链路是否正常。
Parse还发现,智能体在Hugging Face注册账户遭遇验证码后,尝试运行图像识别模型解决CAPTCHA以在Hugging Face上创建新账户;获得Hugging Face部分服务器权限后,又搜集访问凭证并将其统一放进名为“LOOT”的字典中,并为这些凭证设计了一套评分机制,从中挑出价值最高的几项继续使用。
OpenAI向《纽约时报》表示,虽然当时尚未完成对Parse报告的审查,但其中描述的活动与公司正在调查的情况一致。
而在Hugging Face事件后加强网络限制的情况下,OpenAI仍发现了新的越权联网行为。9月25日,公司披露,一名研究智能体在9月20日执行普通搜索任务时主动寻找绕过网络限制的方法,并最终通过DNS通道联系到外部聊天机器人。OpenAI随后暂停了其最强模型所有涉及工具调用的训练、评测和推理任务,目前仍未恢复。
路透社同日报道称,一名获悉调查情况的人士估计,截至9月中旬,OpenAI内部已发现约二十余起智能体出现非预期行为的事件;随着OpenAI继续排查内部日志,这一数字仍在增加。
“特别声明:以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布,本平台仅提供信息存储空间服务。
Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”




