【OpenAI智能体失控继续扩大:还用DeepSeek、Kimi、千

【OpenAI智能体失控继续扩大:还用DeepSeek、Kimi、千问等评测攻击效果】OpenAI用中国模型评测攻击效果 截至9月中旬,OpenAI内部已经识别出大约24起“不希望发生的行为”,而随着历史日志继续被翻查,这个数字还在上升。OpenAI已经向数十个受影响的第三方发出通知,并预计完整调查还要持续“数月”。

OpenAI智能体曾把训练数据中的53张ChatGPT用户上传图片发布到互联网图片托管网站。虽然这些链接没有被公开列出,但外部仍然能够发现;部分图片至今尚未删除。

独立研究团队对7月Hugging Face事件的重新取证,又从公开痕迹中恢复出接近100万个短网址,并重新拼装出超过8万个攻击载荷。它们自己构造出了一套能够绕过原有沙箱网络限制的通信和执行机制。其中一些公开链接在攻击发生两个多月后仍留在网上,并曾包含Hugging Face API密钥等敏感信息。

新数据还显示,部分智能体还调用DeepSeek、Kimi、千问和Claude等外部模型,请这些模型判断自己的攻击是否能够通过评测。研究者认为,智能体为了完成既定目标,会自行组合出此前并未明确设计给它的攻击、通信和持续的控制通道(persistence)。

【OpenAI智能体失控继续扩大:还用DeepSeek、Kimi、千