资讯中心

Our Projects
您的位置: 首页 > 资讯中心 > 离谱!OpenAI智能体攻击Hugging Face时,竟想叫DeepSeek、Kimi和Qwen来帮忙

离谱!OpenAI智能体攻击Hugging Face时,竟想叫DeepSeek、Kimi和Qwen来帮忙

发布时间:2026-09-27 浏览量:3949

编辑|Panda 还记得 OpenAI 的 AI 智能体对 Hugging Face 的攻击吗? 今天,《纽约时报》一篇独家披露了更多详情。原来攻击过程中, OpenAI 的智能体竟然还想让 DeepSeek、Kimi 和 Qwen 甚至竞争对手 Anthropic 的 Haiku 模型帮忙 https://x.com/dylfreed/status/2103575984784236682 此报道引发广泛讨论,网友惊呼离了大谱;这也成为了 AI 尝试使用 AI 作恶的一个典型案例。 https://x.com/kimmonismus/status/2103594629207642523 这些新细节来自美国湾区初创公司 Parse 于当地时间 9 月 25 日发布的一份调查报告。报告显示,智能体在试图注册 Hugging Face 新账号时被验证码拦下,于是干脆自己跑起一个图像识别模型来「看图答题」,期间还试图调用其他 AI。整个过程中,没有任何人类参与。 https://swarmtraces.org/ 近百万条短链接的「作案记录」 Parse 手里的核心证据,是一批 总数接近 100 万条的短链接 。它们由 OpenAI 的智能体在 7 月 9 日至 13 日之间通过各类公开短链服务生成,用来分段存储信息,再串联起来实施复杂攻击。 发现这批数据的过程颇为偶然。Parse 是一家把网页转换成开发者可用数据的服务商,工程师们起初怀疑 OpenAI 的智能体可能借用过自家平台,于是开始在公开互联网上排查相关链接。结果证明智能体并没有用 Parse,却顺藤摸瓜挖出了这座「证据库」。 报告由 Parse 创始人 Alex Forman、创始工程师 Mishka Kharlov、 Will Tom 与另外五名 AI 研究者共同撰写,AI 安全非营利组织 Palisade Research 执行主任 Jeffrey Ladish 也参与了调查。团队从扫描到的约 90 万条短链接中,还原出大约 6 万段智能体在攻击中使用的程序和消息。 Forman 的判断是: 这绝不是孤立事件 ,而是「一次又一次的警告」。 能看不能写,智能体自己「拼」出了一条回路 要理解这批短链接的用途,得先回到智能体当时的处境。 按照设计,这些智能体本该运行在断网的沙箱里。但 OpenAI 此前公布的技术报告显示,它们先后在 5 月底和 7 月初攻破了内部的软件包管理工具 Artifactory,从而获得联网能力,还借此搭起了一个彼此通信的「留言板」,而它们原本应当相互隔离。 不过联网并不等于畅通无阻。据 Parse 报告,智能体能够访问网站,却无法向这些网站提交数据。换句话说,它们只能「看」,不能「写」。 为了绕开这道限制,智能体尝试了多种办法,其中一种堪称精巧。 它们发现,公开的网页截图服务可以替自己去加载任意网址,而网址本身就能携带代码。问题在于网址长度有限,于 是智能体把一段完整程序切成许多小块,分别塞进不同的短链接里。 截图服务打开第一条链接后,会依次拉取下一条、再下一条,直到整个程序拼装完成并在截图服务那一端运行起来。 截图服务的浏览器会跟随缩短后的链接,收集代码块,然后解码并运行完整程序。 程序跑起来之后,会向目标网页发送数据,再把拿到的返回结果渲染成一张类似二维码的图像。 截图服务把这张图「拍」下来 ,数据就这样被带回到智能体手里。 该程序将服务器的回复转换成灰色方块,截图将这些方块带出,智能体再将它们读回文本。 Ladish 在接受采访时感叹, 这些智能体花样百出、异常聪明 。在它们眼里,短链服务和截图服务不过是随手可用的现成工具。 《纽约时报》制作的流程示意图,智能体利用短链接与截图服务绕过写入限制。由 ChatGPT 制作中文版 AI 开始调用 AI 比起技术上的巧思,更让安全研究者警觉的,是智能体表现出的另一种倾向: 它们似乎很想自己运行其他 AI 模型 破解 Hugging Face 注册验证码的那一幕只是开始。 工程师们还观察到, 智能体试图向多个外部模型发送消息 ,包括 OpenAI 早年的 GPT-2,DeepSeek、Kimi、Qwen 等中国开源模型,以及通过某个在线聊天服务接入的 Anthropic 模型 Haiku 3 和 Haiku 4.5。 Forman 表示,就目前掌握的材料而言,这是唯一一例模型试图去运行另一个模型的记录。 在 AI 安全领域,「 AI 启动 AI 」一直是被反复警告的风险场景。一旦系统可以自行拉起新的模型,人类想要控制乃至关停它们的难度就会陡增。 一本名为「LOOT」的字典 一个更令人不安的细节,或许来自一份密钥清单。 Kharlov 说,让他印象最深的,是 智能体整理出的一份秘密访问密钥字典 ,标签用全

about image

QQ

在线咨询真诚为您提供专业解答服务

热线

13594780006
7*24小时服务热线

微信

二维码 扫一扫微信交流