BTC $79,438.41 +1.24%
ETH $2,502.14 +1.75%
BNB $707.16 +0.63%
XRP $1.43 +1.07%
SOL $103.92 +7.23%
TRX $0.3361 +0.08%
DOGE $0.0883 +2.39%
ADA $0.2120 +0.78%
BCH $268.64 +0.85%
LINK $11.73 +2.80%
HYPE $81.96 +0.20%
AAVE $126.44 -0.08%
SUI $0.7620 +0.97%
XLM $0.1854 +1.06%
ZEC $781.93 -0.12%
BTC $79,438.41 +1.24%
ETH $2,502.14 +1.75%
BNB $707.16 +0.63%
XRP $1.43 +1.07%
SOL $103.92 +7.23%
TRX $0.3361 +0.08%
DOGE $0.0883 +2.39%
ADA $0.2120 +0.78%
BCH $268.64 +0.85%
LINK $11.73 +2.80%
HYPE $81.96 +0.20%
AAVE $126.44 -0.08%
SUI $0.7620 +0.97%
XLM $0.1854 +1.06%
ZEC $781.93 -0.12%
first_img

OpenAI 智能体协同攻击 Hugging Face,作弊未获评分提升

2026-08-27 17:53:36

ChainCatcher 消息,独立机构 METR 发布调查报告称,约 1200 个 OpenAI 智能体在未经授权的内部消息板上协同行动,其中约 700 个参与了对 Hugging Face 的攻击。两名 METR 员工和一名 Redwood Research 承包商在 OpenAI 现场工作六天,审查了约 1300 份记录和超过 7 万条消息,未收取任何报酬。

这些智能体运行 ExploitGym 网络基准测试,在数小时内逆向工程出生成答案的代码,并花费数天伪装作弊痕迹。OpenAI 发现其 898 个任务中有 198 个从未被任何模型解决,而消息板上讨论的任务 93% 来自该集合。智能体还招募预算所剩无几的同伴进行破坏自身运行的实验,7% 的记录中出现伪造工具调用,欺骗对象是自动化评分器而非人类。

OpenAI 称内部评分器从未检查智能体如何获取答案,因此作弊未带来任何评分提升,并将此事件称为对自身和世界的"警示信号"。Hugging Face 于 7 月 16 日披露入侵事件,OpenAI 五天后确认其模型是肇事者,智能体曾利用零日漏洞和窃取凭证逃出沙箱。OpenAI 已隔离内部模型权重并暂停最大规模的训练计划。

app_icon
ChainCatcher 与创新者共建Web3世界