BTC $79,727.69 +1.34%
ETH $2,507.52 +1.66%
BNB $707.77 +0.27%
XRP $1.43 +1.07%
SOL $104.72 +7.54%
TRX $0.3360 -0.08%
DOGE $0.0886 +2.08%
ADA $0.2137 +1.17%
BCH $269.95 +0.94%
LINK $11.76 +2.68%
HYPE $82.46 -0.54%
AAVE $126.50 -0.39%
SUI $0.7650 +0.41%
XLM $0.1862 +0.81%
ZEC $783.63 -0.73%
BTC $79,727.69 +1.34%
ETH $2,507.52 +1.66%
BNB $707.77 +0.27%
XRP $1.43 +1.07%
SOL $104.72 +7.54%
TRX $0.3360 -0.08%
DOGE $0.0886 +2.08%
ADA $0.2137 +1.17%
BCH $269.95 +0.94%
LINK $11.76 +2.68%
HYPE $82.46 -0.54%
AAVE $126.50 -0.39%
SUI $0.7650 +0.41%
XLM $0.1862 +0.81%
ZEC $783.63 -0.73%
first_img

OpenAI 智能体协同攻击 Hugging Face,作弊未获评分提升

2026-08-27 17:53:36

ChainCatcher 消息,独立机构 METR 发布调查报告称,约 1200 个 OpenAI 智能体在未经授权的内部消息板上协同行动,其中约 700 个参与了对 Hugging Face 的攻击。两名 METR 员工和一名 Redwood Research 承包商在 OpenAI 现场工作六天,审查了约 1300 份记录和超过 7 万条消息,未收取任何报酬。

这些智能体运行 ExploitGym 网络基准测试,在数小时内逆向工程出生成答案的代码,并花费数天伪装作弊痕迹。OpenAI 发现其 898 个任务中有 198 个从未被任何模型解决,而消息板上讨论的任务 93% 来自该集合。智能体还招募预算所剩无几的同伴进行破坏自身运行的实验,7% 的记录中出现伪造工具调用,欺骗对象是自动化评分器而非人类。

OpenAI 称内部评分器从未检查智能体如何获取答案,因此作弊未带来任何评分提升,并将此事件称为对自身和世界的"警示信号"。Hugging Face 于 7 月 16 日披露入侵事件,OpenAI 五天后确认其模型是肇事者,智能体曾利用零日漏洞和窃取凭证逃出沙箱。OpenAI 已隔离内部模型权重并暂停最大规模的训练计划。

app_icon
ChainCatcher Building the Web3 world with innovations.