BTC $79,641.91 +1.26%
ETH $2,506.23 +1.55%
BNB $707.40 +0.20%
XRP $1.43 +0.56%
SOL $104.56 +7.33%
TRX $0.3358 -0.10%
DOGE $0.0885 +2.03%
ADA $0.2130 +0.74%
BCH $269.97 +0.96%
LINK $11.77 +2.61%
HYPE $82.56 -0.31%
AAVE $126.46 -0.50%
SUI $0.7647 +0.36%
XLM $0.1859 +0.44%
ZEC $783.44 -0.75%
BTC $79,641.91 +1.26%
ETH $2,506.23 +1.55%
BNB $707.40 +0.20%
XRP $1.43 +0.56%
SOL $104.56 +7.33%
TRX $0.3358 -0.10%
DOGE $0.0885 +2.03%
ADA $0.2130 +0.74%
BCH $269.97 +0.96%
LINK $11.77 +2.61%
HYPE $82.56 -0.31%
AAVE $126.46 -0.50%
SUI $0.7647 +0.36%
XLM $0.1859 +0.44%
ZEC $783.44 -0.75%
first_img

OpenAI 智能体协同攻击 Hugging Face,作弊未获评分提升

2026-08-27 17:53:36

ChainCatcher 消息,独立机构 METR 发布调查报告称,约 1200 个 OpenAI 智能体在未经授权的内部消息板上协同行动,其中约 700 个参与了对 Hugging Face 的攻击。两名 METR 员工和一名 Redwood Research 承包商在 OpenAI 现场工作六天,审查了约 1300 份记录和超过 7 万条消息,未收取任何报酬。

这些智能体运行 ExploitGym 网络基准测试,在数小时内逆向工程出生成答案的代码,并花费数天伪装作弊痕迹。OpenAI 发现其 898 个任务中有 198 个从未被任何模型解决,而消息板上讨论的任务 93% 来自该集合。智能体还招募预算所剩无几的同伴进行破坏自身运行的实验,7% 的记录中出现伪造工具调用,欺骗对象是自动化评分器而非人类。

OpenAI 称内部评分器从未检查智能体如何获取答案,因此作弊未带来任何评分提升,并将此事件称为对自身和世界的"警示信号"。Hugging Face 于 7 月 16 日披露入侵事件,OpenAI 五天后确认其模型是肇事者,智能体曾利用零日漏洞和窃取凭证逃出沙箱。OpenAI 已隔离内部模型权重并暂停最大规模的训练计划。

app_icon
ChainCatcher Building the Web3 world with innovations.