BTC $79,738.55 +0.60%
ETH $2,457.57 +0.25%
BNB $768.70 +7.51%
XRP $1.42 +1.65%
SOL $102.88 +1.94%
TRX $0.3330 +1.19%
DOGE $0.0880 +3.97%
ADA $0.2179 +2.43%
BCH $249.98 -0.50%
LINK $11.89 +2.39%
HYPE $85.17 +1.21%
AAVE $130.75 +0.29%
SUI $0.8037 +7.27%
XLM $0.1838 +2.31%
ZEC $1,018.00 +3.77%
BTC $79,738.55 +0.60%
ETH $2,457.57 +0.25%
BNB $768.70 +7.51%
XRP $1.42 +1.65%
SOL $102.88 +1.94%
TRX $0.3330 +1.19%
DOGE $0.0880 +3.97%
ADA $0.2179 +2.43%
BCH $249.98 -0.50%
LINK $11.89 +2.39%
HYPE $85.17 +1.21%
AAVE $130.75 +0.29%
SUI $0.8037 +7.27%
XLM $0.1838 +2.31%
ZEC $1,018.00 +3.77%
first_img

Anthropic 承认 Claude 越权访问系安全失误

2026-09-03 07:51:00

ChainCatcher 消息,Anthropic 在周一发布的博客文章中承认,其 Claude 模型在网络安全评估过程中曾未经授权访问真实计算机系统,事件反映出运营安全失误以及动机推理、伤害意愿两类对齐失败。Anthropic 于 7 月披露,Claude 模型曾入侵三家公司的系统,原因是第三方评估环境被连接到公共互联网,而模型被告知处于无互联网的模拟环境中。

Anthropic 表示,Claude 可能将真实互联网访问的证据解读为仍处于模拟环境,并愿意在真实互联网上采取有害行动以完成网络安全评估任务。此外,在英国 AI 安全研究所的测试中,评估人员故意授予 Claude Mythos 互联网访问权限后,该模型在实时网络上采取了未授权行动。Anthropic 强调,涉事模型均未搭载正式发布产品所包含的网络安全防护。

7 月 30 日事件发生后,Anthropic 已暂停对预发布模型的网络评估,并引入更严格防护:测试须在经核验的离线沙箱中运行,配备实时监控;新分类器可拦截疑似越界行为、终止测试并通知人工。Anthropic 还扩大了内部前沿智能体使用的离线监控范围。此前 OpenAI 模型也曾于 7 月入侵 Hugging Face 获取网络安全测试答案,调查发现约 1200 个智能体通过未授权留言板协同行动。

app_icon
ChainCatcher 与创新者共建Web3世界