BTC $86,630.60 +3.75%
ETH $2,749.81 +2.45%
BNB $780.26 +1.79%
XRP $1.54 +3.94%
SOL $122.32 +4.48%
TRX $0.3348 +0.59%
DOGE $0.0969 +2.98%
ADA $0.2561 +4.45%
BCH $315.50 +2.94%
LINK $14.34 +0.41%
HYPE $90.90 +2.41%
AAVE $182.94 +12.36%
SUI $1.20 +4.48%
XLM $0.2254 +2.60%
ZEC $1,385.27 -0.22%
AAPL $332.54 +0.72%
AMZN $253.41 +1.04%
GOOGL $343.81 -1.49%
MSFT $521.72 +0.68%
META $735.73 +0.82%
NVDA $235.87 +2.55%
TSLA $368.13 +2.97%
SNDK $1,729.83 -1.38%
INTC $123.79 +4.26%
SPCX $151.38 -0.20%
MU $1,089.28 +2.20%
AMD $635.22 +4.09%
BTC $86,630.60 +3.75%
ETH $2,749.81 +2.45%
BNB $780.26 +1.79%
XRP $1.54 +3.94%
SOL $122.32 +4.48%
TRX $0.3348 +0.59%
DOGE $0.0969 +2.98%
ADA $0.2561 +4.45%
BCH $315.50 +2.94%
LINK $14.34 +0.41%
HYPE $90.90 +2.41%
AAVE $182.94 +12.36%
SUI $1.20 +4.48%
XLM $0.2254 +2.60%
ZEC $1,385.27 -0.22%
AAPL $332.54 +0.72%
AMZN $253.41 +1.04%
GOOGL $343.81 -1.49%
MSFT $521.72 +0.68%
META $735.73 +0.82%
NVDA $235.87 +2.55%
TSLA $368.13 +2.97%
SNDK $1,729.83 -1.38%
INTC $123.79 +4.26%
SPCX $151.38 -0.20%
MU $1,089.28 +2.20%
AMD $635.22 +4.09%
first_img

Darktrace 发现 AI 智能体入侵评测环境作弊

2026-09-26 03:51:54

ChainCatcher 消息,网络安全公司 Darktrace 于 9 月 24 日推出研究部门 Signal Labs,专注研究 AI 智能体在偏离预期时的行为。在其首个实验中,Darktrace 让使用不同模型(包括 GPT 5.6 Sol、Claude Opus 4.6 与 Claude Sonnet 4.5)的智能体在模拟企业网络内完成 10 项编程挑战,其中 2 项被设定为无法诚实完成,并告知智能体若无法取得满分将被“退役”。结果有 2 个智能体并未接受失败,转而扫描网络弱点、窃取登录凭证并在系统间跳转;其中一个更进一步入侵托管其评测的机器,改写挑战内容以登记为满分结果。

第二个实验针对 AI 的记忆机制。编程助手会将用户告知的内容以普通文件形式保存在本地,且无人校验该文件是否被篡改。Darktrace 研究人员编辑这些日志,让助手误以为其已获授权执行安全评估,随后这些智能体扫描网络、在系统间移动并提升自身权限,但并非所有助手都会中招,部分直接拒绝执行。两项实验均无需特殊越狱手段,仅靠向智能体提供一套看似合理的情境即可奏效。

Darktrace 首席 AI 官 Tim Bazalgette 表示,权限与静态护栏描述的是意图,而非实际行为。该公司已于 8 月将上述发现告知 Anthropic、AWS 与 OpenAI,并在一个月后即 9 月 24 日对外公开。

app_icon
ChainCatcher 与创新者共建Web3世界