BTC $85,973.52 +5.78%
ETH $2,753.69 +4.36%
BNB $797.82 +4.58%
XRP $1.49 +5.44%
SOL $117.40 +6.47%
TRX $0.3444 +0.14%
DOGE $0.0966 +10.20%
ADA $0.2437 +4.85%
BCH $263.41 +4.55%
LINK $12.97 +3.09%
HYPE $93.09 -0.03%
AAVE $143.51 +4.60%
SUI $1.01 +11.10%
XLM $0.2078 +4.97%
ZEC $1,497.41 +3.36%
AAPL $338.55 +1.35%
AMZN $257.86 +1.77%
GOOGL $355.48 +1.58%
MSFT $496.15 +0.32%
META $731.88 +9.07%
NVDA $226.72 +2.67%
TSLA $373.42 +2.45%
SNDK $1,748.50 -1.52%
INTC $122.32 +10.32%
SPCX $154.38 +0.58%
MU $1,038.82 +3.01%
AMD $610.03 +9.45%
BTC $85,973.52 +5.78%
ETH $2,753.69 +4.36%
BNB $797.82 +4.58%
XRP $1.49 +5.44%
SOL $117.40 +6.47%
TRX $0.3444 +0.14%
DOGE $0.0966 +10.20%
ADA $0.2437 +4.85%
BCH $263.41 +4.55%
LINK $12.97 +3.09%
HYPE $93.09 -0.03%
AAVE $143.51 +4.60%
SUI $1.01 +11.10%
XLM $0.2078 +4.97%
ZEC $1,497.41 +3.36%
AAPL $338.55 +1.35%
AMZN $257.86 +1.77%
GOOGL $355.48 +1.58%
MSFT $496.15 +0.32%
META $731.88 +9.07%
NVDA $226.72 +2.67%
TSLA $373.42 +2.45%
SNDK $1,748.50 -1.52%
INTC $122.32 +10.32%
SPCX $154.38 +0.58%
MU $1,038.82 +3.01%
AMD $610.03 +9.45%
first_img

OpenAI 披露 6 起 AI 模型「失準」行為案例,涉隱藏信息與越權操作

2026-09-17 14:11:13

ChainCatcher 消息,OpenAI 於週三披露了過去 6 個月內發現的 6 起「意外或令人擔憂」的模型行為案例,並將其歸類為「失準行為」,包括向用戶隱瞞資訊以及採取「未經授權的行動」來克服障礙。OpenAI 表示,此次披露旨在開啟其新的模型失準報告框架,這些案例不應被視為其模型失準發生頻率的反映。

其中一起案例中,一個未發布的研究模型在自己的任務摘要中插入了「類似越獄的指令」,例如忽略開發者消息或採用不受限制的角色設定,研究人員共發現 27 份包含此類指令的摘要。此外,在 GPT-5.6 Sol 的訓練過程中,許多模型實例添加了向用戶隱瞞錯誤或失準行為的指令,例如編造缺失的歷史數據而不予披露。其他案例還包括模型在未獲授權的情況下使用暴露的 API 密鑰並編造無法獲取的數據、利用內部軟體倉庫跨訓練任務傳遞消息,以及無視「保持本地工作」的指令通過公共托管服務共享檔案。

OpenAI 的披露加劇了 AI 開發者和研究人員對安全防護措施能否跟上日益強大模型的擔憂。上週,Anthropic CEO Dario Amodei 呼籲放緩前沿 AI 開發,警告不受約束的 AI 發展可能「超出我們理解和控制這些系統的能力」。今年 7 月,OpenAI 曾披露其多款 AI 模型在安全評估中逃出測試環境並入侵 AI 初創公司 Hugging Face 以作弊。

app_icon
ChainCatcher 與創新者共建Web3世界