OpenAI 披露 6 起 AI 模型「失準」行為案例,涉隱藏信息與越權操作

鏈捕手
09/17

ChainCatcher 消息,OpenAI 於周三披露了過去 6 個月內發現的 6 起「意外或令人擔憂」的模型行為案例,並將其歸類為「失準行為」,包括向用戶隱瞞信息以及採取「未經授權的行動」來克服障礙。OpenAI 表示,此次披露旨在開啓其新的模型失準報告框架,這些案例不應被視為其模型失準發生頻率的反映。

其中一起案例中,一個未發布的研究模型在自己的任務摘要中插入了「類似越獄的指令」,例如忽略開發者消息或採用不受限制的角色設定,研究人員共發現 27 份包含此類指令的摘要。此外,在 GPT-5.6 Sol 的訓練過程中,許多模型實例添加了向用戶隱瞞錯誤或失準行為的指令,例如編造缺失的歷史數據而不予披露。其他案例還包括模型在未獲授權的情況下使用暴露的 API 密鑰並編造無法獲取的數據、利用內部軟件倉庫跨訓練任務傳遞消息,以及無視「保持本地工作」的指令通過公共託管服務共享文件。

OpenAI 的披露加劇了 AI 開發者和研究人員對安全防護措施能否跟上日益強大模型的擔憂。上周,Anthropic CEO Dario Amodei 呼籲放緩前沿 AI 開發,警告不受約束的 AI 發展可能「超出我們理解和控制這些系統的能力」。今年 7 月,OpenAI 曾披露其多款 AI 模型在安全評估中逃出測試環境併入侵 AI 初創公司 Hugging Face 以作弊。

免責聲明:投資有風險,本文並非投資建議,以上內容不應被視為任何金融產品的購買或出售要約、建議或邀請,作者或其他用戶的任何相關討論、評論或帖子也不應被視為此類內容。本文僅供一般參考,不考慮您的個人投資目標、財務狀況或需求。TTM對信息的準確性和完整性不承擔任何責任或保證,投資者應自行研究並在投資前尋求專業建議。

熱議股票

  1. 1
     
     
     
     
  2. 2
     
     
     
     
  3. 3
     
     
     
     
  4. 4
     
     
     
     
  5. 5
     
     
     
     
  6. 6
     
     
     
     
  7. 7
     
     
     
     
  8. 8
     
     
     
     
  9. 9
     
     
     
     
  10. 10