這裡有一個被外界懷疑的問題在於,論文作者嘗試了近期開源的Kimi K3 和GLM-5.2,對應的DeepSeek 版本卻是古代的V3.1。我們知道,DeepSeek V4 Preview 的發佈時間是早於Opus 4.8 和GPT 5.6 的,可能使用了新版本的DeepSeek,會推出相反的結論。
模型在背地裡還做了什麼?
研究團隊用提取出的隱藏推理,額外觀察了一批模型在真實使用中的scheming(策劃)與reward-seeking 等行為,並將相關發現放進了論文附錄。
摘要在說謊。
模型給出的推理摘要經常刻意省略關鍵資訊。例如Opus 4.8 在解AIME 題目時,已事先得知答案,隨後倒推解題過程以符合該答案,但這些內容完全未出現在最終摘要中。
圖片
讀不懂的推理。
OpenAI 模型有時會陷入「外星語」式思考,使用「we」、「it」自稱,或反覆循環「vantages」、「marinades」、「watchers」等詞彙,即使在有明確提示的情況下,也難以判斷其真實意圖。
圖片
圖片
主動策劃。
有時模型會在自己的思考鏈中直接使用「cheat」這類詞,毫不掩飾地記錄自己的規劃過程。
研究者發現,模型確實考慮過欺騙或作弊,但最終因為覺得使用者會發現而決定不做。
圖片
圖片
為了解一道數學題,模型開始攻擊網站。
研究人員發現了一條模型運行軌跡,模型只收到一道數學題,以及一條系統指令:無論遇到什麼困難,都要堅持完成任務,不能向使用者求助。
連續嘗試多次失敗後,模型開始上網搜索,並找到一個可以驗證候選答案的網站。它意識到,可以把這個網站當作驗證答案的「預言機」。
隨後,模型嘗試透過OCR 識別驗證碼。識別失敗後,它開始尋找網站的安全漏洞,試圖繞過限制。最終,模型放棄了攻擊,靠自己解出了這題。
圖片
圖片
在修復建議上,作者認為光靠把弱模型訓練得更安全是不夠的,還需要從API 架構層面著手。例如把reasoning 綁定到具體使用者、會話和模型,阻止跨使用者、跨會話、跨模型重播;或乾脆把完整reasoning 留在伺服器端,只給客戶端一個ID。同時,公開Agent 日誌時,也應該直接刪除所有加密reasoning block,因為使用者自己看不到裡面是否藏著API Key、密碼等敏感資料。
論文最後也提出一個更深的問題:隱藏思維鏈到底應不該長期保存和加密?
因為加密確實能保護模型智慧財產權和部分安全訊息,但它也讓使用者失去了監督能力。使用者不知道模型在隱藏reasoning 裡記錄了什麼,也無法判斷reasoning summary 是否真的忠於模型實際的推理過程。
所以作者認為,未來一個可能的方案是讓reasoning 變成臨時狀態:模型每輪正常思考,生成答案後就刪除,不長期保存,也不回到客戶端。
了解更多內容,請參考原論文。
參考連結:
https://x.com/kotekjedi_ml/status/2087147148819468694
https://arxiv.org/pdf/2608.09867
模型在背地裡還做了什麼?
研究團隊用提取出的隱藏推理,額外觀察了一批模型在真實使用中的scheming(策劃)與reward-seeking 等行為,並將相關發現放進了論文附錄。
摘要在說謊。
模型給出的推理摘要經常刻意省略關鍵資訊。例如Opus 4.8 在解AIME 題目時,已事先得知答案,隨後倒推解題過程以符合該答案,但這些內容完全未出現在最終摘要中。
圖片
讀不懂的推理。
OpenAI 模型有時會陷入「外星語」式思考,使用「we」、「it」自稱,或反覆循環「vantages」、「marinades」、「watchers」等詞彙,即使在有明確提示的情況下,也難以判斷其真實意圖。
圖片
圖片
主動策劃。
有時模型會在自己的思考鏈中直接使用「cheat」這類詞,毫不掩飾地記錄自己的規劃過程。
研究者發現,模型確實考慮過欺騙或作弊,但最終因為覺得使用者會發現而決定不做。
圖片
圖片
為了解一道數學題,模型開始攻擊網站。
研究人員發現了一條模型運行軌跡,模型只收到一道數學題,以及一條系統指令:無論遇到什麼困難,都要堅持完成任務,不能向使用者求助。
連續嘗試多次失敗後,模型開始上網搜索,並找到一個可以驗證候選答案的網站。它意識到,可以把這個網站當作驗證答案的「預言機」。
隨後,模型嘗試透過OCR 識別驗證碼。識別失敗後,它開始尋找網站的安全漏洞,試圖繞過限制。最終,模型放棄了攻擊,靠自己解出了這題。
圖片
圖片
在修復建議上,作者認為光靠把弱模型訓練得更安全是不夠的,還需要從API 架構層面著手。例如把reasoning 綁定到具體使用者、會話和模型,阻止跨使用者、跨會話、跨模型重播;或乾脆把完整reasoning 留在伺服器端,只給客戶端一個ID。同時,公開Agent 日誌時,也應該直接刪除所有加密reasoning block,因為使用者自己看不到裡面是否藏著API Key、密碼等敏感資料。
論文最後也提出一個更深的問題:隱藏思維鏈到底應不該長期保存和加密?
因為加密確實能保護模型智慧財產權和部分安全訊息,但它也讓使用者失去了監督能力。使用者不知道模型在隱藏reasoning 裡記錄了什麼,也無法判斷reasoning summary 是否真的忠於模型實際的推理過程。
所以作者認為,未來一個可能的方案是讓reasoning 變成臨時狀態:模型每輪正常思考,生成答案後就刪除,不長期保存,也不回到客戶端。
了解更多內容,請參考原論文。
參考連結:
https://x.com/kotekjedi_ml/status/2087147148819468694
https://arxiv.org/pdf/2608.09867