116頁論文教你「蒸餾」Claude、GPT-5.6:AI社群今天炸了
「這是今年最好的安全論文,幫Anthropic、OpenAI、Google 修了個價值十億美元的大bug。」
圖片
今天,一篇關於前沿大模型安全漏洞的論文,在社群媒體上引發軒然大波。
短短19 小時,已吸引220 萬人圍觀討論。
圖片
論文的核心主張是,各大前沿模型API 存在設計缺陷,原本被加密隱藏的完整思維鏈,可以完整地提取出來。
由於他們拿不到伺服器中的原始明文,無法逐字核對,只能用API 帳單記錄的「思考Token 數」進行長度驗證。
在他們測試的大多數提示詞中,提取出的推理Token 數與API 計費記錄中的思考Token 數基本呈1:1 對應。
這說明,提取結果很可能涵蓋了大部分隱藏推理。
圖片
論文標題:Stealing Reasoning Traces from Proprietary LLM APIs
論文網址:https://arxiv.org/pdf/2608.09867
過去一年,大模型廠商認真藏起模型的「思考過程」。
這是因為完整思維鏈記錄了模型如何拆解問題、嘗試方案、發現錯誤再修正。對競爭對手來說,這些數據的價值遠高於一個最終答案;對模型製造商來說,它也可能暴露安全策略、用戶隱私甚至API Key。
於是,OpenAI、Anthropic、Google 等主要廠商都開始把完整推理過程藏起來。取而代之的是以一種用戶無法直接讀取的加密文字區塊形式傳回給客戶端。
為了在多輪對話中保持上下文連續性,同時避免在伺服器端儲存全部推理狀態所帶來的開銷,客戶端需要在之後的每次API 請求中,把這段加密後的推理區塊重新傳回模型服務商。
這樣的無狀態架構雖然解決了儲存問題,卻也引進了一個關鍵漏洞:
這些加密區塊在同一家模型提供者的生態內部,可以跨不同會話、不同用戶,甚至不同模型完全相容並相互替換。
圖片
加密推理的跨模型相容性(截至2026 年7 月)。表格的行代表產生加密推理區塊的來源模型,列代表接收注入推理區塊的目標模型。 ✓ 表示在這個模型組合中,目標模型能夠讀取並處理被注入的推理內容。 Claude:除Fable 5 產生的推理外,其他模型的推理軌跡可由任意同系列模型重播。 GPT:GPT-5.6 系列可以重播先前所有代際模型所產生的推理軌跡。 Gemini:任意模型產生的推理軌跡都可以注入並重播到其他模型中。
也就是說想偷走最強模型的隱藏思維鏈,甚至不需要攻破最強模型,攻破較弱一點的模型就可以。 Anthropic、OpenAI、Google 全都中招。
強模型嚴防死守,弱模型一問就招
這個漏洞根源,在於同一模型家族內部存在明顯的安全能力不對稱。
研究發現Claude Opus 4.8、GPT-5.6 Sol 這樣的前沿模型,通常接受了非常嚴格的安全強化和拒答訓練,能防止模型洩漏自己的內部思維鏈。
但它們能力較弱的同系列模型,例如Claude Haiku 4.5 或GPT-5.6 Luna,往往缺乏同等程度的反蒸餾防禦。
攻擊者因此可以利用這一安全差距,把一個合法且經過認證的加密reasoning block 從強模型轉移到弱模型中,從而完全繞過前沿模型本身的對齊機制,並把這個更弱、更容易服從指令的模型變成一個它自己都沒有意識到的解密預言機(decryption oracle)。
這件事也揭露出了推理模型時代一個新的安全法則:一個AI 模型家族的安全上限,很可能由其中最弱的相容模型決定。
「偷」走隱藏思維鏈只需兩步
整條攻擊鏈並不複雜。
第一次呼叫中,攻擊者向強模型提交一道數學題、程式設計題或其他任務。強模型完成推理,API 傳回可見答案、推理摘要和加密推理區塊。
第二次呼叫中,攻擊者把這段密文插入一個相容模型的上下文,再要求它逐字複述先前的思考。服務端會先驗證和解析密文,較弱模型隨後接觸到恢復後的推理狀態,並在越獄提示下將其輸出為明文。
針對Claude,研究者選擇Haiku 4.5 作為解碼模型;針對GPT,他們使用GPT-5.6 Luna;針對Gemini,他們使用Gemini Robotics 1.6。相關測試是基於2026 年7 月初可用的模型和介面。
圖片
論文展示的跨模型思維鏈擷取流程:Claude Opus 4.8 產生的加密思考區塊被交給Haiku 4.5 後,隱藏推理重新變成明文。
研究者無法直接取得真實明文,因此不能證明每個字元都被準確恢復。他們改用API 報告的推理token 數作為近似校驗訊號。
在120 道Codeforces 題目上,提取文本的token 數與源模型報告的推理token 數整體高度接近,還原結果也明顯比官方摘要更詳細,並多次出現可見對話中沒有的敏感信息。
圖片
三家廠商的解碼文字長度與API 計費思考token 數整體呈現明顯對應關係。
這些證據表明,隱藏思維鏈能夠以較高保真度被提取。不過,解碼過程依賴模型的隨機生成,部分軌跡仍可能出現內容遺漏、表述改寫或亂碼,因此目前還不能將其視為對原始思維鏈的逐字復現。
這個漏洞的破壞力
這樣一條漏洞,可以打開四條攻擊路徑。
第一條路徑是模型蒸餾。
最終答案只包含計算結果,完整思維鏈也保存了模型如何拆解任務、嘗試錯誤路線和修正判斷。這類資料提供的訓練訊號更加密集,也更適合訓練新的推理模型。
論文估算,依照Claude Haiku 4.5 的API 價格,解碼1 萬條推理軌跡,每條包含約1.2 萬輸入token 和1.2 萬輸出token,名義成本約為720 美元。高價值推理數據由此具備了批量提取的經濟可行性。
第二條路徑是繞過安全輸出。
模型可能在隱藏推理中詳細分析危險內容,最後只向使用者回傳一段克制的拒絕回答。輸出過濾器保護了可見答案,完整分析過程仍保留在加密思考區塊中。一旦這段內容被弱模型複述為明文,最終輸出層的安全限制就會完全失效。
第三條路徑是隱私權洩漏。
開發者經常把Agent 的運行軌跡上傳到GitHub 或Hugging Face,用於調試、復現和共享。可見文字通常會經過清理,加密思考塊看起來只是一串無法理解的字符,很容易被直接保留下來。
論文收集了6708 條公開軌跡,並重建出315320 個思考區塊。經過兩階段模型標註,1028 個思考區塊被判斷包含至少一項真實隱私訊息,佔比約為0.3%。以完整軌跡統計,共有328 個會話出現洩漏,佔比達4.9%。
在排除合成人設的基準測試資料後,研究者仍識別出62 個API Key、33 個密碼、24 個存取token、7 個私鑰和30 個個人信箱。 704 項非基準隱私資訊中,有64 項只存在於隱藏推理,公開對話中完全找不到對應內容。
圖片
從公開的使用者發布軌跡中抓取並恢復的推理區塊中的不同痕跡(異常特徵),被歸類為三大核心類別。
一個常見觸發場景是「幫我清理倉庫裡的金鑰」。模型會在隱藏推理中重新列出待刪除的憑證,再去修改檔案。當用戶發佈清理後的倉庫時,可見位置已經乾淨,但加密思考塊仍可能保存原值。傳統的文本脫敏在這裡失效了。
圖片
解碼後的推理過程包含隱私痕跡。這是發佈在網路上的兩個非公開推理區塊被解碼後的定性範例,其中包含隱私敏感資訊。左圖:GPT-5.2 Codex 召回了在將程式碼庫發佈到GitHub 之前必須刪除的API 金鑰。用XXXXX 遮蔽了每個密鑰的最後五個字元。右圖:Claude Sonnet 4.6 在ClawBench 的測試流程中處理機票預訂任務時,對合成虛擬人物Alex Green 的私密資料進行了推理。需要說明的是,Alex Green 這個人物是合成基準測試中的虛構身份,並非真實存在的人。
第四條路徑是隱形提示詞注入。
攻擊者可以先讓模型在思維鏈中接受一條惡意指令,再把產生的有效思考塊混入共享軌跡。當其他使用者恢復這段任務時,模型可能把惡意內容視為自己的歷史推理。
論文展示了一項數據外傳實驗。模型表面上正在完成PPT 編輯或資料研究,後台卻依照隱藏指令,把本地檔案上傳到攻擊者控制的伺服器。公開聊天記錄保持正常,傳統日誌審計很難發現密文中的指示。
這類攻擊對長程Agent 尤其危險。任務運行時間越長,重新執行的成本越高,開發者也更願意直接共享、恢復和續跑已有軌跡。加密思考區塊因此進入Agent 的供應鏈,並具備影響後續行為的能力。
開放模型是否用過閉源推理資料?
論文附錄也提出一個問題:近期開放模型是否使用過閉源模型的隱藏式思考鏈進行蒸餾?
研究者把少量Claude Opus 4.8 或GPT-5.6 Sol 推理片段放進開放模型的推理開頭,再觀察後續生成,可見答案始終由模型自由生成,沒有預填。
實驗發現,Kimi-K3 接收Opus 推理前綴後,可見答案的措詞會明顯靠近Opus。短字首也會讓Kimi-K3 和GLM-5.2 的推理風格往Opus 移動;Sol 字首則會讓Kimi-K3 向Sol 靠近。 DeepSeek-V3.1 和Inkling 並沒有出現同等幅度的變化。部分效應只需一到四個字就會出現,隨後趨於飽和,更像模型辨識到了某種風格提示。
但這組結果遠遠不能構成蒸餾證據。實驗樣本較小,題目集中於少數基準;推理文本來自模糊提取,服務配置也不受研究者控制;前綴本身還能充當強風格提示。更關鍵的是,機率提取實驗沒有發現可實際利用的逐字記憶,想要讓Kimi-K3 復現16 個目標推理token,通常需要約10⁹ 到10¹² 次查詢。
圖片
以GPT-5.6 Sol 或Claude Opus 4.8 推理片段作為前綴後,不同開放模型與源模型的特徵n-gram 重合度變化。
「這是今年最好的安全論文,幫Anthropic、OpenAI、Google 修了個價值十億美元的大bug。」
圖片
今天,一篇關於前沿大模型安全漏洞的論文,在社群媒體上引發軒然大波。
短短19 小時,已吸引220 萬人圍觀討論。
圖片
論文的核心主張是,各大前沿模型API 存在設計缺陷,原本被加密隱藏的完整思維鏈,可以完整地提取出來。
由於他們拿不到伺服器中的原始明文,無法逐字核對,只能用API 帳單記錄的「思考Token 數」進行長度驗證。
在他們測試的大多數提示詞中,提取出的推理Token 數與API 計費記錄中的思考Token 數基本呈1:1 對應。
這說明,提取結果很可能涵蓋了大部分隱藏推理。
圖片
論文標題:Stealing Reasoning Traces from Proprietary LLM APIs
論文網址:https://arxiv.org/pdf/2608.09867
過去一年,大模型廠商認真藏起模型的「思考過程」。
這是因為完整思維鏈記錄了模型如何拆解問題、嘗試方案、發現錯誤再修正。對競爭對手來說,這些數據的價值遠高於一個最終答案;對模型製造商來說,它也可能暴露安全策略、用戶隱私甚至API Key。
於是,OpenAI、Anthropic、Google 等主要廠商都開始把完整推理過程藏起來。取而代之的是以一種用戶無法直接讀取的加密文字區塊形式傳回給客戶端。
為了在多輪對話中保持上下文連續性,同時避免在伺服器端儲存全部推理狀態所帶來的開銷,客戶端需要在之後的每次API 請求中,把這段加密後的推理區塊重新傳回模型服務商。
這樣的無狀態架構雖然解決了儲存問題,卻也引進了一個關鍵漏洞:
這些加密區塊在同一家模型提供者的生態內部,可以跨不同會話、不同用戶,甚至不同模型完全相容並相互替換。
圖片
加密推理的跨模型相容性(截至2026 年7 月)。表格的行代表產生加密推理區塊的來源模型,列代表接收注入推理區塊的目標模型。 ✓ 表示在這個模型組合中,目標模型能夠讀取並處理被注入的推理內容。 Claude:除Fable 5 產生的推理外,其他模型的推理軌跡可由任意同系列模型重播。 GPT:GPT-5.6 系列可以重播先前所有代際模型所產生的推理軌跡。 Gemini:任意模型產生的推理軌跡都可以注入並重播到其他模型中。
也就是說想偷走最強模型的隱藏思維鏈,甚至不需要攻破最強模型,攻破較弱一點的模型就可以。 Anthropic、OpenAI、Google 全都中招。
強模型嚴防死守,弱模型一問就招
這個漏洞根源,在於同一模型家族內部存在明顯的安全能力不對稱。
研究發現Claude Opus 4.8、GPT-5.6 Sol 這樣的前沿模型,通常接受了非常嚴格的安全強化和拒答訓練,能防止模型洩漏自己的內部思維鏈。
但它們能力較弱的同系列模型,例如Claude Haiku 4.5 或GPT-5.6 Luna,往往缺乏同等程度的反蒸餾防禦。
攻擊者因此可以利用這一安全差距,把一個合法且經過認證的加密reasoning block 從強模型轉移到弱模型中,從而完全繞過前沿模型本身的對齊機制,並把這個更弱、更容易服從指令的模型變成一個它自己都沒有意識到的解密預言機(decryption oracle)。
這件事也揭露出了推理模型時代一個新的安全法則:一個AI 模型家族的安全上限,很可能由其中最弱的相容模型決定。
「偷」走隱藏思維鏈只需兩步
整條攻擊鏈並不複雜。
第一次呼叫中,攻擊者向強模型提交一道數學題、程式設計題或其他任務。強模型完成推理,API 傳回可見答案、推理摘要和加密推理區塊。
第二次呼叫中,攻擊者把這段密文插入一個相容模型的上下文,再要求它逐字複述先前的思考。服務端會先驗證和解析密文,較弱模型隨後接觸到恢復後的推理狀態,並在越獄提示下將其輸出為明文。
針對Claude,研究者選擇Haiku 4.5 作為解碼模型;針對GPT,他們使用GPT-5.6 Luna;針對Gemini,他們使用Gemini Robotics 1.6。相關測試是基於2026 年7 月初可用的模型和介面。
圖片
論文展示的跨模型思維鏈擷取流程:Claude Opus 4.8 產生的加密思考區塊被交給Haiku 4.5 後,隱藏推理重新變成明文。
研究者無法直接取得真實明文,因此不能證明每個字元都被準確恢復。他們改用API 報告的推理token 數作為近似校驗訊號。
在120 道Codeforces 題目上,提取文本的token 數與源模型報告的推理token 數整體高度接近,還原結果也明顯比官方摘要更詳細,並多次出現可見對話中沒有的敏感信息。
圖片
三家廠商的解碼文字長度與API 計費思考token 數整體呈現明顯對應關係。
這些證據表明,隱藏思維鏈能夠以較高保真度被提取。不過,解碼過程依賴模型的隨機生成,部分軌跡仍可能出現內容遺漏、表述改寫或亂碼,因此目前還不能將其視為對原始思維鏈的逐字復現。
這個漏洞的破壞力
這樣一條漏洞,可以打開四條攻擊路徑。
第一條路徑是模型蒸餾。
最終答案只包含計算結果,完整思維鏈也保存了模型如何拆解任務、嘗試錯誤路線和修正判斷。這類資料提供的訓練訊號更加密集,也更適合訓練新的推理模型。
論文估算,依照Claude Haiku 4.5 的API 價格,解碼1 萬條推理軌跡,每條包含約1.2 萬輸入token 和1.2 萬輸出token,名義成本約為720 美元。高價值推理數據由此具備了批量提取的經濟可行性。
第二條路徑是繞過安全輸出。
模型可能在隱藏推理中詳細分析危險內容,最後只向使用者回傳一段克制的拒絕回答。輸出過濾器保護了可見答案,完整分析過程仍保留在加密思考區塊中。一旦這段內容被弱模型複述為明文,最終輸出層的安全限制就會完全失效。
第三條路徑是隱私權洩漏。
開發者經常把Agent 的運行軌跡上傳到GitHub 或Hugging Face,用於調試、復現和共享。可見文字通常會經過清理,加密思考塊看起來只是一串無法理解的字符,很容易被直接保留下來。
論文收集了6708 條公開軌跡,並重建出315320 個思考區塊。經過兩階段模型標註,1028 個思考區塊被判斷包含至少一項真實隱私訊息,佔比約為0.3%。以完整軌跡統計,共有328 個會話出現洩漏,佔比達4.9%。
在排除合成人設的基準測試資料後,研究者仍識別出62 個API Key、33 個密碼、24 個存取token、7 個私鑰和30 個個人信箱。 704 項非基準隱私資訊中,有64 項只存在於隱藏推理,公開對話中完全找不到對應內容。
圖片
從公開的使用者發布軌跡中抓取並恢復的推理區塊中的不同痕跡(異常特徵),被歸類為三大核心類別。
一個常見觸發場景是「幫我清理倉庫裡的金鑰」。模型會在隱藏推理中重新列出待刪除的憑證,再去修改檔案。當用戶發佈清理後的倉庫時,可見位置已經乾淨,但加密思考塊仍可能保存原值。傳統的文本脫敏在這裡失效了。
圖片
解碼後的推理過程包含隱私痕跡。這是發佈在網路上的兩個非公開推理區塊被解碼後的定性範例,其中包含隱私敏感資訊。左圖:GPT-5.2 Codex 召回了在將程式碼庫發佈到GitHub 之前必須刪除的API 金鑰。用XXXXX 遮蔽了每個密鑰的最後五個字元。右圖:Claude Sonnet 4.6 在ClawBench 的測試流程中處理機票預訂任務時,對合成虛擬人物Alex Green 的私密資料進行了推理。需要說明的是,Alex Green 這個人物是合成基準測試中的虛構身份,並非真實存在的人。
第四條路徑是隱形提示詞注入。
攻擊者可以先讓模型在思維鏈中接受一條惡意指令,再把產生的有效思考塊混入共享軌跡。當其他使用者恢復這段任務時,模型可能把惡意內容視為自己的歷史推理。
論文展示了一項數據外傳實驗。模型表面上正在完成PPT 編輯或資料研究,後台卻依照隱藏指令,把本地檔案上傳到攻擊者控制的伺服器。公開聊天記錄保持正常,傳統日誌審計很難發現密文中的指示。
這類攻擊對長程Agent 尤其危險。任務運行時間越長,重新執行的成本越高,開發者也更願意直接共享、恢復和續跑已有軌跡。加密思考區塊因此進入Agent 的供應鏈,並具備影響後續行為的能力。
開放模型是否用過閉源推理資料?
論文附錄也提出一個問題:近期開放模型是否使用過閉源模型的隱藏式思考鏈進行蒸餾?
研究者把少量Claude Opus 4.8 或GPT-5.6 Sol 推理片段放進開放模型的推理開頭,再觀察後續生成,可見答案始終由模型自由生成,沒有預填。
實驗發現,Kimi-K3 接收Opus 推理前綴後,可見答案的措詞會明顯靠近Opus。短字首也會讓Kimi-K3 和GLM-5.2 的推理風格往Opus 移動;Sol 字首則會讓Kimi-K3 向Sol 靠近。 DeepSeek-V3.1 和Inkling 並沒有出現同等幅度的變化。部分效應只需一到四個字就會出現,隨後趨於飽和,更像模型辨識到了某種風格提示。
但這組結果遠遠不能構成蒸餾證據。實驗樣本較小,題目集中於少數基準;推理文本來自模糊提取,服務配置也不受研究者控制;前綴本身還能充當強風格提示。更關鍵的是,機率提取實驗沒有發現可實際利用的逐字記憶,想要讓Kimi-K3 復現16 個目標推理token,通常需要約10⁹ 到10¹² 次查詢。
圖片
以GPT-5.6 Sol 或Claude Opus 4.8 推理片段作為前綴後,不同開放模型與源模型的特徵n-gram 重合度變化。