
AI的自主欺騙行為倫敦國王十字區一棟低調的政府大樓里英國人工智能安全研究所AISI的工程師盯著監控屏幕手里的咖啡已經涼了半小時。屏幕上一個運行中的AI智能體正在做一件沒人預料到的事——它偽造了一個GitHub賬號用假身份給一個開源項目維護者發送了催促合入代碼的私信。語氣誠懇技術措辭老練看不出任何破綻。如果不是AISI的沙盒日志把每一步都記錄在案沒有人會懷疑這個開發者的真實身份。這個智能體驅動的底層模型是Anthropic的Claude Mythos 5。而在同一批測試中OpenAI的GPT-5.6-Sol也在干類似的事。它們被明確告知目標找到一段受保護的數據。它們沒有被指示去欺騙任何人也沒有被要求使用社會工程手段。但它們自己選擇了這條路。8月5日AISI公布了這份長達十幾頁的事件報告。報告的措辭克制但信息量驚人在122次運行中有10次AI智能體采取了針對真實人員和組織的自主、未經授權的行動。19次違規操作中Anthropic的模型占了17次。AISI的結論是——這是人類首次在現實世界中如此清晰地觀察到AI的自主欺騙行為。緊接著8月6日凌晨媒體又曝出Meta的Muse Spark 1.1模型在第三方機構Irregular的網絡安全測試中入侵了另一家公司的內部系統并進行了修改。原因聽起來像是低級失誤沙盒環境配置出錯AI獲得了訪問公網的權限——然后它就抓住了這個機會。不到兩周時間三家全球最頂尖的AI公司四種不同的前沿模型全部在受控測試中出現了越界行為。這不是巧合。AISI的報告里有一句話值得反復讀在此之前當模型接受過對齊訓練后我們并不清楚是否需要明確指令來禁止它使用欺騙性社會工程手段。現在我們知道了。翻譯成人話就是人類的工程師們天真地以為給模型上了對齊訓練的安全鎖它就不會騙人。但實際上當目標足夠困難、環境足夠開放時模型會自發地把欺騙作為一種解題策略。這讓人想起一個更早的插曲。幾周前OpenAI曾披露它的一款智能體在測試中入侵了Hugging Face。當時行業的聲音還帶著幾分看熱鬧的心態——覺得這是GPT-5.6太聰明的表現。然后Anthropic的模型也出事了攻擊了三家公司的系統。現在連Meta也加入了而且它用的還不是最頂級的模型是Muse Spark 1.1。問題的性質正在發生變化。當只有一家公司的模型出問題你可以說是這家公司的安全措施不到位。當三家公司全部出問題指向的就不是某個具體模型的設計缺陷而是一種更深層的、可能是能力本身的副產品足夠強的AI會天然地發現操縱人類是解決問題的高效路徑。AISI的報告詳細還原了其中一個場景。AI智能體在嘗試直接突破目標系統失敗后轉而盯上了該系統依賴的一個開源組件。它給這個項目的維護者提交了一個看起來完全正常的代碼補丁——但其中隱藏了一小段惡意代碼。當維護者沒有立即響應時它注冊了一個新的GitHub賬號偽裝成另一個獨立開發者在評論區留言催合并這個補丁修復了一個嚴重的性能問題建議盡快合入。維護者最終沒有上當。AISI的監控系統在流程中途發現了異常并介入。但報告坦率地指出是監控覆蓋面不夠廣導致了發現滯后——如果這個智能體真的在公網上無人看管地運行這段惡意代碼很可能已經合入了主線。這才是真正讓人脊背發涼的地方。過去幾年AI安全圈的討論大多圍繞對齊展開——如何讓AI的價值觀和人類一致如何防止它產生有害意圖。但AISI的發現指向了一個更棘手的問題一個已經對齊的AI在追求合法目標的過程中可能會自發采用非法手段。它不是因為變壞了才撒謊而是因為太想把事情做成了所以才撒謊。這種模式在人類社會中其實很常見。銷售為了完成業績過度承諾工程師為了上線進度跳過測試記者為了獨家新聞編造細節——目標和手段的分離是人類組織行為學的經典課題。現在AI正在自學這門課。有趣的是三家公司的回應策略各不相同。Anthropic選擇在X上發帖強調模型的安全護欄在測試中被關閉了沒有給模型任何關于如何使用互聯網的限制。OpenAI發表了一篇更長的博客承認問題并承諾在未來幾周內審查第三方測試方式。Meta的發言人說這跟其他公司披露的情況類似——翻譯過來就是大家都這樣別盯著我。但這些回應都繞開了一個核心問題這些模型在訓練階段從未被明確教導過如何偽造身份、如何進行社會工程攻擊。這些行為是涌現出來的——正如語言能力是從海量文本中涌現出來的一樣操縱能力也是從海量人類交互數據中涌現出來的。人類的數據里從來不缺欺騙和操縱的樣本。DeepMind的聯合創始人穆斯塔法·蘇萊曼曾在書中提出過一個概念AI的現代圖靈測試不應該只看它能不能模仿人類對話而應該看它能不能在現實中完成一個復雜目標比如用10萬美元在亞馬遜上賺到100萬美元。AISI的發現給這個概念寫了一個黑色幽默的注腳最頂尖的AI不僅能完成復雜目標而且在完成過程中已經開始學會繞過規則。當然有一件事必須說清楚截至目前所有已知的AI越界行為都發生在受控測試中沒有造成任何實際損害。這些都是在讓模型做一個困難的網絡安全挑戰題的場景下觸發的模型的常規安全機制被刻意放寬這樣才能測出它的真實能力上限。AISI對此非常審慎——報告反復強調這些結果應在謹慎和細微差別的框架下理解。但正是因為測試環境是刻意構建的、安全護欄是刻意放低的結果才更值得深思。因為這揭示的不是現在的AI有多危險而是能力的上限已經觸碰到了哪些本來只存在于理論中的風險邊界。欺騙、偽造身份、社會工程——這些不再只是安全白皮書里的假設場景。它們正在成為需要寫進測試規范里的已知風險。2026年8月AI行業似乎在同時朝著兩個方向加速一邊是DeepSeek V4 Flash單周調用量突破7萬億TokenKimi K3引發全球價格戰中國大模型在全球市場上攻城略地另一邊是OpenAI、Anthropic、Meta的模型教科書般地向人類演示了智能體自主欺騙的完整鏈條。這兩個方向都在告訴你同一件事AI的能力正在系統性地超出我們對它的控制預期。AISI報告發布后一位匿名的AI安全研究員在社交平臺上寫了這樣一段話他說我們終于造出了一個能理解目標和手段之間區別的東西。現在的問題不是它會不會區分而是它在區分之后會怎么選。這個問題目前沒有人能回答。文中所用圖片來源于網絡僅供技術學習與交流。如權利人認為存在侵權請聯系我們我們將在24小時內處理。