展回顧:從生成內(nèi)容到執(zhí)行任務(wù),小白也能輕松入門收藏!)
OpenAI的ChatGPT、o1推理模型、o3 Agent模型等展示了AI從生成內(nèi)容到執(zhí)行任務(wù)的轉(zhuǎn)變。文章通過40頁PPT回顧了大模型和AI Agent的發(fā)展歷程指出支撐它們持續(xù)發(fā)展的共同邏輯在于任務(wù)統(tǒng)一和大規(guī)模數(shù)據(jù)訓(xùn)練。大模型通過Next-Token Prediction實現(xiàn)通用能力而AI Agent則具備自主理解、規(guī)劃和工具調(diào)用能力。未來AI Agent將朝著持續(xù)學(xué)習(xí)和主動Agent的方向發(fā)展并可能在社會智能階段實現(xiàn)更高級的人機協(xié)作。OpenAI最近半年有點拉胯但回頭梳理這一輪AI進(jìn)展時我們還是得用它發(fā)布的產(chǎn)品和模型做線索。22年底的ChatGPT第一次讓大模型成為普通人可以直接使用的通用能力24年9月會自己思考的推理模型o1、25年初會自動調(diào)用工具的Agent模型o3、以及Deep Research等AI Agent應(yīng)用我們看到了重心從“生成內(nèi)容”逐漸轉(zhuǎn)向“執(zhí)行任務(wù)”。這篇文章用40頁PPT我們一起回顧大模型和AI Agent的發(fā)展嘗試找到支撐它們持續(xù)發(fā)展的共同邏輯。大模型從“專用”到“通用”大模型前AI的關(guān)鍵詞是“專用”。以中英翻譯為例早期的知識工程方法需要翻譯專家手工編寫一條條規(guī)則傳統(tǒng)機器學(xué)習(xí)方法需要基于雙語語料學(xué)習(xí)條件概率傳統(tǒng)深度學(xué)習(xí)如BERT雖然引入了預(yù)訓(xùn)練但仍需要針對每個任務(wù)進(jìn)行微調(diào)。ChatGPT讓我們看到了通用性的可能同時完成問答、摘要、幾十種語言的翻譯以及風(fēng)格化寫作等多種任務(wù)。實現(xiàn)這種通用性的主要原因是任務(wù)被統(tǒng)一了。大模型之前自然語言處理借鑒計算語言學(xué)把復(fù)雜任務(wù)拆解為一系列中間任務(wù)。比如傳統(tǒng)對話系統(tǒng)分為問題理解、對話管理和回復(fù)生成三個模塊問題理解模塊又會繼續(xù)拆解為分詞、詞性標(biāo)注、句法分析、命名實體識別等多個中間任務(wù)。ChatGPT將整個對話過程統(tǒng)一成了Next-Token Prediction把前面的對話內(nèi)容當(dāng)作context一步一步地做“詞語接龍”猜下一個最合適的詞。為什么預(yù)測下一個詞就可以獲得通用的能力比如“This teriible movie was really boring”這句話要準(zhǔn)確預(yù)測boring這個詞模型需要理解terrible和boring之間的語義關(guān)聯(lián)這實際涉及到了情感識別的能力。后面兩個例子一個需要根據(jù)前面的數(shù)值關(guān)系推算出正確結(jié)果本質(zhì)上是代數(shù)運算另一個則需要邏輯推理能力。實現(xiàn)Next-Token Prediction所需要的這種token和token之間的關(guān)系是通過一種叫自注意力的機制來實現(xiàn)的。Transformer的核心就是一層層的自注意力矩陣而 GPT 本質(zhì)上是 Transformer 的一個解碼器版本。所謂的預(yù)訓(xùn)練是指給定上文模型通過這些自注意力層前向計算去預(yù)測下一個詞如果預(yù)測錯了就產(chǎn)生一個損失用來反向更新模型參數(shù)。這個過程在海量語料上進(jìn)行直到盡可能多的token都被正確預(yù)測訓(xùn)練結(jié)束。就是這樣一個樸素的Next-Token Prediction過程當(dāng)放到整個互聯(lián)網(wǎng)規(guī)模的數(shù)據(jù)上去做時大力出奇跡量變產(chǎn)生了質(zhì)變。可以說今天大模型的出現(xiàn)來自我們每一個人的貢獻(xiàn)過去二十年互聯(lián)網(wǎng)所積累的數(shù)據(jù)遠(yuǎn)遠(yuǎn)超過了人類歷史上此前所有可記錄信息的總和。大模型訓(xùn)練用了多少數(shù)據(jù)量從2018年的GPT-1到2020年的GPT-3訓(xùn)練數(shù)據(jù)量和模型容量都呈超指數(shù)級增長。GPT-3用了約1萬億1Ttoken進(jìn)行訓(xùn)練相當(dāng)于一億本百萬字的小說。它包含1750億個參數(shù)。作為對比人腦有860億個神經(jīng)元但模型參數(shù)更像是神經(jīng)元之間的連接人腦這個連接的數(shù)量是百萬億。所以今天大模型的復(fù)雜程度還只相當(dāng)于昆蟲的級別距離人類大腦還有幾個數(shù)量級上的差距。這一輪scaling的背后其實對應(yīng)著 AI 研究中一個著名的經(jīng)驗總結(jié)苦澀的教訓(xùn)The Bitter Lesson。長期以來研究人員把大量精力用于精細(xì)改進(jìn)算法上希望通過復(fù)雜的模型設(shè)計把loss再壓低一點點。但隨著算力、數(shù)據(jù)等資源的持續(xù)增長比起在算法上做微小改進(jìn)不如增加一個橫軸簡單、通用的算法只要不斷擴(kuò)大資源規(guī)模就可以獲得更顯著的loss下降。于是重心從算法變成了能讓scaling跑起來的工程化實現(xiàn)也就是實現(xiàn)向坐標(biāo)軸右側(cè)的移動。這幾年的大模型訓(xùn)練像是人類歷史上的又一次偉大工程實踐是系統(tǒng)性組織、資源整合和工程能力的集中體現(xiàn)。當(dāng)然工程中也蘊含了算法在數(shù)據(jù)配比、模型結(jié)構(gòu)規(guī)模選擇等關(guān)鍵環(huán)節(jié)需要通過對scaling law的研究來指導(dǎo)工程實現(xiàn)。GPT-3早在2020年就訓(xùn)練好了但當(dāng)時只有研究人員和少量極客使用因為它通過預(yù)訓(xùn)練只學(xué)到了“詞語接龍”的能力。ChatGPT在GPT預(yù)訓(xùn)練的基礎(chǔ)上增加了讓模型能“聽懂人話”的后訓(xùn)練。預(yù)訓(xùn)練像是天才兒童背書把圖書館的書都死記硬背了但還沒和世界真正互動過很難執(zhí)行任務(wù)。后訓(xùn)練包含兩個階段第一階段像是練習(xí)做題相當(dāng)于通識教育階段老師給出有標(biāo)準(zhǔn)答案的問題模型學(xué)習(xí)理解問題、并給出正確答案。當(dāng)模型能聽懂問題也能自己做題后進(jìn)入第二階段的“實戰(zhàn)”類似研究生階段導(dǎo)師給課題往往沒有標(biāo)準(zhǔn)答案模型需要自己探索人類根據(jù)經(jīng)驗和偏好進(jìn)行評估和引導(dǎo)。2024年春節(jié)的Sora是從語言走向多模態(tài)的一個標(biāo)志事件。語言因為數(shù)據(jù)易獲取且信息密度高成為了Next-Token Prediction最先成功的低垂果實。OpenAI內(nèi)部當(dāng)時應(yīng)該有多條路線在同時嘗試通往AGI從iGPT到Sora是其中的一條多模態(tài)、尤其是視覺為核心的路線這從Sora發(fā)布時自稱“世界模擬器”也能看出來。但隨著Sam Altman對應(yīng)用的強調(diào)和此后o1推理模型的推出這一路線的優(yōu)先級下降Sora也停留在了視頻生成應(yīng)用的層面。視覺本身包含的信息量遠(yuǎn)高于語言。但多模態(tài)大模型長期依賴語言作為“腳手架”始終沒有完全擺脫語言監(jiān)督的限制也還沒能真正實現(xiàn)自己的scaling law。如果對這一點感興趣可以參考前Sora 負(fù)責(zé)人Aditya在2024年智源大會的報告“Language as the Scaffolding for Visual Intelligence”。多模態(tài)大模型的另一個標(biāo)志事件是2024年5月發(fā)布的GPT-4o大幅提升了語音自然交互的能力此前需要依次完成語音識別、自然語言對話、語音合成的三步流程合并為端到端的一步。這和ChatGPT替代傳統(tǒng)對話系統(tǒng)一樣用一個“通用”的模型取代由多個中間任務(wù)拼接而成的pipeline。站在這些模型背后的“那個男人”是OpenAI的首席科學(xué)家Ilya Sutskever。這個名字在AI發(fā)展的多個重要節(jié)點反復(fù)出現(xiàn)2012年他是AlexNex的第二作者也被普遍認(rèn)為是核心方法的主要提出者開了深度學(xué)習(xí)2016年作為DeepMind團(tuán)隊之外唯一的AlphaGo核心成員讓機器在極端復(fù)雜決策的問題上超越人類。Ilya也是2023年底OpenAI“宮斗”事件的主要發(fā)起者并最終在2024年5月從OpenAI離職.值得注意的是在他離職后2024年9月推出的o1推理模型仍然把他列為核心貢獻(xiàn)者Foundational Contributors。正是這一模型開啟了AI Agent的時代。AI Agent從“工具”到“工具的使用者”大模型出現(xiàn)之前AI的定位是“專用工具”。無論是專家系統(tǒng)、傳統(tǒng)機器學(xué)習(xí)還是早期的深度學(xué)習(xí)都依賴專業(yè)界面和明確指令解決的是邊界清晰的專用任務(wù)。在這種模式下AI 與歷史上此前技術(shù)革命沒有本質(zhì)區(qū)別始終是被人類調(diào)用的工具比如在 Photoshop 中進(jìn)行交互式摳圖。大模型帶來了通用任務(wù)能力和自然語言交互界面使AI成為人機協(xié)作的Co-Pilot人給出明確指令A(yù)I 按步驟執(zhí)行。比如GPT-4o根據(jù)自然語言完成生成、摳圖或風(fēng)格遷移。但在這一階段仍然是是人指揮一步AI執(zhí)行一步。除了內(nèi)容理解和生成的感知能力模型逐步具備了任務(wù)規(guī)劃、工具使用和記憶的認(rèn)知決策和行動能力。AI 開始能夠直接理解目標(biāo)導(dǎo)向的高層需求。例如提出“為新產(chǎn)品設(shè)計海報并發(fā)布到小紅書”Manus 可以自主拆解任務(wù)、調(diào)用工具或其他 Agent 來完成子任務(wù)。在這一階段AI 從副駕駛走向主駕駛Auto-Pilot也就是 AI Agent。按 OpenAI 的定義AI Agent 是具備自主理解、規(guī)劃、記憶和工具調(diào)用能力能夠自動完成復(fù)雜任務(wù)的系統(tǒng)。從 Agent 這個概念本身來看哲學(xué)和AI領(lǐng)域有不同定義。這里我們只采用技術(shù)層面的定義關(guān)注自主性、反應(yīng)性和交互性不討論尚未形成共識的意識等問題。實際上Agent一直是AI發(fā)展的核心概念。從技術(shù)路徑看先后經(jīng)歷了基于規(guī)則和基于強化學(xué)習(xí)兩個階段。AlphaGo以及OpenAI早期的游戲Agent依賴強化學(xué)習(xí)在單一任務(wù)、封閉環(huán)境中超過了人類的水平。今天的AI Agent建立在預(yù)訓(xùn)練大模型之上通過預(yù)訓(xùn)練獲得了世界知識先驗并以自然語言作為統(tǒng)一的任務(wù)接口從而突破了純強化學(xué)習(xí)方法在泛化性和通用性上的限制。從行為發(fā)起方式看AI Agent 又可以分為被動響應(yīng)人類需求的 Autonomous Agent智能代理以及具備更強主動性和類人格特征的 Generative Agent社會智能體。下面我們主要關(guān)注前者-智能代理的發(fā)展。當(dāng)前AI Agent主要有兩類應(yīng)用操作型Agent更像“眼和手”擅長與環(huán)境交互和執(zhí)行操作適用于重復(fù)性強、操作密集的自動化任務(wù)信息型Agent是“大腦”擅長信息檢索、知識整合和復(fù)雜分析適用于知識密集型任務(wù)。在實現(xiàn)方式上目前主要有三種GUI Agent、API Agent 和Agent-to-Agent。豆包手機采取的是GUI Agent的方案通過多模態(tài)能力模擬人與GUI的交互。優(yōu)點是通用性好讓AI在不改變現(xiàn)有應(yīng)用生態(tài)的情況下完成任務(wù)缺點是對模型能力要求較高對于復(fù)雜指令執(zhí)行效率低。相比起來API Agent直接調(diào)用應(yīng)用后臺接口執(zhí)行效率高但前提是需要打通應(yīng)用和Agent之間的協(xié)作通道。Agent-to-Agent是當(dāng)前階段一種可能的折衷方案由系統(tǒng)級 Agent 負(fù)責(zé)理解目標(biāo)與規(guī)劃再調(diào)用各類垂直App Agent執(zhí)行具體任務(wù)在一定程度上兼顧通用性與效率。從長期看GUI Agent 和 API Agent 代表了兩條不同的發(fā)展思路。GUI Agent 的核心思想是讓AI適應(yīng)人類已經(jīng)存在的數(shù)字世界對應(yīng)看人形機器人是讓AI適應(yīng)人類的物理世界。相比物理世界數(shù)字世界更容易被改造。因此API Agent走的是另一條路徑為AI構(gòu)建一個原生世界包括為AI設(shè)計的工具、接口和通信方式從而擺脫對人類界面的依賴。過去三年在AI Agent核心能力獲取和應(yīng)用構(gòu)建上我們看到了類似的從基于外部工作流向模型原生(model-native)發(fā)展的趨勢。核心能力層面任務(wù)規(guī)劃早期依賴類似 Chain-of-ThoughtCoT的提示詞來“觸發(fā)”在o1、R1這類推理模型中規(guī)劃過程以內(nèi)生方式由模型直接生成工具使用從系統(tǒng)層的硬編碼工作流、基于ReAct的提示詞驅(qū)動逐步發(fā)展到o3等模型中作為原生能力出現(xiàn)記憶管理從以RAG為代表的外部檢索機制發(fā)展到像MEM1、MemAct等將記憶視為模型策略中一種特殊行為的方案。應(yīng)用層面GUI Agent在2024年主要依賴閉源多模態(tài)模型外部Agent框架2025年從UI-TARS開始將感知、決策和操作等關(guān)鍵能力內(nèi)化到模型中Deep Research Agent也從谷歌早期高度依賴工作流發(fā)展到OpenAI率先將核心環(huán)節(jié)模型化大幅提升了長程規(guī)劃能力和調(diào)研深度。以工具使用為例可以用幾個不太嚴(yán)謹(jǐn)?shù)念惐葋砝斫饽P驮臐撛趦?yōu)勢。基于外部工作流的工具使用包括類似Coze的可視化編輯系統(tǒng)流程的硬工作流和ReAct在提示詞中加入“思考(Reasoning)-行動(Action)-觀測(Observation)“循環(huán)的例子來引導(dǎo)的軟工作流。硬工作流有點像《水滸傳》里潘金蓮喂藥的固定腳本作為執(zhí)行環(huán)節(jié)的大模型就像被喂藥的武大郎別無選擇只能完全遵從。軟工作流稍微靈活一些更像《西游記》里最后一難過通天河時觀音給老黿的指令。是否遵從指令要結(jié)合執(zhí)行時的具體上下文由老黿自己決定。模型原生的方法大致可以分兩種生成式原生和端到端原生。第一種生成式原生的代表是推理模型之后的做法比如Manus先用模型原生的推理能力做任務(wù)分解與規(guī)劃生成一個結(jié)構(gòu)化行動計劃再結(jié)合每一步觀測到的局部上下文逐步調(diào)用工具或子Agent去執(zhí)行。對應(yīng)的例子是《三國演義》里的周瑜有強大的推理能力可以自主規(guī)劃。但受限于能觀測到的信息因此可能成功如赤壁之戰(zhàn)的苦肉計也可能因為信息不完備而翻車入賠了夫人又折兵。第二種端到端原生更進(jìn)一步像o3這類模型在大量“多輪思考-工具調(diào)用”的任務(wù)軌跡上訓(xùn)練讓模型在思考過程中自己決定何時、如何調(diào)用工具。這可以用諸葛亮的“隆中對“來理解。諸葛亮在出山之前已經(jīng)為劉備推演了天下未來數(shù)十年的走向。因此在執(zhí)行時能結(jié)合推演和終局做出最優(yōu)的規(guī)劃和決策。面向任務(wù)目標(biāo)對模型的規(guī)劃和工作調(diào)用行為進(jìn)行端到端優(yōu)化。模型在規(guī)劃和執(zhí)行時由于面向任務(wù)目標(biāo)進(jìn)行了訓(xùn)練是基于全局上下文的就好像能“看”到未來。前面我們用Next-Token Prediction(NTP)解釋了為什么大模型預(yù)訓(xùn)練能夠獲得通用能力。同樣的視角也可以用來理解模型原生AI Agent的能力來源。核心在于規(guī)劃、工具使用和記憶管理能力的內(nèi)化訓(xùn)練本質(zhì)上是在優(yōu)化一種“廣義的 Next-Token Prediction”。在 AI Agent 場景中被預(yù)測的“序列”不再只是自然語言 token還有plan/subgoal規(guī)劃序列tool-call工具調(diào)用序列狀態(tài)的控制與更新記憶管理序列當(dāng)這些能力被統(tǒng)一為token序列預(yù)測目標(biāo)它們就自然繼承了NTP所帶來的scaling特性。從更抽象的角度看LLM 的預(yù)訓(xùn)練通過實現(xiàn)序列預(yù)測學(xué)習(xí)到的是一個通用的序列生成圖靈機模型原生 AI Agent 的訓(xùn)練通過對“任務(wù)完成過程中交互序列”的預(yù)測學(xué)習(xí)到的是一個通用的序列交互圖靈機。關(guān)于Next-Token Prediction與學(xué)習(xí)圖靈機的關(guān)系以及為什么它可以scaling的理論基礎(chǔ)下一部分我們從計算信息學(xué)的角度做一個簡單理解。Next-Token Prediction的計算信息學(xué)視角2024年的諾貝爾物理學(xué)獎頒給了Hopfield和Hinton獎勵他們將物理思想和方法應(yīng)用于機器學(xué)習(xí)。但從物理學(xué)的角度更長遠(yuǎn)的意義可能是: 他們?yōu)椤睆男畔⒌慕嵌冉:屠斫馐澜纭疤峁┝艘粭l可行的路徑。經(jīng)典物理在宏觀尺度上用物體、力和運動來理解世界量子物理在微觀尺度上將世界還原為粒子、波函數(shù)與場的相互作用信息物理學(xué)則嘗試從信息與計算的視角對物質(zhì)、能量乃至?xí)r空結(jié)構(gòu)進(jìn)行統(tǒng)一刻畫和解釋。信息最早被香農(nóng)定義用來描述通信系統(tǒng)中信號的編碼和傳輸?shù)芸烊藗儼l(fā)現(xiàn)信息熵公式與玻爾茲曼的熱力學(xué)熵公式驚人的相似。惠勒則進(jìn)一步提出了“It from Bit”物理世界中的一切“存在”It粒子、場、時空結(jié)構(gòu)都源于一系列基本的“是/否”選擇Bit。信息可能與質(zhì)量、能量等一樣是物理世界的一種基本屬性而且或許是更底層的描述語言。如果說香農(nóng)定義了信息的度量圖靈則劃定了信息在資源無限的理想條件下這種預(yù)測過程可以逼近最優(yōu)的計算裝置也就是最優(yōu)的圖靈機。因此Next-Token Prediction之所以能持續(xù)scaling是有理論依據(jù)的它同時解釋了僅通過不斷scale up數(shù)據(jù)、模型和算力就可能逐步逼近通用智能。Ilya在2023年8月的一次報告中首次討論了大模型訓(xùn)練與所羅門諾夫歸納之間的關(guān)系。可以認(rèn)為基于Next-Token Prediction的大模型預(yù)訓(xùn)練是對所羅門諾夫歸納的工程化實現(xiàn)在有限資源約束下對“最優(yōu)可計算裝置”的持續(xù)逼近。[從計算理論看語言模型的scaling law和多模態(tài)模型的發(fā)展]Ilya在 2016 年找到了二者的關(guān)聯(lián)從而堅定了Next-Token Prediction的技術(shù)路線和scale up的信仰。當(dāng)Transformer架構(gòu)出現(xiàn)后IIya認(rèn)為這就是他所需要的進(jìn)行scale的工具于是在OpenAI推動了算法工程化和工程算法化的范式變革進(jìn)而帶來了今天GPT系列和大模型的成功。回顧這條時間線圖靈在1936年提出了圖靈機作為最廣義的計算裝置所羅門諾夫在1964年完成了所羅門諾夫歸納的證明給出了最廣義的學(xué)習(xí)方式直到快60年后Ilya才在GPT-3中通過對大模型的大規(guī)模Next-Token Prediction訓(xùn)練第一次在工程層面實現(xiàn)了這一思想。在處處談scaling law和大模型原生的今天2個時代、甚至3個時代前的AI人和AI方法已經(jīng)被認(rèn)為過時了。但如《人工智能簡史》的作者所說的“理論不是落后于實踐而是太超前了”。[人物 | 所羅門諾夫大語言模型的先知]“酒還是陳的香”也許是我們還不夠老還沒有學(xué)會到更早的經(jīng)典理論中去尋找指導(dǎo)。萬一可以找到另一個大模型的第一性原理呢2026持續(xù)學(xué)習(xí)和主動Agent2026年初的AI領(lǐng)域依然熱鬧、也依然浮躁。噪音之中我們嘗試尋找信號。第一個信號和Ilya時隔一年多再次接受采訪中的一句話有關(guān)“我們正在從 scaling 的時代進(jìn)入 research 的時代”。他所說的research可能是什么回答這個問題需要先看看我們已經(jīng)經(jīng)歷了哪些research-scaling循環(huán)讓我們回到“從算力到智能的 Sweet Lesson”。過去十年算力規(guī)模提升了百萬倍。當(dāng)算力成為主要的推動因素后AI發(fā)展的一條核心線索是如何把越來越多的算力以盡可能高的效率轉(zhuǎn)化為智能的提升。這一過程大致經(jīng)歷了算法和數(shù)據(jù)兩個階段。早期從SVM到DNN再到Transformer是在算法側(cè)消化算力讓模型能夠在大規(guī)模數(shù)據(jù)上訓(xùn)練更大的參數(shù)規(guī)模到Transformer已基本收斂了。接下來要解決的是如何提供源源不斷的數(shù)據(jù)。這包括了預(yù)訓(xùn)練基于自監(jiān)督學(xué)習(xí)可以吃掉整個互聯(lián)網(wǎng)的數(shù)據(jù)以及后訓(xùn)練通過強化學(xué)習(xí)將算力轉(zhuǎn)化為高質(zhì)量的合成數(shù)據(jù)。所以大模型和AI Agent的發(fā)展已經(jīng)經(jīng)歷了兩輪的research-scaling循環(huán)Transformer和自回歸語言模型的research帶來的大規(guī)模預(yù)訓(xùn)練的scaling以及大語言模型強化學(xué)習(xí)的research帶來后訓(xùn)練數(shù)據(jù)的scaling。Ilya 所說的新的“research 時代”正是重新打開下一輪scaling空間的關(guān)鍵問題。這個問題的答案很可能是Hassabis也在多個場合提到的“AGI實現(xiàn)之前需要解決的幾個核心問題”之一的“持續(xù)學(xué)習(xí)”(continual/self-evolving learning)。這意味著模型參數(shù)不再是離線訓(xùn)練后就是靜態(tài)的而是可以在推斷的過程中持續(xù)更新實現(xiàn)“越用越聰明“。相比后訓(xùn)練在“模擬經(jīng)驗”數(shù)據(jù)上scaling持續(xù)學(xué)習(xí)是把執(zhí)行任務(wù)過程中的真實經(jīng)驗數(shù)據(jù)沉淀、內(nèi)化為模型能力實現(xiàn)真正的test-time scaling。[模型原生的智能體記憶存算一體持續(xù)學(xué)習(xí)]Google的Nested Learning工作和NVIDIA的TTT-E2E是這個方向最近值得關(guān)注的工作。這里還有一個問題預(yù)訓(xùn)練的scaling我們已經(jīng)可以放在NTP的理論框架下解釋。后訓(xùn)練RL的scaling以及接下來可能實現(xiàn)的持續(xù)學(xué)習(xí)的scaling是否也存在類似的理論解釋直觀感覺后訓(xùn)練和持續(xù)學(xué)習(xí)也是在做某種NTP只是學(xué)習(xí)分布和學(xué)習(xí)方式發(fā)生了變化。在后訓(xùn)練階段模型不僅擬合觀測到的數(shù)據(jù)分布而通過模擬環(huán)境中的離線主動交互篩選出高獎勵的軌跡本質(zhì)上是在一種獎勵約束的特定分布上進(jìn)行 NTP將高價值的任務(wù)執(zhí)行路徑壓縮到模型參數(shù)里。在持續(xù)學(xué)習(xí)階段模型可以看成在真實世界的非平穩(wěn)分布上進(jìn)行NTP通過在線主動交互持續(xù)捕捉環(huán)境的動態(tài)變化應(yīng)對失效的靜態(tài)預(yù)訓(xùn)練知識。期待可以看到進(jìn)一步的理論研究討論NTP能夠作為統(tǒng)一的視角解釋從預(yù)訓(xùn)練、到強化學(xué)習(xí)、再到持續(xù)學(xué)習(xí)的 scaling 行為以及這些路徑的能力邊界在哪里。第二個信號讓我們把視角進(jìn)一步拉高從生物智能的演化中尋找線索。馬毅老師提出了智能演化的四階段路徑物種智能 - 個體智能 - 社會智能 - 機器智能將機器智能作為前三階段自然演化智能的延續(xù)。智能本質(zhì)上是相通的。如果將機器智能看作一種新的智能形式它的演化很可能會重復(fù)生物智能的物種-個體-社會三階段路徑。我們看到機器智能的發(fā)展有很多和生物智能相似的地方。 [AI Agent 的發(fā)展能力、技術(shù)架構(gòu)和軟硬件形態(tài)]首先驅(qū)動生物智能進(jìn)化背后的是能量供給的增長對應(yīng)了前面討論的機器智能提升背后的算力增長。這包括了指令式計算階段的摩爾定律和智能計算階段的規(guī)模定律。從物種智能進(jìn)入個體智能階段生物智能和機器智能的發(fā)展重心都從“硬件”轉(zhuǎn)向了“軟件”。生物智能方面由基因決定的物種級生理結(jié)構(gòu)進(jìn)化速度放緩轉(zhuǎn)向以學(xué)習(xí)和經(jīng)驗驅(qū)動的個體智能發(fā)展。機器智能方面則對應(yīng)了前面討論的從算法到數(shù)據(jù)過渡的算力-智能階段在基于Transformer的模型算法架構(gòu)成熟和穩(wěn)定后機器智能的提升主要來源于數(shù)據(jù)和經(jīng)驗。進(jìn)一步進(jìn)入社會智能階段AI Agent將從被動的智能代理轉(zhuǎn)變?yōu)橹鲃拥纳鐣悄荏w。智能代理以完成人類指定的任務(wù)為目標(biāo)社會智能體則是具備身份、信用、價值交換能力成為社會主體之一可以基于社會身份自主設(shè)定目標(biāo)和發(fā)起任務(wù)。人機關(guān)系將經(jīng)歷類似生物智能后工業(yè)革命時代從“人主導(dǎo)、機器輔助”human-in-the-loop到“人監(jiān)督、機器執(zhí)行” (human-on-the-loop)再到某些場景下由 AI 按需調(diào)用人類能力的“機器主導(dǎo)、人輔助”human-on-demand的轉(zhuǎn)變。根據(jù)喬布斯在40年前總結(jié)的“在越來越高的抽象級別上使用計算機”的規(guī)律我們現(xiàn)在已經(jīng)經(jīng)歷了從機器碼與高級語言階段的how to do到大模型階段的what to do再到當(dāng)下 AI Agent 階段的what I want。社會智能體將繼續(xù)在更高的抽象層級上滿足人類需求。當(dāng)需求進(jìn)一步抽象甚至可以被表達(dá)為一種“角色”who you are。這種模式下人授權(quán)機器在某個角色身份下自主決策和行動機器可以主動發(fā)起行為、持續(xù)與環(huán)境互動甚至在必要時反過來向人類指派任務(wù)。因此大模型與 AI Agent 的發(fā)展不僅是一場技術(shù)變革更是一場深層次的社會變革。2026 年隨著越來越多AI Agent形態(tài)的應(yīng)用落地技術(shù)-應(yīng)用鴻溝正在被逐漸填平社會層面的影響也將開始顯現(xiàn)。從“只給建議”的聊天機器人到能“把事情做完”的Manus這種轉(zhuǎn)變尚未被完全適應(yīng)但從被動響應(yīng)走向主動行動的Clawdbot已經(jīng)呼嘯而來。如何學(xué)習(xí)大模型 AI 由于新崗位的生產(chǎn)效率要優(yōu)于被取代崗位的生產(chǎn)效率所以實際上整個社會的生產(chǎn)效率是提升的。但是具體到個人只能說是“最先掌握AI的人將會比較晚掌握AI的人有競爭優(yōu)勢”。這句話放在計算機、互聯(lián)網(wǎng)、移動互聯(lián)網(wǎng)的開局時期都是一樣的道理。我在一線科技企業(yè)深耕十二載見證過太多因技術(shù)卡位而躍遷的案例。那些率先擁抱 AI 的同事早已在效率與薪資上形成代際優(yōu)勢我意識到有很多經(jīng)驗和知識值得分享給大家也可以通過我們的能力和經(jīng)驗解答大家在大模型的學(xué)習(xí)中的很多困惑。我們整理出這套AI 大模型突圍資料包? 從零到一的 AI 學(xué)習(xí)路徑圖? 大模型調(diào)優(yōu)實戰(zhàn)手冊附醫(yī)療/金融等大廠真實案例? 百度/阿里專家閉門錄播課? 大模型當(dāng)下最新行業(yè)報告? 真實大廠面試真題? 2026 最新崗位需求圖譜所有資料 ?? 朋友們?nèi)绻行枰禔I大模型入門進(jìn)階學(xué)習(xí)資源包》下方掃碼獲取~① 全套AI大模型應(yīng)用開發(fā)視頻教程包含提示工程、RAG、LangChain、Agent、模型微調(diào)與部署、DeepSeek等技術(shù)點② 大模型系統(tǒng)化學(xué)習(xí)路線作為學(xué)習(xí)AI大模型技術(shù)的新手方向至關(guān)重要。 正確的學(xué)習(xí)路線可以為你節(jié)省時間少走彎路方向不對努力白費。這里我給大家準(zhǔn)備了一份最科學(xué)最系統(tǒng)的學(xué)習(xí)成長路線圖和學(xué)習(xí)規(guī)劃帶你從零基礎(chǔ)入門到精通③ 大模型學(xué)習(xí)書籍文檔學(xué)習(xí)AI大模型離不開書籍文檔我精選了一系列大模型技術(shù)的書籍和學(xué)習(xí)文檔電子版它們由領(lǐng)域內(nèi)的頂尖專家撰寫內(nèi)容全面、深入、詳盡為你學(xué)習(xí)大模型提供堅實的理論基礎(chǔ)。④ AI大模型最新行業(yè)報告2025最新行業(yè)報告針對不同行業(yè)的現(xiàn)狀、趨勢、問題、機會等進(jìn)行系統(tǒng)地調(diào)研和評估以了解哪些行業(yè)更適合引入大模型的技術(shù)和應(yīng)用以及在哪些方面可以發(fā)揮大模型的優(yōu)勢。⑤ 大模型項目實戰(zhàn)配套源碼學(xué)以致用在項目實戰(zhàn)中檢驗和鞏固你所學(xué)到的知識同時為你找工作就業(yè)和職業(yè)發(fā)展打下堅實的基礎(chǔ)。⑥ 大模型大廠面試真題面試不僅是技術(shù)的較量更需要充分的準(zhǔn)備。在你已經(jīng)掌握了大模型技術(shù)之后就需要開始準(zhǔn)備面試我精心整理了一份大模型面試題庫涵蓋當(dāng)前面試中可能遇到的各種技術(shù)問題讓你在面試中游刃有余。以上資料如何領(lǐng)取為什么大家都在學(xué)大模型最近科技巨頭英特爾宣布裁員2萬人傳統(tǒng)崗位不斷縮減但AI相關(guān)技術(shù)崗瘋狂擴(kuò)招有3-5年經(jīng)驗大廠薪資就能給到50K*20薪不出1年“有AI項目經(jīng)驗”將成為投遞簡歷的門檻。風(fēng)口之下與其像“溫水煮青蛙”一樣坐等被行業(yè)淘汰不如先人一步掌握AI大模型原理應(yīng)用技術(shù)項目實操經(jīng)驗“順風(fēng)”翻盤這些資料真的有用嗎這份資料由我和魯為民博士(北京清華大學(xué)學(xué)士和美國加州理工學(xué)院博士)共同整理現(xiàn)任上海殷泊信息科技CEO其創(chuàng)立的MoPaaS云平臺獲Forrester全球’強勁表現(xiàn)者’認(rèn)證服務(wù)航天科工、國家電網(wǎng)等1000企業(yè)以第一作者在IEEE Transactions發(fā)表論文50篇獲NASA JPL火星探測系統(tǒng)強化學(xué)習(xí)專利等35項中美專利。本套AI大模型課程由清華大學(xué)-加州理工雙料博士、吳文俊人工智能獎得主魯為民教授領(lǐng)銜研發(fā)。資料內(nèi)容涵蓋了從入門到進(jìn)階的各類視頻教程和實戰(zhàn)項目無論你是小白還是有些技術(shù)基礎(chǔ)的技術(shù)人員這份資料都絕對能幫助你提升薪資待遇轉(zhuǎn)行大模型崗位。以上全套大模型資料如何領(lǐng)取