
最近在折騰一些自動化腳本時我遇到了一個挺有意思的場景想把一個網頁上的操作流程固化下來比如定時抓取某個頁面的數據或者自動填寫一些表單。傳統的做法是寫個Python腳本用Selenium或者Playwright去控制瀏覽器但這意味著我得維護一套獨立的運行環境、處理瀏覽器驅動版本、還得應對網頁結構變化帶來的腳本失效問題。就在我琢磨有沒有更輕量、更“嵌入式”的方案時注意到了Codex這個工具。它原本給我的印象是一個能通過自然語言生成代碼的AI助手但這次的變化有點不同——它開始支持在Edge瀏覽器里直接“使用計算機”。這聽起來有點抽象但簡單來說它可能允許Codex直接與瀏覽器交互執行點擊、輸入、導航等操作而無需你離開瀏覽器去寫一個完整的自動化項目。這個變化讓我停下來想了很久。我們過去談瀏覽器自動化談RPA機器人流程自動化往往默認那是一個獨立的、需要專門學習和部署的“工程”。但如果一個你每天都在用的AI編碼助手突然能直接在你瀏覽網頁時幫你完成一些重復性操作這意味著什么是噱頭還是一個真正能改變我們與瀏覽器交互方式的起點1. 先別急著找安裝包理解“計算機使用”到底指什么看到“Computer Use”這個功能很多人的第一反應可能是去搜索“codex安裝教程”或者“codex桌面版下載”。但在此之前我們得先搞清楚這個功能的核心價值點在哪里以及它和我們熟知的那些自動化工具比如瀏覽器插件、油猴腳本、或是獨立的RPA軟件到底有什么不同。1.1 從“代碼生成”到“動作執行”的跨越Codex最初為人熟知的能力是將自然語言描述轉化為可執行的代碼片段。比如你描述“用Python讀取CSV文件并計算某列的平均值”它能生成對應的代碼。這解決的是“寫代碼”的問題。而“計算機使用”Computer Use則試圖解決“執行任務”的問題。它的目標不是給你一段待運行的代碼而是理解你的意圖后直接操控計算機在當前語境下特指瀏覽器去完成這個意圖。例如你告訴它“幫我在這個電商網站搜索‘無線鼠標’并按價格排序”它可能會嘗試自動在搜索框輸入、點擊按鈕、解析頁面元素并執行排序操作。這背后的邏輯是很多重復性的網頁操作其最終目的并不是為了得到一段代碼而是為了得到一個結果。如果AI能跳過“生成代碼-用戶復制-用戶運行”這個中間環節直接產出結果效率的提升是顯而易見的。1.2 在Edge瀏覽器中實現輕量化與場景化的嘗試為什么是Edge瀏覽器而不是一個獨立的桌面應用這其實體現了兩種不同的產品思路。獨立的自動化軟件如一些RPA工具功能強大但通常較重需要安裝、配置學習成本不低。而集成在瀏覽器中則有以下幾個潛在優勢環境統一操作直接發生在瀏覽器沙盒內無需處理跨應用、跨窗口的復雜交互。對于純網頁操作場景路徑最短。權限清晰它的操作范圍理論上被限制在瀏覽器標簽頁內這比一個擁有系統級權限的獨立應用在安全感知上更讓人放心當然具體實現決定了實際的安全邊界。即開即用無需單獨啟動一個軟件在瀏覽網頁時隨時可以喚起處理臨時性的、輕量級的自動化需求。與現有生態結合可以更容易地與瀏覽器插件、開發者工具、甚至其他AI功能如Copilot進行聯動。所以這個功能的目標用戶可能不是需要構建企業級復雜流程的RPA工程師而是廣大的普通用戶、運營人員、數據分析師或者開發者他們面對的是大量重復、規則明確但又不值得專門開發一個系統的網頁操作。1.3 與常見方案的模糊邊界理解一個新功能把它和已知的東西做對比會更清晰。我們可以看一個簡單的對比表格特性瀏覽器插件/油猴腳本獨立自動化工具 (如 Selenium, Playwright)Codex 的 “Computer Use” (概念推測)核心能力通過注入JS腳本修改或增強頁面功能通過API編程控制瀏覽器實現復雜流程通過自然語言指令讓AI理解并執行操作使用門檻需要會JavaScript了解DOM需要會編程處理環境、驅動、反爬等理論上最低只需用語言描述靈活性高可深度定制頁面行為極高可跨頁面、跨應用、處理復雜邏輯未知可能受限于AI的理解能力和安全邊界維護成本中需隨網頁結構變化更新腳本高需維護代碼和運行環境理論上低由AI適應變化(存疑)適用場景固定頁面的功能增強、數據提取測試、數據采集、復雜的業務流程自動化臨時的、簡單的、描述清晰的重復操作從這個對比可以看出Codex的“計算機使用”試圖在“使用門檻”和“靈活性”之間找到一個新平衡點用極高的易用性自然語言來覆蓋那些不夠靈活但非常高頻的簡單場景。注意目前關于該功能的具體實現細節、能力邊界和穩定性信息非常有限。上述分析是基于其概念描述和常見技術路徑的合理推測。在嘗試前務必將其視為一個探索性功能而非成熟的生產力工具。2. 從概念到實操如何開始嘗試與核心邏輯推演由于沒有官方的詳細文檔和明確的公開入口我們無法給出一步步的點擊教程。但是我們可以根據這類功能通常的落地方式推演出一個合理的探索路徑和需要關注的核心邏輯。這比盲目尋找安裝包更有價值。2.1 探索入口與前置條件通常這類與AI深度結合的新功能可能會通過以下幾種方式提供Edge瀏覽器內置側邊欄類似Copilot的側邊欄在瀏覽網頁時側邊欄的AI助手可能新增“執行任務”或“自動化”相關的選項。特定網站或服務集成可能需要訪問特定的實驗室頁面或啟用特定的瀏覽器標志edge://flags。作為ChatGPT Plus或企業版功能通過ChatGPT的“高級數據分析”或“自定義GPT”類似的路徑獲得瀏覽器交互權限。獨立的瀏覽器擴展開發一個專門的擴展申請必要的瀏覽器權限如activeTab,scripting,webNavigation等來實現。對于普通用戶最可能的入口是第一種或第二種。因此如果你的Edge瀏覽器已經更新到最新版本可以留意側邊欄Copilot區域是否有新按鈕或描述詞的變化。同時在地址欄輸入edge://flags并搜索 “Codex” 或 “Computer Use” 之類的關鍵詞看看是否有實驗性開關。關鍵前置條件猜想一個有效的、支持該功能的AI服務賬號如OpenAI的ChatGPT Plus。最新版本的Microsoft Edge瀏覽器。可能需要明確授權該功能訪問當前標簽頁。2.2 理解其可能的工作流程即使無法立即上手理解它“可能怎么工作”也能幫助我們判斷其適用性。一個合理的工作流程推演如下意圖捕獲你在AI聊天界面或瀏覽器側邊欄輸入自然語言指令如“把本頁面所有產品標題和價格提取到一個表格里”。意圖解析與規劃AI模型如GPT-4會解析你的指令將其分解為一系列可執行的原子操作步驟。例如步驟1識別頁面中所有可能是“產品”的容器。步驟2在每個容器中定位“標題”和“價格”文本元素。步驟3提取文本內容。步驟4將數據組織成表格格式。動作執行Codex或背后的執行引擎將這些原子操作轉化為對瀏覽器DOM文檔對象模型的實際操作。這可能通過以下幾種技術之一實現瀏覽器擴展API使用chrome.scripting.executeScript向頁面注入JavaScript代碼來執行操作。無頭瀏覽器驅動在后臺啟動一個輕量級的瀏覽器實例來執行操作對用戶透明。模擬用戶輸入通過系統級的自動化工具模擬點擊和鍵盤輸入權限要求高可能性較低。結果反饋與確認執行過程中可能會需要你的確認尤其是涉及輸入個人信息或執行刪除等危險操作時。最終將提取的數據以文本、表格或文件的形式返回給你。2.3 實操中必須關注的“安全邊界”與“權限控制”這是此類功能最核心、也最需要用戶警惕的部分。讓AI直接操作你的瀏覽器相當于賦予了它“代你行事”的能力。因此以下幾個問題必須在嘗試前想清楚它能訪問哪些數據是僅限當前打開的標簽頁還是能訪問你的瀏覽器歷史、書簽、保存的密碼它能執行哪些操作僅限于讀取和點擊還是可以輸入文本、下載文件、甚至進行支付是否需要逐項確認對于敏感操作如提交表單、下載文件是自動執行還是每次都需要你點擊“允許”操作記錄是否可審計你能否查看AI具體執行了哪些步驟以便在出錯時進行追溯一個負責任的功能設計應該遵循“最小權限原則”和“透明性原則”。作為用戶在首次啟用時務必仔細閱讀權限申請列表并盡量在測試環境如無重要信息的測試網站中先行驗證。注意在任何情況下都不要授權此類功能訪問銀行、支付、郵箱主賬號或存有敏感信息的公司內部網站。先從公開的、信息不敏感的新聞或電商網站開始測試。3. 能力邊界與當前局限性別指望它是“萬能自動化機器人”基于現有信息和類似技術的普遍發展階段我們可以對Codex的“計算機使用”功能做出一些合理的預期管理。過早的夸大或貶低都無助于我們真正利用它。3.1 它可能擅長什么理想場景信息提取與匯總從結構相對規整的列表頁如產品列表、新聞列表、搜索結果頁中提取特定字段名稱、價格、日期、鏈接并整理成表格。這是自然語言描述清晰、頁面元素有規律的任務。簡單的表單填寫在已知字段名稱和內容的條件下幫你快速填充一些重復性的表單例如注冊測試賬號、批量錄入數據需確保數據安全。頁面導航與點擊操作執行“點擊下一頁”、“展開所有評論”、“切換到表格視圖”等明確的導航和交互指令。基于頁面內容的簡單決策例如“找到價格最低的那個選項并點擊‘加入購物車’”。這需要AI能理解“價格最低”的比較邏輯。這些場景的共同點是目標明確、頁面結構可預測、操作步驟線性且簡單。3.2 它很可能不擅長什么當前挑戰處理高度動態或復雜交互的頁面對于大量使用JavaScript動態加載內容、元素ID隨機生成、或有復雜驗證碼的頁面AI可能無法穩定定位元素。需要復雜邏輯判斷或跨多步驟狀態維護的任務例如“監控這個拍賣網站在最后5分鐘如果我的出價不是最高且價格低于100元則自動加價10元”。這涉及狀態監控、條件判斷和循環超出了當前AI執行任務的典型設計范圍。理解模糊或主觀的指令“幫我找一款好看又便宜的藍牙耳機”。什么是“好看”“便宜”的標準是什么這種需要主觀審美和復雜權衡的任務AI很難直接轉化為瀏覽器操作。繞過反自動化機制網站如果有反爬蟲或反自動化措施依賴固定模式的自動化操作很容易被識別和封鎖。AI驅動的操作模式是否更隱蔽目前未知但原則上仍可能被檢測到。保證100%的準確率和穩定性網頁布局隨時可能改變AI的理解也可能出現偏差。它不適合用于處理金融交易、關鍵業務操作等不容有錯的場景。3.3 與“ChatGPT完成Windows設置”的聯想與區分搜索詞中出現了“chatgpt 完成windows 設置”這反映了用戶一種普遍的期待AI能否直接操作整個操作系統Codex的“計算機使用”目前明確限定在瀏覽器內這是一個重要的安全和技術邊界。操作瀏覽器一個相對標準化的應用和操作整個Windows系統擁有無限可能性和極高風險是截然不同的兩件事。后者需要系統級權限面臨無限復雜的環境變量安全風險呈指數級增長。因此短期內看到AI全面接管操作系統設置的可能性極低。瀏覽器的沙盒環境是一個更可行、更安全的起點。4. 給開發者和進階用戶的思考這背后是什么在驅動對于不滿足于只是使用的技術愛好者來說這個功能背后透露的技術趨勢和可能性更值得玩味。4.1 技術棧猜想LLM 瀏覽器自動化API要實現這個功能一個經典的技術組合可能是大型語言模型 (LLM)如GPT-4負責理解用戶自然語言指令并將其分解、規劃成具體的操作步驟Action Plan。這一步的關鍵是“思維鏈”Chain-of-Thought和“工具調用”Function Calling能力。瀏覽器自動化框架/API如Puppeteer或Playwright的核心庫或者直接使用Chrome DevTools Protocol (CDP)。這部分負責接收LLM規劃出的具體操作如click(selector),typeText(selector, text)并將其轉化為真實的瀏覽器交互命令。中間協調層一個關鍵的“翻譯器”或“執行器”。它需要將LLM輸出的抽象計劃映射到當前具體網頁的實際元素上。這可能是最復雜的一環因為LLM需要“看到”網頁的結構。實現方式可能是DOM樹簡化與描述將頁面的DOM結構簡化并轉換成文本描述送給LLM分析。計算機視覺輔助對頁面進行截圖使用多模態模型如GPT-4V來“看”頁面并定位元素。混合模式結合DOM信息和視覺信息提高元素定位的魯棒性。4.2 對現有工作流的潛在影響如果這類技術成熟它不會完全取代傳統的自動化開發但會重塑工作流的起點原型速度極大加快當你需要為一個新的網頁操作寫自動化腳本時可以先讓AI嘗試執行。即使它不能100%完成其生成的“操作意圖”和可能定位到的元素選擇器也能為你提供寶貴的起點和參考節省大量探查頁面結構的時間。降低自動化需求的門檻很多“值不值得自動化”的邊界會發生變化。以前覺得寫腳本太麻煩的一次性任務現在用幾句話描述就能解決這會讓自動化滲透到更細微的工作環節中。人機協作模式變化從“人編寫完整程序 - 機器執行”變為“人描述意圖 - AI嘗試執行 - 人糾正與精調”的交互循環。人的角色更像是一個“監工”和“糾正者”負責處理邊界情況和復雜邏輯。4.3 面臨的挑戰與未來方向這項技術要走向實用化必須解決幾個核心挑戰可靠性問題如何保證AI對頁面元素的理解和操作是穩定、準確的如何應對網頁的A/B測試、動態加載和改版可泛化性在一個網站上學會的操作能否遷移到結構類似的其他網站還是每次都需要重新學習安全與倫理如何防止被惡意利用進行點擊欺詐、數據爬取、或誘導用戶授權危險操作如何確保操作過程透明、可審計成本問題每次操作都調用大模型成本是否可接受能否有小模型或本地模型來分擔部分任務未來的演進方向可能會是“AI智能體”AI Agent在特定領域如瀏覽器的垂直化、工具化落地。它不會是一個全知全能的通用人工智能而是一個配備了“瀏覽器操作工具箱”的專用助手。5. 理性看待當前階段你應該如何嘗試與定位它綜合以上分析我們可以為這個尚在迷霧中的功能畫一個相對清晰的用戶畫像和行動指南。5.1 誰應該去嘗試熱衷于體驗前沿技術的探索者你樂于嘗試新事物能接受功能不穩定、效果不完美并愿意提供反饋。被大量簡單重復網頁操作困擾的普通用戶比如經常需要從多個網頁收集數據做對比或定期執行固定流程的填報工作。開發者與測試人員你可以通過觀察AI如何操作頁面來獲得UI元素定位的新思路或者用它來快速生成一些測試用例的初始步驟。5.2 誰可以暫時觀望尋求穩定、可靠生產級解決方案的用戶如果你需要每天處理成千上萬次操作要求100%準確率和穩定性那么成熟的RPA工具或自研腳本仍然是更靠譜的選擇。處理高度敏感數據的用戶在安全機制完全明確之前謹慎總是對的。對自動化完全陌生的用戶如果連瀏覽器開發者工具都沒打開過直接上手這種AI驅動的高級自動化可能在遇到問題時更難排查。5.3 如果找到入口你的“嘗鮮三步法”假設你已經在Edge中找到了這個功能的入口我建議按以下順序進行這能幫你最快地理解其能力和局限第一步從最簡單的“讀取”開始找一個結構清晰的頁面比如一篇維基百科文章或一個產品列表頁。給出最簡單的指令“列出本頁的所有標題H1 H2”。觀察它能否正確識別并提取文本。這一步驗證其基本的頁面理解和信息提取能力。第二步嘗試基礎的“點擊”與“導航”在同一個網站內給出指令“點擊‘下一頁’按鈕”或“點擊第一個產品的鏈接”。觀察它能否正確識別交互元素并完成導航。這一步驗證其執行基礎交互的能力。第三步挑戰組合任務與模糊指令嘗試一個需要多個步驟的任務“在這個電商網站搜索‘筆記本’按價格從低到高排序然后把第一頁的產品名稱和價格給我”。或者給出一個模糊指令“幫我找找關于這個主題的更詳細信息”。這一步將暴露其在復雜規劃、元素定位和意圖理解上的邊界。在整個過程中請務必打開瀏覽器的開發者工具F12切換到“控制臺”(Console)或“網絡”(Network)標簽頁。你可以觀察是否有額外的腳本被注入以及執行過程中是否有錯誤信息輸出。這是理解其工作原理和排查問題的最直接方式。5.4 一個務實的定位輔助者而非替代者至少在可預見的未來我們應該將此類AI驅動的“計算機使用”功能定位為一個強大的輔助者和效率倍增器而非完全替代人類判斷和專業自動化工具的替代者。它的價值在于快速原型幫你把想法瞬間變成可操作的嘗試。處理瑣事接手那些規則明確、枯燥乏味的重復性點擊和收集工作。激發思路當你不知道如何用代碼實現某個頁面操作時它的嘗試可以給你提供線索。而復雜的邏輯判斷、關鍵的業務流程、對穩定性和安全性要求極高的任務仍然需要經過設計、編碼、測試和評審的傳統自動化流程來保障。回到開頭我自己的那個場景如果Codex的“計算機使用”功能可用我可能會先讓它嘗試幫我抓取數據。如果成功了皆大歡喜如果失敗了它嘗試的過程和遇到的錯誤很可能已經幫我摸清了頁面的大部分結構我再去寫Python腳本時會順暢得多。這本身就是一種有價值的進步。技術的演進往往不是突然替換掉舊工具而是先在某些環節上打開一個新的、更便捷的可能性讓我們重新思考整個工作流的優化方式。