代的執(zhí)行安全語(yǔ)言體系(七一):Agent 身份、意圖、權(quán)力、上下文風(fēng)險(xiǎn))
Working Draft · AI Era Execution Security LanguageThis article is part of the Havenlon Execution Security Language project.The terminology and definitions presented here describe the currentworking draft and may evolve as the discipline matures.AI 時(shí)代執(zhí)行安全語(yǔ)言體系工作草案本系列旨在建立 AI 時(shí)代執(zhí)行安全的共同語(yǔ)言。本文中的術(shù)語(yǔ)與定義代表當(dāng)前工作草案將隨著理論研究、工程實(shí)踐和社區(qū)討論持續(xù)修訂14. Agent Authority智能體權(quán)力一句話定義智能體權(quán)力是 Agent 能夠提出、選擇、請(qǐng)求或?qū)嶋H觸發(fā)動(dòng)作的能力范圍。嚴(yán)格定義Agent Authority 必須拆分為提議權(quán)讀取權(quán)規(guī)劃?rùn)?quán)工具選擇權(quán)工具請(qǐng)求權(quán)有限自主執(zhí)行權(quán)治理參與權(quán)恢復(fù)權(quán)。這些權(quán)力不能混為一體。例如一個(gè) Agent 可以讀取告警生成修復(fù)方案提議重啟服務(wù)但不一定有權(quán)直接重啟生產(chǎn)集群修改管理員權(quán)限關(guān)閉安全控制增加自己的工具權(quán)限。上位概念Execution AuthorityDelegated Authority下位概念A(yù)gent Proposal AuthorityAgent Tool AuthorityAgent Execution AuthorityAgent Governance AuthorityAgent Recovery Authority相關(guān)概念Tool PermissionDelegated ExecutionNo Unilateral Catastrophic AuthorityAuthority InheritanceScope Limit權(quán)力邊界Agent 權(quán)力必須是有限、可撤銷、不可自動(dòng)擴(kuò)張且不可無(wú)條件傳遞的。約束機(jī)制權(quán)力拆分最小權(quán)限非傳遞授權(quán)時(shí)間限制對(duì)象限制高風(fēng)險(xiǎn)轉(zhuǎn)治理權(quán)力變更留證。結(jié)果目標(biāo)讓 Agent 能夠完成任務(wù)但無(wú)法將任務(wù)能力擴(kuò)張為系統(tǒng)主權(quán)。在 Havenlon 中Agent 默認(rèn)擁有 Proposer 權(quán)力只有低風(fēng)險(xiǎn)預(yù)授權(quán)槽位提供有限執(zhí)行能力。15. Agent Identity智能體身份一句話定義智能體身份是用于區(qū)分某個(gè) Agent 實(shí)例、角色、模型、部署環(huán)境和權(quán)限主體的可驗(yàn)證身份。嚴(yán)格定義Agent Identity 可以包含agent_idagent typemodel versiondeploymentownerorganizationrolecredentialtool scoperuntime environmentcurrent policylifecycle state。系統(tǒng)必須區(qū)分用戶身份Agent 身份代表用戶行動(dòng)的委托關(guān)系A(chǔ)gent 使用的服務(wù)賬戶工具底層憑證。不能把 Agent 的所有動(dòng)作都?xì)w因于擁有者本人。上位概念I(lǐng)dentityMachine Identity下位概念A(yù)gent Instance IdentityAgent Role IdentityModel IdentityRuntime IdentityDelegated Agent Identity相關(guān)概念A(yù)gent AuthorityIntent OriginService AccountDevice IdentityEvidence Chain權(quán)力邊界Agent 不能使用用戶或管理員的長(zhǎng)期身份直接執(zhí)行所有動(dòng)作也不能在多個(gè) Agent 之間共享不可區(qū)分的憑證。約束機(jī)制獨(dú)立憑證Agent ID工作負(fù)載身份短期 Token工具作用域?qū)嵗C據(jù)權(quán)限撤銷。結(jié)果目標(biāo)讓每個(gè)機(jī)器發(fā)起動(dòng)作能夠追溯到具體 Agent而不是只顯示“系統(tǒng)執(zhí)行”。在 Havenlon 中Agent Identity 進(jìn)入 Proposal Evidence并與委托者身份和 Execution Intent 分開(kāi)記錄。16. Agent Intent智能體意圖一句話定義智能體意圖是 Agent 根據(jù)目標(biāo)和上下文生成的、希望系統(tǒng)執(zhí)行的結(jié)構(gòu)化動(dòng)作表達(dá)。嚴(yán)格定義Agent Intent 必須與以下內(nèi)容區(qū)分用戶原始目標(biāo)Agent 對(duì)目標(biāo)的解釋當(dāng)前上下文Tool Call最終 Payload。例如用戶目標(biāo)可能是解決這個(gè)客戶問(wèn)題。Agent Intent 可能被具體化為向客戶賬戶退款 500 元。隨后 Tool Payload 可能是refund(account_x, amount500)安全系統(tǒng)必須驗(yàn)證Agent 的具體化是否合理金額是否符合授權(quán)對(duì)象是否正確當(dāng)前上下文是否完整是否需要人工確認(rèn)最終 Payload 是否仍等于該 Intent。上位概念Execution IntentMachine-Initiated Intent下位概念A(yù)gent-Proposed IntentAgent-Derived IntentAgent-Revised IntentMulti-Agent Intent相關(guān)概念Human IntentIntent DriftContext InjectionTool CallingIntent Binding權(quán)力邊界Agent 對(duì)用戶目標(biāo)的解釋不能自動(dòng)成為不可逆執(zhí)行事實(shí)。約束機(jī)制Intent 結(jié)構(gòu)化目標(biāo)來(lái)源引用語(yǔ)義摘要金額與對(duì)象顯式化IntentHash高風(fēng)險(xiǎn)重新確認(rèn)最終綁定。結(jié)果目標(biāo)把模型的開(kāi)放式推理結(jié)果收斂為可驗(yàn)證、可審批和可拒絕的具體動(dòng)作。在 Havenlon 中Agent 輸出必須先轉(zhuǎn)換為標(biāo)準(zhǔn) Execution Intent不能把自然語(yǔ)言推理直接送給 Executor。17. Agent Hallucination智能體幻覺(jué)一句話定義智能體幻覺(jué)是 Agent 生成了不受事實(shí)支持、錯(cuò)誤、不完整或虛構(gòu)的判斷、參數(shù)、狀態(tài)或行動(dòng)依據(jù)。嚴(yán)格定義Agent Hallucination 可能影響對(duì)象金額時(shí)間身份工具能力系統(tǒng)狀態(tài)執(zhí)行結(jié)果Policy用戶授權(quán)外部事實(shí)。在純內(nèi)容場(chǎng)景中幻覺(jué)可能產(chǎn)生錯(cuò)誤回答。在執(zhí)行場(chǎng)景中幻覺(jué)可能變成錯(cuò)誤 Tool Call錯(cuò)誤參數(shù)錯(cuò)誤目標(biāo)不必要執(zhí)行重復(fù)執(zhí)行虛假成功判斷錯(cuò)誤恢復(fù)動(dòng)作。上位概念Model ErrorAgent Risk下位概念Parameter HallucinationState HallucinationPermission HallucinationTool HallucinationResult Hallucination相關(guān)概念Semantic GapTool MisuseFinal RevalidationFact SourceExecution Drift權(quán)力邊界模型輸出不能被視為事實(shí)來(lái)源也不能因?yàn)橹眯疟磉_(dá)強(qiáng)烈而獲得執(zhí)行資格。約束機(jī)制外部事實(shí)驗(yàn)證結(jié)構(gòu)化字段對(duì)象白名單參數(shù)上限Tool Schema獨(dú)立 Policy執(zhí)行前重新驗(yàn)證。結(jié)果目標(biāo)讓模型錯(cuò)誤停留在候選判斷階段而不是直接成為現(xiàn)實(shí)動(dòng)作。在 Havenlon 中Agent 的判斷只作為 Proposal 輸入事實(shí)和執(zhí)行條件由獨(dú)立系統(tǒng)重新驗(yàn)證。18. Prompt Injection提示注入一句話定義提示注入是攻擊者通過(guò)輸入內(nèi)容影響 Agent 的指令理解、目標(biāo)優(yōu)先級(jí)、工具選擇或執(zhí)行行為的攻擊方式。嚴(yán)格定義Prompt Injection 可以來(lái)自用戶輸入網(wǎng)頁(yè)郵件文件數(shù)據(jù)庫(kù)內(nèi)容工具返回其他 Agent長(zhǎng)期記憶RAG 文檔外部 API。攻擊內(nèi)容可能誘導(dǎo) Agent忽略系統(tǒng)指令泄露信息調(diào)用高風(fēng)險(xiǎn)工具修改執(zhí)行目標(biāo)擴(kuò)大作用域偽造審批隱藏行為執(zhí)行攻擊者指定動(dòng)作。Prompt Injection 的核心危險(xiǎn)不是“模型被說(shuō)服”而是被污染內(nèi)容是否能夠穿過(guò) Agent獲得真實(shí)執(zhí)行能力。上位概念A(yù)dversarial InputContext Attack下位概念Direct Prompt InjectionIndirect Prompt InjectionTool-Result InjectionMemory InjectionCross-Agent Injection相關(guān)概念Context InjectionTool MisusePolluted IntentLegitimate-Path AbuseTool Execution Boundary權(quán)力邊界外部文本不能因?yàn)檫M(jìn)入 Agent 上下文就自動(dòng)改變執(zhí)行 Policy、工具權(quán)限或治理狀態(tài)。約束機(jī)制內(nèi)容與指令分離不信任外部上下文工具權(quán)限外置高風(fēng)險(xiǎn) Intent 顯式化獨(dú)立審批Payload Binding最終硬件拒絕。結(jié)果目標(biāo)讓提示注入最多影響 Agent 的候選輸出不能直接繼承成最終執(zhí)行權(quán)。在 Havenlon 中即使 Agent 被注入并生成惡意 Tool Call最終仍需經(jīng)過(guò)獨(dú)立 Execution Intent、Policy 和本地執(zhí)行邊界。19. Context Injection上下文注入一句話定義上下文注入是攻擊者或異常系統(tǒng)將誤導(dǎo)性、偽造、過(guò)期或惡意信息加入 Agent 上下文從而改變其判斷和執(zhí)行計(jì)劃。嚴(yán)格定義Context Injection 比 Prompt Injection 更廣。它可以包括偽造業(yè)務(wù)狀態(tài)污染記憶修改檢索結(jié)果插入虛假審批返回惡意工具結(jié)果提供過(guò)期 Policy偽造用戶意圖隱藏關(guān)鍵限制篡改歷史事件。Agent 可能并未違反任何顯式提示卻基于錯(cuò)誤上下文得出危險(xiǎn)結(jié)論。上位概念Context PollutionAdversarial Context下位概念Memory InjectionRAG InjectionTool Output InjectionState InjectionIdentity Context Injection相關(guān)概念Polluted ContextAgent IntentContext IntegrityPrompt InjectionFact Source權(quán)力邊界Agent 上下文不能作為治理、Policy、身份和執(zhí)行事實(shí)的唯一來(lái)源。約束機(jī)制來(lái)源標(biāo)記數(shù)據(jù)簽名事實(shí)分層新鮮度多源核驗(yàn)Context Binding最終本地狀態(tài)。結(jié)果目標(biāo)阻止被污染的上下文直接決定不可逆執(zhí)行。在 Havenlon 中關(guān)鍵治理、Policy 和執(zhí)行狀態(tài)從受驗(yàn)證來(lái)源讀取而不是只相信 Agent 當(dāng)前上下文。