
一句話講清楚阿里巴巴 Qwen 團隊提出 Skill-RM 把異構的獎勵評估標準 rubric 、參考答案、 checklist 、 verifier 等封裝成可執行的 Reward-Evaluation Skill 讓 Agent 按需檢索資源、收集證據并聚合打分在 RewardBench2 、 RM-Bench 、 JudgeBench 三項基準上以 Qwen3.5-27B 骨干取得 86.2 平均分超越同骨干 LLM-as-a-Judge 基線 2.3 分。論文標題Skill-RM: Unifying Heterogeneous Evaluation Criteria via Agent Skill論文鏈接https://arxiv.org/abs/2606.03980Github 鏈接https://github.com/Qwen-Applications/Skill-RM一道 JSON 題暴露 RM 的「拼湊困境」論文 Figure 1 給了一個極簡但典型的判卷場景。 Prompt 要求寫一個normalizeScores(values)函數返回包含minScore、maxScore、normalizedScores的 JSON 字符串。兩個候選回答擺在一起■A用了 snake_case 鍵名 JSON 結構也不對■B camelCase 鍵名正確字段齊全。怎么判如果只看「像不像好代碼」兩個回答都可能騙過淺層 judge 。真正靠譜的評估要同時動用好幾類資源1.Rubric代碼類任務優先跑測試2.Checklist camelCase 標識符、精確 JSON 鍵名3.Verifier Python sandbox 執行parse_json檢查4.Aggregation rule正確性優先于風格平局才看次要維度。傳統 LLM-as-a-Judge 會把上述內容全塞進一個 prompt 讓模型自己琢磨先看哪條、后看哪條。 Skill-RM 換了個思路把這些資源寫進 Reward-Evaluation Skill 按固定流程「診斷 → 選資源 → 驗證 → 聚合」走一遍。論文示例軌跡里 A 得 2/5 B 得 5/5 最終選 B——每一步證據都掛在結構化輸出里事后能復查。這個例子雖小卻點中了當下 RM 的核心矛盾評估標準已經碎片化編排層卻還停留在 flat prompting。背景 RM 從「打分器」變成「多源驗證器」做過 RLHF 管線的人大概都踩過坑訓練用的 reward 信號和線上用戶真實偏好經常對不上。數學題步驟全對、答案錯一位標量 RM 仍可能給高分代碼能跑通、變量命名違規 flat judge 有時又過度糾結風格。大模型后訓練里 Reward Model RM 是 RLHF 、 RFT 、 GRPO 等流程的「方向盤」。早期范式是點式標量預測優化目標為是 prompt 是回答 輸出一個數。簡單、快但信息損失大。模型能力往推理、代碼、工具調用方向擴張后「怎么判好壞」也跟著變復雜■數學題要對答案、跑 verifier ■代碼題要過單元測試■安全場景要拆約束、做 policy veto ■事實類問題要查 reference 、檢索證據■Agent 軌跡要逐步校驗 tool call 合法性。信號來源各異現有設計卻缺統一編排。標量 RM 把多維證據壓成不透明分數 LLM-as-a-Judge 能寫理由但資源選擇、證據追蹤、信號聚合往往藏在模型「直覺」里難復現。 rubric 條件化、工具增強 judge 等方向各有進展大多一次只暴露一種資源模態——缺的是可復用、可編排、證據可追溯的抽象層。Agent Skill 范式為何能遷移到 RM Anthropic 的 Agent Skills 、開源 agentskills.io 規范把「怎么做一類任務」打包成文件系統制品核心是SKILL.md流程 元數據旁邊掛腳本、參考文檔、可執行資源 Agent 按需漸進式加載。獎勵評估和 Agent 做任務底層邏輯很像都要在多種工具/文檔里選對資源、按步驟執行、留下可復查記錄。 Anthropic 的 Skill 把這類流程固化成文件 Skill-RM 把它專門用到「怎么給模型回答打分」。論文把資源庫分成五類每類在判卷鏈路里各司其職資源類型例子作用Rubric Criterion有用性、正確性、安全定義評判維度與優先級Reference答案鍵、證據段落支撐事實/數學正確性Checklist Constraint格式要求、禁止行為把指令遵循拆成可檢查項Verifier ToolPython sandbox產出可執行觀測Calibration Aggregation證據優先級規則解決沖突、映射到最終判斷Skill-RM 的核心動作把獎勵知識外化成Reward-Evaluation Skill——帶資源庫、調用協議、證據 schema 的可執行評估程序相當于給 judge 一份「判卷說明書」加「工具箱」。Skill-RM 總覽 Reward-Evaluation Skill 含流程文檔與結構化資源庫評估時動態檢索 rubric 、 verifier 等資源產出可追溯的 Agentic 評估軌跡。三步走 Skill-RM 實際怎么判一道題把形式化定義翻譯成工程語言流程可以壓成三步。第一步加載 Skill 規格。 類似讀SKILL.md這次要評哪些準則輸出格式是點式分數、成對偏好還是從 個候選里選一個論文把 Skill 記為 —— 是說明書 是工具箱。第二步按協議收集證據。 Agentic judge 逐步執行列出可用資源 → 檢視 rubric → 調 verifier → 填 checklist 。每激活一條準則 就記一條證據 是觀測比如 sandbox 返回parse_json: pass 是局部判定滿足/違反/不確定。所有證據匯總成 是最終結論字段。第三步確定性讀出獎勵。 讀出函數 從完整軌跡 映射到任務所需輸出 給標量 給最優候選編號 即成對偏好。點式 RM 、 pairwise RM 、 rubric 聚合 RM 被收進同一套 Skill 執行范式——差別只在最后一步怎么讀 。關鍵設計是漸進式披露資源默認潛伏 Skill 規格觸發才加載。 flat prompt 把整庫資源一次性倒給 judge 上下文噪聲會把關鍵信號淹沒——后面消融實驗會驗證這一點。資源庫本身通過 LLM 輔助策展從文獻、 benchmark 文檔、可驗證評估實踐里聚合候選去重、泛化、版本凍結。論文 Appendix 列了 6 類通用資源 helpfulness rubric 、 math answer-first rubric 、 code test-first rubric 、 safety bounded-help rubric 、 JSON format checklist 、 evidence priority aggregation rule 加樣本級擴展接口。實驗同骨干對比才是硬指標RewardBench2 / RM-Bench / JudgeBench 主結果論文在三大 RM benchmark 上對比了標量 RM 、生成式 RM 、 rubric 系統、 agentic judge 等基線。外行看榜單容易被 MoE 大模型分數吸引內行應盯同骨干 Qwen3.5-27B方法RewardBench2RM-BenchJudgeBench平均GPT-4o Judge64.973.159.865.9Skywork-Reward-V2-Llama-3.1-8B84.192.880.085.6Qwen3.5-27B Judge81.189.880.883.9RewardAgent (Qwen3.5-27B)82.080.566.376.3Skill-RM (Qwen3.5-27B)85.091.582.186.2同骨干下 Skill-RM 三項全漲平均從 83.9 提到 86.2 2.3 。 RewardBench2 和 RM-Bench 拿到完整行最高 JudgeBench 上 122B MoE 變體沖到 85.2 27B 版 82.1 也已超過同骨干 judge 的 80.8 。三大 benchmark 完整對比加粗為最高、下劃線為次高。 Skill-RM (Qwen3.5-27B) 平均 86.2 為完整行第一。和 TIR-Judge-Zero agentic verifier judge 平均 76.4 比 Skill-RM 的優勢在統一編排多種資源而不只是掛一個 Python 執行器。和 OpenRubrics 、 Auto-Rubric 等 rubric 系統比 Skill-RM 能同時調度 rubric 、 reference 、 verifier 、聚合規則不必為每種任務單獨改 prompt 模板。掛載樣本級資源 RL 場景的關鍵增益標準 benchmark 通常只給 prompt 和候選回答。真實 RL 管線里 per-sample 的 reference 、約束、 verifier 輸出經常可用。 Skill-RM 通過 Skill 接口掛載這些sample-specific資源方法RewardBench2RM-BenchJudgeBench平均Qwen3.5-27B Judge81.189.880.883.9OpenRS sample-spec.84.087.593.188.2Skill-RM85.091.582.186.2Skill-RM sample-spec.86.091.589.789.1OpenRS 在 JudgeBench 上沖到 93.1 定制評估協議但同骨干平均最高仍是 Skill-RM sample-spec. 的 89.1。無樣本資源時 Skill-RM 已 2.3 掛上樣本資源后再 2.9 說明 Skill 接口對 RL 下游價值更大。消融 append 資源反而降分這篇論文最有啟發的一行數據在這里方法平均ΔBaseline (Qwen3.5-27B Judge)83.90.0 appended resources81.0-2.9 appended sample-spec.82.0-1.9 Python tool83.6-0.3Skill-RM86.22.3Skill-RM sample-spec.89.15.2把 reference 和 verifier 直接粘進 prompt 平均分從 83.9 掉到 81.0 。 append 模式下 judge 同時看到 rubric 、 checklist 、 verifier 說明卻缺少 Skill 協議規定的「先診斷再選資源」順序關鍵信號如 sandbox 的 parse_json 結果容易被長 prompt 稀釋——這和漸進式披露的設計正好相反。單獨給 Python 工具也幾乎沒增益 83.6 。2.3 分的提升更像是編排贏了而不是資源變多了。論文還在 GPT-4o 、 Claude-3.5-Sonnet 、 DeepSeek-V3 等多個骨干上做了補充實驗 Appendix Table 8 趨勢一致 Skill-RM 相對同骨干 flat judge 均有正向提升說明機制不綁死 Qwen 一家。Best-of-N 重排哪里賺、哪里還難JETTS 固定池實驗用 Qwen2.5-72B-Instruct 生成 10 個候選比較重排質量和生成能力無關。 Baseline 和 Skill-RM 走相同 sequential pairwise knockout Skywork-Reward-V2-Qwen3-8B 獨立打分選最高。■GSM8K Skill-RM 97.8 Oracle10 上界 97.9 Baseline 97.7——數學近乎飽和 Skill 只是把最后 0.1 摳出來■IFEval 、 HumanEval Skill-RM 明顯超過 Baseline 和 Skywork 指令遵循和代碼場景收益最實在■BigCodeBench Skill-RM 有正向提升但距 Oracle 仍有明顯差距復雜代碼任務的重排仍是短板。如果你在工程里做采樣解碼 Best-of-N IFEval 和 HumanEval 值得優先加 Skill-RM 式重排層 BigCodeBench 這類復雜代碼任務單靠 judge 重排很難貼近 Oracle10 上界。指令遵循 RL 能當獎勵源嗎IF-RewardBench 排序Kendall 相關 overall assessment 方法Single-TurnMulti-TurnSystem-Prompt平均Gemini-3-Flash0.5890.4600.4890.513Qwen3.5-27B0.5070.4400.2870.411Skywork-V2-Llama3.1-8B0.1530.2050.0390.133Skill-RM0.6190.5400.4130.524標量 RM Skywork 平均 0.133 在 IF 場景幾乎失靈 Skill-RM 平均 0.524 最高 Single-Turn 0.619 和 Multi-Turn 0.540 拉滿。 System-Prompt 子集 0.413 仍落后 Gemini-3-Flash 的 0.489——長系統提示是指令遵循 judge 的硬骨頭后續 Skill 擴展值得盯。VerInstruct GRPO 下游訓練方法IFEvalIFBenchAdvancedIF平均Tulu 382.627.625.045.1VerIF83.727.622.844.7Skill-RM84.827.625.445.9VerIF 是最接近的對照同樣用 VerInstruct GRPO 。 Skill-RM 平均 45.9 最高 IFEval 1.1 、 AdvancedIF 2.6 IFBench 持平 27.6 。增幅不大但方向正確——Skill-RM 可以端到端接入 RL 獎勵鏈路而不只是離線 benchmark 刷分。和 TIR-Judge 、 OpenRS 差在哪快速對照三條代表性路線TIR-Judge-Zero給 judge 掛 Python 執行器讓模型寫代碼驗證答案。強項是 verifiable 任務弱項是資源類型單一——rubrics 、 checklists 、聚合規則仍靠 prompt 硬塞。OpenRS樣本級資源做得深 JudgeBench 上樣本資源掛載后極強 93.1 。代價是評估協議定制程度高跨任務泛化要單獨適配。Skill-RM用 Skill 抽象統一調度所有資源類型默認協議下就能漲分掛載樣本資源后進一步拉升。 trade-off 是推理開銷多步 Agentic 軌跡比單次標量 RM 慢論文也承認需要 early stopping 、證據緩存、 artifact 剪枝來控成本。局限三件事還沒解決作者列了三條邊界1.評估范圍以文本 IF 和標準 RM benchmark 為主多模態、長程 Agent 、主觀偏好待擴展2.Skill 靠人工策展自動化構建與持續更新是開放題3.推理成本高于標量 RM 生產環境要算 ROI——Best-of-N 重排可能劃算每 token 在線 RL 獎勵可能要慎重。RM 競爭正在轉向「評估基礎設施」Skill-RM 本質是把 agentskills.io 那套「說明書 工具箱」搬進判卷同一骨干 Qwen3.5-27B 上編排式 Skill 比 flat judge 平均高 2.3 分 append 資源反而掉 2.9 分——說明問題在流程不在堆料。對齊訓練要的是穩定、可審計的獎勵信號 flat prompt 每次讓 judge 從零決定資源用法復現性和透明度都吃虧。幾條工程建議基于論文數據而非空泛展望■RL 管線里已有 reference / verifier 的試試封裝成 Skill 式接口別直接 append 進 prompt——消融已經證明會降分■采樣解碼后加 Best-of-N 重排 IFEval / HumanEval 收益明確■System-Prompt 長上下文場景仍是弱點值得單獨擴 Skill 資源庫■上線前算清楚延遲 Agentic 多步評估的 token 開銷能不能被 Best-of-N 的質量增益覆蓋。開源倉庫 https://github.com/Qwen-Applications/Skill-RM 已放出。 Qwen 應用團隊這條線如果和 Qwen3.5 訓練棧深度整合有機會成為開源對齊方案里「可編排獎勵」方向的標桿實現。學AI大模型的正確順序千萬不要搞錯了2026年AI風口已來各行各業的AI滲透肉眼可見超多公司要么轉型做AI相關產品要么高薪挖AI技術人才機遇直接擺在眼前有往AI方向發展或者本身有后端編程基礎的朋友直接沖AI大模型應用開發轉崗超合適就算暫時不打算轉崗了解大模型、RAG、Prompt、Agent這些熱門概念能上手做簡單項目也絕對是求職加分王給大家整理了超全最新的AI大模型應用開發學習清單和資料手把手幫你快速入門學習路線:?大模型基礎認知—大模型核心原理、發展歷程、主流模型GPT、文心一言等特點解析?核心技術模塊—RAG檢索增強生成、Prompt工程實戰、Agent智能體開發邏輯?開發基礎能力—Python進階、API接口調用、大模型開發框架LangChain等實操?應用場景開發—智能問答系統、企業知識庫、AIGC內容生成工具、行業定制化大模型應用?項目落地流程—需求拆解、技術選型、模型調優、測試上線、運維迭代?面試求職沖刺—崗位JD解析、簡歷AI項目包裝、高頻面試題匯總、模擬面經以上6大模塊看似清晰好上手實則每個部分都有扎實的核心內容需要吃透我把大模型的學習全流程已經整理好了抓住AI時代風口輕松解鎖職業新可能希望大家都能把握機遇實現薪資/職業躍遷這份完整版的大模型 AI 學習資料已經上傳CSDN朋友們如果需要可以微信掃描下方CSDN官方認證二維碼免費領取【保證100%免費】