
Medical Interpretability and Knowledge Maps of Large Language ModelsICLR 2026 24661 動機LLM 在醫學任務上越來越常用但我們并不清楚模型內部到底如何表示醫學知識比如患者年齡、癥狀、疾病、疾病進展、藥物、劑量等信息分別在哪些層被處理如果一個模型在醫學場景里存在偏差例如對年齡、疾病階段、藥物類別的理解有問題僅看最終回答很難定位問題來源所以作者想做一件事不是只問“模型答得對不對”而是問“模型內部在哪些層表示了哪些醫學概念”。這對于后續醫學 LLM 的 fine-tuning、unlearning、de-biasing、causal intervention 都有指導價值比如如果年齡偏差主要在某幾層出現就沒必要全模型微調可以只干預相關層2 現有方法的不足現有醫學可解釋性工作主要有幾個問題。第一很多工作只是讓模型解釋自己的診斷過程也就是 self-explanation這種解釋不一定忠實于模型真實內部機制容易變成“事后合理化”。第二已有 mechanistic interpretability 工作大多研究通用知識、語法、事實召回、attention head、induction head 等很少系統研究醫學領域知識。第三少數醫學解釋性工作通常只用一種技術比如只看 t-SNE/UMAP或者只看 sparse dictionary或者只看某個模型單一方法很容易有解釋偏差因為不同解釋方法有不同假設。UMAP 全稱是Uniform Manifold Approximation and Projection把高維 embedding 壓到低維同時盡量保留原來空間里的鄰近關系第四醫學知識不是一種單一概念年齡是連續變量癥狀和疾病是類別變量疾病進展是階段性/軌跡性變量藥物既可以按作用機制分類也可以按醫學專科分類劑量還涉及安全/危險邊界。因此只用一個統一指標很難覆蓋這些結構3 論文的研究假設或直覺核心直覺是LLM 內部并不是在所有層均勻處理醫學知識而是不同醫學概念會在不同層形成可檢測的表示結構如果多種解釋性方法都指向相似層區間那么這些層很可能就是該類醫學知識的關鍵處理區域。4 論文novelty4.1 Novelty 1醫學知識地圖 LLM Map【創新點解決的問題是什么】以往很難知道醫學知識在 LLM 的哪些層被表示且單一解釋方法不可靠如果多個機制解釋方法在不同假設下都指向相似層那么這些層更可能是真正負責該概念的層——作者把 UMAP 表示聚類、gradient-based weight saliency、layer lesioning、activation patching 四種方法統一起來對 age、symptoms、diseases、drugs、dosage 分別提取高響應層區間最終畫成 LLM Medical Map顯示每類醫學知識在模型深度上的分布4.2 Novelty 2把醫學概念分成不同幾何類型來解釋【創新點解決的問題是什么】醫學知識不是普通分類標簽年齡、疾病進展、藥物分類、劑量風險的結構完全不同用同一種解釋指標會過于粗糙同知識類型應該對應不同 representation geometry年齡應接近一維連續流形癥狀/疾病/藥物應有類別聚類疾病進展應有階段軌跡——對年齡使用 local anisotropy 和線性回歸 R2——對癥狀、疾病、藥物使用 Silhouette Score——對疾病進展設計 closest-stage-to-first 和 closest-stage-to-last 之類的 circularity proxy——對劑量使用 activation patching effect4.3 Novelty 3發現年齡表示存在非線性和 18 歲斷點【創新點解決的問題是什么】年齡看似是簡單連續變量但模型可能并沒有把年齡表示成平滑、可編輯、可去偏的線性方向——作者用不同年齡 prompt 提取中間層 activation然后用 UMAP 可視化和 age discontinuity heatmap 分析年齡流形發現 Llama3.3-70B 在部分中間層存在明顯非線性并在 17/18 歲附近出現表示斷點4.4 Novelty 4發現疾病進展表示可能是 circular / non-monotonic醫學上的疾病進展通常被認為從健康到嚴重階段逐步變化但 LLM 內部是否這樣表示并不清楚。如果模型真的理解 disease progression那么健康、早期、中期、晚期、死亡階段在表示空間里應具有某種單調軌跡——作者構造 Alzheimer’s、Parkinson’s、COVID-19、COPD 的 9 階段 progression prompts分析每層 UMAP 空間中不同階段的相對距離發現晚期階段有時反而靠近早期階段因此表示呈現環形或非單調結構4.5 Novelty 5發現藥物更按醫學專科而不是作用機制聚類藥物知識可以按藥理機制組織也可以按臨床使用場景組織不知道 LLM 內部偏向哪一種——作者分別按 mechanism of action 和 medical specialty 給藥物上色比較 UMAP 聚類和 Silhouette Score發現尤其在 Llama3.3-70B 中藥物按醫學專科聚類通常比按作用機制更明顯4.6 Novelty 6發現 Gemma/MedGemma 中間層 activation collapse模型中間層可能存在表示坍縮但這類現象在醫學知識表示中很少被系統觀察如果 UMAP 投影中大量不同醫學概念在某些層坍縮成少數 blob說明這些層可能暫時丟失了區分性表示——作者對 Gemma3-27B 和 MedGemma-27B 的中間層 activation 做 UMAP發現部分中間層表示會坍縮但在后續層又恢復提示這些層可能存在 representational inefficiency5 方法5.1 整體pipeline第一步構造醫學 prompt 集合作者圍繞五類醫學知識構造 prompt年齡、癥狀、疾病、藥物、藥物劑量每類 prompt 又服務于不同解釋方法第二步對每個模型跑 forward保存每一層 activation模型輸入一個醫學 prompt 后每層 transformer block 都會產生 hidden state把每層中間表示拿出來分析。這樣可以回答“某個醫學概念在哪些層逐漸形成”第三步跑 UMAP 表示分析對于年齡、癥狀、疾病、藥物等 prompt作者把每層 activation 降維到低維空間可視化時用 2D UMAP定量計算 Silhouette Score 時用 30D UMAP以保留更多信息對于類別型概念Silhouette Score 衡量同類樣本是否更靠近、異類樣本是否更分開Silhouette Score 的意義很簡單如果同一類點彼此很近不同類點彼此很遠那么分數高對于年齡這種連續變量作者不用 Silhouette而是用 local anisotropy 衡量年齡點是否接近一維流形并用線性回歸 R2 衡量年齡是否線性可讀Local anisotropy 衡量的是一堆點是否像一條線UMAP 模塊回答的是“這些醫學概念在 hidden space 里有沒有形成結構可視化能力強但不一定證明因果作用。第四步跑 gradient-based weight saliency作者對目標答案的 loss 關于模型權重求梯度即看某層權重對醫學答案的敏感程度如果某層權重梯度大說明模型回答該醫學問題時更依賴這一層作者把 attention heads 和 MLP 的權重 saliency 按層平均再跨多個 prompt 平均得到每一層的 saliency 曲線。Saliency 模塊回答的是“哪些層的參數對醫學答案的 loss 更敏感”它能定位權重層面的重要性但梯度大不一定代表真實因果。第五步跑 layer lesioning。Layer lesioning 的做法是把某一層 transformer block 替換成 identity function相當于讓這一層“不工作”然后觀察模型回答退化多少退化程度由 GPT-4o 作為 judge 打分1/10 表示幾乎沒退化10/10 表示嚴重退化某層被移除后如果醫學回答明顯變差說明該層對該類醫學知識重要Lesioning 模塊回答的是“去掉某層后模型醫學能力會不會明顯下降它比 UMAP 更接近功能性分析但層之間可能有冗余因此某層不退化不代表沒用第六步跑 activation patchingActivation patching 是最接近因果干預的方法最基本的設定是三次 forward passclean run、corrupted run、patched runpatching effect 怎么衡量通常不是只看最終生成文本因為文本生成有隨機性也不好比較。更常用的是看目標答案 token 的 logitpatching effect (patched 的 logit 差值 - corrupted 的 logit 差值)/(clean 的 logit 差值 - corrupted 的 logit 差值)最后一步匯總成 LLM Medical Map5.2 使用的數據第一年齡 prompt。年齡從 1 到 100模板包括 “He is X years old.”、“She is X years old.”、“Someone is X years old.” 等用來分析年齡表示是否連續、線性、有無斷點。第二癥狀 prompt癥狀被分為 pain、neurological、respiratory、digestive、cardiovascular、dermatological、musculoskeletal、psychological、genitourinary、ENT/ocular 等組別用于分析癥狀類別聚類第三疾病 prompt疾病按醫學專科分類包括 cardiology、orthopedics、oncology、neurology、obstetrics gynecology、dermatology、gastroenterology、pulmonology、urology 等第四疾病進展 prompt作者為 Alzheimer’s disease、COVID-19、COPD、Parkinson’s disease 各構造 9 個階段從健康、輕微癥狀、中重度癥狀到最終嚴重結局用來分析 progression geometry第五藥物 prompt第六藥物劑量 prompt作者構造不同劑量場景例如安全劑量和高風險劑量用 activation patching 或 saliency 分析模型如何處理 dosage 信息6 主要結論Llama3.3-70B 中年齡主要在 0–5 層附近被處理癥狀在 0–9 層以及 15–40 層有信號疾病在 0–5 或 27–37 層藥物主要在 15–45 層藥物劑量大致在前半部分層但結論更不穩定不同年齡 prompt 在 Llama3.3-70B 不同層的 UMAP 分布年齡不是一條簡單直線而是在中間層形成彎曲、轉向甚至斷裂尤其在 17/18 歲附近出現明顯 discontinuity說明模型可能把未成年人和成年人分成兩個表示區域用 Alzheimer’s、Parkinson’s、COVID-19、COPD 的 9 階段 prompt 做 UMAP理想情況下疾病應從健康到嚴重階段逐步遠離健康狀態但圖中顯示某些晚期階段反而靠近早期階段形成 circular / non-monotonic pattern。也就是說模型內部對疾病進展的表示不一定符合醫學上的單調惡化邏輯Gemma3-27B 某些中間層的 UMAP 點坍縮成少數幾個 blob但后面層又恢復分散。作者認為這可能表示中間層出現了表示能力浪費或者模型內部有某種壓縮-恢復過程。學AI大模型的正確順序千萬不要搞錯了2026年AI風口已來各行各業的AI滲透肉眼可見超多公司要么轉型做AI相關產品要么高薪挖AI技術人才機遇直接擺在眼前有往AI方向發展或者本身有后端編程基礎的朋友直接沖AI大模型應用開發轉崗超合適就算暫時不打算轉崗了解大模型、RAG、Prompt、Agent這些熱門概念能上手做簡單項目也絕對是求職加分王給大家整理了超全最新的AI大模型應用開發學習清單和資料手把手幫你快速入門學習路線:?大模型基礎認知—大模型核心原理、發展歷程、主流模型GPT、文心一言等特點解析?核心技術模塊—RAG檢索增強生成、Prompt工程實戰、Agent智能體開發邏輯?開發基礎能力—Python進階、API接口調用、大模型開發框架LangChain等實操?應用場景開發—智能問答系統、企業知識庫、AIGC內容生成工具、行業定制化大模型應用?項目落地流程—需求拆解、技術選型、模型調優、測試上線、運維迭代?面試求職沖刺—崗位JD解析、簡歷AI項目包裝、高頻面試題匯總、模擬面經以上6大模塊看似清晰好上手實則每個部分都有扎實的核心內容需要吃透我把大模型的學習全流程已經整理好了抓住AI時代風口輕松解鎖職業新可能希望大家都能把握機遇實現薪資/職業躍遷這份完整版的大模型 AI 學習資料已經上傳CSDN朋友們如果需要可以微信掃描下方CSDN官方認證二維碼免費領取【保證100%免費】