
第十一篇最終成果展示與展望——文淵慧典能做什么不能做什么——大胖老師“咱們的系統從第一行代碼到現在快三年了。是不是該來個階段總結”——二黑從抽屜里掏出一份厚厚的報告封面印著“文淵慧典1.0版本發布與評估報告”往桌上一放“早就準備好了。成績單和體檢報告都在這。好的壞的一目了然。”——小菜湊過去看只見目錄上寫著功能清單、性能指標、用戶分布、典型案例、已知缺陷、未來路線圖。“二黑你這是把咱們扒光了給人看啊”——二黑推了推眼鏡“開源項目透明是底線。能做什么不能做什么都得說清楚。讓用戶自己判斷比自吹自擂管用一萬倍。”——大胖老師端起保溫杯滿意地點了點頭“那就開誠布公地講。今天咱們既報喜也報憂。喜的是我們真的做出了一點能用的東西憂的是還有太多書等著我們去認而我們做得還不夠快、不夠好。”一、文淵慧典1.0一份遲到但誠懇的“成績單”大胖老師把二黑的報告投在屏幕上翻到“功能清單”那一頁。上面密密麻麻列了幾十項他挑重點念核心功能PDF自動拆頁支持加密PDF密碼輸入圖像自適應二值化、展平糾偏、手機拍照梯形校正基于PPStructure的古籍專用版面分析正文、夾注、眉批、標題、印章自動分離豎排/橫排/混合排版方向自動檢測與旋轉校正閱讀順序智能重建從右到左、從上到下、夾注插入正文基于PaddleOCR的繁體中文識別字庫3.5萬覆蓋康熙字典常用字避諱字自動補全清代、宋代規則可配置異體字標準化可選輸出原字/標準字雙版本置信度標注與校對輔助低置信度自動標黃古文語言模型上下文糾錯輸出格式雙層PDF可搜索、純文本TXT、帶格式Word、ALTO XML完全離線運行純CPU推理支持Windows/Linux雙平臺一鍵安裝Web圖形界面拖拽上傳小菜看著這一長串感嘆“不知不覺我們已經做了這么多功能了。”“但更重要的是這些數字。”二黑翻到下一頁屏幕上出現一張數據表性能指標基于i5-8500/8G內存/機械硬盤辦公電腦實測平均識別速度7.8秒/頁A4古籍300DPI綜合識別準確率刻本93.2%石印本89.7%手抄本72.5%版面分析正確率單欄豎排98.5%雙欄帶夾注91.3%復雜混合版式82.6%內存占用峰值1.2GB處理300頁PDF崩潰率0.05%連續處理1000頁以上“這些數字不是實驗室里跑出來的是二十家試點圖書館的真實使用數據匯總。”二黑強調“每個數字背后都有原始記錄可查。我們還在GitHub上公開了測試集和復現方法任何人都可以驗證。”二、三年二十家圖書館一千萬字大胖老師又翻到“用戶分布與使用統計”那一頁。地圖上釘著二十顆圖釘從湖南到甘肅從東北到云南。旁邊是一組累計數據累計處理古籍頁數約21萬頁累計識別總字數約1.08億字用戶覆蓋圖書館數20家縣級館18家市級館1家高校館1家開源社區Star數5.2k貢獻者數37人核心團隊3人社區貢獻者34人被引用次數12次學術論文及技術報告“一億字什么概念”二黑打了個比方“《四庫全書》總共約八億字。我們這一年多識別的字數已經相當于《四庫全書》的八分之一了。當然這不是說我們處理了《四庫全書》而是我們處理的那些地方志、家譜、契約加起來達到了這個體量。在以前這些文字要靠館員一個字一個字敲可能要敲幾百年。現在二十臺老電腦一年多就做到了。”小菜插嘴“最有意思的不是總量是那些‘意外發現’。”他翻出幾個案例湖南王姐發現的“憋死縣令”——康熙年間縣令帶頭吃觀音土便秘幾死成為當地文史圈熱門趣聞。甘肅某館從一份民國契約里發現了當地最早的“股份制”雛形——幾個村民合伙買水車按股分紅。一位研究生用文淵慧典搜索“女”“妻”“妾”等關鍵詞從幾千頁清代契約中定位到三份女性作為獨立賣方的契約寫出了一篇核心期刊論文。“這些故事”大胖老師說“比任何benchmark都更能說明系統的價值。技術指標是骨用戶故事是肉。骨肉都擺出來別人才能看清你到底做了個什么東西。”三、坦誠的“體檢報告”文淵慧典目前做不到的事說完成績二黑翻到了報告最扎心的一頁——“已知缺陷與局限性”。“做開源項目最忌諱的就是吹牛。”二黑語氣嚴肅“我們有什么短板必須老老實實寫出來讓用戶有預期讓社區知道該往哪兒發力。”他逐條念1. 手寫體識別能力有限。當前版本對印刷體刻本和石印本的識別較好但對潦草的手抄本準確率只有70%左右尤其是行書、草書以及個人風格極強的字跡錯誤率較高。這不是短期內能根本解決的需要更多手寫體標注數據。2. 特殊版式仍有盲區。三欄以上、側批、版心外密集批注、卷軸裝、經折裝等非常規版式版面分析正確率下降明顯。我們的閱讀順序算法對常見版式有效但對罕見的古籍排版仍會出現順序錯誤。3. 生僻字覆蓋不全。雖然字庫已擴展到3.5萬但Unicode擴展B區以后的漢字、部分異體字、俗字、避諱改字、缺筆字仍可能識別錯誤或輸出亂碼。遇到甲骨文、金文、小篆等古文字系統完全無能為力。4. 表格識別不夠精準。古籍中的表格如譜牒世系表、田畝清冊識別率不高表格結構恢復不完整需要人工后期整理。5. 標點符號和句讀。當前版本僅輸出純文本不自動添加標點。古文句讀是一個獨立且高難度的NLP任務我們目前只做了基礎的語言模型糾錯尚未整合句讀功能。6. 多文種支持缺失。目前僅支持中文漢字對滿文、蒙文、藏文、彝文、西夏文等少數民族文字以及日文、韓文、越南喃字等東亞文字沒有支持。7. 對極端硬件仍有門檻。雖然我們做了大量優化但在10年以上的老爺機2G內存、單核CPU上仍然運行緩慢體驗不佳。“這七條”大胖老師總結“就是我們下一階段要攻克的山頭。我們不回避也不焦慮。羅馬不是一天建成的古籍OCR的完全體也不是三年能干完的。坦誠面對不足是進步的開始。”四、展望文淵慧典的未來路線圖講完不足二黑又翻到了最后一頁——“未來路線圖”。上面畫著一條時間軸從2026年延伸到2029年標注了幾個關鍵節點。2026-2027夯實基礎擴大覆蓋收集更多手寫體標注數據將手抄本準確率提升至80%以上支持滿文、蒙文識別與相關高校合作整合自動句讀模塊基于大語言模型微調推出在線體驗版僅作演示核心功能仍保持離線用戶擴展到100家圖書館2027-2028架構升級端到端探索端到端的統一古籍OCR大模型輸入圖像直接輸出按閱讀順序排列的帶標點文本減少對分模塊流水線的依賴降低級聯誤差引入多模態能力圖文聯合理解印章釋讀、批注筆跡分析啟動“古籍知識圖譜”項目從識別文字到提取人物、地名、事件、職官等實體2028-2029生態構建走向智能打造古籍數字化開放平臺館員上傳圖像系統自動完成識別、校對、實體提取、知識關聯生成結構化數據庫與中華古籍資源庫、高校數字人文平臺對接實現數據互通社區貢獻者超過500人形成可持續的開源生態探索輕量化移動端部署讓王大姐用手機拍照就能現場OCR“這個路線圖很激進”二黑坦誠“但我們有信心。因為現在站在我們身邊的已經不只是我們三個人了。有37個社區貢獻者有20家圖書館的用戶有PaddleOCR背后的百度團隊有千千萬萬關心古籍數字化的人。力量在匯聚。”五、王大姐的一句話大胖老師關掉投影從抽屜里拿出一張明信片遞給小菜。“這是上周王姐寄來的。她在上面寫了一句話我看了之后覺得我們這幾年的辛苦被這句話總結了。”小菜接過明信片念道“以前我覺得古籍數字化是國家大事跟我沒關系。現在我覺得我能干一點我的同事能干一點我們縣的書就能早一天被看到。謝謝你們把大事變成了小事。”二黑沉默了幾秒然后說“把大事變成小事把高不可攀的技術變成雙擊就能用的工具讓最普通的館員也能參與到文化傳承里來——這就是文淵慧典存在的全部意義。”六、尾聲這不是結束甚至不是結束的開始窗外2026年的陽光正好。實驗室的白板上那張從2023年畫到現在的項目時間線已經被各種顏色的筆跡填滿。大胖老師拿起板擦沒有擦掉任何東西而是在時間線的末端畫了一個箭頭箭頭下面寫了一行字“下一個三年。”“文淵慧典1.0今天就正式發布了。”他說“但你們知道我最喜歡哪個版本號嗎”小菜猜“2.0”二黑猜“3.0”大胖老師搖頭“都不是。我最喜歡的版本號是‘正在更新中’。因為那意味著我們還在路上王大姐們還在用古籍還在被一本一本地喚醒。”他端起保溫杯對著窗外舉了一下“致三千年簡牘致八百萬線裝。你們的遺囑我們收到了。下一程繼續。”下期預告小菜合上筆記本“老師這篇寫完了咱們的系列是不是該收尾了”二黑接口“應該還有一篇。所有做開源項目的人最后都要感謝一圈——感謝開源社區感謝用戶感謝那些貼膏藥標注數據的同學感謝每一個提bug的人。”大胖老師笑道“對。做了三年欠了無數的人情。最后一篇咱們不寫技術專門寫感謝。”“主題就叫——”《謝天謝地謝開源文淵慧典背后的那些“巨人的肩膀”和“王大姐的橘子”》小菜已經開始翻通訊錄準備致謝名單了。窗外二十顆圖釘依舊釘在地圖上每一顆都閃閃發光。而大胖老師的保溫杯里今天泡的是王姐從湖南寄來的新茶——茶葉不貴但特別解渴。本文為注水技術版您看看即可不必當真寫此文字就是圖一樂-