返回首頁

模型與企業 AI

Thomson Reuters 推出法律模型 Thomson:從 Snowdon 權重續訓,先進入 CoCounsel 文件審閱

Thomson 以 Imperial College London 的 Snowdon 開放權重模型為基礎,再用 Westlaw、Practical Law 等專有資料及法律專家回饋進行中期與後期訓練。官方評測顯示引用可驗證性優於通用前沿模型,但完整技術報告與獨立驗證仍未完成。

Nyc203446 · CC BY 3.0 · Image source
zh-Hant

Thomson Reuters 正式推出自有大型語言模型 Thomson,首個生產部署是 CoCounsel Legal 的 Tabular Analysis,用於大量文件的結構化審閱。CoCounsel 並未改成單一模型架構:Thomson 會處理具領域優勢的工作,其他任務仍可路由至第三方前沿模型,管理員也能選擇替代模型。

這不是從零預訓練的基礎模型。官方披露目前版本以 Imperial College London FAIR Lab 的 Snowdon 開放權重模型為起點,先從 Westlaw、Practical Law、Checkpoint 與 Reuters News 選取、清理、去重及混合資料進行 continued pre-training,再以法律專家建立的複雜評分規則、偏好資料和工具使用軌跡完成後訓練。迄今採用的 Thomson Reuters 內容仍少於總量一成。

團隊把防止領域微調造成「災難性遺忘」列為訓練目標,尤其關注容易先退化的指令遵循能力。官方結果中,Thomson 的指令遵循綜合分數為 0.914;在由 53 道內部法律研究題構成的深度研究測試,接入 Westlaw/Practical Law 後,逐項檢查「主張是否獲其引用來源支持」的 factuality 得分為 0.83,對照兩套可自由搜尋公開網路的前沿系統為 0.65 與 0.68。

項目兩年投入約 4,000 萬美元,涵蓋人才與運算;報道稱最終一次訓練成本約 45 萬美元。這條路線對持有高品質專有語料的企業有實際意義:競爭壁壘可能從參數規模轉向資料權利、專家評分規則及可重複的領域評測。

不過,公開表格混合了業界基準、內部長上下文測試與模型裁判,模型大小、訓練 token 數及基礎 Snowdon 的完整規格也未披露。完整技術報告尚待發布,小型開放權重版本和外部 API 亦只是計畫;現階段不應把廠商評測解讀成已證明全面超越 Claude、GPT 或 Gemini。

來源

  1. How we built Thomson
  2. Thomson Reuters launches proprietary AI model for legal work
  3. Thomson Reuters Built Its Own AI Model That Now Ranks Among the World’s Best