模型發布
Thomson Reuters 以 200B token 持續訓練 Qwen,開放 35B 法律模型供非商業研究
Thomson-1.0-Small 從 Qwen3.6-35B-A3B 延伸,以專有文件、合成改寫及通用能力重播資料進行中期訓練。官方評測顯示法律代理能力有所提升,但部分通用與程式任務反而落後基礎模型。

Thomson Reuters 發布首個自有 Thomson 模型家族,並在 Hugging Face 開放 35B 參數的 Thomson-1.0-Small。模型並非從零預訓練,而是以 Qwen3.6-35B-A3B 為起點,經 Snowdon 中間檢查點持續訓練;權重可由 Transformers、vLLM 與 SGLang 載入,但採 PolyForm Strict 1.0.0,只准學術及非商業用途,不能視為一般開源模型。
官方披露,中期訓練從逾 19 兆 token 的資料池挑出 2000 億 token,約由專有文件、文件的合成改寫,以及避免災難性遺忘的通用能力 replay data 三部分組成。後訓練再加入 DPO、強化學習、法律 IRAC 等領域本體衍生資料,以及鼓勵忠實工具使用和引用的 Deep Research 軌跡。整套流程耗用約 35,207 個 B200 GPU 小時、1.63×10²³ FLOP;公司稱整個模型計畫投入 4000 萬美元。
同一評測管線下,Small 版綜合平均為 74.6,高於基礎 Qwen 的 71.7;Harvey Legal Agent Benchmark 從 69.5 升至 73.4,PRBench Hard 從 26.9 升至 31.4。不過結果並非全面改善:Terminal-Bench 2.1 由 45.2 降至 40.5,Humanity’s Last Exam 亦由 14.1 降至 13.4,顯示 replay data 只能減輕、不能消除領域持續訓練的取捨。
這次發布值得關注的不是「法律模型超越前沿模型」的宣傳,而是企業如何把私有語料轉成監督訊號,同時維持可部署的小型 MoE 基礎。工程團隊下一步應等待第三方重現、資料污染分析及實際引用正確率測試;現有分數、資料配方與成本數字主要仍由供應商自行提供。