開放模型/持續訓練
Thomson-1.0-Small 以 200B token 持續訓練強化專業能力,但權重授權限制生產使用
Thomson Reuters 以 Qwen3.6-35B-A3B 為基礎,公開具 35B 總參數、每次啟用 3B 的 Thomson-1.0-Small。模型在法律、稅務與研究代理評測有所提升,但成績主要由開發團隊量測,PolyForm Strict 授權也不是一般開源授權。

Thomson Reuters 與 Imperial College London、DatologyAI、Lambda 公開 Thomson-1.0-Small 權重及技術報告,嘗試證明機構不必從零預訓練,也能把現有開放權重模型改造成專業領域模型。它沿用 Qwen3.6-35B-A3B 的 MoE 架構,總參數 350 億、每個 token 啟用約 30 億參數,原生上下文為 262,144 token,權重採 BF16。
訓練不是一次窄域微調,而是三段式持續學習。團隊先以 Constitutional DPO 依照 Public AI Constitution 重新對齊價值,再從超過 19 兆 token 的候選池篩出 2,000 億 token 做持續預訓練;資料約由專有專業文件、合成改寫及一般能力 replay 組成,以模型合併抑制災難性遺忘。最後再結合 DPO、強化學習、法律 IRAC 等領域本體,以及具工具與引用獎勵的 Deep Research harness。完整流程耗用約 1.63×10²³ FLOP,折合 35,207 個 B200 GPU 小時。
官方評測的未加權總平均為 74.6,高於基礎 Qwen 的 71.7;Harvey Legal Agent Benchmark、文件處理與 RAG、一般代理等項目均有改善。不過提升並不全面:Stanford LegalBench、程式設計、數學及多語能力仍落後部分對照模型,顯示 replay 只能減輕、不能消除能力交換。工程團隊亦須注意,雖然權重可由 Transformers、vLLM 與 SGLang 載入,其 PolyForm Strict 1.0.0 授權限制商業及生產用途。下一步應關注獨立重跑、資料污染檢查,以及同等算力下持續訓練相對於 RAG 或較小型領域模型的成本效益。