RAG/深度研究代理
DeepWeaver 先編織證據再生成答案,DeepSeek-V4-Flash 論據充分度由 75.4% 升至 86.5%
DeepWeaver 以 Thought Block Chain 整理主張、關鍵資訊與來源,再反覆檢查尚未利用的證據。它改善多款模型的長篇回答與引用指標,但新評測集中於中文水環境問題,程式碼也尚未真正釋出。

清華大學團隊提出 DeepWeaver,嘗試解決深度研究系統在「找到資料」與「寫出可靠答案」之間的斷層。一般 RAG 會把大量檢索片段直接塞進長上下文,但實驗顯示,加入更多含雜訊證據不一定勝過只取樣 120 段:模型可能漏讀細節、合併不相容主張,或把引用接到錯誤句子。
DeepWeaver 在最終生成前維護 Thought Block Chain(TBC)。每個區塊綁定主張、摘要資訊、關鍵詞及支持證據;系統先建立草稿,再由 subordinate TBC 掃描尚未覆蓋的片段,最後以 commit 步驟合併新主張並丟棄重複內容。兩輪精煉效果最佳,第三輪未帶來明顯增益。
在新建的 LoQA 上,DeepSeek-V4-Flash 加入 DeepWeaver 後,證據召回由 24.2 升至 31.6、論據充分度由 75.4% 升至 86.5%,相關引用數由 31.0 升至 44.6;Qwen3.5-122B-A10B 與 DeepSeek-V3.2 亦呈現一致提升。網頁研究測試固定沿用 WebWeaver 的搜尋器,以隔離證據合成效果;DeepWeaver 的有效引用分數為 60.13,WebWeaver 為 26.74。
成本並非完全免費。以兩張 A100 執行 Qwen3-30B-A3B 時,DeepWeaver 平均讀入 316 萬 token,較 WebWeaver 的 235 萬更多;但中間輸出由 30.7 萬降至 9.4 萬 token,本機時間由 18.5 分鐘降至 14.2 分鐘,估算成本接近 0.313 與 0.303 美元。工程團隊應留意:LoQA 僅涵蓋中文水環境領域,多項品質分數由 LLM 裁判產生,而且 GitHub 倉庫目前只有說明文件並註明程式稍後更新,尚不能獨立重現完整流程。