代理基礎設施
690 項代理技能實測:混合檢索 hit@5 達 73.5%,加入 LLM 知識圖譜反降 11.2 點
新研究發現,以嵌入近鄰預先限制候選邊,會讓知識圖譜無法觸及檢索器原本找不到的技能。BM25 與向量融合仍留下約四分之一查詢未解,但在相同 token 預算下勝過圖譜鄰居。

代理技能庫擴大後,系統必須先決定要載入哪個 `SKILL.md`,否則把研究中的 690 項技能全部放入上下文,每次約需 46,900 token。8 月 6 日提交的[比較研究](https://arxiv.org/abs/2608.06196)測試兩條路線:一是融合 BM25 與 MiniLM 向量相似度的混合排序器;二是讓 Claude Haiku 4.5 在每項技能的八個嵌入近鄰中,產生 prerequisite、data flow、ordering 等八類關係,形成 1,421 條具型別邊。
在 117 個刻意避免重複技能描述用詞的查詢上,混合排序器 hit@5 為 73.5%±8.0%。若以圖譜鄰居取代部分排序結果,在相同候選與 token 預算下反而低 11.2 個百分點,差異達統計顯著。原因不是圖譜完全錯誤,而是候選生成先被同一套嵌入近鄰限制:1,022 組不同的具型別配對中,98.6% 已存在於相似度圖,新增 1,421 條邊也沒有連接任何新節點或合併分量。LLM 只能替既有連線加上語意標籤,無法擴張可達範圍。
這項「預篩選拓撲上限」直接反映在失敗案例:混合排序器漏掉的 30 題中,73% 從第一名候選出發、三跳內仍無法抵達正確技能;第一名猜錯時,繼續讀取排序結果可救回 48.3%,圖譜鄰居僅救回 25.9%。此外,由系統作者撰寫的查詢會讓 BM25 hit@5 虛高 44.2 點,顯示技能描述回音會嚴重污染評測。
這對採用 [Agent Skills 漸進載入規格](https://agentskills.io/specification)的系統很實際:名稱與描述適合做第一階段召回,但工作流圖應從實際共用紀錄、人工依賴或不同於檢索器的候選訊號建立。研究只測單一企業技能庫與 117 題,方向型關係仍有 8.5% 矛盾;論文所列重現儲存庫目前亦無法公開存取,因此數字尚待外部重跑。