返回首頁

AI 評測與多代理系統

28 款模型的 17 萬次投票顯示:增加代理數量無法消除共同錯誤

新研究以四類二元篩選任務測量 28 款語言模型,發現模型往往在相同樣本上一起犯錯,使多數決留下無法靠擴大委員會消除的誤差底線。研究亦指出,最佳通過門檻取決於正、負案例各自的錯誤相關性,固定過半規則未必最安全。

JUNO Collaboration: Angel Abusleme, Thomas Adam, Shakeel Ahmad, Rizwan Ahmed, Sebastiano Aiello, Muhammad Akram, Abid Aleem, Tsagkarakis Alexandros, Fengpeng An, Qi An, Giuseppe Andronico, Nikolay Anfimov, Vito Antonelli, Tatiana Antoshkin… · CC BY 4.0 · Image source
zh-Hant

多代理系統常以「多數決」降低單一模型的不穩定性,但這項假設只有在各代理錯誤大致獨立時才成立。7 月 27 日提交的新研究蒐集 28 款語言模型在四種二元篩選基準上的 174,384 張主要協定選票,另公開約 27,000 筆推理協定資料,涵蓋 20 款開放權重模型與 8 款前沿 API 模型。研究者分別估計好案例與壞案例中的命中率及模型間潛在相關性,再用奇數編號題目擬合參數、預測偶數題目的委員會損失。

結果顯示,模型錯誤並非均勻共現:在某些案例類型中,模型高度同步失誤,在另一類案例中則較具互補性。因此,簡單要求過半代理同意,可能同時放大漏放或誤擋風險。以準確率 0.8 的參考代理為例,研究測得的跨模型家族相關區間約為 0.24 至 0.85;即使委員會規模趨近無限,多數決仍可能保留單一代理錯誤的 21% 至 90%。若不同類型錯誤的代價不對稱,最佳 `k-of-n` 門檻也會偏離半數。

對部署團隊而言,重點不是單純增加模型或重複採樣,而是先在代表性資料上估計「逐案例共同失敗」:同一基礎模型的多次取樣、相近訓練資料或相同提示模板,都可能提供虛假的多樣性。實務上應以保留集選擇門檻,並按任務狀態分開計算相關矩陣與錯誤成本。不過,研究集中於可化約成二元決策的篩選任務,採用 Gaussian copula 建模;其結論尚不能直接外推到開放式程式修改、工具執行或代理辯論。下一步值得觀察的是,加入真正異質的工具、檢索來源與訓練家族,能否實際壓低這個相關誤差底線。

來源

  1. State-dependent error correlations shape voting thresholds in committees of AI agents
  2. Replication package: Correlated errors determine the optimal architecture of AI-agent organizations