返回首頁

模型與代理系統

Gander 開源全雙工多模態代理,以「小腦—大腦」分工並行對話與長任務

Gander 把串流影音對話、插話控制與非同步代理執行接到同一時間軸,前端模型可在後端代理工作時繼續與使用者互動。首版公開 Apache 2.0 程式與權重,但完整資料集尚未釋出,官方部署設定也需要三張 GPU。

Golf NFLD www.golfnewfoundland.ca · CC BY-SA 3.0 · Image source
zh-Hant

Gander 於 9 月 9 日公開模型權重、訓練程式及代理執行環境,試圖解決語音代理常見的二選一:低延遲模型適合即時對話,較強的推理代理卻需要較長時間才能規劃及操作工具。系統因此拆成「小腦」、編排執行環境與可替換的「大腦」。

小腦以 MiniCPM-o 4.5 為基礎,將音訊、影像、文字及輸出排成一秒一單位的因果序列;每個單位先預測 `listen`、`speak`、`interrupt` 或 `tool` 控制符,再生成最多八個文字 token。獨立 Talker 每單位產生 50 個 S3 語音 token,並以約半秒的區塊串流輸出,因此模型合成語音時仍可繼續接收畫面與聲音。上下文最多保留 128 個單位。

遇到長任務時,編排層會把已確認的使用者指令、畫面及任務狀態交給後端代理;首版以 Codex 為內建 provider。使用者可在執行期間補充條件、取消任務或處理權限請求,而 generation fence 會阻止已過時的執行結果被送成最終答案。這比單純把語音辨識接到文字代理,多了一套處理插話、任務世代與進度回傳的狀態機。

官方以 270 萬筆混合資料訓練,涵蓋語音互動、影音理解、代理生命週期及干擾樣本。報告稱其在 Daily-Omni 得到 78.53% 準確率,45 個委派測試均能把最終回覆綁到正確任務;但目前缺少統一的「全雙工代理」基準,多項結果仍來自團隊評測。工程團隊還應注意:完整服務設定分別用 GPU 執行 Thinker、Talker 與 ASR,資料集截至 9 月 10 日仍在釋出流程中,重現訓練與成本比較尚不完整。

來源

  1. Omni Interaction Agent Technical Report
  2. Omni-Interaction-Agent repository
  3. Gander model card