企業 AI/代理模型
Salesforce Koa 以工作流程規格生成訓練環境,將 CRM 工具操作寫入 120B 模型
Salesforce 以 Nemotron 3 Super 為底座,透過合成企業情境、SFT 與 GRPO 訓練首款 CRM 推理模型 Koa。它在多輪工具使用上明顯改善,但論文承認整體表現仍落後最強前沿模型,官方「錯誤少三倍」也來自自家 CRM 評測。

Salesforce 與 NVIDIA 發表 Koa,一款由開放權重 Nemotron 3 Super 120B 後訓練而成、預定整合至 Agentforce 的企業代理模型。核心並非再餵入 CRM 文件,而是把業務流程規格轉換成可互動的訓練環境:系統從 Agent Script 描述展開具有人物角色、資料狀態與多輪對話的任務,要求模型呼叫正確工具完成更新商機、分派客服案件或安排後續聯絡等操作,再依實際任務是否解決產生獎勵。
訓練分成監督式微調及採用 GRPO 的強化學習,使用 NeMo RL、NeMo Gym 與 NeMo AutoModel。Salesforce 表示語料涵蓋逾 14 個產業的合成情境,未使用客戶資料;模型權重、後訓練及推論均由 Salesforce 控制並留在其基礎設施內。這使企業模型的信任邊界不同於把資料傳往通用外部 API,但 Koa 本身並未因此成為可下載的開放權重模型。
論文較值得注意的是「規格到獎勵」方法:對依賴資料狀態的請求,獎勵以工具執行後是否達成目標為準,而非只由另一個模型評判回答文字。結果顯示 Koa 相對底座模型的最大增益集中在多輪工具使用;官方另稱它在 CRM Bench 的動作任務中能以少三倍錯誤匹配或超越領先模型。不過,論文明確指出 Koa 雖勝過一個強力專有基線,仍不及最強前沿模型,而 CRM Bench、合成資料分布及部署環境皆由 Salesforce 掌握,外部可重現性有限。
Koa 已用於 Salesforce 內部 Slack 代理,部分客戶將先行試用,預計 2026 年冬季在美國區域正式提供。工程團隊接下來應觀察模型版本能否固定、工具權限與回滾機制如何暴露,以及在企業自訂物件、長尾流程和惡意工具回傳下,規格導向獎勵是否仍能維持可靠性。