最新模型
Laya 開放非自回歸決策模型,多語版 T4 單題測試約 33 毫秒
Laya 以雙向編碼器直接產生選項機率,並公開權重、SDK 與評測材料。作者測試顯示低延遲潛力,但繁體中文準確率、機率校準及模型切換成本仍需逐項驗證。

ConvAI Innovations 於 9 月 18 日公開 Laya 決策模型的技術說明,Python 套件也在同日開始發布。專案提供開放權重,讓分類、有序等級評分與真假判斷直接產生數值結果,供客服分流、文件處理或代理路由使用。[作者說明](https://dev.to/nandakishor_m_6cc0adfde9f/i-built-non-autoregressive-decision-models-a-year-ago-then-a-frontier-lab-called-it-a-18me)、[套件紀錄](https://pypi.org/project/laya/)
其核心是雙向編碼器加決策頭:每個候選選項配置遮罩標記,模型評分後,對同一問題的選項做 softmax。英文版約 4.21 億參數,多語版約 3.22 億;呼叫端可在請求時定義選項,毋須逐字生成答案。這可減少文字解析與格式錯誤,但選錯分類、過度自信仍然可能發生。[模型卡](https://huggingface.co/convaiinnovations/laya)
訓練採用 RLCD,以嚴格適當評分規則獎勵機率分布,並透過策略梯度更新。這種目標在理論上鼓勵誠實機率,卻不保證換到新領域仍校準良好。模型卡明確要求以自己的資料重新調整溫度參數,也承認通用權重在部分工作流程上的表現弱於多數類別基線;較高分數來自專門微調版本。[架構與限制](https://huggingface.co/convaiinnovations/laya)
作者測得,多語版在 T4 上處理單題約 32.8 毫秒,十題批次共 72.3 毫秒。部署時另有冷載入成本:路由器預設只保留一組模型,交替語言可能觸發重新載入,文件列出的 T4 中位時間達 10.3 秒。預載多組權重可減少切換等待,但須自行衡量常駐記憶體需求。[部署說明](https://pypi.org/project/laya/)
繁體中文已有可檢查的數字。作者在 MASSIVE 的二十選一意圖測試中,列出多語版 `zh-TW` 準確率 54%、預期校準誤差 0.327;它證明了可測試的中文能力,也顯示機率仍有偏差。大量選項還會瓜分決策頭的 token 預算,選項文字遭截短後可能難以區分。[公開評測](https://github.com/NandhaKishorM/laya/blob/main/BENCHMARKS.md)
對工程團隊而言,公開權重與評測程式提供了建立本機快速分類器的起點。下一步應以繁體中文業務資料檢查準確率、拒答門檻及選項順序敏感度,並將冷載入納入延遲測試。跨語言流量也須單獨壓測,避免平均值掩蓋切換停頓。專案與 Jev 的比較採用不同來源、提示和樣本,尚不能視為公平的直接勝負判定。[比較條件](https://github.com/NandhaKishorM/laya/blob/main/BENCHMARKS.md)