最新模型
Aleph Alpha 公開 Kolibri-1,78B MoE 模型以混合注意力支援百萬 token 上下文
Kolibri-1 以 Apache 2.0 公開權重,每個 token 啟用約 3.46B 參數,主攻德英雙語、文件處理與工具呼叫。百萬 token 視窗來自超出原生 256k 訓練長度的延伸,官方仍建議複雜任務使用較短上下文。

Aleph Alpha 於 10 月 3 日發布 Kolibri-1,公開約 78.1B 參數的混合專家模型權重與設定檔,採 Apache 2.0 授權。模型聚焦德文與英文,提供可調整的思考模式及工具呼叫,讓開發者可自行部署長文件問答、結構化擷取與代理流程。官方公告
技術重點是如何控制大型模型的運算與長上下文成本。Kolibri 的 50 層均採 MoE,每層包含 384 個路由專家,每個 token 選取其中 6 個,另有一個共享專家;實際啟用參數約 3.46B。注意力則由 40 層的 512-token 滑動視窗與 10 層全域注意力組成。這能限制多數層的長序列成本,但完整權重仍須留在記憶體,不能依啟用參數量估算部署容量。模型卡
百萬 token 視窗也有明確界線:模型先以 16k 序列預訓練,再經 64k 中期訓練與 256k 長上下文適應。原生訓練長度為 262,144 tokens;官方表示,因位置編碼僅用於滑動視窗層,可在不調整位置縮放的情況下延伸,並已驗證至 1,048,576 tokens。不過,對複雜任務及重視延遲、吞吐量的服務,仍建議不超過 256k。工程上應分別測試視窗容量、跨段檢索與完整任務成功率。模型卡
部署需使用 aleph-alpha-inference 提供的 vLLM 外掛,並配置 kolibri1 推理與工具呼叫解析器。思考強度透過聊天模板設定為 none、low、medium 或 high;超過 256k 的服務還須明確覆寫最大序列長度。部署說明
官方另以缺少證據時拒答的訓練強化文件依據,對企業 RAG 有實際研究價值,但發布時的效能比較仍屬廠商自測。中文並非其目標語言,繁體中文團隊應先驗證雙語文件、拒答品質、工具參數正確性與長序列顯存占用,再判斷是否適合既有工作負載。官方技術說明