開放模型/程式代理
Poolside 開放 Laguna S 2.1:118B MoE 每個 token 僅啟用 8.5B 參數
Laguna S 2.1 以滑動視窗、注意力閘門及 FP8 KV cache 壓低長上下文成本,主打可自行部署的代理程式設計。模型提供多種精度權重與完整評測軌跡,但百萬 token 能力、效能比較及單機可行性仍高度取決於量化格式與執行環境。

Poolside 發布面向代理程式設計的開放權重模型 Laguna S 2.1。它共有 1,176 億參數,但採 Mixture-of-Experts 架構,每個 token 約啟用 85 億參數;模型包含 48 層、256 個專家及一個共享專家,支援在工具呼叫之間保留交錯式推理狀態。
架構重點不是單純擴大參數,而是控制長上下文的記憶體流量。48 層中有 36 層使用 512-token sliding-window attention,僅12層執行全域注意力,並以逐頭 softplus gate 調整注意力輸出;FP8版本亦可把KV cache量化成FP8。官方模型卡標示262,144-token原生上下文,部分託管端點則提供最高100萬token,因此工程團隊不能把API規格直接等同所有本機權重的保證。
官方公布Laguna S 2.1在Terminal-Bench 2.1、SWE-bench Multilingual及公開版SWE-Bench Pro分別取得70.2%、78.5%及59.4%,並釋出最終評測軌跡,方便檢查代理是否真正完成任務。然而比較表混合了Poolside自行執行與第三方回報結果,模型、代理框架、時間上限及工具設定也不完全一致,不能只依單一百分比排名。
權重涵蓋BF16、FP8、INT4與NVFP4,並支援vLLM、SGLang、TensorRT-LLM、llama.cpp及Ollama。FP8檔案仍約121GB;所謂「本機可跑」通常意味工作站級共享記憶體、多GPU,或進一步量化,而非一般24GB顯示卡。其OpenMDW-1.1授權允許商業使用與修改,但部署者仍須閱讀使用限制。接下來值得觀察的是獨立長流程測試、量化後能力損失,以及滑動視窗在大型程式庫跨檔案追蹤上的實際代價。