開放權重模型
Solar Open 2 以混合線性注意力支撐百萬 token,250B MoE 每次僅啟用 15B 參數
韓國 Upstage 發布面向長流程代理的 Solar Open 2,將 2500 億參數 MoE、混合注意力與百萬 token 上下文整合於同一模型。官方表示量化後可用兩張 NVIDIA H200 部署,但效能與長上下文穩定性目前主要依賴團隊自測。

Upstage 於 7 月 22 日公開 Solar Open 2 權重與技術報告。模型共有 2500 億參數,但每個 token 只啟用 150 億參數;其 48 層骨幹配置 320 個路由專家與一個共享專家,企圖用稀疏 MoE 保留大型模型容量,同時壓低每次前向傳播的運算量。
更值得注意的是其長上下文設計。Solar Open 2 每三層線性注意力插入一層標準 softmax 注意力,並取消位置編碼。線性層以 recurrent state 累積歷史資訊,softmax 層則補足精確的 token 關聯,官方據此把上下文由前代的 128K 延伸至 1M token。這條路徑避開 RoPE 外插限制,但不代表百萬 token 內的所有資訊都能同等可靠地被檢索;工程團隊仍應測試長文件中的位置偏差、工具狀態遺失與 KV/狀態記憶體需求。
後訓練資料涵蓋對話式工具呼叫、程式開發與辦公工作,並延續針對韓文最佳化的 tokenizer。報告稱,其他全球模型的 tokenizer 處理相同韓文時會多耗用約 1.2 至 1.9 倍 token;這對韓文 RAG、代理軌跡與 API 成本具有直接影響。官方也宣稱模型在 MMLU-Pro、LiveCodeBench 與 APEX-Agents 領先同級開放權重模型,量化後可放進兩張 H200。
不過,這些比較仍由開發團隊提供,且「每 token 啟用 15B」不等同只需保存 15B 權重;自架服務仍須處理完整 250B 權重、專家路由與跨 GPU 通訊。接下來應觀察第三方長上下文壓力測試、量化後的工具呼叫退化,以及 vLLM、SGLang、llama.cpp 等執行期能否有效支援其混合注意力結構。