返回首頁

開放模型/代理基礎設施

Solar Open 2 以混合線性注意力把 250B MoE 的上下文擴至 100 萬 token

Upstage 開放 Solar Open 2 權重,以 250B 總參數、15B 每 token 啟用參數處理長流程代理工作。模型只在四分之一層保留 softmax 注意力與 KV cache,但百萬 token 能力及韓文辦公代理成績仍主要來自團隊自評。

Metro-Goldwyn-Mayer · Public domain · Image source
zh-Hant

Upstage 發布 Solar Open 2,一款面向工具調用、程式設計及文件型辦公流程的開放權重模型。它採稀疏 MoE,總計約 250B 參數,每個 token 路由至約 15B;320 個路由專家之外另有一個共享專家。權重支援英文、韓文與日文,模型卡列出的架構為 48 層、4096 hidden size,以及 196,608 詞元的 byte-level BPE。

真正值得注意的是長上下文設計。模型按「一層 softmax、三層線性注意力」交錯排列,因此只有 12 層需要保存傳統 KV cache。線性層使用擴充至負特徵值的 gated delta rule,並完全移除 RoPE 等位置編碼;Upstage 估計,這讓 100 萬 token 推論所需記憶體與計算量降至同形狀全 softmax 模型約四分之一。對會累積大量工具結果、程式碼與中間產物的代理而言,這比單純提高標稱上下文更有部署意義。

訓練方面,團隊從 Solar Open 1 選擇性轉移仍相容的 5.69B 參數,只占新模型約 2.3%,其餘重新預訓練;再從 20T-token 語料池整理出 10T-token 混合資料。後訓練先建立十二個領域專家,再以 multi-teacher on-policy distillation 合併成單一檢查點。

官方報告稱,Solar Open 2 在 MMLU-Pro、LiveCodeBench 與 APEX-Agents 領先相近規模的開放模型;韓文 Ko-GDPval 得分則由前代的 3.4 升至 86.8。不過 Ko-GDPval 是內部辦公代理基準,模型比較也未必共用相同代理框架。工程團隊下一步應觀察推論框架對混合注意力與 NoPE 的原生支援、百萬 token 下的實際記憶體曲線,以及第三方能否重現長流程成功率。

來源

  1. Solar Open 2 Technical Report
  2. Solar Open 2 model card