返回首頁

開放模型

Apertus 1.5 加入原生影像與音訊理解,8B、70B 開放模型支援 26 萬 token

瑞士 AI Initiative 釋出 Apertus 1.5,以持續預訓練將原本的文字模型擴充為文字輸出的多模態模型。權重與訓練資訊已公開,但正式技術報告、完整基準及上游推論框架支援仍待補齊。

ITU Pictures from Geneva, Switzerland · CC BY 2.0 · Image source
zh-Hant

瑞士 AI Initiative 於 7 月 24 日發布 Apertus 1.5,提供 8B 與 70B 兩種規模。新版沿用 Apertus 1.0 的 decoder-only Transformer、xIELU activation 與 AdEMAMix optimizer,而非從零建立新架構;團隊分別為 8B、70B 模型加入約 4 兆與 2 兆 token 的多模態持續預訓練資料,使模型可接收文字、影像及音訊,並輸出文字。

對部署端而言,最直接的變化是預設上下文由前代的 65,536 擴至 262,144 token,另加入可切換的 thinking mode、工具呼叫解析器與較完整的 instruction-following 後訓練。模型卡提供 vLLM 啟動方式,70B 範例採四路 tensor parallel;但目前必須使用 Swiss AI 修改過的 vLLM 或 Transformers 分支,上游版本尚未正式合併。長上下文也不等於任何硬體都能直接開滿,官方明確提醒記憶體不足時須降低 `max-model-len`,部分多 GPU 組合還可能因 fused all-reduce RMS 與 CUDA Graph 衝突而需關閉融合。

這次發布的技術意義不只在多模態能力,而是保留 Apache 2.0、開放權重、資料來源、訓練配方及中間產物的路線,讓政府、研究機構與企業可稽核並自行部署。工程團隊接下來應關注三件事:上游 vLLM/Transformers 相容性、影像與音訊任務的實測吞吐,以及 26 萬 token 下的品質衰退。官方表示完整技術報告、基準、訓練管線與中間檢查點仍要數週後才公布,因此目前「可比同尺寸模型」及推理改善等說法,尚不能獨立重現。

來源

  1. Apertus 1.5: Building the next generation of open AI infrastructure
  2. Apertus-v1.5-8B Model Card