語音 AI/推論系統
SGLang-Omni 接入 MOSS-Transcribe-Diarize,將多說話人轉錄納入連續批次服務
SGLang-Omni 新增 MOSS-Transcribe-Diarize 部署路徑,透過 OpenAI 相容端點一次輸出逐段時間戳、文字與說話人標籤。這讓 0.9B 開放模型更容易進入線上服務,但官方效能資料使用的三個評測集目前不是完全公開。
Archive
共 979 篇技術新聞
語音 AI/推論系統
SGLang-Omni 新增 MOSS-Transcribe-Diarize 部署路徑,透過 OpenAI 相容端點一次輸出逐段時間戳、文字與說話人標籤。這讓 0.9B 開放模型更容易進入線上服務,但官方效能資料使用的三個評測集目前不是完全公開。
開放模型/代理基礎設施
Upstage 開放 Solar Open 2 權重,以 250B 總參數、15B 每 token 啟用參數處理長流程代理工作。模型只在四分之一層保留 softmax 注意力與 KV cache,但百萬 token 能力及韓文辦公代理成績仍主要來自團隊自評。
Agent applications
Meta 將 Muse Spark 1.1 的規劃與工具使用能力部署到 Meta AI,使助理能讀取郵件、行事曆並建立簡報等持續性成果。這次更新擴大了模型可接觸的私人上下文,但官方未公開工具權限、撤銷機制及端到端任務成功率。
AI coding tools
SpaceXAI 為 Grok Build 加入 Workflows,讓單次背景作業按階段平行派送最多 1,024 個代理,再彙整及驗證結果。工作流可保存為團隊共用指令,但官方尚未公布成本、成功率或大型代理群的錯誤相關性評測。
AI 基礎設施
NVIDIA 公開 ModelExpress 的完整傳輸路徑,讓新推論副本優先透過 P2P RDMA 從既有 GPU 複製權重與編譯快取。官方在 8 張 B200 上把 DeepSeek-V4-Pro 的 API 就緒時間由 8 分鐘縮至 1 分 44 秒,但結果高度依賴同型 GPU、高速網路與相容的張量配置。
代理訓練
Hugging Face 為 TRL 補上 OpenEnv 原生整合,將多輪環境以統一工廠介面交給 GRPOTrainer,而非把每次工具呼叫視為獨立函式。環境可在 WebSocket 服務或容器內執行,但專案仍處實驗階段,隔離強度與獎勵可信度須由使用者自行驗證。
AI 基礎設施/分散式運算
Google 公布 Ray 在 TPU 上的完整 AI 程式庫路徑,以 topology 欄位確保模型工作者落在同一 ICI slice。新版並加入 JAX 原生資料批次、JaxTrainer、官方容器與 TPU 監控,但目前主要驗證環境仍是 GKE。
代理訓練/強化學習
Microsoft Research 等研究者提出 OpenForgeRL,讓 Codex、OpenClaw 與 GUI 代理可在原生執行框架內接受端到端強化學習。系統以模型呼叫代理伺服器和 Kubernetes 隔離 rollout,但程式、資料與權重仍待完整公開。
開發者平台
Runway Dev 新增生成式媒體路由器,依能力、價格上限及品質與延遲偏好,為每次請求選擇底層模型。系統提供 dry run 與選模理由,但未公開品質評分器、測試集或路由效益數據。
AI 基礎設施
AMD 正式推出 CDNA 5 架構的 Instinct MI455X,以及由 72 顆加速器組成的 Helios 機櫃。新平台以開放互連與較大 HBM 容量挑戰 NVIDIA NVL72,但目前公布的效能仍以理論峰值為主。
開放模型
瑞士 AI Initiative 釋出 Apertus 1.5,以持續預訓練將原本的文字模型擴充為文字輸出的多模態模型。權重與訓練資訊已公開,但正式技術報告、完整基準及上游推論框架支援仍待補齊。
多模態推論
KAIST 團隊提出免訓練的 ReMo,在輸入端移除可由音訊解釋的畫面 token,並以文字代理保留物件語義。作者自測在 Qwen Omni 系列壓縮逾半輸入且未降低平均分數,但程式與獨立重現結果尚未公開。