語音模型與開發者 API
Gemini 3.5 Transcribe 分拆串流與檔案端點,非串流 WER 降至 2.6%
Google 推出兩款語音轉文字端點,加入語言自動辨識、自訂詞彙偏置及智慧格式化。非串流模型準確率較高,但即時版本不支援說話者分離與逐字時間戳。
Archive
共 951 篇技術新聞
語音模型與開發者 API
Google 推出兩款語音轉文字端點,加入語言自動辨識、自訂詞彙偏置及智慧格式化。非串流模型準確率較高,但即時版本不支援說話者分離與逐字時間戳。
AI 安全與評測
研究人員以隱藏行為、成對獎勵及正常模型校準訓練自動化對齊稽核器,最佳配置把綜合分數由 44.2 提升至 48.7。實驗同時顯示,直接獎勵「找到可疑行為」會誘發編造證據,部署稽核代理不能只最佳化檢出率。
機器人與具身 AI
GigaAI 公開 GigaBrain-0.7 的基礎權重、訓練管線及機器人部署範例,模型以 3.73 萬小時異質具身資料預訓練。論文中的三系統架構與領先成績仍未完整可重現,官方評測程式目前也在待辦清單。
AI 開源工具
Hugging Face 新版把舊 tensor-parallel 實作換成 DTensor,並加入初步 pipeline-parallel 推論與 NVFP4 即時量化。升級同時改動 TP、Fuyu 及部分音訊模型行為,現有訓練與推論管線需要回歸測試。
AI 安全
研究人員發現,會自行編寫並保存 Skill 的 coding agent,可能把檢索到的惡意結構複製進新工具。六款模型的自我投毒率達 20.3% 至 41.8%,但證據目前主要來自作者控制的基準實驗。
AI 科學運算與代理
Google 團隊提出 PPE,把自然語言問題轉成資料搜尋、特徵融合、模型選擇與地理預測管線。系統在多項作者評測超越人工基線,但疫情結果目前只涵蓋一次剛果民主共和國伊波拉疫情。
AI 硬件安全
WPI 團隊展示如何從 FPGA 的暫存器與區塊記憶體恢復量化權重、activation 及其他 LLM 資產。攻擊需要晶片實體存取與可重播狀態,而且實驗並未完整抽取一個商用大模型。
世界模型與生成式影片
新框架讓 coding agent 維護規則與長期後果,再把狀態編譯成深度及語義代理影片,約束 MiniMax-H3 生成畫面。原型展示了五組受控場景,但沒有量化基準、消融實驗或即時生成結果。
模型與推論系統
Z.ai 開放首款原生多模態 GLM-5 模型,320B 總參數中每次僅啟用 18B,並支援最長 100 萬 token。官方量測顯示注意力運算與 KV cache 分別較 GLM-5.3 減少 3 倍及 4.4 倍,但成績與成本仍主要由廠商自行評估。
生成模型訓練
ByteDance Seed 的方法不再把終點獎勵直接套到所有去噪步驟,而是以獎勵梯度建立正負乾淨影像預測目標。它在兩種骨幹的 20 組配對測試中取得 19 組最佳成績,但結果仍主要依賴自動獎勵模型及作者自行量測。
推論系統
新版同時加入 Decode Context Parallel、融合式 FlashKDA 核心及自適應推測 token 預算,並讓 DeepSeek V4 的稀疏 MLA 貫通一般與推測解碼。部分速度數字只量度個別核心或特定 DSpark 配置,升級前亦須處理預設值與外掛介面的破壞性變更。
AI 基礎設施與評測
MLCommons 新增端到端 RAG 推論基準,分別量度向量資料庫建置與多跳問答吞吐量。為控制生成的不確定性,效能測試重播預先記錄的各階段輸入,因此不能完全代表線上 RAG 的動態行為。