語音 AI
Azure Speech LLM 2607 自動更新語音辨識,片語清單可提示逾 2,000 個實體
Microsoft 更新託管式 LLM Speech,主打混合語言、專有名稱與數字辨識,並宣稱部分情境延遲較 2605 版最多降低三倍。新版沿用現有 Fast 與即時 API,卻會在服務端自動部署,因此既有語音代理也需要自行建立回歸測試與版本觀測。
頭版
偏技術的 AI 模型、軟體、晶片、開源、研究與基礎設施新聞。
語音 AI
Microsoft 更新託管式 LLM Speech,主打混合語言、專有名稱與數字辨識,並宣稱部分情境延遲較 2605 版最多降低三倍。新版沿用現有 Fast 與即時 API,卻會在服務端自動部署,因此既有語音代理也需要自行建立回歸測試與版本觀測。
推論系統
Dynamo 現可將視覺編碼、LLM 預填充與解碼分配給獨立工作程序及不同等級 GPU,避免影像請求阻塞純文字流量。官方測試雖顯示首 token 與端到端延遲最高改善 5 倍、7 倍,但長輸出或大型稠密模型可能抵銷拆分收益。
代理基礎設施/推論排程
新研究把「回合已就緒」與「送入推論引擎」拆開,以 CVaR 尾部風險及動態工作量預算決定提交順序。SWE‑bench 軌跡重播中最高得到 3.5 倍 P95 加速,但結果只涵蓋固定代理軌跡、單一到達亂數種子與 A100/vLLM 環境。
AI 安全與評測
新基準固定檢索內容,以四種條件測量 RAG 如何改變五款開放模型回答有害問題的行為。含答案的文件讓所有模型更容易產生正確但危險的內容,而安全裁判之間也只有中度一致性。
具身 AI 與機器人
Show-Harness 讓通用 VLM 輸出方向、夾取與釋放等符號,再由各機器人的直譯器轉成受限運動。Gemini 零樣本與微調後的 Qwen 2B 在十項實機任務分別達 89% 與 86%,但測試仍集中於桌面取放。
語音模型
小米提出端到端目標說話者 ASR,把一至四秒參考語音和混合錄音送入同一音訊編碼器,不先執行語音分離。模型也能在目標缺席時輸出空字串,但訓練大量依賴未公開資料,且首版報告尚未提供可驗證權重與程式。
推論系統
PELM 不只調整處理器頻率,還動態選擇推測解碼設定與驗證深度,在熱限制下共同控制硬體和模型工作量。論文報告最高 23.1% 加速及 52.4% 節能,但峰值結果不能直接外推到手機或其他模型。
AI 輔助軟體安全
Datasette 首次以 Claude、GPT 系列代理執行完整安全稽核,再由兩名開發者交叉撰寫測試與修補程式。新版收緊私有資料權限、SQL/HTML escaping、認證及 HTTP 快取,但部分重現測試暫緩公開,外界尚不能完整獨立驗證漏洞範圍。
AI 研究與代理訓練
Google 的 ToolGrad 先建立可執行的 API 鏈,再反向生成對應指令,避開傳統代理以搜尋碰運氣找答案的低效率。實驗顯示小型資料集即可改善未見工具上的函式呼叫能力,但結果仍集中於單輪基準與合成工作流。
推論基礎設施
SageMaker 即時推論端點新增 `PREFIX_AWARE`,讓相同系統提示、文件或對話歷史盡量落到同一實例。官方七節點測試顯示長前綴工作負載明顯受益,但序列化差異、熱門前綴與快取容量仍會左右實際成效。
地球觀測與應用研究
Google 與 NASA JPL 讓視覺 Transformer 直接結合 EMIT 的光譜及空間脈絡,同時估算濃度、羽流邊界與排放源位置。公開模型找回約八成專家標註案例,但更高敏感度也帶來地表混淆與假陽性風險。
代理評測與安全
AgentAudit 不只計算任務是否完成,而是從執行軌跡分別檢查規劃、記憶、工具選擇、安全與執行完整性。五款模型的綜合信任分數差距很大,但九項任務與單一模型裁判不足以支持通用排名。
生成式音訊
YuE2 把旋律與和弦的符號規劃、語意 token 和 flow-matching 音訊合成放進同一套生成流程。權重可在 24GB GPU 執行,但非商用授權及最佳八選一評測,使其與商用系統的比較仍須保守解讀。