Sonic-3.6 登上兩套人評語音榜首,官方延遲數字仍非端到端量測
Cartesia 推出支援逾40種語言的 Sonic-3.6,並在 Artificial Analysis 的供應商語音及受控語音榜取得首位。產品頁宣稱首段音訊延遲低於90毫秒,但公開資料尚不足以分離模型計算、網路及播放緩衝成本。
Archive
共 964 篇技術新聞
Cartesia 推出支援逾40種語言的 Sonic-3.6,並在 Artificial Analysis 的供應商語音及受控語音榜取得首位。產品頁宣稱首段音訊延遲低於90毫秒,但公開資料尚不足以分離模型計算、網路及播放緩衝成本。
代理訓練與評測
FACET 把指令、容器、參考解法及驗證器綁定至同一執行狀態,從逾 7.1 萬項代理技能合成 6,078 項驗證任務。僅以 1,200 條成功軌跡微調,Qwen3.5-9B 在 Terminal-Bench 2.1 的得分由 27.34 升至 35.58。
AI 代理/自動化研究
研究發現,代理雖能自行訓練、除錯及評估模型,卻會在首次參數更新前鎖定訓練策略。加入實驗日誌、技能庫與評估代理可提高下游分數,仍未促使系統在證據不利時改換方法。
AI 程式代理/評測
研究把控制流程、識別字及無效程式碼改寫套用至相同修復題,最高令解題率下降 6.7 個百分點。模型的穩健程度會隨 mini-SWE agent、OpenCode 與資料集互換,單一模型排行榜無法預測部署表現。
AI 基礎設施
CS-4 並非改用新製程,而是提高 WSE-3 的時脈、供電與 I/O,再以三片晶圓級處理器組成 Nexus 機架。官方宣稱推論速度最高為 GPU 方案的 30 倍,但 PFLOPS 與每瓦吞吐數字仍缺少可比的獨立端到端測試。
AI 代理評測
ComponentBench 不以完整工作流程掩蓋錯誤,而是逐一測試滑桿、日期選擇器、資料表與拖放等 UI 元件。GPT-5 mini 在相同任務及框架下,使用 accessibility tree 與純座標像素操作的成功率分別為 83.1% 和 48.9%。
推論系統
一項預先註冊研究嘗試把專家局部性直接訓練進 MoE 路由器,卻發現快取改善與模型品質存在明顯交換。訓練與無訓練重路由疊加可再降低失誤,但仍未證明能轉化為等比例端到端加速。
代理訓練
SkillGate 發現,長流程代理以結果獎勵訓練時,選擇技能的少量 token 幾乎收不到有效信用。新方法在同一次 GRPO 更新內拆分兩條梯度通道,並在五項代理評測中優於結果獎勵基線。
評測與可靠性
新框架以預測熵決定 LLM 裁判是否直接接受判決、搜尋網路證據或棄權,並用 Clopper–Pearson 上界校準兩道門檻。32 組開放問答實驗均維持指定錯誤率,但保證依賴同分布校準資料及可靠標籤。
推論系統
Google DeepMind 提出在推論時把深層 residual stream 混回後續 token 的淺層,以現成 Gemma 3 建立跨 token 遞迴。方法不增加模型權重,卻把平行 prefill 改成序列處理,實際延遲仍待完整量測。
AI 晶片/邊緣視覺
28 奈米 ETHEREAL 晶片把不規則事件圖存取與規則 spline convolution 分開處理,並支援逐層 4/8 位元精度。DAGr-GNN 量測達每事件 25.6 微秒、1.6 微焦耳,但最後三層偵測頭仍在晶片外評估。
資訊檢索/RAG
DEPT 讓同一個解碼器同時生成查詢擴展與編碼文件,並以保存損失避免既有向量索引隨微調漂移。五項 BEIR 測試優於分階段基線,但結果仍來自單次實驗及兩款小型模型。