推論系統
MoNe 將長上下文寫入測試時神經記憶,128K 推論總 FLOPs 減少 81%
Qualcomm AI Research 為凍結的 Transformer 外掛逐層快速權重,以 512-token 分段吸收上下文,查詢時不再讀取原文。Qwen2.5-0.5B 的 128K 實驗維持固定顯存並勝過 ICL、RAG,但證據目前限於三項合成檢索任務。
Archive
共 966 篇技術新聞
推論系統
Qualcomm AI Research 為凍結的 Transformer 外掛逐層快速權重,以 512-token 分段吸收上下文,查詢時不再讀取原文。Qwen2.5-0.5B 的 128K 實驗維持固定顯存並勝過 ICL、RAG,但證據目前限於三項合成檢索任務。
模型工程/評測工具
TokEval 將數字位值、程式 AST 邊界、UTF-8 完整性及跨語言成本納入 tokenizer 評測。控制實驗顯示部分指標可預測特定下游能力,但結果目前限於單一 1.27B 架構。
代理強化學習
Microsoft 重寫 Agent Lightning,以模型 API 代理層擷取既有代理框架的完整互動,不必把工具迴圈搬入訓練引擎。官方以 6,000 筆資料訓練 Qwen3.5-9B,報告 SWE-bench Verified 由 41.8% 提升至 56.4%。
GPU 與強化學習系統
開源函式庫 rl-triton 把 GAE、V-Trace、Retrace 等信用分配遞迴改寫成 Triton 關聯式掃描,將序列依賴深度由 O(T) 降至 O(log T)。在 4,096 個環境、128 步的測試中,它較已向量化的 torch.compile 基線快 1.6 至 5.70 倍,但大型策略的端到端 PPO 加速僅約 1.02 倍。
推論系統
TileMix 不刪除 token 連線,而是在同一個融合 kernel 內,按注意力分數 tile 選擇 FP16 或 INT8 Tensor Core 路徑。LLaMA 3.2 3B 的 4K 測試達 31.80K token/s,但結果目前限於 A100、靜態路由及 prefill 階段。
AI 代理與評測
Salesforce 重新評測兩種文字記憶方法,發現加入自我改進迴圈後,71% 的設定出現更高跨次執行變異。原本隱含由易至難課程的固定題序一經打亂,ReasoningBank 不但未改善代理,反而降低通過率。
代理評測
新評測以 73 項駕駛艙異常任務測試代理能否觀察狀態、操作系統並全程遵守硬性安全限制,而非只回答航空知識題。GPT-5.6 Sol 的成功率最高,但相近的知識分數與任務成功率並不一致,顯示靜態問答不能替代互動安全測試。
科學代理與評測
新評測要求模型僅憑論文發表前已存在的參考文獻,反推出被隱藏論文的核心研究構想。四模型交叉評審與瑞士制選拔提高匹配率,但候選數、裁判群與計算量均未與單模型條件對齊。
代理訓練與醫療 AI
Benchmark-as-Teacher 把評測中的階段分數直接轉成下一輪訓練課程,並以隔離合成資料避免把測試答案帶入更新。論文報告 9B 策略明顯優於一般 GRPO,但完整訓練資料尚未釋出,跨系統排名亦混合了不同執行框架。
FabriMAE 從 VLA 模型內部的視覺注意力熵產生可靠度分數,不需另訓練驗證器或重複執行機器人軌跡。PI0.5 在 LIBERO-Plus 的成功率增加 1.1 個百分點,但目前證據仍限於模擬環境,論文連結的程式庫亦尚未公開存取。
AI 代理與符號規劃
PDDLCoder 不要求語言模型直接產生長期行動序列,而是先建立可由符號規劃器驗證的 PDDL 世界模型。DeepSeek V4 Flash 在四個保留領域解出 95/106 題,但不同基礎模型的結果由 89.6% 跌至零,顯示框架成效高度依賴模型遵守格式及利用工具回饋的能力。
Inference systems
FluxBin 不把超低位元權重重新展開成 FP16,而是用二元圖樣直接索引預先計算的部分和。論文在單張 A100 報告最高 5.92 倍速度與 10.19 倍能源改善,但目前公開程式碼連結仍無法存取。