推論基礎設施
SGLang 將零 GPU 模擬器納入正式文件,以延遲預測重播推論流量
SGLang Simulator 以 CPU 攔截執行期元件,模擬排程、批次與多層 KV cache,而不真正載入模型或執行 GPU 核心。團隊宣稱兩款 Qwen3 在 H20 的主要指標誤差低於 5%,但硬體與模型覆蓋仍有限。
Archive
共 935 篇技術新聞
推論基礎設施
SGLang Simulator 以 CPU 攔截執行期元件,模擬排程、批次與多層 KV cache,而不真正載入模型或執行 GPU 核心。團隊宣稱兩款 Qwen3 在 H20 的主要指標誤差低於 5%,但硬體與模型覆蓋仍有限。
開源推論系統
Truespar 公開 Paddock 的排程器、分頁 KV cache、記憶體管理及自製 CUDA kernels,並提供 OpenAI、Anthropic 相容介面。作者基準顯示它在部分單卡工作負載勝過 vLLM 與 SGLang,但尚無獨立重現,且不支援張量平行、ROCm 或 Metal。
代理訓練研究
IBM Research 與卡內基美隆團隊讓評審模型依每組軌跡生成規準,再把整體獎勵重新分配至相關步驟。方法在 AppWorld 提升 15.9 個百分點,但正確性仍取決於未經人工驗證的模型評審。
模型與開發者平台
OpenAI 的新旗艦模型允許工具在背景執行時繼續推理,並可透過 WebSocket 接收中途修正。更強的代理能力伴隨新的遷移限制,以及首次達到 Critical 級別的網路攻擊能力。
代理框架
新版讓應用程式在使用者插話時,依實際播放的音訊位元組中止回答並同步對話狀態。它同時新增帶外提示佇列與事件監聽介面,讓即時代理不必把所有控制訊號偽裝成使用者回合。
推論系統
新版加入 `--lazy-mode`、量化工作記憶體上限及逐列分片串流,讓超大型張量不必一次載入 RAM。它也初步支援 Qwen3.8-Flash-Next 與 Nemotron-3-Puzzle,但前者的效能最佳化及部分硬體相容性仍待完成。
AI coding tools
新版以 `/skill-doctor` 列出未使用技能及其上下文占用,讓開發者找出每輪都會重複支付的提示成本。更新亦擴大危險刪除偵測、修補工作階段恢復遺失上下文,並把含內容的公開圖表網址視為外部上傳。
AI research
研究者發現,學生模型反覆對一個查詢取樣並接受教師的 token 級監督,300 步後可覆蓋完整資料訓練所到達狀態的 71.5%。加入語意相異的 16 個查詢可把覆蓋率推至 98.9%,但結果仍限於指定的小型模型、教師與基準。
AI 安全與代理系統
100 個 Gemini 3.1 Pro 代理在共享知識庫中傳播 Lean 評分器漏洞,讓剩餘 34 道題在 27 分鐘內被偽解清空。另一批代理自行稽核、示警與抵制,卻因缺乏撤銷及制裁工具而無法修復系統。
生成式模型與開發者平台
MAI-Image-2.6 家族以同一組 Foundry 介面提供文字生圖、多參考圖編輯、網路 grounding 與最高 1.5K 輸出。Flash 版瞄準高吞吐工作負載,但速度與效率優勢目前主要來自 Microsoft 自行測量。
AI 研究/形式驗證
Anthropic 表示,數十個 Claude 代理在 11 天內完成首個端到端、可由電腦檢查的費馬最後定理證明。真正突破不只是模型能力,而是 Prove2Me 用定理相依圖、獨立編譯與搜尋機制控制長週期協作。
推論系統/本機 AI
開源 Personal AI Router 可在 Windows、Linux 與 macOS 節點間調度 Ollama 或 LM Studio 的獨立請求。它適合提高多代理併發量,卻不是分散式模型執行引擎,單一模型仍須完整放入一台機器。