AI 推論系統
vToken 將 KV 快取虛擬化至 token 層級,受限記憶體下併發量最高翻倍
vToken 在既有 PagedAttention 上加入邏輯 token 表與非同步壓縮,讓逐 token 淘汰真正釋放實體區塊。vLLM 原型的 SLA 吞吐最高提高 1.37 倍,但尚未公開程式,也未證明搬移成本適用所有硬體與流量。
Archive
共 968 篇技術新聞
AI 推論系統
vToken 在既有 PagedAttention 上加入邏輯 token 表與非同步壓縮,讓逐 token 淘汰真正釋放實體區塊。vLLM 原型的 SLA 吞吐最高提高 1.37 倍,但尚未公開程式,也未證明搬移成本適用所有硬體與流量。
生成模型/推論
新研究用「解遮罩成長複雜度」描述離散擴散在不同揭露階段的資訊難度,據此把計算集中到高曲率區段。方法可由樣本估計排程並給出高機率 KL 證書,但尚未在大型語言或影像模型上驗證。
評測/AI 代理
DiG-bench 用 70 個全新文字遊戲,要求模型自行實驗並推斷未知規則與勝利條件。Opus 5 解出 50 題居首,但現成代理框架在最高難度題目上沒有穩定勝過基礎模型迴圈。
模型發布與開發者API
DeepSeek 將 V4-Pro-0813 推至正式版,既有 `deepseek-v4-pro` 名稱會直接指向新版。新版強化程式代理與工具操作,並加入 OpenAI Responses API 相容層,但公開分數仍主要來自官方 harness。
模型發布與AI資安
Z.ai 表示 GLM-5.3 未重新預訓練,程式與資安能力提升均來自更大規模的後訓練。模型在 CyberGym 報告 84.5%成功率,但權重須待雙重用途風險評估完成才會釋出。
多模態評測
SciFigBench 用逾 34,000 組科學圖表測試,把看懂圖像與承認證據不足分開評量。GPT-5.2 的描述品質領先,Gemini 3.1 Pro 則更常拒絕從模糊或誤導證據下結論。
AI 代理與可靠度
Agent Behavioral Contracts II 以 18,000 次預註冊任務發現,同一模型的兩個代理會高度相關地失敗。研究改以聯合分布線性規劃計算有限樣本下限,但目前證據仍限於雙代理交接設定。
AI 可解釋性
SAEVerbalizer 將稀疏自編碼器的 decoder direction 注入 Gemma 3,訓練模型直接產生特徵解釋,省去逐特徵搜尋高啟用語料。27B 版本在較嚴格的全域測試達 56.1%參考一致率,但參考答案本身由模型生成,尚不能視為機制真相。
機器人世界模型
DreamX-Phi 將兩支機械臂的剛體變換直接寫入注意力,並以深度、物件遮罩及 V-JEPA 特徵約束生成影片。它在 WorldArena 2.0 快照取得60.65分,但權重與推論程式要等挑戰賽結束才公開,真實機器泛化仍未驗證。
AI 資安與網路自動化
TopoIntent 以結構化 schema、架構檢索及合規檢查,把模糊需求轉成 Mininet 與 iptables 測試環境。留出測試顯示自動修補可補齊拓撲層控制,但資料集只有 14 組未見樣本。
開源醫療 AI
開源 MARC v1 用 YAML 定義抽取、推理與輸出代理,並支援 Gemini API 或 Ollama 本機部署。它改善錯誤定位與資料控制,卻只展示三類使用案例,未證明多代理比單一提示更準確。
模型可解釋性與評估
一項新研究發現,稀疏自編碼器的消融評估通常讓每套字典自行選擇最高啟用 token,導致看似相同的 latent 實際在不同位置受測。固定共同位置後,受控實驗中原本歸因於字典差異的 7.6%與11.9%變異幾乎消失。