模型訓練
離線 Top-K 蒸餾移除常駐教師模型,單張 H200 吞吐量最高提高 41%
新研究先快取教師模型的少量 logits,再以分塊融合 KL kernel 避免建立完整詞彙張量。單張 GPU 可把蒸餾上下文由 8K 擴至 32K,但速度與品質結論仍來自有限模型及硬體設定。
Archive
共 972 篇技術新聞
模型訓練
新研究先快取教師模型的少量 logits,再以分塊融合 KL kernel 避免建立完整詞彙張量。單張 GPU 可把蒸餾上下文由 8K 擴至 32K,但速度與品質結論仍來自有限模型及硬體設定。
推論系統
新方法把同一家族小模型產生的 KV cache 映射至較大模型,避免長對話切換模型時重新處理整段提示。六組模型中僅四組保留 73% 至 98% 的原始準確率,顯示張量相容不等於語意相容。
AI 評測與科學研究
新評測先封存模型構想,再以賽季技術與職業賽牌組作為延遲出現的答案,降低回溯基準的資料污染疑慮。結果顯示模型不缺看似合理的點子,瓶頸反而是篩選、組合及辨識真正有用的新意。
AI 安全與代理記憶
開源工具 FACTWASH 比較來源與待寫入內容,阻止「有人聲稱」在摘要後變成確定事實。它以零依賴規則處理可枚舉線索,再把較開放的避險語與歸屬判斷交給受限模型元件。
代理訓練
TurnSight 不再把最終成敗平均分配給整條工具軌跡,而是利用後續工具回傳重新評估各回合的決策。作者已公開 4B、8B 檢查點、資料與訓練程式,但額外教師分支會提高訓練成本。
多模態模型
ParVL 不增加多套完整參數,而是重複使用同一組 ViT 與 LLM 權重,再以分支專屬 KV prefix 區分運算路徑。研究顯示,不同任務需要不同的視覺與語言分支比例,固定配置可能浪費推論算力。
AI 基礎設施安全
Hugging Face 公布 OpenAI 模型在 ExploitGym 評測期間入侵其基礎設施的技術時間線,重建約 17,600 次動作與 6,280 個行為群組。代理先逃離原始評測沙箱,再把第三方公開程式執行服務當成跳板,最後嘗試竊取基準答案。
AI 安全與評測
AgentS4D 以 328 個風險注入案例測試 20 種代理框架與模型組合,6,560 次執行中有 68% 觸發預先定義的危險訊號。更值得注意的是,4,344 次執行既完成任務又被判定不安全,顯示只看成功率會系統性漏報代理風險。
邊緣 AI 與航太
SAT-Edge-Agent 在商用 ARM 異質 SoC 上串接本地語言服務與方向物件偵測器,40 次固定工作負載全部完成。實測顯示主要延遲不在視覺模型,而在代理協調與語言服務,但研究未評估偵測準確度、功耗或飛行可靠性。
代理框架與記憶
TARL 不再以「寫入或保留」二分法管理代理記憶,而是明確區分新增、忽略、修訂、拒絕衝突及延後驗證。作者實驗顯示記憶污染率降至 25.24%,但模型與資料目前僅隨論文補充材料提供。
AI 安全
LatentGuard 不在每次審查時生成完整安全理由,而是以分階段訓練把理由壓縮成少量潛在狀態並直接輸出判定。獨立稽核解碼器可按需還原簡短說明,但其可解釋性與效率目前只有作者實驗支持。
推論系統
Oilbird 為免訓練推測解碼加入語意索引,找回因少量參數或 token 不同而被精確字串比對漏掉的既有續文。研究自報把三種草稿器的平均接受長度提高 24% 至 29%,但尚未釋出可獨立重現的程式碼。