生成模型與推論最佳化
OYS 直接搜尋擴散模型去噪時間步,5 步生成保留 50 步品質的 89% 至 94%
OYS 不修改或蒸餾模型,而以貝葉斯最佳化為每個模型及任務尋找低步數去噪排程。研究在六款文字生成圖像模型及修補任務上報告改善,但搜尋成本需由大量預生成樣本攤銷。
Archive
共 964 篇技術新聞
生成模型與推論最佳化
OYS 不修改或蒸餾模型,而以貝葉斯最佳化為每個模型及任務尋找低步數去噪排程。研究在六款文字生成圖像模型及修補任務上報告改善,但搜尋成本需由大量預生成樣本攤銷。
AI 代理與瀏覽器自動化
阿里雲團隊把瀏覽器代理的錯誤恢復、複雜 UI 操作與長程信用分配納入同一訓練流程。27B 模型在新建的中英雙語 BrowserBench 取得 65.1% Pass@1,但模型權重與評測資料的公開可得性仍待確認。
Qwen3.8-27B 讓 27B 級模型進入單張 24GB 消費級 GPU 的可用範圍。公開資料顯示,一般 GGUF 部署約落在 30 至 60 tok/s;在 RTX 4090 上啟用 KV cache 量化、MTP 與新版 llama.cpp 後,社群實測可提升至 70 至 85 tok/s,但這仍不是開箱即得的基準。
AI 評測與推理
IOL-AI Challenge 要求系統先從少量例句推導陌生語言規則,再完成翻譯、轉寫與訂正。受限於單張 T4 的最佳提交把同模型基線 GM 由 9.40 提至 19.79,但與達到金牌線的封閉模型仍有明顯差距。
AI 代理安全
PACE 不要求語言模型自行判斷交易是否安全,而以確定性規則檢查交易意圖、模擬結果及實際 calldata。簽署後的政策決策紀錄由智慧帳戶在執行前重驗,但目前零失敗結果只來自簡化 DeFi 沙盒。
AI 安全與強化學習
Google DeepMind 研究讓同一個 Gemini 策略分別扮演解題者與批評者,再由較弱的凍結模型裁決。辯論維持裁判辨別力並追回約 45% 的 RLVR 差距,但代價是更多訓練步驟與受限制的批評篇幅。
推論系統
NVIDIA 開源 TensorRT Model Connect,以兩道指令把受支援的 Hugging Face 或本機 checkpoint 建成可移交 C++ 應用的版本化 bundle。它縮短模型移植路徑,但目前定位仍是參考實作,支援範圍與效能須按模型、精度及硬體逐項驗證。
AI 系統與 GPU
PTXBench 同時檢查生成核心是否正確、指定指令是否真的執行,以及相對 cuBLAS、cuDNN 與 FlashInfer 的速度。結果顯示,會寫出新架構指令不代表能把它轉成有效加速,B200 注意力核心尤其困難。
代理基礎設施
新系統把文件代理的搜尋結果、原生檔案、差異檢視與最終提交綁定至明確版本,避免代理讀到舊解析內容卻編輯新版檔案。固定框架消融顯示,同時提供解析與原生檢視優於任一單一檢視,但完整程式與跨框架重現仍待補足。
醫療 AI/安全評測
新研究把評測前移至病人尚未清楚描述問題的首次接觸階段。加入「先釐清、後建議」的系統指令改善回應順序與交接摘要,卻仍未可靠問出決定性病史。
推論系統
Qualcomm AI Research 為凍結的 Transformer 外掛逐層快速權重,以 512-token 分段吸收上下文,查詢時不再讀取原文。Qwen2.5-0.5B 的 128K 實驗維持固定顯存並勝過 ICL、RAG,但證據目前限於三項合成檢索任務。
模型工程/評測工具
TokEval 將數字位值、程式 AST 邊界、UTF-8 完整性及跨語言成本納入 tokenizer 評測。控制實驗顯示部分指標可預測特定下游能力,但結果目前限於單一 1.27B 架構。