開放模型與推論系統
Muse Glimmer 30B 以 17GB 量化權重與 DFlash 草稿模型,把多模態代理搬上單張顯卡
Meta 公開 Muse Glimmer 30B 權重、視覺編碼器及 DFlash 草稿模型,17GB 版本可在 24GB VRAM 內同時執行文字、影像與推測解碼。官方在 RTX 5090 測得平均 233.4 token/s,但安全評測與部署細節顯示它仍需要外部防護及新版 runtime。
Archive
共 970 篇技術新聞
開放模型與推論系統
Meta 公開 Muse Glimmer 30B 權重、視覺編碼器及 DFlash 草稿模型,17GB 版本可在 24GB VRAM 內同時執行文字、影像與推測解碼。官方在 RTX 5090 測得平均 233.4 token/s,但安全評測與部署細節顯示它仍需要外部防護及新版 runtime。
AI 輔助科學研究
研究團隊以推理模型、編程代理及檔案式記憶執行約 240 個研究 session,最終提出並由作者驗證 `K_G ≥ 6π/11`。系統展現強大局部證明能力,卻未自行察覺搜尋已陷入瓶頸,研究方向與成果取捨仍依賴約 40 次人類指令。
AI for Science/代理評測
ChemWorld 以型別化操作、相容性編譯器及私有化學定律,讓研究者在相同公開介面下只替換單一世界規則。開源版本通過 52 種生成組合與八條完整流程,但它驗證的是軟體執行語義,並非真實化學準確度。
AI 程式設計/演化搜尋
EvoMem 從成功的程式突變中抽取具來源紀錄的策略卡,再於後續任務檢索最多三張卡引導 LLM。九類測試的平均目標指標提高 6.40%,但結果變異大,且實驗仍限於小型研究型工作負載。
代理工程
Agentic Configuration Management 把代理、提示、模型、工具與工作流正規化成可獨立版本控制的設定項目。參考實作支援 LangGraph、CrewAI 與 OpenAI Agents SDK,但目前驗證集中於小型合成案例及作者自訂 oracle。
AI 基礎設施
MISA-T 不只依前綴命中選擇推論節點,還限制不同工作負載可同時占用 KV 快取的 session 數量。作者在 Step3.7 與 Qwen3.6-35B-A3B 測得 43.6% 至 53.3% 的 rollout 吞吐增益,但實作尚未公開。
模型架構與推論
UniF-MoE 不再分別決定共享專家、FFN 寬度與啟用專家數,而是讓每個 token 先選共享通道,再按剩餘需求累積路由機率。它在作者的 DeiT 與 BERT 實驗中改善準確率及 MoE 推論成本,但尚未在生成式大型語言模型或分散式 expert parallelism 上驗證。
代理評測
微軟研究團隊以 238 萬次 rollout 比較 41 種語言,發現相同任務換語言後,即使採貪婪解碼,代理仍會改走不同工具路徑。研究亦顯示非英語任務高度依賴先轉成英語,但目前工具只是符號化呼叫,尚未涵蓋真實 API 的錯誤與副作用。
模型量化與推論
ReRound 不使用校正語料,而是從模型自身權重訓練條件式擴散模型,重新判斷接近量化區間中點的權重應向上或向下捨入。部署時維持原有低位元格式且沒有額外推論負擔,但每款模型須先支付數小時的專屬重建成本。
AI 代理與自動化研究
研究者在固定 GPT‑5‑mini 與兩小時預算下,讓除錯顧問跨搜尋分支共享執行環境限制,使 AIDE 的 90 次執行全部產生有效提交。成果顯示代理外殼仍有大量可回收算力,但實驗只涵蓋九項表格預測競賽。
AI 程式開發/軟體測試
研究者讓本機模型只讀取 Python 重構前後的 diff,從 217 組 Rope 轉換中歸納出 13 類行為改變。維護者接受其中 12 項為缺陷,但模型精確率僅 0.67,尚不足以取代測試或靜態分析。
自動駕駛/多模態模型
小鵬提出 XCoT-VLA,以有限的語意動作 token 取代數十個自然語言推理 token,再透過 flow matching 生成連續軌跡。開迴路測試顯示橫向誤差下降,但尚無封閉迴路安全評估,延遲數字亦未涵蓋完整車載軟硬體堆疊。