AI 輔助晶片設計
MicroEvo 以 LLM 與 MCTS 搜尋處理器設計,達標所需模擬次數較 NSGA-II 少 10.6 倍
MicroEvo 把處理器設計知識、Pareto 樹搜尋及歷次 PPA 回饋結合,用較少模擬尋找效能、功耗與面積折衷。最高 36.2% hypervolume 增益來自模擬設計空間,尚不能等同實體晶片改善。
Archive
共 972 篇技術新聞
AI 輔助晶片設計
MicroEvo 把處理器設計知識、Pareto 樹搜尋及歷次 PPA 回饋結合,用較少模擬尋找效能、功耗與面積折衷。最高 36.2% hypervolume 增益來自模擬設計空間,尚不能等同實體晶片改善。
推論系統
PaDoc 讓版面序列與各區域內容共用頁面前綴並行解碼,避免把整頁文件串成單一路徑。2.1B 模型在 OmniDocBench 維持 94.24 整體分數,但效能數字來自單一 GPU 與特定排程設定。
3D 生成與具身 AI
iARCS 先修正室內場景生成器的碰撞與可行走性,再把自然語言需求編譯成可執行獎勵函式進行第二階段強化學習。它在 3D-FRONT 實驗優於 MiDiffusion 的幾何指標,但每項新需求都要另訓練 LoRA,且作者尚未發布實作。
邊緣 AI
開源專案 esp32-ai 以 4-bit 量化及分層記憶體配置,把約 2,500 萬個嵌入參數留在快閃記憶體,只按 token 讀取所需列。模型能在低於 10 美元的微控制器上離線生成文字,但能力仍限於簡短故事與單一領域問答。
推論系統
PhyAI 以模型轉接器保留各架構的條件、求解器與動作語意,再共用圖執行、核心、快取及多 GPU 服務。公開測試涵蓋 π0、π0.5、GR00T N1.7、Cosmos3 與 MiniCPM-Robot,但部分比較未使用完全相同的數值精度。
AI 評測與教育應用
Ai2 以 462 份真實數學家教逐字稿建立可重播評測,要求模型在「提供鷹架」與「要求學生深入推理」之間選擇。明示兩者取捨可改善七款模型表現,但模擬學生與模型評分仍不能證明真實學習成效。
應用研究
Otter 不把每個棋盤局面視為獨立樣本,而是同時納入最近 20 步及時間控制資訊。模型在作者的 Lichess rapid 測試上優於 Maia-2,但未與已發布的 Maia-3 在同一資料切分直接比較。
代理訓練
成功示範不一定適用於代理繞路後抵達的狀態,無條件提供完整軌跡甚至可能壓低正確動作機率。SMRC-SD 只在狀態與示範步驟相容時加入自我蒸餾訊號,在 ALFWorld 與 WebShop 均優於完整路徑基線。
評測與可重現性
新分析發現,Google ERA 使用季後整併資料回測,實際取得了 CDC 模型預測當時尚不可見的修訂資訊。資料幾乎未修訂時兩者 WIS 相若,顯示 AI 預測基準必須保存每個時間點可用的資料版本。
代理基礎設施
Kitesurf 將 Rust、Wasm 與模組化 Web 元件帶入 Cloudflare Workers,針對內容擷取、表單操作及截圖等代理工作負載縮減瀏覽器開銷。官方測試宣稱部分任務的 CPU 與記憶體用量低 3 至 7 倍,但網站相容性、反機器人驗證及原始碼可用性仍是主要限制。
代理安全/強化學習評估
HERALD 以同題反事實編輯稽核搜尋代理獎勵,發現真實但未曾檢索的引用可在基礎評分下取得不低於原軌跡的分數。加入一項引用—檢索集合成員檢查後,593 個合格問題未再觀察到成功攻擊,但強化訊號只出現在 0.03% 訓練軌跡。
模型發布/端側 AI
LFM2.5-2.6B 以短卷積與 GQA 混合架構,把代理推理、工具使用及長上下文帶到手機與個人電腦。官方測得 M5 Max 解碼 220 token/s,但效能與代理基準均主要來自廠商自評。