返回首頁

AI 硬體設計

ArchAgent v2 以代理演化三層預取器,DPC4 模擬效能略勝人工冠軍

ArchAgent v2 將 L1D、L2 與 LLC 預取器分階段演化,再以即時容量檢查淘汰超出硬體預算的候選。最終設計在 DPC4 模擬環境比人工冠軍 BertiGO 高 0.3%,但尚未經實體晶片驗證。

Gciriani · CC BY-SA 4.0 · Image source
zh-Hant

Google、Google DeepMind 與加州大學柏克萊分校研究者提出 ArchAgent v2,把 LLM 驅動的程式演化擴展至三層快取預取器。直接同時搜尋 L1D、L2 和 LLC 會形成非單調組合空間:某一層的改善可能破壞另一層,而且一次 ChampSim 評測最慢可超過 12 小時。新框架因此先演化並凍結 L1D,再依序處理 L2、LLC,最後才開放跨層與多核心聯合最佳化。

另一項關鍵改動是把硬體可實現性納入回饋。候選程式必須同步維護 `prefetcher_size()`,編譯及模擬階段會檢查 L1D 32KB、L2 128KB、LLC 256KB 的狀態預算,超額方案直接取得負回饋。最終設計分別使用 31.1、110.0 與 230.3KB,並加入跨頁 stride/delta 追蹤、RL 仲裁器及依記憶體頻寬調節的節流機制。

在 DPC4 相同規則與保留測試軌跡下,作者報告相對基線的幾何平均 IPC 提升 3.8%,較人工冠軍 BertiGO 高 0.3%;低頻寬單核心增益為 4.6%,BertiGO 則為 2.6%。這證明代理可在嚴格模擬器與容量約束內搜尋微架構,而不只是產生無法落地的高階演算法。不過成果仍有明顯邊界:搜尋耗時約兩個月,多核心收益有限,容量計算最終仍經人工覆核,且 ChampSim 的 IPC 與儲存量不能替代 RTL、時序、面積、功耗及實體製程驗證。下一步應觀察生成策略是否公開,以及能否在不同追蹤資料和合成流程重現收益。

來源

  1. ArchAgent v2: A Case Study with the Data Prefetching Championship
  2. Fourth Data Prefetching Championship resources