AI 基礎設施
AtumAI 將資料中心控制策略編譯成可搜尋規格,三類任務均勝過人工基線
AtumAI 把自然語言需求轉成含目標、硬限制、決策變數與評估方法的中介表示,再結合擴散模型、演化演算法及代理模型搜尋策略。研究在工作配置、資源伸縮與電力管理上報告改善,但結果來自模擬器,尚未證明能安全接管生產控制平面。

資料中心的排程、資源伸縮與電力管理通常由專家反覆設計啟發式策略;直接讓 LLM 改寫控制器,卻容易漏掉容量、延遲及功率等硬限制。8 月 3 日提交的 AtumAI 將這類工作拆成「問題編譯」與「策略搜尋」兩層,希望把代理從程式碼生成器變成受規格約束的系統最佳化工具。
前端 Datacenter Task Compiler 先從自然語言要求及負載紀錄、平台限制等資料,建立具型別的中介表示。決策變數、最佳化目標、限制條件、模擬器、衡量指標與執行時間預算都必須明確列出;規則式 critic 會拒絕未定義變數、單位衝突及無法量測的限制,避免模型自行補造數值。系統也維護可跨任務重用的 optimization pass,例如容量保護與突發負載預測,再依新任務的義務選擇及具體化。
後端不只要求 LLM 提案:擴散模型負責探索結構不同的控制策略,演化演算法調整連續或離散參數,代理模型則先過濾低潛力候選,再把少數方案送入高擬真模擬器。論文自報,工作配置相對人工基線把成功率提高 17%、排程吞吐提高 8%;資源伸縮的成本效率提高 24%,SLO 違規率維持 1.3%;電力管理則減少 21% 功率並提高 17% 吞吐。
工程價值在於把「代理提出策略」與「策略符合可執行合約」分開,也讓同一搜尋管線可服務不同控制問題。不過論文沒有公開程式碼,評估亦以三個研究環境及團隊設定的模擬器為主;模擬器偏差、故障模式、策略回滾及線上變更的穩定性仍未驗證。下一步應觀察是否釋出 IR、工作負載與基線實作,以及候選策略能否通過影子部署、形式化安全界線和真實叢集的長期測試。