強化學習與邊緣 AI
VSPG 免反向傳播更新離散動作 actor,兩項 SustainGym 回報均勝 DNN 基線
VSPG 把每個動作存成單位超向量,將 softmax policy gradient 化為優勢加權向量疊加及正規化,不需 actor 的自動微分或最佳化器狀態。它在兩種建築控制氣候取得較佳回報並較耐位元錯誤,但效能高度取決於固定編碼器。

Vector-Symbolic Policy Gradient(VSPG)嘗試用超維度計算重寫離散動作策略。系統以固定編碼器把狀態映射成高維單位向量,每個動作則對應一個單位超向量;兩者內積乘上溫度參數後形成 softmax logits。研究證明,在標準 policy-gradient surrogate 下,actor 更新可精確寫成 `C ← row-normalize(C + ηΛᵀS)`:把優勢加權的狀態向量疊加至被選動作,並從競爭動作扣除對應成分。
這個改寫讓 actor 不必使用 autograd 或保存 Adam、SGD 等最佳化器狀態。每個動作向量同時可解讀為固定大小的壓縮 kernel memory,將過往狀態的優勢證據疊加在同一表示內;推論只需為每個動作執行一次內積,不會隨訓練樣本數增加記憶體。對二元超向量,論文另給出理論界線:在固定相似度間隔下,隨機位元翻轉導致貪婪動作改變的機率會隨向量維度呈指數下降。
實驗涵蓋傳統控制、MiniGrid 與多代理 SustainGym。建築控制訓練 500 回合後,FHRR 或 RFF 編碼的 VSPG 在 hot-dry、warm-humid 氣候取得每步平均回報 -7.28 與 -7.11,優於 DNN 的 -13.41 與 -12.12;數值越高越好。作者亦把 actor 量化至 1、2、4、8 位元,再隨機翻轉儲存位元,VSPG 整體退化較神經及原始線性 actor 平緩。公開程式包含完整訓練腳本、超參數搜尋設定及位元錯誤測試。
限制在於「免反向傳播」只適用於 VSPG actor;SustainGym 的集中式 critic 仍在訓練時估計 GAE。編碼器也不是無關緊要的前處理:Basis-VSPG 在兩種氣候的回報降至 -40.36 與 -79.65,RFF 在較難的 DoorKey 任務亦曾失敗。下一步須比較實際能耗、記憶體占用及硬體上的容錯收益,並驗證方法能否擴展至高維或連續動作。