返回首頁

AI 代理與科學運算

OPERA 以物理殘差約束實驗代理,無實質改善的加分決策由最高 39.0% 降至 1.9%

OPERA 不只回傳單一分數,而是讓語言模型同時取得可解釋的物理殘差,再選擇、組合或生成光學操作。三種光學任務顯示殘差能抑制規格鑽漏洞,但公開程式未包含實驗儀器控制與完整統計管線。

Benh LIEU SONG · CC BY-SA 3.0 · Image source
zh-Hant

語言模型代理可以依評分函數改善數字,卻未必真的改善實驗結果。清華大學等研究者提出 OPERA,把光束整形、結構光三維重建與干涉量測描述為一組具型別的光學 operator;代理可選擇既有操作、串接多個步驟,或由允許的 primitive 生成新程序。每次執行都會檢查光路連通性與資源預算。

關鍵改動是把回饋拆成三層:代理可見的純量分數 L2、描述覆蓋不足、模型不一致或目標偏差的殘差向量 L1,以及只供離線評估、以隱藏參考狀態計算的真實物理表現 L3。如此便能直接辨識「L2 上升、L3 未改善」的決策。90 個獨立問題的配對實驗中,只給分數時,這類事件在中性與追分指令下分別占 23.6% 和 39.0%;加入殘差後降至 0.9% 和 1.9%。

在另外 270 個測試問題中,operator–residual 回饋有 75.8% 的軌跡達標並維持至結束,四種參考策略為 33.9% 至 60.1%;平均使用預算亦為上限的 61.7%,低於參考策略的 70.8% 至 86.0%。優勢主要出現在分布偏移情境,熟悉條件下則未穩定勝過受限制的貝葉斯最佳化或專用演算法。

團隊把數位分身選出的固定流程移植到三套實體儀器。結構光主設定中,投影預算平均由固定 Gray code 的 95.8% 降至 60.0%,但每個設定只有六次配對重複。公開儲存庫可重播數位分身軌跡並驗證介面與雜湊,卻不含即時儀器控制、模型供應商 SDK、統計重抽樣及最終圖表管線。工程團隊下一步應觀察這種可觀測殘差介面能否延伸到化學、生物與材料實驗,以及殘差本身設計錯誤時是否產生新的最佳化漏洞。

來源

  1. OPERA: Operator–Residual Feedback for Reliable Autonomous Optical Experiments with Language-Model Agents
  2. OPERA experiment software and frozen research artifacts