返回首頁

AI 代理與研究自動化

OpenAI 稱研究代理工時已超越人類三倍,但產出指標仍不能等同科研進展

OpenAI 公布內部資料,稱截至八月中旬,每一個人類研究工作日對應 3.1 個代理工作日,並已達到「自動化研究實習生」的內部里程碑。數據顯示代理正擴大實驗與工程吞吐量,但多數長任務仍需人工介入,算力增長也使因果關係難以拆分。

Esculenta · CC BY-SA 4.0 · Image source
zh-Hant

OpenAI 首次較完整公開程式代理如何改變其研究流程。公司把「自動化研究實習生」定義為:能在人類指導下完成界定清楚、原本可能耗費熟練研究者數日的任務,而不是自行選擇研究方向或決定是否擴大訓練、暫停實驗及部署模型。

截至 2026 年八月中旬,OpenAI 研究組織的代理總執行時間,換算後達每個人類工作日 3.1 個代理工作日。依 API 定價估算,代理使用量居中的研究者每天消耗超過 600 美元推論資源,第 90 百分位則超過 7,000 美元。研究者也愈常同時啟動四個以上代理,把除錯、實驗基礎設施、監控及分析工作並行化。八月的每位活躍實驗者實驗數量創 2025 年開始追蹤以來新高,高層規劃卻仍只占代理輸出的很小部分。

這些數字不宜直接解讀為科研生產力提升 3.1 倍。「代理工作日」是執行時間,不是經同行驗證的發現;實驗量增加亦與可用算力同步成長。OpenAI 只對能取得 ground truth 的任務估計成功率,且過去半年超過一半成功完成的四至八小時任務,至少接受過一次人工介入。相關分類器、內部任務分布及原始資料均未對外開放。

對研究平台團隊而言,真正值得追蹤的是瓶頸轉移:當程式撰寫與除錯被大量並行化,GPU 配額、實驗設計、結果判讀及安全審查可能成為新的關鍵路徑。外部若要重現這類成效,需要同時量測有效實驗、人工修正次數、失敗成本與最終研究成果,而不能只統計 token、執行時間或提交量。

來源

  1. Research acceleration: The view inside OpenAI
  2. The Shift to Agentic AI: Evidence from Codex