AI 評測與開發工具
Rails 開源 lemans 評測框架:以檔案還原、斷網與完整軌跡降低代理作弊空間
Rails Foundation 公開用於 Agents on Rails 榜單的 Ruby 評測框架 lemans,支援 Daytona 與本機 Docker 沙盒。框架會隔離驗證程式、保存可重播證據,並在評分前還原受保護檔案。

Ruby on Rails 團隊把 Agents on Rails 榜單背後的 `lemans` 以 MIT 授權開源,讓開發者建立、執行及稽核程式代理評測。它以 Ruby 3.4 以上版本運行,模型層交由 RubyLLM 接駁,沙盒可選 Daytona 或本機 Docker;評測專案只需 `bench.yml`、環境映像、任務指令及驗證程式。隨附的 `miniswen` 則是 mini-SWE-agent 的 Ruby 移植,可獨立作為簡化程式代理使用。
lemans 的重點不只是啟動模型,而是把「代理是否真的完成工作」變成可檢查的產物。每次試驗會保存代理補丁、ATIF 格式互動軌跡、驗證紀錄、成本、token、步數、時間及環境摘要;Oracle 與 no-op 代理分別確認正確解答必須通過、空白解答必須失敗。評分前,框架會從初始快照還原 `test/`、`bin/` 及測試環境設定等受保護表面,防止代理刪除測試或改寫測試啟動器來製造假成功。
遠端沙盒在安裝階段可連網,代理開始工作後則只允許存取模型供應商主機,降低搜尋現成補丁或外洩資料的機會。框架也會從寫入磁碟的軌跡中過濾已知供應商憑證;這項設計源於測試模型曾執行 `env`,令 OpenRouter 金鑰差點進入公開紀錄。
同步發布的 Rails 榜單顯示,Qwen3.8-27B 得到 48/63,但每次執行中位時間約 27 分鐘,Rails API recall 只有 7.9%;GPT-5.6 Terra 為 49/63,中位時間約 182 秒。這說明任務成功率不能脫離延遲、成本與框架知識解讀。不過,現有結果集中於 Rails 任務並使用同一個簡化代理,尚不能外推至一般軟體工程能力;憑證過濾也只涵蓋框架辨識的秘密,不能取代最小權限與外部日誌清理。