代理評測/軟體工程
QuoteBench 固定模型輸出重播命令路徑,單層 shell 解析可令成功率跌逾 70 點
QuoteBench 把模型生成與後續序列化、包裝及 shell 解析分開量度,揭露相近總分可能掩蓋完全不同的傳輸損壞。八組設定的固定回覆經額外解析器後下降 55.4 至 73.2 個百分點,而部分模型只是在得知邊界後學會補償。

程式代理交出的 Bash 看似正確,仍可能在工具介面把字串序列化、插入 wrapper,再交給第二層 shell 時改變語意。引號、`$()`、反引號、glob、換行與帶空格檔名都可能在錯誤的一層提前展開。若評測只看最後是否完成任務,便無法區分模型原本寫錯命令,還是 harness 在生成後破壞了正確輸出。
QuoteBench 以56個一次性 Bash 任務測量這條邊界,涵蓋14類由實際事故機制整理出的操作;每題以檔案位元組、argv、JSON、Git 狀態或目錄狀態作精確驗證。實驗交叉兩個軸:模型是否獲告知後續還有一層解析器,以及同一份已儲存回覆究竟直接交給 `bash -c`,還是先經未轉義的巢狀 wrapper。固定回覆再重播,使「傳輸造成的損壞」與「模型因合約說明而改寫命令的補償」可以分開計算。
八組同時段模型設定的原始回覆經額外解析後,成功率下降55.4至73.2個百分點;六組在邊界被揭露後追回30.4至60.7點,另外兩組沒有改善。GPT-5.6-sol 的配對總分只差負3.6點,實際卻包含負64.3點傳輸損壞及正60.7點補償。作者又把回覆送入本機 SSH 重播,七組結果與合成 wrapper 的損壞幅度完全一致;正確轉義或改用暫存腳本則在448個設定-任務組合中消除全部巢狀路徑特有失敗。
工程上的結論不是要求模型背更多 quoting 規則,而是把動作表示與解析邊界納入系統合約:能傳 argv 或型別化操作時,不應反覆拼接 shell 字串;評測亦應公開生成格式、執行路徑及最終狀態驗證器。限制是核心資料只有56題、採一次性 POSIX/Bash 任務,不涵蓋 PowerShell、網路與認證錯誤、互動終端或多輪修復,因此尚不能推算完整 coding-agent 工作負載的故障率。