AI 代理與資料工程
QueryProof 以規則閘門攔截錯誤 SQL,7B 代理的 Business Truth Rate 達 56.2%
QueryProof 把歧義判定、SQL 白名單與執行後驗證交給確定性規則,只讓模型處理指標解析及 SQL 草擬。它在 80 題凍結測試集勝過未配置相同外殼的 32B 基線,但按題型家族重抽樣後,優勢區間仍跨越零。

新公開的 WarehouseReliabilityBench 試圖補上 Text-to-SQL 評測的盲點:一段 SQL 即使能執行、甚至與參考查詢相似,仍可能採用錯誤的營收定義、忽略資料截止日,或在 schema 改版後讀取已棄用欄位。資料集包含兩個合成倉庫與 400 項凍結任務,涵蓋正常查詢、商業定義歧義、資料不足、schema drift 及提示注入;約半數題目的正確行為不是回傳數字,而是要求澄清、棄答或拒絕。
QueryProof 因此沒有採用開放式代理迴圈,而是建立 `PARSE`、語意層查找、歧義檢查、SQL 草擬、AST 驗證、執行及結果核驗等有限狀態流程。7B 模型只負責選擇候選指標與撰寫 SQL;安全判定、日期解析、欄位允許清單及是否回傳答案,都由讀取 YAML 語意層與實體 catalog 的規則控制。執行環境另以唯讀 DuckDB、`sqlglot` AST allowlist、逾時及結果大小限制阻止 DDL、DML 和外部資料函式。
在只執行一次的 80 題測試集,純 7B QueryProof 的 Business Truth Rate 為 56.2%,加入 32B 升級路由後反降至 53.7%;直接提示的 32B 基線為 30.0%。路由版每個正確答案的估算成本低 71%,錯誤卻被標成成功答案的比率亦由 75.4% 降至 35.1%。不過這不是公平的模型尺寸對決:32B 基線未取得相同規則外殼,而且十個題型家族存在相關性;改以家族重抽樣後,兩組差異的信賴區間都包含零。專案已公開原始輸出、預註冊協定及一鍵重算流程,但仍是合成資料上的研究原型。接下來真正重要的是在真實語意層、權限模型及持續變動的倉庫上測量規則維護成本,以及確定性檢查究竟漏掉多少「可執行但商業上錯誤」的答案。