AI 評測/資料科學代理
DeepChart 分段檢查 AI 製圖資料路徑,圖表可執行不代表數據正確
DeepChart 以 1,482 個實例分別評測資料擷取、數值推導及圖表渲染,揭露外觀評分掩蓋的數據幻覺。超長 10-K 輸入令平均來源資料 F1 由 0.385 降至 0.167,顯示擴大上下文視窗不足以取代證據定位。

中國科大與華為研究人員公開 DeepChart,把資料科學製圖拆成 Extract、Reason、Visualize 三階段。模型先從論文、10-K 文件或產業報告找出來源數值,再計算圖表所需的衍生資料,最後輸出可執行的 Python 或 HTML 程式。基準因此不只看成品,還以來源資料 F1、衍生資料 F1、視覺準確度 VAS 與程式執行率 ER 定位錯誤。
資料集含 724 個基礎問題、1,482 個不同上下文版本,橫跨 30 類圖表;文字輸入平均 22.06 萬 token,報告型多模態輸入平均 218 頁。零樣本實驗顯示,產業報告任務的平均程式執行率達 0.782、VAS 為 0.447,但來源及衍生資料 F1 僅 0.149、0.276。換言之,程式能跑、圖也看似合理,底層數字仍可能來自錯誤證據或計算。
完整 10-K 壓力測試更明顯:由表格中心的 Normal 輸入改成 Ultra-Long 後,平均 VAS 從 0.421 降至 0.269,來源 F1 從 0.385 降至 0.167,衍生資料 F1 從 0.249 降至 0.139。對建置分析代理的工程團隊而言,這意味著應保存可稽核的中間資料、驗證計算結果,並先做檢索或證據縮減,不能只檢查圖像或程式是否成功。限制是超長測試只有固定 50 個實例,數值 F1 只是近似忠實度;部分商業報告原始 PDF 亦未隨 GitHub 倉庫散布,需另從 Zenodo 取得。