代理評測
FINCHAL 開放代理直接參賽,以零技能模擬與未來價格分隔運氣和預測能力
FINCHAL 透過遠端 MCP 工具讓人類與 AI 代理在同一介面提交四種資產的多空部位,並用未來市場資料即時評分。它先模擬 20,000 個隨機策略建立「運氣上限」,但完整賽季尚未產生可比較的模型結果。

FINAL-Bench 團隊 8 月 24 日啟動 FINCHAL,嘗試把 AI 預測評測從可反覆調參的歷史回測,改成答案尚未存在的前瞻測試。參賽者每次為 NVIDIA、Bitcoin、黃金或原油提交介乎 −1 至 +1 的部位;部位持續有效,轉倉按資產收取交易成本,槓桿固定為一倍。價格以小時級資料結算,股票只計正常交易時段,沒有足夠小時資料時才退回日線。[設計說明](https://cdn-avatars.qwak.ai/blog/FINAL-Bench/financial-forecast-challenge)表示,評分器另以封閉形式可驗算的合成路徑測試零部位、反向複利、交易成本與禁止偷看下一根價格等條件。
代理不是上傳 CSV,而是連接遠端 MCP server,取得 `get_rules`、`get_data`、`submit_position` 與 `check_score` 四個工具。這讓模型能自行讀規則、拉取歷史資料及改變部位,也把工具描述、錯誤語義與驗證範圍納入測試;公開文章披露,早期 schema 曾宣稱支援一小時資料,實際卻回傳日線,後來改為不支援時明確拒絕。這類錯誤對代理尤其危險,因格式正確但語義錯誤的回應可能直接污染特徵與決策。MCP 規格本身把工具定義為模型控制的可執行介面,並建議高影響操作保留人工確認;FINCHAL 的下單雖是紙上交易,API 金鑰和遠端 HTTP 端點仍須按同類安全模型處理。[MCP 工具規格](https://modelcontextprotocol.io/specification/2025-06-18/server/tools)
評測的核心是每項資產先模擬 20,000 個零技能隨機策略,將實際市場路徑下的第 95 百分位設為運氣上限,再以 `-log10(1-p)` 映射排名。主辦方因不同資產尾部分布無法可靠校準,放棄合併成單一總榜;這是合理限制,也代表結果只能在同一資產內比較。[公開 Space](https://huggingface.co/spaces/FINAL-Bench/finchal)提供程式與計分介面,但目前只有基線與回測參考線,尚無證據顯示任何代理能持續越過運氣上限。工程師應關注資料發布與提交時間戳能否接受外部稽核、代理能否藉高頻試探或多帳號取得優勢,以及 12 月賽季結束後是否公布完整失敗軌跡而非只展示贏家。