AI 評測與推理
IOL-AI 以未公開語言學奧賽題測推理:14B 模型靠解碼流程把基線分數提高逾一倍
IOL-AI Challenge 要求系統先從少量例句推導陌生語言規則,再完成翻譯、轉寫與訂正。受限於單張 T4 的最佳提交把同模型基線 GM 由 9.40 提至 19.79,但與達到金牌線的封閉模型仍有明顯差距。

8 月 18 日公開的 [IOL-AI Challenge 論文](https://arxiv.org/abs/2608.18011)把 2026 國際語言學奧林匹亞個人賽題目改造成隱藏測試集。這類問題不像數學題先給定規則:模型必須從陌生語言的少量對照資料自行推導語法、詞彙或數字系統,再回答翻譯、配對與訂正問題,因此較能測量「先發現規則、再推理」的能力。
公開挑戰收到 46 隊共 731 次提交,其中 80.7% 成功執行;每次只能使用一張 T4、限時 30 分鐘且不能連網。分數取加權完全匹配率與 chrF 的幾何平均。前十名有九隊採用量化 Qwen2.5-14B 或 Qwen3-14B;冠軍以 Qwen2.5-14B-AWQ 得到 19.79,較主辦方同模型基線 9.40 增加一倍以上。
差異主要來自推論管線而非參數量。隊內對照顯示,自洽投票平均增加 2.08 分,重試或格式修正增加 1.40 分;相反,chain-of-thought 提示與 JSON 結構輸出分別降低 1.55 與 4.66 分。領先方案多以貪婪解碼為主,按剩餘時間配置 token,並逐題寫入結果以避免逾時令整份提交失效。
研究另讓 IOL 評審匿名評閱五個系統。Claude Opus 4.8 超過當屆 70 分金牌線、相當於人類第四名,Gemini 3.6 Flash 達銀牌線;兩個受限算力的開放提交則落在參賽者最後 5%。自動分數雖與人工排名一致,卻把較弱系統高估約 12 至 14 分,也漏算強模型以文字寫出的正確分析。
工程上值得注意的是,輸出協定與解碼策略足以主導受限環境的結果。不過測試題數少,隨機解碼變異可能很大;主辦方也曾為前沿模型加入事後格式修正,因此小幅分差不應被解讀成穩定能力差距。