AI 評測與科學研究
AI 科學家改用賽車與牌組做前瞻評測,GPT-5.2 的 166 個構想僅命中 10 項實際創新
新評測先封存模型構想,再以賽季技術與職業賽牌組作為延遲出現的答案,降低回溯基準的資料污染疑慮。結果顯示模型不缺看似合理的點子,瓶頸反而是篩選、組合及辨識真正有用的新意。

評估「AI 科學家」是否能提出新發現,通常面臨沒有標準答案、驗證週期過長,以及模型可能讀過歷史成果等問題。8 月 4 日上傳的新研究改採前瞻、延遲揭曉的真實世界評測:研究者讓模型依 2026 年一級方程式新規提出賽車設計構想,之後再與季前實車出現的 40 項創新比對;另一組實驗則在《魔法風雲會》牌池更新後生成牌組,再與 19 副職業巡迴賽牌表比較。競爭者獨立產出的公開成果因此成為事後可觀測答案。
F1 實驗涵蓋六種模型。表現最佳的 GPT-5.2 在多次執行中提出 166 個構想,命中 40 項真實創新中的 10 項;按產生量正規化後,每百個構想命中 6 項。所有模型合計,被判定符合規則的構想有 19.4% 對應實際創新,明確違規者只有 0.9%,說明規則檢查可縮小搜尋空間,但仍不足以找出最有價值的方案。初步由 LLM 標出的 519 組潛在配對,經人工審查後有 89% 被降為不匹配,也暴露語意相似度容易把表面重疊誤當相同機制。
牌組實驗共生成 108 副牌;Gemini 3 Flash 的最佳單副結果找回某副季軍牌組 7 張新卡中的 5 張。值得注意的是,加入工具後,主牌合法率可明顯改善,例如 GPT-5.2 由 11% 升至 100%,但所有模型的新卡發現率反而下降,顯示工具框架可能強化約束遵循,卻收窄探索。兩個領域終究只是科學發現的代理任務,命中人類方案也不等於獨立推導;但其程式、提示、輸出與資料已公開,值得研究者進一步檢查時間截點、裁判偏差,以及能否把同一方法移植到具模擬器或實驗驗證的科學問題。