AI 評測與教育應用
TutorMoments 重播真實教學決策,測出七款 LLM 預設傾向過度提示
Ai2 以 462 份真實數學家教逐字稿建立可重播評測,要求模型在「提供鷹架」與「要求學生深入推理」之間選擇。明示兩者取捨可改善七款模型表現,但模擬學生與模型評分仍不能證明真實學習成效。

Ai2 公開 TutorMoments 預覽版,將 AI 家教評測從「答案是否正確」改成檢查模型能否在正確時機介入。資料包含 462 份去識別化的一對一數學家教逐字稿,對象為美國二至七年級學生;27 名具經驗的教師標出超過 1,500 個關鍵時刻,判斷當下應提供鷹架、提高認知要求,或避免給予過多協助。可執行評測則凍結為 520 個平衡情境,鷹架與嚴謹推理各 260 個。
執行時,系統在關鍵點截斷真實對話,讓受測模型接手家教角色五輪,另一個語言模型扮演學生。之後由經教師標註校準的模型分類器計算三項指標:需要幫助時是否適當搭鷹架、適合挑戰時是否推動更深入推理,以及是否避免把任務簡化過頭。初步測試涵蓋七款 LLM;若提示只要求「好好教學」,模型普遍過度協助且很少要求學生自行推理。把鷹架、過度鷹架與嚴謹度的取捨明寫進提示後,所有模型分數都上升,但策略仍較真人單一,常反覆要求學生解釋答案。
對開發者而言,TutorMoments 的價值在於把教學代理的政策選擇做成可重播、可釘選資料修訂版的測試。開源執行器會記錄模型、提示與資料內容雜湊,並輸出逐情境對話、評分與摘要,方便比較提示或模型更新造成的行為漂移。不過它量到的是模擬決策而非學習成果:學生由 LLM 模擬,評分也依賴模型分類器;真人基準又刻意集中於教師原本可能處理不佳的片段,不能用來宣稱 AI 已勝過教師。資料目前也只涵蓋單一國家的中小學數學情境。