多模態評測
PerceptionBench、視覚推論を10の基本知覚能力に分解――16種のマルチモーダルモデルはいずれも正解率60%未満
Moonshot AIは、42の既存ベンチマークにおける最初の失敗点から知覚能力の分類体系を構築し、3,000問の短答式問題によって10の基本的な視覚能力を切り分けた。その結果、総合スコアが近いモデルでも知覚上の弱点がまったく異なり得ることが示された。一方、テストセットはより大規模な社内問題プールから抽出されており、データ汚染と評価者バイアスには引き続き注意が必要だ。