ホームへ戻る

電腦操作代理

TMI、交錯するコンピューター操作からタスクツリーを再構築、ステップ記述精度が30.3%から74.9%に向上

Task Model Inductionは、画面と入力のログ全体を単一のワークフローに圧縮するのではなく、まず非連続のタスクを分離し、その後に目標階層とループ制御フローを再構築する。生成されたエージェントスキルのホールドアウト問題における精度は、最良ベースラインの14.29%から18.57%に向上した。一方、パイプライン全体がフロンティアモデルに依存し、生の操作トレースには重大なプライバシーリスクが伴う。

King of Hearts · CC BY-SA 3.0 · Image source
zh-Hant

スタンフォード大学とカーネギーメロン大学の研究チームは、スクリーンショット、マウスクリック、キーボードイベントを、監査可能で再利用可能なタスクモデルへ変換するTask Model Induction(TMI)を提案した。従来のワークフロー要約は通常、1つの記録が1つの目標に対応すると仮定する。これに対しTMIは、同じユーザーが複数のアプリケーションを切り替える状況を許容し、同一タスクに属する非連続の活動を再び集約する。

システムは3段階で動作する。第1段階では、Vision-Language Modelが操作前後の画面を比較し、座標によるクリックなどの低レベルイベントを意味のあるアクションにグラウンディングしたうえで、局所的な目標に基づいてセグメント化する。第2段階では、各活動を既存の潜在タスクに割り当てるか、新しいタスクを作成する。さらに、ファイル、URL、エンティティ名などの識別子を使い、アプリケーションや呼称の変化に対する堅牢性を確保する。最後に、誤って分割されたタスクをグローバルに統合する。

第3段階では、「なぜ実行するのか」を表す再帰的な目標ツリーと、「どのように実行するのか」を表す手続きツリーを別々に生成する。手続きには、トレースから観察可能なsequence、for-each、whileのみを使用する。決定論的検証器は、すべての活動がいずれかのタスクに属すること、ループに具体的なインスタンスまたは終了条件があることを要求する。その後、2つのツリーを調整し、各ノードが目標と制御フローの両方を持つモデルに統合する。すべての誘導段階にはGPT-5.4を使用し、評価にはそれぞれGPT-5.5とClaude Sonnet 5を採用した。

38件のHumanWork記録から合成した交錯トレースでは、TMIのタスククラスタリングにおけるAdjusted Rand Indexは0.974だった。GPT-5.5による評価では、ステップ記述精度は74.9%で、ワークフロー要約の30.3%を上回った。制御フロー演算子の正解率は88.5%で、ベースラインは52.7%だった。ただし、テストの交錯データは、もともと単一タスクだった記録を分割して人為的に混合したものであり、完全に自然なマルチタスクの業務日を再現したものではない。

チームはさらに、単一の成功デモンストレーションからCodexスキルを構築し、同じGPT-5-miniを使ってSkillLearnBenchのホールドアウト問題を実行した。TMIスキルの精度は18.57%で、最良の自動ベースラインである14.29%に対して30%の相対改善となったが、絶対的な成功率は依然として低い。導入前には、スクリーンショットとキーボードイベントに含まれる個人情報をマスキングする必要もある。また、論文に記載されたライブラリへのリンクは現時点で一般公開されておらず、即時の再現を制約している。

出典

  1. Inducing Task Models from Computer-Use Traces
  2. Inducing Task Models from Computer-Use Traces