返回首頁

電腦操作代理

TMI 從交錯電腦操作重建任務樹,步驟描述準確率由 30.3% 升至 74.9%

Task Model Induction 不把整段螢幕與輸入紀錄壓成單一工作流程,而是先拆出非連續任務,再重建目標階層與迴圈控制流。產生的代理技能在保留題準確率由最佳基線的 14.29% 升至 18.57%,但整套流程依賴前沿模型,且原始操作軌跡帶來明顯私隱風險。

King of Hearts · CC BY-SA 3.0 · Image source
zh-Hant

史丹福大學與卡內基美隆大學團隊提出 Task Model Induction(TMI),嘗試把螢幕截圖、滑鼠點擊及鍵盤事件轉成可稽核、可重用的任務模型。現有工作流程摘要通常假設一段紀錄只對應一個目標;TMI 則允許同一使用者在多個應用程式間切換,並把屬於同一任務但不連續的活動重新聚合。

系統分三階段運作。第一階段由視覺語言模型比較操作前後的畫面,把座標點擊等低階事件接地成具語意的動作,再依局部目標分段。第二階段逐一把活動配給既有潛在任務或建立新任務,並以檔案、網址與實體名稱等識別符抵抗應用程式及稱呼改變;最後再全域合併被錯誤拆散的任務。

第三階段分別產生「為何執行」的遞迴目標樹,以及「如何執行」的程序樹。程序只使用可由軌跡觀察的 sequence、for-each 與 while;確定性驗證器要求每個活動有歸屬、迴圈具實例或退出條件,再把兩棵樹調和成節點同時帶有目標與控制流的模型。所有誘導階段使用 GPT-5.4,評分則分別採用 GPT-5.5 與 Claude Sonnet 5。

在由 38 段 HumanWork 紀錄合成的交錯軌跡上,TMI 的任務分群 Adjusted Rand Index 為 0.974。以 GPT-5.5 評分時,步驟描述準確率為 74.9%,高於工作流程摘要的 30.3%;控制流運算子正確率則為 88.5%,基線為 52.7%。不過測試中的交錯資料是把原本單一任務紀錄切段後人工混合,仍不等於完全自然的多工工作日。

團隊再從單一成功示範建立 Codex 技能,並以相同 GPT-5-mini 執行 SkillLearnBench 保留題。TMI 技能準確率為 18.57%,相較最佳自動基線 14.29% 是 30% 相對增益,但絕對成功率仍低。部署前還必須先遮蔽截圖與鍵盤事件中的個資;論文宣稱的程式庫連結目前亦未能公開存取,限制即時重現。

來源

  1. Inducing Task Models from Computer-Use Traces
  2. Inducing Task Models from Computer-Use Traces