醫療 AI
AMIE Video 以三代理拆分即時問診,模擬臨床評分達 83%
Google 將低延遲對話、深度臨床規劃與影音感知拆成三個非同步代理,在 100 個模擬視訊問診情境的整體評分高於醫師組的 68%。研究仍只使用專業病人演員,模型、程式及影音資料亦未公開,不能直接外推至真實醫療部署。

Google Research 與 Google DeepMind 8 月 10 日公開 AMIE Video,把原本偏文字的醫療對話系統改造成即時影音架構。系統沒有要求單一模型同時兼顧反應速度與完整推理,而是以三個非同步代理分工:Talker 使用 Project Astra 基礎設施及 Gemini 3 Flash,只讀取最近五秒影片並產生低延遲語音回覆;Planner 以 Gemini 3.1 Pro 維護症狀摘要、鑑別診斷、管理計畫及對話里程碑,最密集每十秒執行一次深度推理;Perception 則以較長影音視窗追蹤咳嗽、姿勢、語速或動作等線索,寫入持久觀察記憶,再供 Talker 取用。[論文](https://arxiv.org/abs/2608.09861)亦建立單輪「能力單元測試」與多輪模擬評測,嘗試分開檢查感知、推理及互動失敗。
研究以 100 個可由演員呈現的臨床情境,比較 AMIE Video、AMIE Text 與十名美國基層醫師;另由二十名醫師評分,十五名專業病人演員提供使用體驗。AMIE Video 在案例專屬量表取得 83%,醫師組為 68%;鑑別診斷首選命中率為 91% 對 77%,引導視訊身體檢查則為 72% 對 39%。不過 top-3 診斷差異已無統計顯著性,病人演員在建立關係與合作感上仍較偏好真人醫師。
工程價值在於,這套設計把即時代理常見的「快回覆」與「慢推理」衝突改成狀態同步問題,但也引入 Planner 資訊過期、感知正確卻未觸發行動等新故障模式。它仍依賴離散輪替,無法像真人般重疊說話或因畫面即時插話;高頻顫抖、細微情緒及精確解剖位置也仍是弱點。Google 先前的[真實臨床可行性研究](https://research.google/blog/exploring-the-feasibility-of-conversational-diagnostic-ai-in-a-real-world-clinical-study/)仍採醫師監督的文字病史蒐集流程;下一步應觀察真實患者、跨族群校準、延遲與代理狀態一致性,而非只看 OSCE 總分。