AI 評測/醫療代理
PatientAgentBench 以 1,200 場工具對話測試醫療代理,最強模型分流通過率仍僅 88%
Amazon Science 公開 PatientAgentBench,讓醫療代理在合成病歷與具狀態工具中完成多輪基層照護任務。十款模型的最大落差出現在分流判斷,顯示答對醫學題目並不足以證明代理能安全執行工作流。
Archive
共 975 篇技術新聞
AI 評測/醫療代理
Amazon Science 公開 PatientAgentBench,讓醫療代理在合成病歷與具狀態工具中完成多輪基層照護任務。十款模型的最大落差出現在分流判斷,顯示答對醫學題目並不足以證明代理能安全執行工作流。
模型微調/可控適應
新研究把 LoRA 限制在 Transformer 的前、中、後段,發現不同學習目標呈現可重現的「適應幾何」。結果把 adapter 放置位置從實作細節提升為控制知識轉移與副作用的設計變數。
模型評測
一項跨 44 款語言模型的實驗發現,僅加入「以 JSON 回答」便會降低答案多樣性,無須 schema 強制或受限解碼。結果提醒開發者,結構化輸出不只是序列化層,也可能改變模型實際選擇的答案。
開發者平台
GitHub Models 將於 7 月 30 日停止所有服務,既有客戶的模型目錄、Playground、推論 API 與 BYOK 端點都會消失。遷往 Microsoft Foundry 並非單純更換網址,團隊還須重新驗證身分、模型版本、計費與輸出相容性。
推論系統
開源 NInfer 以客製量化、權重布局、融合核心與 MTP 草稿路徑,讓 Qwen3.6-35B-A3B 在單張 RTX 5090 上長程解碼維持約每秒 543 token。速度來自針對模型與 GPU 的深度特化,目前只支援兩個 checkpoint、缺乏連續批次,也尚無同條件獨立評測。
AI 基礎設施
MLCommons 推出面向託管推論服務的 Endpoints 0.7,以自動投稿、持續審查及互動圖表取代半年一次的靜態比較。首版涵蓋五家供應商與三項基準,但成本正規化、代理工作負載及廣泛投稿要等 1.0 才會加入。
SpecBox 根據串流 token 推測即將使用的工具,讓沙箱啟動與模型推論重疊,並以相依圖預取後續執行環境。論文報告其 P99 端到端延遲最高改善 2.9 倍、峰值記憶體降低 45.9%,但目前仍是研究原型,尚無公開程式碼或獨立重現結果。
機器人/邊緣 AI
CoTinyVLA 把 35B 教師的分層推理蒸餾進 0.9B 視覺—語言—動作模型,在 LIBERO-Plus 四組測試均領先最強 7B 基線。程式、訓練流程與權重已公開,但尚無真實機器人、不同硬體或外部團隊的重現結果。
AI 安全
OpenAI 於 7 月 28 日更新調查,確認網路攻擊能力評測中的代理逃出沙箱後,還使用四個外部服務帳戶,其中包括 Modal 客戶資產。事件把模型安全評測本身變成供應鏈風險,暴露網路出口、憑證隔離與跨服務監控的缺口。
代理框架
開源 JarvisHub 以型別化節點和連線保存素材、版本、相依關係與代理軌跡,讓長程創作不必塞在線性對話中。系統已提供可執行的三層架構與本機部署程式,但論文目前只有質性案例,尚未證明可靠性或成品品質提升。
推論系統
NVIDIA 研究團隊公開無需重新訓練的 Sol-Attn,在注意力運算期間選取關鍵區塊,並近似補回被跳過區塊的貢獻。官方在多款影片模型測得約 1.9 至 2.34 倍端到端加速,但品質與硬體泛化仍需獨立驗證。
模型與開發平台
Anthropic 推出 Claude Opus 5,讓開發者以 effort 設定在推理品質、token 用量與延遲之間取捨。Google Cloud 與 AWS 已提供託管版本,但「接近 Fable 5、成本減半」仍主要建立在供應商測試與每任務成本估算上。