全ニュース

技術ニュース 985 件

多模態評測

PerceptionBench、視覚推論を10の基本知覚能力に分解――16種のマルチモーダルモデルはいずれも正解率60%未満

Moonshot AIは、42の既存ベンチマークにおける最初の失敗点から知覚能力の分類体系を構築し、3,000問の短答式問題によって10の基本的な視覚能力を切り分けた。その結果、総合スコアが近いモデルでも知覚上の弱点がまったく異なり得ることが示された。一方、テストセットはより大規模な社内問題プールから抽出されており、データ汚染と評価者バイアスには引き続き注意が必要だ。

本地 AI 與代理應用

Home Assistant 2026.8 Beta、llama.cppとLiteLLMをネイティブ統合――住宅向け会話エージェントを完全セルフホスト可能に

Home Assistantにllama.cppとLiteLLMの会話統合が追加され、モデルごとに個別のエージェントと指示を設定できるようになった。今回の更新でローカルモデル導入のハードルは下がるが、現時点ではまだbetaであり、エンドツーエンドのtool callingの信頼性はモデル、schema、ハードウェアに左右される。

多模態模型與推論

Mage-VL、動画の符号化情報を直接利用して視覚トークンを選択、ストリーミング・マルチモーダル推論を最大3.5倍高速化

MicrosoftのMage-VLは、動画フレームを均等にサンプリングする代わりに、I/P frame、motion vector、residual energyを利用し、変化の大きい領域だけをエンコードする。4Bモデルでは、静的タスクの能力を維持しながら視覚トークンを75%以上削減できるとしているが、速度と品質の比較は依然として主に公式テストに基づく。

代理系統/長期記憶

MemChain、検索後にエージェントの記憶を再構成し、エビデンストレースで回答モデルに渡すコンテキストを短縮

MemChainはベクトル検索の結果をそのまま言語モデルに渡すのではなく、まず計画・順位付け・圧縮を行い、出典に基づくアクティブメモリへ変換する。研究ではLoCoMoとLongMemEval-Sで最先端の結果を報告しているが、完全なコードや実環境でのレイテンシーコストはまだ公開されていない。

機器人與具身 AI

HiFi-UMI、ミリメートル精度のウェアラブルデータでロボットを直接訓練――ポストトレーニングで実機デモが不要に

HiFi-UMIは、オフラインのステレオ慣性SLAM、マイクロ秒精度の同期、両手を捉える6視点を統合したポータブルなデータシステムだ。人間の操作データのみをロボットのポストトレーニングに直接利用できる。3種類のVLA/世界・行動モデルの実機成功率は現場での遠隔操作ベースラインに近いが、結果は依然として単一チームによる制御されたタスクに集中している。

實體 AI/科學自動化

PUDA、制限付きCLIとイベントログでラボエージェントを接続し、生成的プランニングをハードウェアドライバ層から分離

PUDAは自動化機器を探索可能なコマンドラインツールとして公開し、JSON、NATS/JetStream、安定した識別子を用いてコマンド、測定、サンプルの来歴を保存する。エージェントは次の実験を選択できるが、実際のハードウェア操作は、エンジニアが事前に作成し、パラメータ検証を組み込んだドライバメソッドを介してのみ実行される。

AI 程式開發

CAPA、コーディングアシスタントのセッション横断記憶を評価:同一ユーザーの履歴で初回成功率が平均15.6ポイント向上

CAPAは、ユーザーが繰り返し省略する実装上の好みを600件の実行可能なコーディングタスクに組み込み、アシスタントが過去の会話から新たな要件を推測できるかを検証した。12モデルでは、同一ユーザーの履歴を追加しても最終成功率の上昇は平均6.8ポイントにとどまった一方、初回成功率は15.6ポイント向上した。これは、記憶が主に確認のやり取りを減らすものであり、失敗そのものを解消するわけではないことを示している。

代理評測

TREK、実行可能なルールで旅行エージェントを検証――最強モデルでも完全実行可能率は46.2%にとどまる

TREKは、LLMによる旅行計画の評価をやめ、エンティティ、予算、営業時間、交通手段、暗黙の要件を項目ごとに検証する。15種類のエージェントのうち最高性能のモデルでも、解決可能なタスクを完全に通過した割合は46.2%にすぎず、部分的に正しくても実行可能な旅程としてまとめることは依然として難しいと示された。

AI 安全與代理評測

SecRespondが侵害後フォレンジックのワークフローを再現、23モデルはいずれも単一の演習環境を完全に検知・修復できず

SecRespondでは、セキュリティエージェントがクリーンな環境で攻撃課題を解くだけでなく、侵害されたホストの読み取り専用ディスクスナップショットを分析する。23モデルはアラートの内容を言い換えることはできたものの、アラートで明らかにされていないインプラントや修復の検証を総じて見落とした。

代理系統與工具路由

CAM-DF、エージェントのツールランキングをコスト考慮型の停止判断へ転換し、ツール露出を37%削減

新たな研究によると、関連性ランキングで決められるのはツールの順序だけで、エージェントが何個のツールを読み込むべきかには答えられない。CAM-DFは読み込みを継続する限界便益を直接学習し、ほぼ同等のタスク成功率を維持しながらツール露出を37%削減する。

AI 代理與安全

MemTX、エージェントの共有メモリをトランザクション型コミットに変更、550万のプロトコル状態を網羅的に検証しても安全規則の違反なし

MemTXでは、エージェントが書き込んだ情報を即座に実行可能な事実として扱わず、証拠、権限、出所、スナップショット分離、検証付きコミットを導入する。研究では5つのモデルすべてで下流への被害がゼロだったと報告されたが、結果は依然として制御された評価環境に基づくものであり、現実の外部システムで生じる不可逆な副作用を修復できることまでは証明されていない。