全ニュース

技術ニュース 972 件

AI 代理安全

PACE、AIエージェントの取引承認をオンチェーンのバイト列に紐付け――サンドボックス試験で危険な実行率を0.80からゼロへ

PACEは、取引が安全かどうかを言語モデル自身に判断させるのではなく、取引意図、シミュレーション結果、実際のcalldataを決定論的ルールで検証する。署名済みのPolicy Decision Recordは実行前にスマートアカウントによって再検証されるが、現時点で失敗ゼロという結果が得られているのは、単純化されたDeFiサンドボックスに限られる。

AI 安全與強化學習

2者間ディベートがRLAIFの報酬ハッキングを抑制、数学タスクにおける方策の最高精度は72.63%から74.74%へ

Google DeepMindの研究では、同一のGemini方策に問題解決者と批評者の役割をそれぞれ担わせ、より弱い凍結モデルに判定させた。ディベートは判定モデルの識別能力を維持し、RLVRとの差の約45%を取り戻したが、より多くの訓練ステップと批評文の長さ制限を必要とした。

推論系統

TensorRT Model Connect パブリックプレビュー:Hugging FaceモデルをONNX経由なしでネイティブC++推論向けにパッケージ化

NVIDIAはTensorRT Model Connectをオープンソース化した。2つのコマンドで、サポート対象のHugging Faceモデルまたはローカルcheckpointを、C++アプリケーションに引き渡せるバージョン管理されたbundleとしてビルドできる。モデル移植の工程を短縮する一方、現時点ではreference implementationという位置付けであり、対応範囲と性能はモデル、精度、ハードウェアごとに検証する必要がある。

AI 系統與 GPU

PTXBenchがLLMによるH100/B200専用PTXの直接生成を実測、最先端カーネルライブラリに安定して追いつけるモデルはなし

PTXBenchは、生成されたカーネルの正確性、指定された命令が実際に実行されたか、さらにcuBLAS、cuDNN、FlashInferに対する速度を同時に検証する。その結果、新アーキテクチャ向け命令を生成できても、それを実効的な高速化につなげられるとは限らず、特にB200のAttentionカーネルが難しいことが示された。

代理基礎設施

StagedWorkspace、コンテンツハッシュでエージェントの解析ビューとネイティブファイルを同期し、OfficeQA Pass@1を8.3~12.1ポイント向上

新システムは、ドキュメントエージェントの検索結果、ネイティブファイル、diffビュー、最終提出物を明示的なバージョンに結び付け、古い解析内容を読んだエージェントが新しいファイルを編集する事態を防ぐ。固定したフレームワークでのアブレーションでは、解析ビューとネイティブビューを併用する方が、いずれか一方だけを使う場合より優れていた。一方、完全なコードとフレームワークをまたぐ再現結果は、まだ十分に提供されていない。

醫療 AI/安全評測

医療LLM、患者への回答前にセルフケアを提案――短い指示で出現率が9/12から0/12に

新たな研究は、患者がまだ問題を明確に説明できていない初回接触の段階へ評価を前倒しした。「まず明確化し、その後に助言する」というシステム指示により、応答の順序と引き継ぎ要約は改善したものの、意思決定を左右する病歴を確実に聞き出すには至らなかった。

推論系統

MoNe、長文コンテキストをテスト時ニューラルメモリに書き込み、128K推論の総FLOPsを81%削減

Qualcomm AI Researchは、凍結したTransformerの各層に高速重みを追加し、コンテキストを512-token単位で取り込む手法を開発した。クエリ時に原文を再読み込みする必要はない。Qwen2.5-0.5Bを用いた128Kの実験では、メモリ使用量を一定に保ちながらICLとRAGを上回ったが、現時点でのエビデンスは3つの合成検索タスクに限られる。

代理強化學習

Agent Lightning v1.0、実運用のエージェントフレームワークを強化学習に直接統合し、Qwen3.5-9BのSWE-bench Verifiedを56.4%に向上

MicrosoftはAgent Lightningを全面的に書き直し、モデルAPIのプロキシ層を通じて既存のエージェントフレームワークの完全なインタラクションを取得できるようにした。ツールループをトレーニングエンジンへ移植する必要はない。公式発表によると、6,000件のデータでQwen3.5-9Bを訓練し、SWE-bench Verifiedのスコアを41.8%から56.4%へ向上させた。

GPU 與強化學習系統

rl-triton、7種類の強化学習リターン計算をGPU scanに統合し、関数呼び出し全体で最大5.70倍高速化

オープンソースライブラリのrl-tritonは、GAE、V-Trace、Retraceなどの信用割り当てにおける再帰計算を、Tritonによるassociative scanへと書き換え、系列依存の深さをO(T)からO(log T)へ削減した。4,096環境、128ステップのテストでは、すでにベクトル化されたtorch.compileベースラインより1.6~5.70倍高速だった一方、大規模ポリシーにおけるend-to-endのPPO高速化は約1.02倍にとどまった。

AI 代理與評測

自己改善エージェント、タスク順序のランダム化で平均効果が+1.5%から-4.5%へ逆転

Salesforceが2種類のテキスト記憶手法を再評価したところ、自己改善ループを導入した設定の71%で、実行間のばらつきが増大した。暗黙に易しい順から難しい順へ並べられていた固定タスク順序をシャッフルすると、ReasoningBankはエージェントを改善しないばかりか、成功率を低下させた。