全ニュース

技術ニュース 970 件

AI 基礎設施

NVIDIA DSX MaxLPS、ラック電力を動的に配分し、GB200のワット当たり推論性能を1.5倍に向上

DSX MaxLPSはリアルタイムテレメトリーに基づいて未使用電力を再配分する。NVIDIAの測定では、GB200 NVL72ラックの割り当て電力を、スループットを維持したまま125 kWから90 kWに削減できた。このソリューションはワークロード別の電力設定と45°C液冷も組み合わせるが、中核となるDynamic Power Softwareは依然としてDeveloper Previewの段階にある。

AI for Science/代理基礎設施

Brain Researcher、脳画像エージェントの初手ツール選択率を23.3%から93.6%へ向上

Brain Researcherは、知識グラフ、型付きワークフロー、レビュー規則によって神経画像解析エージェントを制約し、仮説、証拠、実行の来歴を保存する。ツールルーティングは大幅に改善したものの、検証可能な証拠の実装率は依然として22.0%にとどまり、自動レビューでも方向性に関する統計的誤りを見逃したことがある。

具身 AI/安全訓練

SafeBranch、同一状態で安全な分岐をペアリングし、IS-Benchの安全成功率を0.031から0.281へ向上

SafeBranchは、エージェントの危険な軌跡を重要な意思決定地点までロールバックし、同一コンテキスト内の安全な行動と安全でない行動のみを比較する。学習後のデプロイには外部criticが不要だが、現時点の成果はシミュレーション上の家庭環境に限られ、データ構築も依然としてGPT-4oの判定に依存している。

AI 安全與模型反學習

ConceptGuardは同一概念の善用と悪用をペアリング、最良条件でも分離スコアはわずか0.38

ConceptGuardは、忘却セットと保持セットを互いに無関係な事実として扱うのではなく、同じ技術の有害な用途を抑制しながら正当な用途を保持するようモデルに求める。4種類のアンラーニング手法はいずれも忘却と有用性のトレードオフを示し、その効果は概念ごとに大きく異なった。

AI 評測與形式化推理

FormalTCS、175問のLean課題で研究プロセスを評価——自動形式化の最高スコアはわずか11.5点

FormalTCSは、過去2年間のトップ理論計算機科学論文から研究レベルの問題を抽出し、自然言語による主張から機械検証可能な証明を生成するまでのモデル能力を段階別に測定した。既に形式化された定理の証明では、最高性能のモデルがPass@8で28.6を記録した一方、自然言語を正しいLeanの定理文へ変換する工程が依然として最大のボトルネックとなっている。

代理框架與安全

Forge 0.18.1、MCPにユーザー単位のOAuthを導入、ツール呼び出しは認可完了を待って再開可能に

オープンソースのエージェント実行環境Forgeは、MCP接続と認証情報をユーザーごとに分離し、OAuth 2.1のメタデータディスカバリーと動的クライアント登録を自動化できるようになった。新版では、きめ細かなアウトバウンド制御と承認監査も追加されたが、現時点のMCPサポートは依然として主にHTTPトランスポートに限られる。

AI 開發者平台

Anthropic Python SDK 1.0がhttpx2へ移行、従来のトレーシングやmockが気付かないまま機能しなくなる可能性

新バージョンでは最低Pythonバージョンが3.10に引き上げられ、Text Completions、一部のサンプリングパラメータ、クライアント側の圧縮インターフェースが削除された。通常のAPI呼び出しはほとんど変更不要だが、httpxに直接依存するモニタリング、テスト、カスタムトランスポート層は移行が必要となる。

推論系統

Daedalus-150M、注意層の3分の2を畳み込みに置き換え、2KコンテキストでCPUデコードを1.76倍高速化

Daedalus-150Mは、シングルユーザー環境での4-bit CPU推論に特化して設計されており、大半のネットワーク層で、増え続けるKV cacheを繰り返し読み込む必要がない。初期結果では、コンテキストが長くなるほど速度面の優位性が拡大する一方、モデルの上限は2Kにとどまり、性能値についても異なるハードウェア上での独立した再現検証が必要だ。

AI 安全

MaliciousSkillBench、9,740件のエージェントスキルを集約――ソース横断検出でMacro-F1が0.665に低下

新ベンチマークは、13の公開ソースから収集したエージェントスキルを重複排除し、構造ファミリー単位で分割することで、類似サンプルが訓練セットとテストセットの両方に混入するのを防いだ。最高性能のテキスト分類器はランダム分割で優れた結果を示した一方、未知のソースに対しては良性スキルの62.4%を悪意あるものと誤判定した。

代理基礎設施

NemoClaw 0.0.113、ローカル推論の検証を強化し、サンドボックス再構築後のMCP認証情報の再発行に対応

NVIDIAはオープンソースのエージェント実行スタックを更新し、vLLM、llama.cpp、Ollama、モデルルーターにおける状態ドリフトへの対処を重点化した。新版ではサンドボックスのライフサイクル、イメージの出所証明、障害復旧も厳格化されたが、依然として急速なイテレーションの途上にあるパッチリリースだ。

AI 安全與私隱

8つのクローズドモデルでは通常の応答にコンテキスト内の秘密が潜み得る、4桁の正確な復元率は82%

新たな研究によると、モデルが秘密の直接的な漏洩を拒否しても、応答の長さ、形式、語彙などの統計的特徴がコンテキスト情報を伝える可能性がある。適応型ブラックボックス攻撃では、2桁の秘密をほぼ完全に復元でき、4桁でも正確な一致率は82%に達した。

AI 程式代理與評測

SWE-bench Scienceは20の科学分野を収録、最優秀のコーディングエージェントでも119問中47.90%しか解決できず

SWE-bench Scienceは、98の実在する科学ソフトウェアリポジトリを用いて、単位、座標系、数値的不変条件、ファイル形式などの暗黙的な契約を検証する。Claude CodeとOpus 5の組み合わせが暫定首位だが、pass@1は依然として50%未満で、エンジニアリング統合問題ではわずか27.78%にとどまった。