全ニュース

技術ニュース 981 件

推論系統

Fast Gemma検証版が毎秒510トークンを突破、単一A10Gでスライディングウィンドウ注意機構とMTPを組み合わせ高速化

VIDRAFTは、Fast Gemma Challengeで検証済みの最高性能構成を公開した。Gemma 4 E4Bは単一のNVIDIA A10G上で510.58 tokens/sを達成し、perplexityを2.3930に維持した。複数の推論最適化を組み合わせた成果だが、テスト条件は単一ストリーム、固定ハードウェア、非公開プロンプトセットであり、そのまま本番環境のスループットと同一視することはできない。

資料中心基礎設施

NERCの「Computational Load」Level 3報告期限が到来、AIデータセンターに動的モデルと故障波形記録を要求

North American Electric Reliability Corporation(NERC)は、送電計画・系統運用部門に対し、8月3日までにモデル、安定度解析、試運転、動的波形記録を含む7項目のComputational Load対策について報告するよう求めている。これは一般的なエネルギー政策の表明ではなく、AIデータセンターで発生する秒単位の負荷遮断や電力振動を電力系統のエンジニアリングモデルに組み込むことを求めるものだ。

AI 安全/代理系統

SafeKeep、ツールschemaがモデルの拒否シグナルを弱めることを発見—プロンプトインジェクション成功率を2.5%に低減

新たな研究によると、エージェントが使用するJSON形式のツール仕様は単なる中立的なインターフェースではなく、モデル内部の拒否表現を弱める可能性がある。SafeKeepは実行前に、平文化したテキスト仕様を用いて安全性を別途判定し、有害な要求に対する平均拒否率を23.8%から70.6%へ引き上げた。

AI 基礎設施

Etched、低電圧演算とクラスター共有メモリでGPUに挑むラックスケール推論アーキテクチャを公開

Etchedの初期N4P推論チップがラック検証段階に入り、低電圧演算アレイとクラスター規模のメモリによって、それぞれスループットとレイテンシのボトルネックに対処する。同社は、疎なMoEでピークFLOPsの80%超を維持できるとしているが、再現可能なモデル、消費電力、エンドツーエンド性能のデータはまだ公開していない。

代理訓練

Echoverse、進化可能なアプリでコンピューターエージェントを訓練――9Bモデルのテスト横断成功率が67.1%に向上

Microsoft Researchのチームは、静的なWebページを増やし続けるのではなく、エージェントの失敗軌跡に基づいて合成アプリケーション、タスク、評価器を連動して修正する。9Bモデルは14の評価セットにおける平均成功率を36.5%から67.1%へ伸ばしたが、現時点でベンチマークとして公開されている環境は4つのみだ。

AI 代理

Qwen-UI-Agent、スマートフォン・デスクトップ・ブラウザ操作を統合、オンラインRLの軌跡は100ターン超

AlibabaのQwenチームは、スマートフォン、デスクトップ、Web、DeepSearchを横断するGUIエージェントの技術レポートを公開した。単一のアクション空間で画面操作、CLIコマンド、バッチアクションを組み合わせる。複数の自己申告ベンチマークで既存システムを上回ったとしているが、モデルの重み、訓練データ、完全な実行フレームワークはまだ同時公開されていない。

代理評測

OSRewardが27種類のコンピュータエージェント判定モデルを検証、困難な軌跡から広範な「成功の誤判定」バイアスが判明

OSRewardは、Web、Windows、Ubuntu、モバイルプラットフォームにまたがる1,019件の人手でアノテーションされた軌跡を用い、視覚言語モデルがコンピュータエージェントのタスク完了を正しく判定できるかを検証した。チームは推論過程を含む10万件の判定データも公開し、セルフホスト可能な9Bおよび35BのOS-Shepherd報酬モデルを学習した。

多模態模型

Cosmos 3 Edge、世界モデルを4Bに小型化し、単一GPUで視覚・テキスト・ロボット動作を同時処理

NVIDIAはCosmos 3 Edgeの重みと推論パイプラインを公開した。4BのMixture-of-Transformersに自己回帰推論と拡散ベースのマルチモーダル生成を組み合わせ、テキスト、画像、動作軌跡を入力できる。DROIDデータでファインチューニングしたロボットポリシー版も提供するが、物理的一貫性とエッジデバイスでのレイテンシーについては、独立した検証がなお必要だ。

AI 推論與系統

WIDE、トークンごとにAttentionとFFNを動的にプルーニングし、LLMデコードをエンドツーエンドで1.55倍高速化

WIDEは動的プルーニングをトークン単位のAttentionヘッドグループとFFNチャネルグループにまで細分化し、prefillとdecodeの両方をサポートする。研究では、スパース率50%でコア層のデコードが最大4.95倍高速化した一方、エンドツーエンドの高速化は1.55倍に縮小したと報告している。

AI 安全與標準

OWASP Agentic Skills Top 10、v1の公開レビューを完了し、スキルのサプライチェーンを独立した攻撃対象領域に位置付け

OWASPの「Agentic Skills Top 10」v1ドラフトが公開レビューを終え、悪意あるスキル、過剰な権限、依存関係の混同、クロスプラットフォーム移植のリスクを10種類の管理項目に整理した。このフレームワークは、スキルをモデルとMCPツールの間に位置する振る舞いのレイヤーとして捉え、権限、出所、完全性を宣言できる共通フォーマットを提案している。

模型與本機推論

POCKET、35Bの疎なMoEを8.2 GBに圧縮、標準のllama.cppでスマートフォンおよびCPUのみの環境でも実行可能

VIDRAFTはPOCKETシリーズの重みを公開し、35Bモデルを最小8.2 GBまで量子化しつつ、各tokenで有効化されるパラメータを約3Bに維持した。モデルはアップストリームのllama.cppをそのまま利用できるが、圧縮手法は公開されておらず、性能と品質を示す根拠も現時点では主に開発チームによるものだ。