全ニュース

技術ニュース 983 件

AI 安全與標準

OWASP Agentic Skills Top 10、v1の公開レビューを完了し、スキルのサプライチェーンを独立した攻撃対象領域に位置付け

OWASPの「Agentic Skills Top 10」v1ドラフトが公開レビューを終え、悪意あるスキル、過剰な権限、依存関係の混同、クロスプラットフォーム移植のリスクを10種類の管理項目に整理した。このフレームワークは、スキルをモデルとMCPツールの間に位置する振る舞いのレイヤーとして捉え、権限、出所、完全性を宣言できる共通フォーマットを提案している。

模型與本機推論

POCKET、35Bの疎なMoEを8.2 GBに圧縮、標準のllama.cppでスマートフォンおよびCPUのみの環境でも実行可能

VIDRAFTはPOCKETシリーズの重みを公開し、35Bモデルを最小8.2 GBまで量子化しつつ、各tokenで有効化されるパラメータを約3Bに維持した。モデルはアップストリームのllama.cppをそのまま利用できるが、圧縮手法は公開されておらず、性能と品質を示す根拠も現時点では主に開発チームによるものだ。

AI 安全與產品工程

Google Earth、画像生成機能を公開翌日に撤回—SynthIDでも偽衛星画像の流出を防げず

GoogleはNano Banana 2を実在の地理画像に統合したが、ユーザーはすぐに爆発や空爆など架空の場面を生成し、そのスクリーンショットを拡散した。同社は翌日、この機能を撤回した。生成結果にはウォーターマークが付与され、共有地図にも書き込まれないものの、今回の事例は、出所表示だけでは入力制限やインターフェースの分離の代わりにならないことを示している。

科學機器學習

UNICON、4,160万パラメータで9種類の数値システムを統一、重みを凍結したまま分野横断予測

UNICONは、河川、交通、電力網、気象、人流などのデータを共通のグラフ系列インターフェースに変換し、少数の数値例を通じてコンテキスト内で新たなタスクを指定する。学習に含まれていないWebトラフィックなどの分野でも専用モデルに迫るが、現時点で検証されているのは予測タスクのみで、重みとコードも公開されていない。

代理安全與評測

5つのオープンウェイトモデルの自己申告信頼度はほぼ一定、低信頼度優先の監査はランダム抽出と同等の可能性

新たな研究は、限られた人的予算でエージェント群の監査をシミュレーションし、自己申告信頼度の歪みによってランキング戦略がランダム抽出を下回る臨界点を特定した。5つの小・中規模オープンウェイトモデルでは、2つのベンチマークにおける信頼度のAUROCが約0.5にとどまったが、この結論は単一のプロンプトと直接回答という設定に基づく。

AI 代理評測

ORCA-benchが6日間のテレメトリ現場を再現、最先端エージェントの中難度根本原因分析は最高でも25.3%

ORCA-benchは、実行可能なマイクロサービス、50 GBのテレメトリデータ、1,079件のインシデントを用い、コーディングエージェントが曖昧な報告から根本原因を特定できるかを検証した。完全なソースコードが与えられても、最良のエージェントが、実環境に近い入力を使う中難度タスクで正解できたのは約4分の1にとどまった。

多模態推論

ReToken、単一の学習可能なtokenで視覚KV cacheを選別――長時間動画QAで8.0ポイント向上

ReTokenは、すべての画像tokenを一度にモデルへ入力するのではなく、事前に格納した視覚KV cacheから質問に関連するスパースなブロックを取り出す。バックボーンを凍結し、検索tokenのみを学習する手法は単一のH100で実行できるが、成果は依然として主に2種類の8Bモデルに基づいている。

模型 API

Mistralの旧モデル群が7月31日に提供終了へ、コーディングエージェントと構造化出力の回帰テストが必要

Mistralによる夏季のモデル整理が最終段階に入り、Devstral、Magistral、Mistral Small、Open Mistral Nemoなどの旧バージョン識別子が対象となる。公式の代替モデルは同一アーキテクチャのスナップショットではないため、移行時には名前を変更するだけでなく、ツール呼び出し、出力schema、コンテキスト、コストを改めて検証する必要がある。

AI 基礎設施

SageMaker HyperPod Inference v3.1、カスタムPod、証明書、Pod単位のリクエスト上限を解放

AWSはHyperPod Inference Operatorを更新し、チームがKubernetes Pod仕様を直接調整し、カスタムTLS証明書を構成し、単一Podの同時リクエスト数を制限できるようにした。これらのインターフェースにより、大規模モデルのサービングに必要な分離とバックプレッシャー制御が補完されるが、アップグレード前には、カスタム設定がOperator管理下のリソースを損なわないことを検証する必要がある。

基準與基礎設施

MLPerf Endpoints v0.7が公開、エージェント推論向けに継続的な提出と比較可能な結果パイプラインを導入

MLCommonsはEndpoints v0.7をリリースし、推論テストを固定バッチ方式の提出から、自動審査と継続的な更新に対応するエンドポイント・ベンチマーク基盤へと刷新した。今後追加されるマルチターンのエージェント・ワークロードでは、孤立したリクエストのtokens/sだけでなく、個々のユーザーの進捗速度とシステム全体のスループットを同時に評価する。