全ニュース

技術ニュース 987 件

推論基礎設施

NVIDIA Dynamo、Kimi K3向けマルチノード展開レシピを提供——100万tokenの推論には少なくとも16基のGB200/GB300が必要

Dynamoの実験版がKimi K3のマルチモーダル処理、推論、ツール呼び出しの解析に対応し、集約型およびprefill/decode分離型のKubernetesレシピを公開した。このレシピは2.8T MoEの展開要件をラックトポロジー単位で定量化しているが、現時点では正式なQAを通過しておらず、GB200構成には既知の起動エラーも残っている。

模型後訓練與企業 AI

9Bモデル、500ドルのGRPOでカタログ審査を習得――単一ワークフローでフロンティアAPIを上回る

Fermi Senseは、採点可能なECカタログ環境において、2基のGPUと約500ドルを使い、9Bのオープンモデルを達成可能スコアの87.3%まで訓練した。この成果は、強化学習によって企業ルールを小規模モデルに組み込める可能性を示す一方、評価データ、モデルの重み、完全な再現パッケージはまだ公開されていない。

AI 程式開發工具

Grok 4.5がGitHub Copilotに統合、500Kコンテキストと推論強度をIDE横断で利用可能に

GitHubはGrok 4.5をCopilotのIDE、CLI、クラウドエージェント、デスクトップアプリに順次展開し、最大50万tokenのコンテキスト、テキスト・画像入力、3段階の推論強度を提供する。企業管理者はモデルポリシーを明示的に有効化する必要がある。一方、GitHubが現時点で公表しているのは社内のターミナルタスクに関する所見のみで、比較可能なCopilotの評価結果はまだ示されていない。

AI 評測與多代理系統

28モデルへの17万票が示す:エージェント数を増やしても共通エラーは解消できない

新たな研究が4種類の二値スクリーニングタスクで28の言語モデルを測定した結果、モデルは同じサンプルで一斉に誤る傾向があり、多数決には委員会を拡大しても解消できない誤差の下限が残ることが分かった。また、最適な通過閾値は正例と負例それぞれの誤差相関に左右され、固定的な過半数ルールが必ずしも最も安全とは限らないことも示された。

模型評測與安全

一つの終助詞でモデルの同意率が64ポイント変動、反迎合訓練は表面的な文型しか学んでいない可能性

45モデルを対象とした再現可能なテストで、中立的な質問を確認を求める語尾に変えるだけで、モデルの同意率に最大64ポイントの差が生じることが分かった。新世代モデルは肯定的な誘導を拒む傾向が強い一方、不確実さを示す表現に対しては全モデルが逆に同意を増やしており、改善が堅牢な判断ではなく文型規則による可能性を示している。

多模態評測

ERUnderstand、ER図を構造化テストに変換――VLMは多項関係と弱エンティティで精度が大幅に低下

ERUnderstandは2,960枚の実体関連図を収集・生成し、視覚言語モデルにフィールド単位で照合可能なJSON schemaの出力を求める。モデルは一般的なエンティティや属性を認識できる一方、テキストの意味や空間的な近接性を頼りに接続を推測することが多く、複雑なEER構造ではF1が最低0.07にとどまった。

AI 研究與代理訓練

PlanPhysが長期エージェント訓練を分解:疎な報酬下ではon-policy蒸留がGRPOより安定

PlanPhysは制御可能な合成環境を用い、事前学習、GRPO、単一教師蒸留、マルチ教師蒸留が長期計画能力をどのように形成するかを個別に検証した。実験では、少量の長い軌跡と明示的な状態遷移が汎化に有効である一方、教師の知識や計画パターンに互換性がない場合、蒸留が既存能力をかえって損なうことが示された。

開源模型與電腦視覺

FeyNoBg、BiRefNetの中間ステージを深化し、混合データで前景認識と境界の精細さを両立

Feynは、2億6,300万パラメータのFeyNoBgと、学習用ライブラリNoBgをオープンソースで公開し、背景除去、バッチ推論、ファインチューニングのインターフェースを統一した。公式比較では、8つのデータセットのうち4つでS-measureが首位となった一方、速度、メモリ使用量、透明度誤差などのデプロイ指標は報告されていない。

AI 安全與開源基礎設施

Open Secure AI Alliance、オープンなAIエージェント防御スタックを構築へ――ツール共有とガバナンスの具体化はこれから

NVIDIAと30を超える組織がOpen Secure AI Allianceを設立し、モデル、エージェントフレームワーク、アイデンティティ、隔離、脆弱性スキャン技術を共有する計画を発表した。初期メンバーはNOOA、SPIFFE/SPIRE、Safetensors、Lightwell、MDASHなどの基盤コンポーネントを挙げているが、共通リポジトリ、テスト仕様、提供スケジュールはまだ公表されていない。

電腦視覺

合成顔でCLIPをファインチューニングするコンペの結果:フル訓練と少量データLoRAでそれぞれ異なる手法が勝利

IJCB-AFMFR 2026では、同一の合成IDデータを用いて、4チームがCLIP ViT-L/14を顔認識モデルへ変換する手法を検証した。フルデータ部門ではSub-Center ArcFaceによるフルファインチューニングが首位となり、制限データ部門ではrank-stabilized LoRAが勝利した。ただし、参加規模とデータソースが結論の一般化を制限している。

AI 安全

システムログに悪意あるテキストを書き込むことで、LLMに実際の攻撃を正常な活動と誤判定させることが可能

新たな研究により、攻撃者が自身で制御できるログフィールドにプロンプトを注入し、SOCで使用されるLLM分析パイプラインを妨害できることが実証された。モデルの説明には操作された痕跡がしばしば表れることも判明したが、このシグナルだけでは信頼できる防御策として不十分だ。

AI 開發工具

Antigravity CLI 1.1.8、強い型付けがされたエージェントイベントを出力し、CIでツールとサブエージェントを段階的に追跡可能に

GoogleはAntigravity CLIにJSON、NDJSONストリーミング、出力schema制約を追加し、ヘッドレスエージェントが端末のテキストを解析する必要をなくした。イベントではツールのパラメータ、結果、サブエージェントの軌跡も公開されるため、可観測性が向上する一方、機密データが漏えいする範囲も拡大する。