全ニュース

技術ニュース 987 件

代理框架與開發工具

NVIDIA、NOOAをオープンソース化:Pythonクラスでエージェントの状態、ツール、永続メモリを統合

NOOAはエージェントを単一のPythonクラスとして表現し、分散したプロンプトやツールschemaをメソッド、フィールド、docstring、型アノテーションで置き換える。公式発表ではSWE-bench Verifiedで82.2%を達成し、token使用量を約半分に削減したとしているが、フレームワークはまだ研究プレビュー段階にあり、モデルが生成したコードを実行する際には別途sandboxが必要だ。

開放模型與推論

Kimi K3の完全版ウェイトが正式公開、2.8T MoEがAPI提供からセルフホスティングへ

Moonshot AIは7月27日、Kimi K3の完全版ウェイト、モデルカード、技術レポートを公開した。外部チームはこの3兆パラメータ級のスパースモデルを実際にデプロイし、監査できるようになった一方、少なくとも64基のアクセラレーター、カスタムコード、推論履歴への依存が明確な参入障壁となる。

AI 安全

MostarGate、3層の権限の共通部分でエージェント認証情報を縮小——600問のデータセットがまず企業ポリシーの不備を浮き彫りに

新たな研究では、エージェントが利用できる権限を、ロール上限、タスク分類、禁止される組み合わせという3要素の共通部分に限定し、各タスクで完全なロール認証情報を保持することを防ぐ。公開データセットは600件の企業タスクを15種類の最小権限に対応付けているが、93%の改善が示すのはポリシー改訂の効果であり、導入済みシステムにおける攻撃阻止率ではない。

開源模型

Nanbeige4.2-3B、Looped Transformerでエージェントモデルを圧縮――埋め込みを除く3Bパラメータで256Kコンテキストに対応

Nanbeige Labは、28兆tokenを用いてゼロから事前学習したNanbeige4.2-3Bを公開した。同一のTransformer層を繰り返し使用し、パラメータを増やさずに計算深度を高める。公式のエージェント評価では、より大規模なQwen3.5-9Bを概ね上回ったが、結果は独自の実行フレームワークに大きく依存しており、独立した再現検証がなお必要だ。

推論與模型服務

SGLang 0.5.16、信頼度に応じて投機的検証の長さを動的調整し、ハイブリッドアーキテクチャのキャッシュを再編

SGLangの新バージョンはDSparkを導入し、ドラフトモデルの信頼度に応じて各ラウンドの検証ウィンドウを変更する。また、UnifiedRadixTreeをスライディングウィンドウ、Mamba、スパースアテンションモデルのデフォルトキャッシュに設定した。複数の量子化バックエンドの削除やrollout転送形式の変更も含まれるため、既存サービスをアップグレードする前に互換性を確認する必要がある。

機器人與世界模型

Cosmos-H-Dreams、手術世界モデルをリアルタイムの閉ループへ前進、RTX PRO 6000 1基で約160 FPSを生成

NVIDIAは、少数ステップ拡散、自己生成履歴を用いた蒸留、ストリーミングKVキャッシュによって構築した手術ロボット向け生成シミュレーターを公開した。システムはロボットの運動データをリアルタイムで受け取り、次の映像区間を合成できるが、視覚的なリアリティは物理的な正確性や臨床検証の代替にはならない。

開放模型與代理

LLaDA 2.2、生成途中でトークンを追加・削除できる拡散モデルへ――反復修正可能なエージェントループを狙う

inclusionAIは、Levenshtein Editingによって並列デコード中の挿入・削除・置換を可能にした100B級モデル「LLaDA2.2-flash」を公開した。一部のエージェント評価とスループットでは自社の自己回帰ベースラインを上回ったものの、コード修復や関数呼び出しの精度では依然として後れを取り、サービス対応もまだ整っていない。

推論與基礎設施

vLLM 0.26、クロスレイヤーKVキャッシュとハイブリッドアテンションを拡張、DeepSeek-V4の推論カーネルも高速化

vLLM 0.26では、KV-cacheグループごとに異なるアテンションバックエンドを選択できるようになり、オブジェクトストレージも階層型キャッシュに組み込まれた。新版ではDeepSeek-V4、ROCm、XPU、speculative decodingの最適化にも注力しているが、公式マイクロベンチマークの結果が実際のサービススループットを直接示すわけではない。

代理評測

FluxBench、チップ設計エージェントを完全なRTL-to-GDSフローへ――同一モデルでもアーキテクチャ次第で最大86%の性能差

FluxBenchは、単発のコード出力だけでなく、統一されたプロンプト、ツール、プロセスライブラリを用い、エージェントがRTL生成から論理合成、配置配線、ECOまで完遂できるかを評価する。著者らは、同じ基盤モデルでもエージェントフレームワークによって性能に86.27%の差が生じ得ると報告している。ただし、商用EDAを用いた実験範囲は狭く、論文も一度撤回された後に再投稿されている。

AI 評測

動的予測ランキングが専用エージェントの優位性を示す:フロンティア汎用モデルはForecastBenchを独占せず

ForecastBenchが7月27日に更新した暫定ランキングでは、上位3位をTorchcast AIの専用エージェントが独占し、最高Brier Indexは65.6だった。GPT-5.5検索エージェントとスーパーフォーキャスターの中央値は近い水準にあるが、問題数、提出時期、信頼区間の違いにより、順位の単純な比較には限界がある。

AI 代理安全

Destructive Command Guard、ルールベースのhooksでエージェントの危険なコマンドを阻止、1日でGitHub Starsが約500増加

Rust製ツールdcgは、AIコーディングエージェントがコマンドを実行する前に、Git、ファイルシステム、データベース、クラウドリソースを破壊する可能性のある操作を阻止する。プロジェクトは7月26日の1日で約497 Starsを獲得したが、あくまでパターンマッチングによる防御であり、サンドボックス、権限分離、バックアップの代替にはならない。

本機 AI 推論

Nativ、MLX-VLM、ローカルAPI、パフォーマンステレメトリーをオープンソースのmacOS推論ワークスペースとして統合

Nativ v0.0.1は、モデルのダウンロード、チャット、モニタリング、OpenAIおよびAnthropic互換エンドポイントをネイティブSwiftUIアプリに統合し、最近ローカルAIコミュニティで注目を集めている。初版はApple SiliconとmacOS 26のみをサポートし、モデル横断のパフォーマンス検証や互換性テストはまだ公開されていない。