全ニュース

技術ニュース 989 件

Agent applications

Meta AIがGmailおよびGoogle Calendarと連携、Muse Spark 1.1がアプリ横断の個人向けワークフローを実行開始

MetaはMuse Spark 1.1の計画立案・ツール利用能力をMeta AIに導入し、アシスタントがメールやカレンダーを読み取り、プレゼンテーションなどの継続的に利用できる成果物を作成できるようにした。今回のアップデートにより、モデルがアクセス可能な非公開コンテキストは拡大したが、ツールの権限、権限取り消しの仕組み、エンドツーエンドのタスク成功率について、公式情報は公開されていない。

AI coding tools

Grok Build Workflows、最大1,024エージェントでプログラミングタスクを分解——段階的な検証と再開可能な状態管理を追加

SpaceXAIはGrok BuildにWorkflowsを追加し、単一のバックグラウンドジョブから段階ごとに最大1,024エージェントへ並列に処理を割り当て、結果を集約・検証できるようにした。ワークフローはチーム共有コマンドとして保存できるが、コスト、成功率、大規模なエージェント群におけるエラー相関の評価結果はまだ公表されていない。

AI 基礎設施

NVIDIA ModelExpress、GPU間で重みを転送し、806 GiBモデルのスケールアウト時間を2分未満に短縮

NVIDIAはModelExpressの転送経路全体を公開した。新しい推論レプリカは、既存のGPUからP2P RDMA経由で重みとコンパイルキャッシュを優先的に複製する。公式検証では、8基のB200上でDeepSeek-V4-ProのAPI利用可能までの時間を8分から1分44秒に短縮したが、この結果は同一種類のGPU、高速ネットワーク、互換性のあるテンソル構成に大きく依存する。

代理訓練

TRLがOpenEnvに対応、GRPOで状態を持続するツールエージェントを直接訓練可能に

Hugging FaceはTRLにOpenEnvのネイティブ統合を追加し、各ツール呼び出しを独立した関数として扱うのではなく、統一されたファクトリインターフェースを通じてマルチターン環境をGRPOTrainerに提供できるようにした。環境はWebSocketサービスまたはコンテナ内で実行できるが、プロジェクトはまだ実験段階にあり、分離の強度と報酬の信頼性は利用者自身が検証する必要がある。

AI 基礎設施/分散式運算

Ray、TPU slice スケジューリングを Serve、Data、Train に組み込み、マルチホスト AI ワークフローを統合

Google は、Ray 上で TPU を利用するための包括的な AI ライブラリパスを発表した。`topology` フィールドにより、モデルワーカーが同じ ICI slice に配置されることを保証する。新バージョンには JAX ネイティブのデータバッチ、`JaxTrainer`、公式コンテナ、TPU モニタリングも追加されたが、現時点で主に検証されている環境は依然として GKE である。

代理訓練/強化學習

OpenForgeRL、実環境のエージェントフレームワークを強化学習に接続――エージェントサーバーで訓練と実行を分離

Microsoft Researchなどの研究者が、Codex、OpenClaw、GUIエージェントをネイティブ実行フレームワーク内でエンドツーエンドの強化学習に対応させるOpenForgeRLを発表した。モデル呼び出し用のエージェントサーバーとKubernetesによってrolloutを分離するが、コード、データ、重みはまだ完全には公開されていない。

開發者平台

Runway Media Router、単一エンドポイントで画像・動画・音声生成モデルへのリクエストを振り分け

Runway Devに生成メディア向けルーターが追加された。機能、価格上限、品質とレイテンシーの優先度に基づき、リクエストごとに基盤モデルを選択する。dry runとモデル選択理由も提供するが、品質評価器、テストセット、ルーティング効果を示すデータは公開されていない。

AI 基礎設施

AMD Helios、72基のMI455Xを単一メモリドメインに統合し、1ラックで31 TBのHBM4を提供

AMDは、CDNA 5アーキテクチャを採用したInstinct MI455Xと、72基のアクセラレーターで構成されるHeliosラックを正式発表した。新プラットフォームは、オープンなインターコネクトと大容量HBMでNVIDIA NVL72に挑むが、現時点で公表されている性能値は依然として理論ピークが中心だ。

開放模型

Apertus 1.5、ネイティブな画像・音声理解に対応—8B/70Bのオープンモデルが26万tokenをサポート

Swiss AI InitiativeはApertus 1.5をリリースした。継続事前学習により、従来のテキストモデルを、テキストを出力するマルチモーダルモデルへと拡張している。重みと学習情報は公開済みだが、正式な技術レポート、完全なベンチマーク、アップストリームの推論フレームワーク対応はまだ整っていない。

多模態推論

ReMo、音声とテキスト間で視覚情報を再配分し、Omni-LLMの入力tokenを54%削減

KAISTの研究チームは、音声から説明可能な映像tokenを入力段階で除去し、テキストプロキシによって物体の意味情報を保持する、学習不要のReMoを提案した。著者らの評価では、Qwen Omniシリーズで平均スコアを低下させることなく入力を半分以上圧縮したが、コードと独立した再現結果はまだ公開されていない。

具身 AI/機器人

FLUX-mimic、動画生成バックボーンでロボットの動作を予測——RTX 5090 1基で応答時間を101ミリ秒に短縮

Black Forest Labsとmimic roboticsは、FLUX 3の動画世界モデルに軽量なアクションデコーダーを接続し、同一の表現で視覚予測とロボット制御を処理する。チーム内で実施した柔軟部品の仕分けテストでは成功率95%を達成したが、モデル、データ、完全な評価結果はまだ公開されていない。

資料集/程式模型

The Stack v3、約5兆のコードtokenを公開――旧版の重複排除の不具合を修正し、ソースコードを内包

Hugging FaceとBigCodeは、次世代のオープンなコード事前学習コーパスを公開した。訓練データセットには約1億7,300万サンプル、4.9兆tokenが含まれる。新版ではユーザーがソースコードを別途取得する必要がなくなった一方、ライセンス、データ汚染、15.9 TBのストレージコストについては、引き続き訓練チーム側でのガバナンスが必要となる。