AI 科學與高效能運算
米国エネルギー省、AI科学ワークフロー278件を始動—エージェントフレームワーク、モデル、国立研究所のHPCを連携
Genesis Missionの第1弾プロジェクトは、原子力、重要鉱物、チップ設計、商用核融合を網羅。研究チームはモデル、エージェントフレームワーク、高性能コンピューティング資源を共同利用する。OpenAIもCodexの利用権とAPIクレジットを提供し、約2,000人の研究者と2件の大規模科学実験を支援する。
トップ
モデル、AI ソフトウェア、半導体、OSS、研究、基盤技術を中心にした AI ニュース。
AI 科學與高效能運算
Genesis Missionの第1弾プロジェクトは、原子力、重要鉱物、チップ設計、商用核融合を網羅。研究チームはモデル、エージェントフレームワーク、高性能コンピューティング資源を共同利用する。OpenAIもCodexの利用権とAPIクレジットを提供し、約2,000人の研究者と2件の大規模科学実験を支援する。
代理基礎設施
Claude Managed Agentsのメモリ一覧取得には7月22日付で新ルールが適用され、安定した並び順、ディレクトリ形式のプレフィックス照合、クエリ深度の制限などが導入された。これは単なるSDKのヘッダー変更ではなく、既存の同期プログラムで400エラー、項目の取りこぼし、カーソルの無効化が発生する可能性がある。
訓練系統
研究チームはDeepSeek-V4ファミリー向けに並列化戦略、通信スケジューリング、カーネル、演算子融合を再設計し、Ascendでの学習効率をオープンソースのベースライン比2.93倍に高めた。さらに、ソルバーで検証したデータを用いてオペレーションズ・リサーチ用モデルを学習したが、コード、データ、ハードウェア測定については、より完全な公開再現性が求められる。
端側推論
BaseRTは、手書きのDense/MoE GEMMおよびFlashAttentionカーネルを追加し、プロンプト段階の行列演算をM5 GPU内のNeural Acceleratorに委ねる。チームはM5 Proでllama.cppとMLXを大幅に上回ったと報告しているが、現時点のデータは開発元による単一マシンでのテストに限られる。
程式代理/推論最佳化
SWE-Pruner Proは独立した分類器の呼び出しを廃止し、軽量な予測ヘッドを使ってコーディングエージェントの内部表現から、ツール出力の各行を保持すべきか判断する。2つのオープンMoEモデルと4つのマルチターン・ベンチマークでトークン削減を達成したが、推論サーバーの改修が必要で、一部の品質向上については今後の再現検証が待たれる。
具身 AI/機器人
Alibaba DAMO Academyは、2B、9B、122B-A10Bの3種類のRynnBrain 1.1モデルを公開し、接触点予測とネイティブ3D groundingを追加した。併せて開発されたRynnBrain-VLAは、統一されたアクション空間を用いてUnitree G1、Astribot-S1、天機舞姫を横断的に訓練するが、ハードウェア間の汎化性能は、現時点では主にチーム独自の実験によって裏付けられている。
開發者工具
GitHubはCopilot impact dashboardを追加し、「Code-first」「Agent-first」「Multi-agent」などの利用フェーズ別に、マージ速度とアウトプットを比較できるようにした。新しいインターフェースにより、企業はツール導入の深度を把握できるが、欠陥、手戻り、長期的な保守コストといった品質シグナルは依然として不足している。
AI 基礎設施
Anthropicは2027年上半期から、AMD Instinct MI450シリーズGPUの初期導入を開始し、総規模を最大2 GWまで拡大する計画だ。この提携はハードウェアの調達にとどまらず、両社はClaudeを活用してGPUワークロードとROCmソフトウェアスタックを最適化する。
Inklingは、総パラメータ数9750億、アクティブパラメータ数410億のMoEアーキテクチャでオープンウェイト市場に参入する。調整可能な推論強度、100万トークンのコンテキスト、Tinkerでのファインチューニング手段も提供する。
GPT-5.6ファミリーが一般提供を開始し、Sol、Terra、Lunaがそれぞれ最高性能、コストとのバランス、大量の低コストワークロードを担う。3モデルは長大なコンテキストとツールインターフェースを共有するが、推論コスト、安全性に関する挙動、実際の品質については個別の評価が必要だ。
機器人資料與工具
Pollen Roboticsは、約490ユーロのハンドヘルド型Grabetteを公開した。デュアルカメラ、IMU、グリッパーエンコーダーを使用して6自由度の操作を記録し、ブラウザベースの処理フローでSLAMの実行、軌跡の検証、標準LeRobotデータの出力を行う。
程式代理評測
AgentLensは、エージェントがコーディング課題を解けたかどうかだけでなく、インタラクションの全軌跡と実際のプロダクト成果を精査する。オープンソースのベンチマークを使用して、モデルのバージョン比較、挙動の劣化の特定、継続的インテグレーション(CI)プロセスへの組み込みが可能だ。
代理評測
OmniaBenchは、明確な状態空間を持つ、ツールおよびインタラクション形式を横断したエージェント評価を構築し、644問の精選された高難度セットも提供する。結果から、計画、制約の維持、エラー後の適応が、依然として最先端エージェントに共通する弱点であることが示された。