全ニュース

技術ニュース 968 件

AI 代理與開源工具

Prime Agent、永続型RLM harnessをオープンソース化――エージェントの記憶、サブエージェント、実行環境を対話の外部に保持

Prime Agentは、常駐型IPython、daemonセッション、バージョン管理可能なContinual Harnessにより、長時間稼働するコーディングエージェントを支援する。作者らによれば、ARC-AGI-3 RHAEのBest@1は30%から95.5%へ向上した。ただし、このスコアはモデルとharnessを組み合わせたシステム全体の結果であり、基盤モデル単体の能力比較には使えない。

代理評測

SWE-bench Science、科学ソフトウェア修復課題119問を公開—最良エージェントの完全合格率も5割未満

新ベンチマークは、コードがコンパイルできるかだけでなく、非公開の科学テストを用いて単位、数値的不変条件、ファイルのセマンティクス、モジュール間のデータフローを検証する。Claude CodeとOpus 5の組み合わせによる全体のpass@1は47.90%。実験では、ドメイン知識の追加によってエージェントが誤った方向に固執する場合もあることが示された。

推論與開源執行環境

DFlash 2、Qwen3.8-27Bでトークンを並列ドラフト生成――ただしvLLM nightlyには現在、読み込みとVRAMに関する不具合

DFlash 2は、候補パスセレクターと動的畳み込みによってブロック拡散ドラフトを改善し、単一リクエストのテストでQwen3.8-27Bに自己回帰デコードの2.7~3.4倍のスループットをもたらした。最新の再現可能な不具合では、vLLM nightlyが誤ったdecoder layerを生成するほか、語彙重みを共有する前に一時的に約4.74GiBを余分に割り当てるため、24GBのGPUでは起動できない可能性がある。

AI 晶片與資料中心

MTIA 300、12基のRDMA NICと集団通信エンジンをチップに統合し、PCIeと演算コアの競合を回避

MetaはMTIA 300のシステム設計を公開した。内蔵NIC chiplet、ニアメモリ・リダクション・ユニット、コンパイル方式のHCCLにより、レコメンデーションモデルの学習を高速化する。公式発表によると、40基のアクセラレータにおける通信時間は比較対象のGPUクラスタの約4分の1に短縮されたが、コスト、消費電力、汎用LLM学習との比較は示されていない。

AI 基礎設施

AWS ParallelCluster 3.16、ノード診断機能を追加する一方でIAM、NFS、コンテナスタックも変更

新版AMIには`pcluster-diag`が組み込まれ、ノードの役割に応じてSlurm、IMDS、ディレクトリサービス、Lustreの状態を検査し、構造化レポートを出力できる。今回のアップグレードではAmazon Linux 2とAWS Batchのサポートも終了し、権限、ネットワークの外向き通信、実行環境に関する変更への事前対応が必要となる。

AI 開發工具

DeepSeek Harness rc.2のnpmタグ分裂:メインプログラムは最新版、しかしプラグイン開発では0.0.xを取得する可能性

DeepSeek Harnessのメインパッケージでは`latest`がすでに0.1.1-rc.2を指している一方、複数の基盤パッケージでは依然として初期バージョンが最新版として指定されている。プラグインAPIを直接インストールすると、peer dependencyの競合が発生したり、バージョンが食い違った依存関係ツリーが警告なしに構築されたりする可能性がある。

AI 基礎設施

SageMaker HyperPodにマネージドRayが登場:トレーニング、推論、障害復旧でKubeRayインターフェースを共用

AWSは、Rayクラスターの作成、リモートジョブの送信、監視、ワークスペース接続をHyperPod on EKSに統合した。インターフェースにはKubeRayと標準Ray APIが引き続き採用される一方、デプロイには複数のアドオンが必要で、コストや性能の比較も公式には公表されていない。

AI 開發工具

GitHub Agentic WorkflowsがPRのリアルタイムsteerに対応、ただし公式週報が案内するv0.87.4には未収録

新機能により、実行中のエージェントがPRコメントを読み取り、`steer`指示に従って作業を修正できるようになった。同時に、明示的な読み取り権限も必要となる。しかし公式週報は、それより前に作成されたv0.87.4での試用を推奨しており、このタグに固定したデプロイでは実際には機能を利用できない。

AI 基礎設施

NVIDIA Groq 3 LPXが量産開始:静的スケジューリングにより100Kコンテキストで毎秒3,431出力tokenを実現

Groq 3 LPXは、256基のLP30、128GBのSRAM、コンパイラによって事前スケジューリングされたチップ間転送を統合した低レイテンシdecodeシステムだ。第三者テストでは、長いコンテキストにおいて既存の公開endpointを上回る速度を示したが、コスト、並行処理時のthroughput、本番サービスでの性能はまだ公開されていない。

AI 評測與開發工具

Rails、オープンソースの評価フレームワーク「lemans」を公開:ファイル復元、ネットワーク遮断、完全な軌跡でエージェントの不正余地を低減

Rails Foundationは、Agents on Railsリーダーボードで使用するRuby製評価フレームワーク「lemans」を公開した。DaytonaとローカルDockerサンドボックスに対応し、検証プログラムを隔離して再生可能な証拠を保存するとともに、採点前に保護対象ファイルを復元する。

AI 程式開發平台

Slack Code、コーディングエージェントを一時的なコラボレーションチャンネルに移行。ただし初期統合と権限境界にはなお制約

Slack Codeは、エージェントとの対話、計画、コード差分、行単位のコメント、リアルタイムHTMLプレビューをプロジェクト専用チャンネルに集約する。Slackのチャンネルガバナンスと監査機能を継承する一方、リポジトリ権限や実際のデプロイによる副作用は、引き続き各エージェント統合によって制御される。