全ニュース

技術ニュース 991 件

程式代理/推論最佳化

SWE-Pruner Pro、コーディングモデルの隠れ状態を直接読み取り、エージェントのトークンを最大39%削減

SWE-Pruner Proは独立した分類器の呼び出しを廃止し、軽量な予測ヘッドを使ってコーディングエージェントの内部表現から、ツール出力の各行を保持すべきか判断する。2つのオープンMoEモデルと4つのマルチターン・ベンチマークでトークン削減を達成したが、推論サーバーの改修が必要で、一部の品質向上については今後の再現検証が待たれる。

具身 AI/機器人

RynnBrain 1.1、接触点とネイティブ3D定位を具身基盤モデルに導入し、3種類のロボットを横断してVLAを訓練

Alibaba DAMO Academyは、2B、9B、122B-A10Bの3種類のRynnBrain 1.1モデルを公開し、接触点予測とネイティブ3D groundingを追加した。併せて開発されたRynnBrain-VLAは、統一されたアクション空間を用いてUnitree G1、Astribot-S1、天機舞姫を横断的に訓練するが、ハードウェア間の汎化性能は、現時点では主にチーム独自の実験によって裏付けられている。

開發者工具

GitHub、導入フェーズ別にCopilot効果ダッシュボードを刷新—ただし、アウトプット量はエンジニアリング品質と同義ではない

GitHubはCopilot impact dashboardを追加し、「Code-first」「Agent-first」「Multi-agent」などの利用フェーズ別に、マージ速度とアウトプットを比較できるようにした。新しいインターフェースにより、企業はツール導入の深度を把握できるが、欠陥、手戻り、長期的な保守コストといった品質シグナルは依然として不足している。

模型發布

OpenAI、GPT-5.6をSol、Terra、Lunaに分割し、100万トークンのコンテキストとエージェント向けツールインターフェースを統一

GPT-5.6ファミリーが一般提供を開始し、Sol、Terra、Lunaがそれぞれ最高性能、コストとのバランス、大量の低コストワークロードを担う。3モデルは長大なコンテキストとツールインターフェースを共有するが、推論コスト、安全性に関する挙動、実際の品質については個別の評価が必要だ。

機器人資料與工具

Grabette、低コストのロボット実演データ収集デバイスをオープンソース化――手作業をLeRobotデータセットに変換

Pollen Roboticsは、約490ユーロのハンドヘルド型Grabetteを公開した。デュアルカメラ、IMU、グリッパーエンコーダーを使用して6自由度の操作を記録し、ブラウザベースの処理フローでSLAMの実行、軌跡の検証、標準LeRobotデータの出力を行う。

程式代理評測

AgentLens、コーディングエージェントの評価を本番環境の軌跡へ移行し、夜間回帰テストと失敗診断を支援

AgentLensは、エージェントがコーディング課題を解けたかどうかだけでなく、インタラクションの全軌跡と実際のプロダクト成果を精査する。オープンソースのベンチマークを使用して、モデルのバージョン比較、挙動の劣化の特定、継続的インテグレーション(CI)プロセスへの組み込みが可能だ。

代理評測

OmniaBench、1,431件のシナリオ横断タスクで汎用エージェントを検証、最先端モデルのPass@1は依然6割未満

OmniaBenchは、明確な状態空間を持つ、ツールおよびインタラクション形式を横断したエージェント評価を構築し、644問の精選された高難度セットも提供する。結果から、計画、制約の維持、エラー後の適応が、依然として最先端エージェントに共通する弱点であることが示された。

推論與量化

Nunchaku LiteがDiffusersにネイティブ対応、W4A4量子化で拡散TransformerのVRAM使用量とレイテンシを削減

DiffusersがNunchaku LiteのINT4およびNVFP4チェックポイントを直接読み込めるようになり、モデル専用の推論エンジンを別途インストールする必要がなくなった。SVDQuantは重みとアクティベーションを同時に量子化し、VRAMの節約に加えて、実際のデノイズ時間の短縮を目指す。

模型安全評估

Anthropic、RSP 3.4を更新:自動化R&Dのしきい値を再定義し、リスク報告の仕組みを調整

AnthropicのResponsible Scaling Policy 3.4は、自動化R&D能力のしきい値、社内における未編集版報告書の共有範囲、外部レビューの方法を変更した。一見するとガバナンス中心の更新だが、実際にはモデル能力評価、デプロイメントゲート、安全性報告のエンジニアリングプロセスに影響を及ぼす。