OpenAI、GPT-5.6をSol、Terra、Lunaに分割し、100万トークンのコンテキストとエージェント向けツールインターフェースを統一
GPT-5.6ファミリーが一般提供を開始し、Sol、Terra、Lunaがそれぞれ最高性能、コストとのバランス、大量の低コストワークロードを担う。3モデルは長大なコンテキストとツールインターフェースを共有するが、推論コスト、安全性に関する挙動、実際の品質については個別の評価が必要だ。
Archive
技術ニュース 31 件
GPT-5.6ファミリーが一般提供を開始し、Sol、Terra、Lunaがそれぞれ最高性能、コストとのバランス、大量の低コストワークロードを担う。3モデルは長大なコンテキストとツールインターフェースを共有するが、推論コスト、安全性に関する挙動、実際の品質については個別の評価が必要だ。
機器人資料與工具
Pollen Roboticsは、約490ユーロのハンドヘルド型Grabetteを公開した。デュアルカメラ、IMU、グリッパーエンコーダーを使用して6自由度の操作を記録し、ブラウザベースの処理フローでSLAMの実行、軌跡の検証、標準LeRobotデータの出力を行う。
程式代理評測
AgentLensは、エージェントがコーディング課題を解けたかどうかだけでなく、インタラクションの全軌跡と実際のプロダクト成果を精査する。オープンソースのベンチマークを使用して、モデルのバージョン比較、挙動の劣化の特定、継続的インテグレーション(CI)プロセスへの組み込みが可能だ。
代理評測
OmniaBenchは、明確な状態空間を持つ、ツールおよびインタラクション形式を横断したエージェント評価を構築し、644問の精選された高難度セットも提供する。結果から、計画、制約の維持、エラー後の適応が、依然として最先端エージェントに共通する弱点であることが示された。
模型與開發平台
Muse Spark 1.1がMeta Model APIを通じて初めてパブリックプレビューとして公開され、OpenAI互換インターフェースも提供される。100万tokenのコンテキスト、検索の引用、構造化出力、並列ツール呼び出しを統合し、エージェントの基盤となるモデルだ。
推論與量化
DiffusersがNunchaku LiteのINT4およびNVFP4チェックポイントを直接読み込めるようになり、モデル専用の推論エンジンを別途インストールする必要がなくなった。SVDQuantは重みとアクティベーションを同時に量子化し、VRAMの節約に加えて、実際のデノイズ時間の短縮を目指す。
實體 AI 與機器人
Cosmos 3 Edgeは、シーン理解、未来予測、動作生成を同時に実行できる40億パラメータのオープンワールドモデルだ。公式によると、Jetson Thor上で1回につき32個の動作を生成し、制御周波数は最大15 Hzに達する。
模型與資安
GoogleはGemini 3.6 Flash、3.5 Flash-Lite、アクセス制限付きの3.5 Flash Cyberを同時に発表した。今回の更新では、エージェントシステムのコストとレイテンシ、セキュリティ特化モデルを一体的なデプロイ課題として捉えている。
模型安全評估
AnthropicのResponsible Scaling Policy 3.4は、自動化R&D能力のしきい値、社内における未編集版報告書の共有範囲、外部レビューの方法を変更した。一見するとガバナンス中心の更新だが、実際にはモデル能力評価、デプロイメントゲート、安全性報告のエンジニアリングプロセスに影響を及ぼす。
UniVRは、複雑な推論、物理ダイナミクス、長期計画を視覚的なデモンストレーションのみから共同学習することを目指している。ByteDanceは同時に34B Planningチェックポイントを公開し、テキストによるChain-of-Thoughtに依存しない視覚エージェント研究に、検証可能なベースラインを提供した。
檢索與推論
Nemotron 3 Embedは、8B BF16、1B BF16、1B NVFP4のテキスト埋め込みモデルを提供する。低精度版では、検索モデルのメモリ効率とスループット効率が最優先の設計目標に据えられているが、品質については対象コーパス上での検証が必要だ。
開放權重模型
Moonshot AIは、総パラメータ数2.8兆、各tokenで16個のエキスパートを活性化するMoEアーキテクチャを採用し、100万tokenのコンテキストと画像入力にも対応するKimi K3を発表した。完全なウェイトは後日公開予定のため、現時点ではAPIでの性能とセルフホスティング可能性の実証を区別して評価すべきだ。