AI 代理與開放模型
AREX、二重ループ検証でディープリサーチを駆動、4Bおよび122B-A10Bエージェントモデルを公開
北京智源人工智能研究院(BAAI)がAREXを発表した。研究エージェントが暫定回答を項目ごとに検証し、未充足の制約を起点に次の検索ラウンドを開始する。チームはApache 2.0ライセンスの重みと実行コードも同時公開したが、ベンチマーク結果は依然として主に作者による自己評価に基づく。
Archive
技術ニュース 989 件
AI 代理與開放模型
北京智源人工智能研究院(BAAI)がAREXを発表した。研究エージェントが暫定回答を項目ごとに検証し、未充足の制約を起点に次の検索ラウンドを開始する。チームはApache 2.0ライセンスの重みと実行コードも同時公開したが、ベンチマーク結果は依然として主に作者による自己評価に基づく。
模型工程
Microsoftは「hill-climbing」ポストトレーニング・プロセスを公開し、製品ツール、grader、実利用シグナルをモデルの反復改善へフィードバックしている。MAI-Code-1-FlashはExcel環境で再トレーニングした後、旧世代のGPUでも提供可能だが、パラメータ規模、評価セット、元の実験データは公表されていない。
開發者平台
OpenAIは7月23日、GPT-5シリーズのCodexモデル5種や旧版のcomputer-use、deep-researchエンドポイントを含む、旧モデルのスナップショット13種の提供を終了した。公式の代替モデルは、挙動やコストが同一のエイリアスではないため、既存のエージェントではモデル名の文字列を変更するだけでなく、再評価が必要になる。
具身 AI
OpenBMBはMiniCPM-Robotの重み、コード、デプロイ文書を更新し、単一の1.5B VLAで複数の操作タスクを処理できるようにした。さらに、0.9Bモデルで目標追跡を実行する。ストリーミングコンテキストとカスタム推論カーネルにより重複する視覚計算を削減する一方、公式ベンチマークだけではロボット間の汎化性能を証明するには不十分だ。
評測與 RAG
CLEF 2026のFinMMEvalが2つの多言語金融QAタスクの結果を公開した。モデルは選択肢が限定された問題では92~97.5%に達した一方、言語をまたぐ証拠に基づく短答生成では性能が大幅に低下した。短答部門の上位4チームの差は1ポイント未満で、ROUGEによるランキングでは事実の正確性を判別しにくいことも浮き彫りになった。
AI coding tools
GitHub Issuesは、ラベル、フィールド、担当者の変更やクローズなどの操作に信頼度と根拠を付与する、エージェント自動化コントロールのパブリックプレビューを開始した。管理者は不確実な操作を人間による承認に回せるが、GitHubは、この仕組みがサーバー側のアクセス制御に代わるものではないと明確に警告している。
Applied AI
OpenAIは、医療機関の記録、Apple Health、対応する健康アプリを同期できるChatGPT Healthの提供を、米国の成人ユーザー向けに開始した。システムはb.wellを通じて異種EHRデータを集約し、関連データを基盤モデルのトレーニングに使用しないとしているが、本製品は診断を目的としたものではない。
AI 程式開發工具
CursorはAutoモードをリクエスト単位のモデルルーターで駆動する方式に変更し、プロンプト、コンテキスト、分野、複雑さに応じて異なるモデルへ振り分ける。公式発表ではオンラインA/Bテストによりコストを最大60%削減できるとしているが、ルーティング規則、モデルごとの配分、完全な生データはいずれも公開されていない。
代理訓練與評測
Prime Intellectは、ソフトウェアエンジニアリング、ターミナル操作、ウェブ検索のデータセットを23個のtasksetに統合し、統一APIを通じてエージェント評価と強化学習に接続できるようにした。reward hackingを抑えるため、テストや採点用データの注入も評価段階まで遅延させているが、採点処理は依然としてエージェントと同じサンドボックスを共有しており、完全な分離には至っていない。
AI 程式開發工具
LinearのIssueをGitHub Copilotクラウドエージェントに直接委任できるようになった。エージェントはGitHub Actionsの一時環境でコードを変更し、ドラフトPRを作成する。正式版では、モデル、ブランチ、カスタムエージェント、実行中の方向修正に関する制御が追加された一方、クロスプラットフォームの権限やプロンプトインジェクションのリスクについては、引き続きチームによるガバナンスが必要となる。
AI 推論與編譯器
PyTorchとGoogleはHelion向けのTPUバックエンドを構築し、PyTorchスタイルのカーネルコードをPallasへコンパイルできるようにした。これにより、TPU用の低水準カーネルを別途記述する負担が軽減される。チームはTPU v7上のFlash Attentionで最大838 TFLOPsを測定したが、機能はなお活発な開発段階にある。
AI 開發工具與標準
GitHub MCP Serverは、7月28日に確定予定のMCP 2026-07-28仕様を先行してサポートした。新版ではプロトコルの中核がステートレスなリクエスト方式に変更され、水平スケーリングのコストが削減される一方、独自クライアントや長時間タスクの実装では、複数の破壊的変更への対応が引き続き必要となる。