全ニュース

技術ニュース 977 件

AI 安全與開發工具

Muse Code、ClaudeとCodexの個人向け指示をデフォルトで読み込み――プロバイダー間の互換性がデータ境界の問題を浮き彫りに

独立したテストにより、MetaのMuse Codeは起動時にユーザーのホームディレクトリ内にある`CLAUDE.md`と`AGENTS.md`を探し、その内容をモデルエンドポイントへ送信するコンテキストに組み込むことが判明した。この互換性設計は任意のファイルの流出を意味するものではないが、本来は別のプロバイダーだけに渡すことを想定していた個人ルール、内部パス、機密性の高いプロンプトがMetaに送信される可能性がある。

AI for Science/生物基礎模型

CellWorld、潜在細胞表現による事前学習へ転換――5.74Mモデルが18の空間トランスクリプトミクスタスクで掲載ベースラインを上回る

CellWorldはマスクされた遺伝子値を直接再構成せず、近傍細胞と少量の発現ヒントからtarget encoderの潜在表現を予測する。コードと学習設定はMIT Licenseで公開済みだが、事前学習済み重みは依然として承認制の非公開リポジトリに置かれている。

模型合併與多模態代理

AgentPatch、学習不要でマルチモーダルエージェントのマージを修復――6ベンチマークの平均スコアが54.5から56.6へ

AgentPatchは、モデルのマージ後に生じた弱点を特定し、エキスパートモデル固有の残差と重要なFFNニューロンのみを復元する。出力は単一の静的checkpointで、ルーティングや推論時のエージェントを必要としないが、完全な評価adapterとモデルweightsはまだ公開されていない。

開源工具

Open Science v0.12.1、研究エージェントのコンテキスト圧縮、実行、成果物の証拠をローカルワークスペースに保持

AIPOCHのApache-2.0デスクトップワークベンチは、モデルエージェント、Python/Rカーネル、科学データコネクタ、イミュータブルな成果物バージョンを統合する。8月9日のアップデートではコンテキスト圧縮が可視化され、Codex MCPの承認とWindowsでのnotebook実行に関する問題が修正されたが、移植可能な完全リプレイにはまだ対応していない。

AI 安全

OpenAI、Astraの一部開発を停止:初期評価ではモデルが「Critical」レベルのサイバー攻撃能力に達した可能性を排除できず

OpenAIは、Astraのエージェント型コーディング能力とサイバー攻防能力が進歩したため、モデルが最高リスクの閾値を超えた可能性を排除できないと説明した。同社はテスト環境を隔離し、ツールとネットワークへのアクセスを制限するとともに、監視モデルでエージェントの推論過程と高リスクな行動を検査している。

AI 程式代理與強化學習

DiDPO、コードdiffを信用割当単位に分解し、Qwen2.5-Coder-7Bの主要評価平均を48.4%に向上

DiDPOは、エージェント実行全体の成否をすべてのtokenに均等配分せず、複数の軌跡に含まれる類似したsub-diffを比較する。公開されたverl-codeには訓練用エントリーポイントとデータレシピが含まれるが、著者によるモデルcheckpointはまだなく、実験も完全なソフトウェアリポジトリ修復を対象としたものではない。

AI 研究與科學代理

Fisher-R1、検証可能なp値で統計エージェントを訓練、P-HardのStrict pass@1で33.0%を達成

P-Benchでは、エージェントが統計手法を自ら選択し、Rコードを実行してp値を報告する必要があり、単にコードが実行できるかどうかを確認するだけではない。14Bモデルは難問のStrict指標で掲載されたオープンモデルを上回ったが、現時点で公開リポジトリには説明文書しかない。

推論系統

Ling-3.0-flash INT4、単一マシンで実測38.7 token/s――メインラインvLLMの誤用で誤った出力が気付かれず生成される可能性

コミュニティのデプロイ手順では、単一のDGX Spark上でCUDA Graphと1層のMTP投機的デコーディングを有効にし、Ling-3.0-flash INT4の生成速度を20.8 token/sから38.7 token/sへ引き上げた。さらに重要なのは、メインラインのvLLMがV3アーキテクチャをまだサポートしておらず、古いattentionパスを無理に適用すると、エラーが報告されないまま、一見流暢だが誤った内容が出力される可能性があるという点だ。

多模態模型

MiniMax、H3の基盤ウェイトを公開:33Bのシングルストリームモデルで最長15秒のステレオ動画を同期生成

MiniMax H3は、テキスト、画像、動画、音声を単一シーケンスにまとめ、映像と音声のlatentを共同予測し、最大768p、24 FPS、32 kHzステレオで出力する。公式ワークフローでは2Kへの再生成も可能としているが、プロンプトの構造化機能と高解像度モジュールは、依然としてホスト型APIでのみ提供される。

AI 代理與評測

HarnessOpt-Bench、モデルによるエージェント・ハーネスの書き換えを評価——モデル選択の影響はコーディングツールの約1.8倍

Scale AIは、プロンプト、ツール、メモリ、制御フローをモデルが変更可能なプログラムとして扱い、非公開テストセットで実際の改善を測定した。111回の実験では、ネイティブのコーディングエージェントが共通ハーネスを安定して上回ることはなく、検証段階で得られた最高スコアも概して楽観的だった。

AI 代理訓練

CalibForge、強弱エージェントによるキャリブレーションで5,431件のターミナルタスクを構築、35BモデルがTerminal-Bench 2.0で47.57%を達成

CalibForgeは、実行可能な合成問題をすべて残すのではなく、異なる解答エージェント間で所定の成功・失敗関係が生じるまでタスクを繰り返し修正する。キャリブレーション軌跡でファインチューニングした2つのモデルは、3種類のコーディングエージェント・ベンチマークすべてで性能が向上したが、フルパラメータ学習には64基のH20が必要で、一部の評価は1回しか実施されていない。

AI 評測與安全

MISTで23モデルすべてが誤ったヒントの影響を受けると判明、SCOPEはQwen3-4Bの回答反転率を35.0%から16.3%に低減

新ベンチマークは4種類の対照的なコンテキストを用い、モデルが証拠を正しく評価しているのか、それとも外部情報を一律に無視しているだけなのかを判別する。SCOPEはDPOの選好データ構成のみを変更し、正解・無関係コンテキストでの精度を維持しながら、誤情報による回答反転を抑える。