全ニュース

技術ニュース 972 件

模型後訓練

Open-MOPD、マルチティーチャー蒸留のtoken予算を再配分し、能力統合率を35.6%から83.4%へ向上

Open-MOPDは、マルチティーチャー型オンライン方策蒸留の主なボトルネックが教師間の勾配競合ではなく、ドメインごとに割り当てられる有効なtoken更新量の著しい不均衡にあることを突き止めた。tokenシェアの均衡化、ギャップ指向の割り当て、学生報酬の再計算を組み合わせ、単一の3Bモデルで利用可能な能力向上分の83.4%を回収した。

科學機器學習

Monroe、8,100万分子でグラフモデルを事前学習し、凍結ベクトルとTabPFNの組み合わせでタスク別ファインチューニングを上回る

Monroeは、疎グラフ注意機構、立体化学エッジ、1,152種類の事前学習目標を組み合わせ、凍結した分子ベクトルに対してTabPFNでインコンテキスト予測を行う。Polarisの全28タスクで統計的に最良のグループに入ったが、「勝率100%」には最良手法との有意差がない引き分けも含まれる。

代理與強化學習

SPADE、同一のLLMに実行可能な訓練環境を記述させ、30Bモデルの8評価平均を5.3ポイント向上

SPADEは、プロンプトの前後におけるリターン差を用いて環境設計者を訓練し、エージェントの能力に応じてカリキュラムを自動的に難化させる。Qwen3-30B-A3Bはツール使用評価で最大13.9ポイント向上したが、環境検証器が仕様を満たさないタスクや解のないタスクを受理する可能性は残る。

強化學習與邊緣 AI

VSPG、バックプロパゲーションなしで離散行動actorを更新し、SustainGymの2評価でDNNベースラインを上回る

VSPGは各行動を単位ハイパーベクトルとして格納し、softmax policy gradientを、アドバンテージで重み付けしたベクトルの重ね合わせと正規化に変換するため、actorの自動微分やオプティマイザ状態を必要としない。2種類の気候条件における建物制御でより高いリターンを達成し、ビットエラーにも高い耐性を示したが、性能は固定エンコーダに大きく依存する。

代理評測

FM-Bench、エージェントにクラブを20年間運営させるも、15モデルすべてが拒否されたオファーから市場価格を推定できず

FM-Benchは、26種類のツールと約340~400の意思決定ポイントを通じて、エージェントが遅延報酬、隠された情報、競合相手の反応に対処できるかを検証した。15モデルはいずれも20シーズンを完遂したが、順位が安定したのは後半に入ってからで、自律的なメモリ管理にも「追加するだけで削除しない」「繰り返し上書きする」という2つの失敗パターンが見られた。

AI 安全/多模態模型

視覚エンコーダーだけを逆伝播させてVLMを攻撃、H100での生成時間を20分超から約100秒に短縮

新たな研究では、マルチモーダルモデル全体を逆伝播させることなく、入力画像のみを調整し、視覚エンコーダーの表現を元画像から乖離させるか、指定したターゲットに近づける。4つのオープンVLMすべてで非標的型攻撃の成功率が93%を超えたが、評価は単一のLLMジャッジに依存しており、ブラックボックスでの転移性能はまだ検証されていない。

模型架構與代理工具使用

循環推論で複数ツールの組み合わせを改善、1B LlamaのBFCL平均スコアが21.4から32.9に上昇

同じTransformer層を再利用し、各tokenを生成する前に隠れ状態を反復更新する手法を研究。同一のデータとLoRA設定で循環モデルと通常モデルを比較したところ、改善は並列呼び出しと呼び出し間の依存関係に集中した。一方、単一のAPI呼び出しが中心のAPI-Bankでは、一貫した優位性は見られなかった。

AI 安全與代理系統

VLAがエージェントの隠れ状態通信を監視、同一モデルによるオークション試験でAUROC 0.993

新たな研究では、エージェント間で受け渡されながら対話ログには記録されない連続ベクトルと、その後の公開行動を同一イベントに紐付け、異常検知、反実仮想的影響、スパース特徴の3層で検査する。平均0.993という結果には、テキストによる共謀と潜在状態による共謀の両方のサンプルが含まれ、攻撃も研究者が事前に設計したものであるため、自発的な密謀を検出する汎用能力とはまだ見なせない。

代理訓練與評測

FACET、実行環境を先に構築してからターミナルタスクを生成、9Bエージェントのスコアが8.24ポイント向上

FACETは、指示、コンテナ、参照解法、検証器を同一の実行状態に結び付け、7万1,000件を超えるエージェントスキルから6,078件の検証可能なタスクを合成した。わずか1,200件の成功軌跡でファインチューニングした結果、Qwen3.5-9BのTerminal-Bench 2.1スコアは27.34から35.58へ上昇した。

AI 代理/自動化研究

1,338件のポストトレーニング軌跡が示す、AIエージェントが隣接実験で戦略を変更した割合はわずか2.1%

研究により、エージェントはモデルのトレーニング、デバッグ、評価を自律的に実行できる一方、最初のパラメータ更新前にトレーニング戦略を固定してしまうことが明らかになった。実験ログ、スキルライブラリ、評価エージェントを追加すると下流タスクのスコアは向上したが、証拠が不利な場合に手法を切り替えるようシステムを促すには至らなかった。

AI 程式代理/評測

意味保存変換でコーディングエージェントのコストが最大22.9%増、堅牢性ランキングはフレームワーク次第で逆転

同じ修正課題に制御フロー、識別子、デッドコードの書き換えを適用したところ、問題解決率は最大6.7ポイント低下した。モデルの堅牢性はmini-SWE agent、OpenCode、データセットの組み合わせによって入れ替わり、単一のモデルランキングではデプロイ時の性能を予測できない。