全ニュース

技術ニュース 972 件

代理評測

AeroCopilotBenchは飛行手順を実行可能な状態機械に変換、最高性能のエージェントでも安全通過率は72.6%にとどまる

新たなベンチマークは、73件のコックピット異常時タスクを用いて、エージェントが状態を観察し、システムを操作しながら、全過程で厳格な安全制約を遵守できるかを検証する。単に航空知識の問題に回答させるものではない。GPT-5.6 Solが最高の成功率を記録したが、知識スコアが近いモデル同士でもタスク成功率は一致せず、静的な質疑応答ではインタラクティブな安全性テストを代替できないことが示された。

科學代理與評測

Reconstruction、論文を隠して過去の参考文献のみを提示――複数モデルによる評価で研究アイデアの一致率が14.6%から35.6%に向上

新たなベンチマークでは、モデルに論文発表前から存在する参考文献だけを与え、非公開にされた論文の中核的な研究アイデアを逆算させる。4モデルによるクロスレビューとスイス式選抜で一致率は向上したが、候補数、評価モデル群、計算量は単一モデル条件と揃えられていない。

代理訓練與醫療 AI

BaT、エージェントの失敗段階に応じて強化学習を編成、9B方策のAutoMedBench-Liteスコアが19.9から53.4に向上

Benchmark-as-Teacherは、評価における段階別スコアを次の学習ラウンドのカリキュラムへ直接変換し、隔離された合成データによってテストの正解が更新に混入するのを防ぐ。論文では9B方策が標準的なGRPOを大幅に上回ったと報告しているが、完全な学習データはまだ公開されておらず、システム横断のランキングには異なる実行フレームワークが混在している。

AI 代理與符號規劃

PDDLCoder、エージェントによるPDDLの反復修正で、未見のプランニング問題106問における実行可能成功率89.6%を達成

PDDLCoderは、言語モデルに長期的な行動系列を直接生成させるのではなく、シンボリックプランナーで検証可能なPDDL世界モデルをまず構築する。DeepSeek V4 Flashは、完全に保留された4ドメインで106問中95問を解いた一方、基盤モデルによって結果は89.6%から0%まで低下しており、このフレームワークの性能が、モデルのフォーマット遵守能力とツールからのフィードバックを活用する能力に大きく依存することを示している。

AI coding agents

Kozuchi、同一27Bコード修復エージェントをJavaへ展開、Multi-SWE-benchで128問中41問を解決

富士通は、ファインチューニング不要のQwen3.5-27B、8段階の修復フロー、エージェント横断型のテスト選択器をそのままJavaへ移植した。PythonのSWE-bench Verifiedでは500問中374問を解決した一方、Javaでの成功率は32.03%にとどまり、エージェントフレームワークの移植性が言語能力の同等性を意味しないことを示した。

科學 AI 與模型後訓練

PertMind、細胞摂動のエンドポイントで4Bモデルを訓練し、1億件の単一細胞データを強化学習の報酬に変換

PertMindはQwen3-4Bをベースに、遺伝子応答、パスウェイの方向性、出力形式から計算可能な報酬を構成し、人手で大量の生物学的推論軌跡を作成する必要をなくした。モデルは摂動の逆推定や二重摂動タスクにもゼロショットで転移できるが、自然言語によるメカニズムの説明を因果関係の証明とみなすことはできない。

代理評測與推理效率

R³-Bench、6問で推論予算を共有すると71/72のテスト条件でモデル性能が自身のオフライン上限を下回る

新しい評価では、各問題に個別の割り当てを与えず、6問の間でtokenやツール操作を配分するようモデルに求める。6つのモデルは個々の問題を解ける場合でも、共有予算下では計算資源を最も効果の高い問題へ適切に振り向けられない傾向を示した。

評測與關聯式學習

RelArena-α、21件のリレーショナルデータタスクを統一条件で再実行。標準チューニングモデルではTabPFN-Relが首位

Prior Labsは、データ分割、ハイパーパラメーターチューニング、評価を統一するオープンソースのパイプラインを公開し、グラフモデル、リレーショナルTransformer、表形式データ手法を改めて比較した。TabPFN-Relの結果は、リレーショナルデータを先に集約してから表形式データ向け基盤モデルに渡す手法が依然として競争力を持つことを示す。ただし、CPUによる特徴量合成のコストは、ランキングの実行時間に完全には算入されていない。

推論系統

FreeToken、MoEキャッシュミスを動的に分割し、8GBのRTX 4060で35Bモデルを39.3 token/sで実行

FreeTokenは、ホストメモリとPCIe帯域幅に基づき、キャッシュミスしたエキスパートをGPUへ転送するか、CPUで直接計算するかを動的に決定する。論文では、5種類のコンシューマー向けシステムにおいて、最も強力なベースラインの1.3~2.1倍のデコードスループットを報告しているが、リンク先のコードリポジトリは現時点で公開アクセスできない。

代理評測

エージェントのコンテキスト圧縮後も成功率は変わらず、GPT-5.5の状態再取得回数はなお約3倍に

新たな評価ではツール呼び出しを状態取得とタスク実行に分け、コンテキスト圧縮が成功率を低下させる前に、エージェントの再取得コストを大幅に増やし得ることが判明した。GPT-5.5は5倍圧縮で完了率が80%から85%になった一方、平均retrieval呼び出し回数は21.0回から63.9回に増加した。