全ニュース

技術ニュース 970 件

模型訓練與代理

MidTool、ツール利用を中間学習へ前倒しし、Qwen3-4BのBFCLv3総合スコアを10.5ポイント向上

MidTool-Mixは、Web、PDF、コード、実際のツールインターフェースから203億tokenを合成し、モデルがSFTやRLに進む前に、ツールの境界、パラメータ、ワークフローを学習できるようにする。同一のSFTレシピを適用した場合、Qwen3-4BのBFCLv3総合スコアは39.73%から50.25%へ向上したが、深度検索タスクは依然としてまったく解決できていない。

AI 評測與安全

凍結したQwen3-8Bでも「能力拡張」が生じる――研究、自律的改善の評価に実測による帰無ベースラインの導入を要求

新たな研究により、1回限りのgreedy decodingと不安定な閾値によって、まったく訓練していないモデルが能力を獲得または喪失したように見えることが判明した。設問ごとの正確検定に切り替えると、3種類のself-trainingはいずれも既存能力を安定して強化しただけで、基盤モデルが一度も示さなかった新能力の獲得は実証できなかった。

代理系統

PILOT、決定論的ガードレールで淘宝(Taobao)のレコメンド実験を管理、探索効率は53.3%から93.3%に向上

PILOTは、実験管理、セグメント別戦略の探索、メモリ整理を3つのLLMロールに担わせる一方、権限管理、統計的判定、状態の書き込みは決定論的サービスに委ねる。淘宝の5つのオンラインbucketにおける社内結果では探索効率が40ポイント向上したが、公開再現可能なコードやトラフィック規模は報告されていない。

AI 評測

CentaurBench:単独での問題解決に最も優れたモデルが、別のエージェントの指導にも最も優れているとは限らない

CentaurBenchは、7種類の業務タスクを用いてモデルの自動化能力と支援能力を個別に評価した。2つのランキング間の相関係数は約0.48にすぎない。支援なしのGPT-3.5-Turboが3つのタスクですべての指導ありのバージョンを上回り、強力なモデルを追加してもエージェントのワークフローが必ず改善するわけではないことを示した。

Agent frameworks

TrueForgeがエージェント実行フレームワークをオープンソース化、14件の企業向けタスクでマネージドサービスより30~75%低コストと主張

TrueFoundryは、エージェントループ、MCPツール、オンデマンドサンドボックス、サブエージェント、承認フローを組み合わせたセルフホスト可能な実行フレームワーク「TrueForge」をMIT Licenseで公開した。公式のEnterprise-Benchでは、同一モデルで約30%、GLM-5.2への切り替えで約75%のコスト削減を報告しているが、比較対象は14件のタスクに限られる。

AI coding tools

Slack Code、コーディングエージェントを共有チャンネルに導入――diff表示、ライブプレビュー、人による承認に対応

SalesforceはSlack Codeを発表した。チームは会話からプロジェクト専用のCode Channelを直接作成し、エージェントが生成したコードを共同で監視、修正、承認できる。初期段階ではClaude、Devin、GitHub Copilot、ChatGPT、Vercel agentsと連携するが、セキュリティ分離、権限の粒度、APIの詳細はまだ完全には公開されていない。

代理評測/可觀測性

AFANet、6.5万の学習可能パラメータでマルチエージェント障害を診断、ドメイン内推論を199秒から1.16秒に短縮

AFANetはエージェント間の対話を、時間的な接続と同一エージェント内の接続を持つグラフに変換し、2層のGCNで障害エージェントとエラー種別を判定する。AEGIS-Benchでは複数のLLMベースラインを上回ったが、データセットをまたぐエージェント—エラーのペアリングF1は依然として低い。

RAG/深度研究代理

DeepWeaverは証拠を先に編み上げてから回答を生成、DeepSeek-V4-Flashの論拠充足度が75.4%から86.5%に向上

DeepWeaverはThought Block Chainを用いて主張、重要情報、情報源を整理し、未活用の証拠を繰り返し確認する。複数モデルの長文回答と引用指標を改善した一方、新しい評価は中国語の水環境問題に集中しており、コードもまだ実際には公開されていない。

推論系統

Liquid AI、LFM2.5にDSparkドラフトモデルを追加—H100 1基でデコードを最大3.18倍高速化

Liquid AIは、約3億パラメータのDSparkドラフトモデル3種を公開した。LFM2.5は投機的デコーディングにより、複数の候補tokenを一度に検証できる。batch size 1のgreedy decodingテストでは最大3.18倍の高速化を達成したが、SGLangサポートは依然としてオープン中のPRであり、デプロイの成熟度は今後の検証が必要だ。

AI 程式代理

SkillForge、プロジェクトのテストから合成障害を事前生成し、2つのコーディングエージェントでSWE-bench Verifiedを5ポイント超改善

SkillForgeは実際の課題チケットが発生する前に、テストでカバーされた実行パスから検証可能な障害を生成し、その修復軌跡をプロジェクト固有のスキルへ蒸留する。Mini-SWE-Agentと組み合わせることで、DeepSeek-V3.2とGPT-5-miniのSWE-bench VerifiedにおけるPass@1は、それぞれ72.2%と60.6%に上昇した。

模型後訓練

Open-MOPD、マルチティーチャー蒸留のtoken予算を再配分し、能力統合率を35.6%から83.4%へ向上

Open-MOPDは、マルチティーチャー型オンライン方策蒸留の主なボトルネックが教師間の勾配競合ではなく、ドメインごとに割り当てられる有効なtoken更新量の著しい不均衡にあることを突き止めた。tokenシェアの均衡化、ギャップ指向の割り当て、学生報酬の再計算を組み合わせ、単一の3Bモデルで利用可能な能力向上分の83.4%を回収した。

科學機器學習

Monroe、8,100万分子でグラフモデルを事前学習し、凍結ベクトルとTabPFNの組み合わせでタスク別ファインチューニングを上回る

Monroeは、疎グラフ注意機構、立体化学エッジ、1,152種類の事前学習目標を組み合わせ、凍結した分子ベクトルに対してTabPFNでインコンテキスト予測を行う。Polarisの全28タスクで統計的に最良のグループに入ったが、「勝率100%」には最良手法との有意差がない引き分けも含まれる。