全ニュース

技術ニュース 973 件

模型評測

TsuGO、推論テキストを探索木に復元 Gemini 3.1 Proのオープン形式・難問の正答率はわずか19%

TsuGOは、検証可能な囲碁の詰碁問題600問を用い、答えやtoken数だけでなく、モデルが推論リソースを正しい分岐に投入できているかを測定する。4択の候補を取り除くと、複数の推論モデルで正答率と探索効率が同時に急落し、ニューラルネットワークで探索を誘導するKataGoとの差も依然として大きかった。

模型訓練

段階的に深層化するTransformerではPost-NormがPre-Normを逆転、9層の生徒モデルでCEが0.0328低下

Qwen3-8Bを用いた蒸留実験で、全層を同時に学習する場合は2つの正規化位置にほとんど差がない一方、Transformer blockを段階的に追加するとPost-Normが明確に優位になることが示された。この結果は、正規化位置をモデルの成長戦略と切り離して選択すべきではないことを示唆している。

AI 程式工程

AIコードレビューでLinux 7.2-rc7に400件超の修正、ボトルネックは人手によるトリアージへ

Linux 7.2-rc7では、リリースサイクル終盤にもかかわらず、230人を超えるコントリビューターから400件以上の修正が取り込まれ、その一部はAIレビュー・ツールが発見した問題に起因する。AIがカーネルの保守プロセスを代替したわけではないが、Sashikoなどのエージェントによるバグ発見の速度は、人間によるトリアージと検証の能力を上回り始めている。

多模態與遙測

LongEarth-R1、最長30フレームの衛星画像系列を推論し、12の時空間タスクすべてで比較モデルを上回る

LongEarth-Benchは11万7,000枚のリモートセンシング画像を約12万組の長系列QAに整理し、地形の変化、異常、欠損状態をモデルに追跡させる。Qwen2.5-VL-7BをベースとするLongEarth-R1は、フレーム番号、構造化推論、時空間報酬を導入したが、データ、重み、コードはまだ公開されていない。

AI 代理與開發工具

AutoDesign、エージェントに自身の設計ハーネスを書き換えさせ、7構成のポスター評価が平均12.4ポイント向上

AutoDesignは、外側のエージェントが実行トレースを分析して本番システムを変更し、独立した開発セットによって更新を採用するかどうかを決定する。オープンソースのDesignHarnessは、著者らのPosterBenchで複数の商用システムを上回ったが、自動スコアと人間の選好との相関係数はわずか0.34だった。

影片生成與模型架構

V-RAE、動画のlatentに凍結済み視覚表現を採用、K600の生成学習で最大6倍速く収束

V-RAEは、動画VAEをピクセル再構成だけを目的に学習するのではなく、DINOv3、SigLIP2、V-JEPA 2.1などの意味特徴に時間圧縮とデコーダーを追加する。著者らの実験では、この新しいlatentによって生成と未来フレーム予測の両方が改善したが、現時点での検証は低解像度、短いクリップ、クラス条件付き生成に限られている。

AI 安全

RAGSieve、検索結果自体を基準にした二層フィルタリングでRAGポイズニングの成功率を67.4%から14.0%に低減

RAGSieveは、信頼できるコーパスや事前にラベル付けされた汚染サンプルを必要とせず、クエリごとのランキング末尾と文書の局所的な意味近傍をそれぞれ比較する。オープンソースの実験は3つの質問応答データセット、3種類のリトリーバー、6種類の攻撃を対象としているが、流暢に書かれた単一の悪性文書や、すでに汚染された検索ランキング末尾は依然として検出をすり抜ける可能性がある。

開放模型

Mimir 1B、深い層の積み重ねを階層型リカレント構造に置き換え、デンマーク語ベンチマーク平均で評価対象の9Bモデルを上回る

デンマークのFoundation Modelsチームは、HRMの高レベル・低レベルのリカレント処理を活用したMimir v1をゼロから学習し、開発者が評価した20種のベンチマークで一部の4Bモデルに迫る性能を達成した。重みは公開されているが、「利用可能なデータ」は完全なオープンデータを意味せず、一部のコーパスは契約またはEUの研究例外規定に基づいてのみ使用されている。

模型可解釋性與評測

同一モデル群の「テスト認識」はプロンプト次第で正の相関から負の相関へ反転、モデル自体が説明する分散はわずか0.8%

追試により、プローブの文脈上のラッパーを書き換えるだけで、モデル規模との相関係数が+0.94から−0.82へ変化することが判明した。研究チームは、少なくとも9〜10種類のプロンプトにまたがって測定しなければ、単一のactivation directionではモデル間を比較できないと提言している。

代理記憶與檢索

ReFind、意味記憶インデックスを構築せず、未加工のチャット履歴検索でHippoRAG 2を平均5ポイント上回る

ReFindは書き換えていない会話履歴を保持し、エージェントがキーワード、時間、sessionフィルターを繰り返し使って証拠を収集できるようにする。約2,800問のテストでは平均正解率58.2%を達成し、最強の構造化記憶ベースラインの53.2%を上回った。ただし、比較においてすべてのコントローラーとツール予算が統一されていたわけではない。

推論系統

DARTree、先にツリーをバッチ構築してから枝刈り、Qwen3-4Bのデコード速度はローカルARの最大9.73倍

DARTreeは、拡散ドラフトモデルの因果補正を単一パスから複数分岐へ拡張し、ノード単位のheap探索を深さごとのバッチ展開に置き換える。単一のRTX 6000 Adaを用いたテストでは、7タスクすべてで平均高速化率がDFlash、DDTree、Dominoを上回ったが、コードはまだ公開されていない。

模型發布

Intern-S2-Preview-397B、数値予測ブランチを追加。4Bメモリモジュールで生物学タスクの平均スコアが3.40ポイント向上

新たな技術報告では、科学PDF、時系列、ツール操作、長期エージェントタスクを単一の訓練パイプラインに統合し、Apache 2.0ライセンスの重みを公開した。独立したMemory Decoderにより、397Bのバックボーンを凍結したままドメイン能力を追加できるが、現時点では生物学モジュールでのみ実証されている。