全ニュース

技術ニュース 975 件

應用研究/AI 基礎設施

GENCO、単一のグラフニューラルネットワークで電力網の3種類の問題を処理、大規模AC潮流計算のスループットを約29倍に向上

GENCOは、異種グラフアテンション、物理量デコーディング、反復的な残差補正により、潮流計算、最適潮流計算、状態推定を統一的に処理する。大規模電力網でのバッチ推論は従来のACソルバーより明らかに高速だが、未知の電力網に対するゼロショット性能や実環境のSCADAデータでの精度は、既存ツールを直接置き換えられる水準にはまだ達していない。

AI 編程工具

Coderlet、読みやすいコーディングエージェント制御層を公開。ただしサンドボックスと自動テストは未実装

Coderlet は、モデル呼び出し、ツール検証、実行結果、永続メモリを3つの明確な境界に分け、MIT License の下で実行可能な Python 実装を提供する。エージェントの制御フローや障害復旧の研究には適しているが、より高性能なコーディングエージェントというわけではなく、現時点ではユーザーの OS 権限をそのまま使用する。

模型可解釋性

Universal Activation Bus、単一のアダプター群でモデルをまたいでSAEとプローブを共有

Universal Activation Busは、5つの言語モデルの中間表現を固定された3,072次元の空間に整列させる。新しいモデルは、それぞれ独自の線形エンコーダーとデコーダーを学習するだけでよい。実験対象のモデルは同一のプローブ、スパースオートエンコーダー、自然言語インタープリターを再利用できたが、より幅の広いモデルでは表現の再構成に依然として顕著な歪みが生じた。

醫療 AI

AMIE Video、リアルタイム診療を3エージェントに分割、模擬臨床評価で83%を達成

Googleは、低遅延対話、詳細な臨床計画、映像・音声知覚を3つの非同期エージェントに分割した。100件の模擬ビデオ診療シナリオにおける総合評価は、医師群の68%を上回った。ただし、研究ではプロの模擬患者しか使用されておらず、モデル、コード、映像・音声データも公開されていないため、実際の医療現場への導入に結果を直接一般化することはできない。

GUI 代理

直接的な座標生成をレイアウトマッチングに置き換え、GUI グラウンディングが ScreenSpot-Pro で 41.3%を達成

北京大学の研究者は、マルチモーダルモデルを操作意図の解釈だけに用い、その後 Text/Icon 候補検出器と凍結した CLIP でクリック領域を選択する手法を提案した。ScreenSpot-Pro の精度は、掲載された最良ベースラインの 18.9%から 41.3%へ向上した。ただし、論文がいう「回帰なし」は最終マッチング段階に限られ、候補ボックス検出器自体は引き続きバウンディングボックス回帰損失を使用している。また、実装はまだ公開されていない。

生成模型評測

Open-EA、視覚生成評価エージェントを3Bに小型化。ただし現時点で完全対応するのはVBenchの動画ワークフローのみ

Open-EAは、複数ターンの視覚モデル評価軌跡を10,042件の教師ありデータに整理し、従来GPT-4oに依存していた計画ワークフローをローカルのEA-3Bへ移植した。モデル、データ構築手法、runtimeは公開されたが、「評価時間を従来手法の10%に短縮」という結果は主に元のAPIベースのエージェントによるものであり、EA-3B全般の効率を保証するものとは直接みなせない。

模型訓練與蒸餾

TIDEが教師—生徒間のミスマッチを修正、Qwen3の推論Avg@8が6.9%から20.3%に向上

TIDEは、高いtoken一致率をそのまま蒸留の成功とは見なさず、生徒による過剰生成と、教師が選好するtokenの取りこぼしを個別に処理する。強いミスマッチ設定では、平均回答長も同時に3.6分の1へ短縮した。一方、完全な訓練の再現には依然として8基のGPUが必要で、著者らはcheckpointを公開していない。

模型推論與壓縮

ICBQが量子化ブロックの継ぎ目を再検証、Qwen3‑8Bの三値モデルのパープレキシティを5752.9から29.9へ低減

ICBQは量子化器を置き換えるのではなく、隣接するTransformerブロックの境界に2回目の共同キャリブレーションを施し、初期の誤差が深さ方向に累積するのを抑える。品質向上の代償として量子化時間は平均21%増加し、著者らはまだ実装を公開していない。

AI 安全

ElasticBack、単一のAgent Skillに条件付きバックドアを埋め込み、大半のモデルで誤作動率を2%以下に抑制

ElasticBackは悪意あるルールを`SKILL.md`に隠し、自然言語内の特定の概念を起動スイッチとして利用するため、モデルの重みを変更する必要がない。実験では、複数の静的チェックと実行時チェックを回避できた一方、Claudeでの誤作動率は依然として20~24%に達した。

AI 代理與資料工程

QueryProof、ルールゲートで誤ったSQLを阻止——7BエージェントのBusiness Truth Rateは56.2%

QueryProofは、曖昧性判定、SQL allowlist、実行後検証を決定論的ルールに委ね、モデルには指標の解釈とSQLの草案作成だけを担当させる。80問の固定テストセットでは、同じルール基盤を持たない32Bベースラインを上回ったが、問題タイプのファミリー単位でリサンプリングすると、優位性を示す区間は依然としてゼロをまたいだ。

模型架構與推論

Matryoshka、3種類のモデルを単一の重みに内包し、学習計算量を36%削減

Matryoshka Language Model Suitesは、500M、1.5B、3Bのサブモデルを個別に切り出せる入れ子構造として連結し、サイズごとの重複学習を回避する。前段の層とKVキャッシュを共有することで、投機的デコーディングのスループットも14%から26%向上するが、現時点で検証されているのは3B級の基盤モデルに限られる。

AI 程式驗證

P³、プログラムと証明を事前に共同設計し、Leanの問題解決率を4.6~11.2ポイント向上

P³は、エージェントがコードを書く前に、実装構造、補助補題、証明の分解方法を共同で計画し、実装後に証明を繰り返し修正する事態を防ぐ。3つのLean 4ベンチマークにおける全モデル構成で比較対象のワークフローを上回ったが、最難関のリポジトリタスクでは、最高でも22.2%しか解決できなかった。