全ニュース

技術ニュース 983 件

多模態模型訓練

PCDがマルチモーダルの失敗を知覚と推論のシグナルに分解、32Bから8Bへの蒸留で平均スコアが61.22に上昇

Perception-Correction Distillationは、回答が失敗し、かつ生徒と教師の知覚出力が食い違う場合にのみ、知覚区間の蒸留を強化する。Qwen3-VLを用いた2組のモデル縮小実験では、いずれも一様なon-policy distillationを上回ったが、この手法は教師が実際に生徒より正確に見えていることに依存する。

標準與 AI 工程

EU AI Act第50条が適用開始、生成コンテンツに機械可読マークが必須に

EUでは8月2日から、チャットボットによる通知、生成コンテンツへの機械可読マーク、ディープフェイクの開示などの透明性義務が適用される。高リスクシステムに関する規則は延期されたが、Article 50は同時に停止されておらず、プロダクトチームは引き続き出力パイプラインとフロントエンドのプロセスを改修する必要がある。

模型與程式代理

DeepSeek-V4-Flash 0731、後学習のみをやり直し、Terminal-Bench 2.1の公式スコアが82.7に上昇

DeepSeekは、後学習をやり直したV4-FlashをAPIのパブリックベータとして提供開始した。モデルアーキテクチャ、総パラメータ数284B、アクティブパラメータ数13Bはいずれも変更されていない。新版はResponses APIをネイティブサポートし、コーディングエージェントとツール利用を重視しているが、主要な評価は未公開のDeepSeek Harnessに依存している。

RAG 與檢索系統

GLM-RAG、知識グラフのテキストをGraph Transformerに入力し、クロスドメインのマルチホップ検索でGNNベースラインを上回る

GLM-RAGでは、グラフ距離だけに基づいて情報を伝播するのではなく、ノード、関係、質問が第1層のAttentionから相互作用する。未知ドメインのマルチホップ評価ではより良い結果を達成したが、シングルホップタスクでは依然として通常のベクトルRAGが優位で、コードとモデルもまだ公開されていない。

AI 安全與評測

DFOT、導出センサー値に対するLLMの過信を定量化——クロスモーダル蒸留で訂正率が最大6.69ポイント向上

新たなフレームワークは「モデルが導出値を誤って信頼する」問題を、矛盾受容、文脈による誤誘導、誤りの訂正、効用低下などの指標に分解する。PPGによる心調律判定を事例に、訓練時にECGを利用し、デプロイ時にはPPGのみを必要とする信頼度モデルが4つのエンドポイントを改善した。ただし、データと重みはコードとともに公開されていない。

多模態 RAG

DualG-MRAG、多モーダル知識グラフを2層に分割し、MMQAのR@5を61.9%に向上

DualG-MRAGは、マクログラフで文書横断推論の経路を探索し、ミクログラフで局所的な画像・テキスト証拠を照合することで、細粒度ノードによる知識グラフの急速な肥大化を防ぐ。MMQAでは、R@5をグラフベースの最良ベースラインの42.1%から61.9%へ向上させたが、コードとインデックス構築コストはまだ公開されていない。

代理訓練

GRSD、エージェント自身の成功・失敗軌跡を比較して報酬を配分、ALFWorldのunseenタスク成功率は83.6%

Group-Reflective Self-Distillationは、外部教師から固定スキルを抽出するのではなく、同一方策による成功rolloutと失敗rolloutを比較し、その差分をターン単位の訓練信号へ変換する。3種類のエージェント環境で全体的な改善を達成した一方、訓練時間はGRPOより17%増加し、反省テキストの評価には依然として外部モデルの呼び出しが必要となる。

開源治理與 AI 程式工具

GCC、著作権上重要なLLM由来コンテンツを拒否、生成テストはメンテナーの裁量で例外的に受け入れ可能

GCC Steering CommitteeはAIによる貢献に関するポリシーを承認し、原則としてLLMの出力を含む、またはその出力から派生した実質的なコードや文章を拒否する。モデルは引き続きデバッグ、分析、レビューに利用でき、メンテナーは生成されたテストを受け入れることもできるが、その出力を通常の貢献に直接含めることはできない。

程式代理與評測

Change2Task、過去のPRを新版コードへ移植——900件のエージェントタスクが3段階検証を通過

Change2Taskは、マージ済みPRから開発意図を抽出し、同じリポジトリの現行バージョン上で実行可能なタスクとして再構築する。研究では1,130件の候補変更から900件のタスクセットを生成したが、大半のケースでは再構築に別のコーディングエージェントを必要とした。

代理與強化學習

MemHarness、行動前にエージェントの記憶を書き換え、7BモデルのALFWorld成功率を85.2%に向上

MemHarnessは、検索した過去の経験をそのまま再生するのではなく、同じポリシーモデルに現在の状態に照らして批判・再構成させたうえで、行動を決定する。GRPOによるエンドツーエンド学習後、ALFWorldとWebShopでそれぞれ85.2%と75.6%の成功率を達成したが、コードと重みはまだ公開されていない。

LLMOps

Grafana Agent Observabilityが正式提供開始、オープンソースSDKでオンライン評価とエージェントCIを連携

Grafanaは、社内で利用してきたエージェント可観測性プラットフォームを正式提供し、5言語と複数のエージェントフレームワークに対応するagento11y SDKを公開した。同プラットフォームは、会話、ツール実行、コスト、OTel traces、オンライン評価、オフライン実験を単一の回帰テストフローに統合するが、製品の全機能は依然としてGrafana Cloudに依存する。

科學 AI 與代理

SciDataSailor、エージェントによる科学データベースの直接探索を実現、9BモデルのPass@1が14.01から28.99に向上

SciDataSailorはモンテカルロ木探索を用いて、実行可能なファイル探索軌跡を合成し、2,300件を超える教師ありデータを公開した。Qwen3.5-9Bはファインチューニング後、ステップ数を制限したテストで試行錯誤を削減したが、一部の評価は依然としてLLM-as-a-Judgeに依存している。