多模態模型訓練
PCDがマルチモーダルの失敗を知覚と推論のシグナルに分解、32Bから8Bへの蒸留で平均スコアが61.22に上昇
Perception-Correction Distillationは、回答が失敗し、かつ生徒と教師の知覚出力が食い違う場合にのみ、知覚区間の蒸留を強化する。Qwen3-VLを用いた2組のモデル縮小実験では、いずれも一様なon-policy distillationを上回ったが、この手法は教師が実際に生徒より正確に見えていることに依存する。
Archive
技術ニュース 983 件
多模態模型訓練
Perception-Correction Distillationは、回答が失敗し、かつ生徒と教師の知覚出力が食い違う場合にのみ、知覚区間の蒸留を強化する。Qwen3-VLを用いた2組のモデル縮小実験では、いずれも一様なon-policy distillationを上回ったが、この手法は教師が実際に生徒より正確に見えていることに依存する。
標準與 AI 工程
EUでは8月2日から、チャットボットによる通知、生成コンテンツへの機械可読マーク、ディープフェイクの開示などの透明性義務が適用される。高リスクシステムに関する規則は延期されたが、Article 50は同時に停止されておらず、プロダクトチームは引き続き出力パイプラインとフロントエンドのプロセスを改修する必要がある。
模型與程式代理
DeepSeekは、後学習をやり直したV4-FlashをAPIのパブリックベータとして提供開始した。モデルアーキテクチャ、総パラメータ数284B、アクティブパラメータ数13Bはいずれも変更されていない。新版はResponses APIをネイティブサポートし、コーディングエージェントとツール利用を重視しているが、主要な評価は未公開のDeepSeek Harnessに依存している。
RAG 與檢索系統
GLM-RAGでは、グラフ距離だけに基づいて情報を伝播するのではなく、ノード、関係、質問が第1層のAttentionから相互作用する。未知ドメインのマルチホップ評価ではより良い結果を達成したが、シングルホップタスクでは依然として通常のベクトルRAGが優位で、コードとモデルもまだ公開されていない。
AI 安全與評測
新たなフレームワークは「モデルが導出値を誤って信頼する」問題を、矛盾受容、文脈による誤誘導、誤りの訂正、効用低下などの指標に分解する。PPGによる心調律判定を事例に、訓練時にECGを利用し、デプロイ時にはPPGのみを必要とする信頼度モデルが4つのエンドポイントを改善した。ただし、データと重みはコードとともに公開されていない。
多模態 RAG
DualG-MRAGは、マクログラフで文書横断推論の経路を探索し、ミクログラフで局所的な画像・テキスト証拠を照合することで、細粒度ノードによる知識グラフの急速な肥大化を防ぐ。MMQAでは、R@5をグラフベースの最良ベースラインの42.1%から61.9%へ向上させたが、コードとインデックス構築コストはまだ公開されていない。
代理訓練
Group-Reflective Self-Distillationは、外部教師から固定スキルを抽出するのではなく、同一方策による成功rolloutと失敗rolloutを比較し、その差分をターン単位の訓練信号へ変換する。3種類のエージェント環境で全体的な改善を達成した一方、訓練時間はGRPOより17%増加し、反省テキストの評価には依然として外部モデルの呼び出しが必要となる。
開源治理與 AI 程式工具
GCC Steering CommitteeはAIによる貢献に関するポリシーを承認し、原則としてLLMの出力を含む、またはその出力から派生した実質的なコードや文章を拒否する。モデルは引き続きデバッグ、分析、レビューに利用でき、メンテナーは生成されたテストを受け入れることもできるが、その出力を通常の貢献に直接含めることはできない。
程式代理與評測
Change2Taskは、マージ済みPRから開発意図を抽出し、同じリポジトリの現行バージョン上で実行可能なタスクとして再構築する。研究では1,130件の候補変更から900件のタスクセットを生成したが、大半のケースでは再構築に別のコーディングエージェントを必要とした。
代理與強化學習
MemHarnessは、検索した過去の経験をそのまま再生するのではなく、同じポリシーモデルに現在の状態に照らして批判・再構成させたうえで、行動を決定する。GRPOによるエンドツーエンド学習後、ALFWorldとWebShopでそれぞれ85.2%と75.6%の成功率を達成したが、コードと重みはまだ公開されていない。
LLMOps
Grafanaは、社内で利用してきたエージェント可観測性プラットフォームを正式提供し、5言語と複数のエージェントフレームワークに対応するagento11y SDKを公開した。同プラットフォームは、会話、ツール実行、コスト、OTel traces、オンライン評価、オフライン実験を単一の回帰テストフローに統合するが、製品の全機能は依然としてGrafana Cloudに依存する。
科學 AI 與代理
SciDataSailorはモンテカルロ木探索を用いて、実行可能なファイル探索軌跡を合成し、2,300件を超える教師ありデータを公開した。Qwen3.5-9Bはファインチューニング後、ステップ数を制限したテストで試行錯誤を削減したが、一部の評価は依然としてLLM-as-a-Judgeに依存している。