全ニュース

技術ニュース 985 件

代理評測

OmegaUse-OfficeVal、オフィスエージェント評価にタスク別コストラベルを導入 最高性能モデルも品質では人間に3分の1超及ばず

百度(Baidu)の研究チームは、文書、スプレッドシート、プレゼンテーションに関する100件の長工程タスクを、人間の作業時間、価格の代理指標、実行可能な検証ツールとともに公開した。最高性能モデルの平均スコアは17.91で、人間のベースラインである27.79を下回った。推論が安価かつ高速でも、成果物をそのまま利用できるとは限らないことを示している。

研究代理/開放模型

AREX、研究エージェントに未解決の条件を反復検証させ、4Bモデルが圧縮状態で長期探索を維持

BAAIは深層調査を「検索—項目別検証—対象を絞った追加調査」という再帰的ループに再構成し、確認済みの証拠と未解決の制約をモデル自身が圧縮するよう訓練した。4BのDenseモデルと122B-A10BのMoEモデルの重みは公開されたが、その優位性は主に自動検証可能な合成タスクに由来しており、オープンエンドな科学研究へ直接一般化できるとは限らない。

AI 輔助晶片設計

ACE-RTLがNemotronにVerilogの反復コンパイルと修正を実行させ、9種類のタスクで平均合格率97.1%を達成

NVIDIAはNemotron 3 Ultraを「生成—テスト—リフレクション」のRTLエージェントループに統合し、CVDPの9種類のエージェントタスクで平均合格率97.1%を達成した。この結果は、実行可能な検証がチップ設計モデルを大幅に強化できることを示す一方、データの関連性、ツール設定、ベンダーによる自己評価が依然として結果の一般化を制約している。

開放模型

Kimi K3、2.8T MoEの重みを公開――104Bのアクティブパラメータでセルフホスティングのハードルはクラスター級に

Moonshot AIがKimi K3の重みと技術レポートを正式に公開した。ネイティブな視覚処理、100万tokenのコンテキストを備え、各tokenにつき896個の専門家のうち16個をアクティブ化する。オープンウェイト化により、公式が主張する能力をようやく再現できるようになったが、低精度化しても1TBを超える重みのため、完全なデプロイは依然として一般的なワークステーションの手には届かない。

開放模型/程式代理

Poolside、Laguna S 2.1をオープン化:118B MoEで各tokenあたり有効化するパラメータはわずか8.5B

Laguna S 2.1は、sliding-window attention、attention gate、FP8 KV cacheによって長いコンテキストのコストを抑え、セルフホスト可能なエージェント型コーディングを主眼に据える。複数の精度の重みと完全な評価trajectoryが提供されている一方、100万tokenへの対応能力、性能比較、単一マシンでの実行可能性は、量子化形式と実行環境に大きく左右される。

代理系統與推論

同一モデルがツール呼び出し予測器を兼任、Qwen 4Bの次ステップ的中率が17ポイント超向上

研究チームは、エージェントが推論中に自身の次のツール呼び出しを予測して先行実行する仕組みを開発し、外部ドラフトモデルを共有重みとKV cacheで置き換えた。共同強化学習により、2種類のQwen 4Bモデルの平均Hit@1はそれぞれ61.2と66.3に向上したが、論文では実際の並列デプロイにおけるエンドツーエンドの高速化はまだ定量化されていない。

AI 供應鏈安全

SkillGate、ルールでエージェントスキルを事前選別しLLM入力を77%削減するも、攻撃の約4分の1を見逃す

オープンソースのSkillGateは、エージェントがスキルを読み込む前に530個のルールで疑わしい箇所を特定し、LLMによる判定と隔離に引き渡す。公式ベンチマークでは誤検知率1.13%、再現率76.9%を記録し、低コストなゲートウェイの実現可能性を示したが、サンドボックスや最小権限の代替にはまだならない。

模型與 AI 安全

Shieldstral、モデレーションポリシーをクエリに組み込み、3Bマルチモーダルモデルがテキスト安全性評価で平均F1 84.9%を達成

Shieldstralは、コンテンツモデレーションを自然言語で指定できる二値質問応答として統一し、同一モデルで製品の文脈に応じて判定基準を切り替えられるようにした。論文によると、テキストとマルチモーダルの平均F1はそれぞれ84.9%と83.8%に達したが、モデルの重みと完全な推論パッケージはまだ同時公開されていない。

代理框架與安全

1,723件のMCPアプリを実測:約3分の2がツール実行前の承認を要求せず

初の大規模なMCPクライアント研究により、公式SDKとファイルベースの設定が主流となる一方、ブロッキング型のツール承認率はわずか37.2%であることが判明した。プロトコルは通信形式を統一したものの、権限、設定、Human-in-the-Loopによる監督については、アプリケーション層で一貫した慣行がまだ確立されていない。

代理評測

100ページ超の企業規程でエージェントを制約するHANDBOOK.md、30種類のモデル構成でも最高厳格合格率はわずか36.2%

Surge AIは、メール、チャット、カレンダー、企業向けツールを横断し、20~124ページに及ぶ可変ポリシーへの準拠をモデルに求める、65件の長期ワークフロー型エージェントタスクを公開した。すべてのルールを同時に満たす必要がある厳格評価では、最良の構成でも合格率は36.2%にとどまり、長いコンテキスト容量が継続的なコンプライアンスを意味するわけではないことが示された。

AI 評測/醫療代理

PatientAgentBench、1,200件のツール対話で医療エージェントを評価――最強モデルでもトリアージ合格率は88%

Amazon ScienceがPatientAgentBenchを公開した。医療エージェントに、合成診療記録と状態を持つツールを使って複数ターンのプライマリケア業務を遂行させる。10モデル間で最大の差が生じたのはトリアージ判断であり、医学問題に正解できるだけでは、エージェントがワークフローを安全に実行できる証明にはならないことが示された。

模型微調/可控適應

階層別 LoRA 実験で判明:語彙・事実・行動ポリシーの学習では、最適な更新位置が異なる

新たな研究では、LoRA を Transformer の前半・中盤・後半の各層に限定し、学習目標ごとに再現可能な「適応ジオメトリ」が現れることを確認した。この結果により、adapter の配置位置は単なる実装上の詳細ではなく、知識の転移と副作用を制御する設計変数として位置づけられる。