代理安全/校準
偽のプロ向けダッシュボードでLLMエージェントが賭けに出やすく、12モデルの行動コミット率は36.8%に上昇
新たな研究により、予測不可能な問題でも権威的に見えるデータダッシュボードを添えると、すべての数値が捏造であっても、LLMエージェントは方向性のある判断を下しやすくなることが分かった。540件の合成事例によるファインチューニングで行動ゲートを一時的に修正できるものの、出力形式を強制すると効果は失われる。
Archive
技術ニュース 966 件
代理安全/校準
新たな研究により、予測不可能な問題でも権威的に見えるデータダッシュボードを添えると、すべての数値が捏造であっても、LLMエージェントは方向性のある判断を下しやすくなることが分かった。540件の合成事例によるファインチューニングで行動ゲートを一時的に修正できるものの、出力形式を強制すると効果は失われる。
代理安全與瀏覽器自動化
Anthropicはブラウザエージェントをすべての有料プランに拡大した。ユーザーが計画を一度承認すれば、Claudeは複数タブをまたいでクリック、入力、ワークフローの実行ができる。各自律アクションは安全性分類器による再審査を受けるが、公式テストでは依然として攻撃成功率が0.3%あり、画面のスクリーンショットから機密データが取り込まれる可能性もある。
機器人與具身 AI
Perceptron AIは、360億パラメータのIsaac 0.5の重みとLeRobot統合を公開し、同一のスパースなバックボーンから言語、空間座標、連続または離散アクションを出力できるようにした。一般動画によって遠隔操作データの必要量を大幅に削減できると公式は主張するが、これはオフラインのaction lossに基づく換算であり、中核となる自己教師あり学習目標は依然としてプロプライエタリ技術である。
模型與推論架構
AlibabaはQwen3.8-Flash-Nextの重みを公開した。Qwen Sparse Attention、Gated Residual、510億個のn-gram embeddingパラメータにより、長いコンテキストの計算コストを削減する。モデルは26万2,144 tokenをネイティブにサポートするが、性能値は主に公式評価に基づいており、ライセンスも一般的なApache 2.0ではない。
LLMOps 與評測工具
新バージョンでは、投票、平均、またはカスタム関数によって複数のLLMスコアラーを統合し、各サブスコアの根拠と出典も保持できる。リリースノートで言及されたイミュータブルな評価データセットのバージョンは現時点ではDatabricksでのみサポートされ、オープンソースのトラッキングバックエンドには同等の機能がまだない。
AI 評測與安全
北京航空航天大学のチームは、テキストがAIによって生成されたかどうかだけを問うのではなく、内容の構想と表層的な表現の由来を個別に判定する。再構築されたMixD2Cテストセットでは、同一のデータ分割で再実行したRACEを上回ったが、データセットをまたぐ汎化性能と完全な再現性にはなお限界がある。
AI safety research
新たな研究によると、trajectoryごとにリセットされるguardrailでは、複数の反復処理に分散された攻撃の証拠を識別できず、リスクスコアを時間とともに単純に減衰させる方式も、待機によって回避され得る。LoopHarnessは、著者が管理する1,000件の攻撃episodeにおいて、クリーンなタスクの完了率96.9%を維持したが、結果は独立した再現と実システムでの検証を待つ必要がある。
AI coding tools
GitHubはMCP 2026-07-28をCLI、SDK、IDEに導入し、hook間でOpenTelemetry traceを関連付ける機能も追加した。新版では従来の`/plugins`エントリポイントも廃止されるため、アップグレード前にプラグイン管理、自動更新、企業ポリシーの挙動を確認する必要がある。
模型訓練
新たな研究では、パラメータ摂動とフォワード評価のみを用いて推論モデルを訓練し、進化戦略がGRPOのエントロピー崩壊と大規模サンプリング時のカバレッジ低下を緩和できることを示した。結果は1.5Bから7Bまでのモデルを対象としているが、訓練規模、タスク範囲、再現性には依然として制約がある。
AI 安全
新たな研究により、サブエージェント、永続目標、スケジュールタスクがツール出力を高権限のユーザー指示として再パッケージ化する可能性が明らかになった。攻撃は6つのエージェントで全13種類の標的を達成し、自動権限レビューを有効にしても、検証された経路は阻止されなかった。
資料集與多模態研究
LAION-BVDはCommon Crawlから、動画・音声・フレームを横断するオープンな研究用データを構築し、合成キャプション付きの5,500万クリップや3億枚のフレームなどのサブセットを公開した。ViCLIPの評価ではInternVidベースラインを最大2.1%上回ったが、データは研究用途に限定されており、ソースの権利、URLのリンク切れ、合成アノテーションの誤りについては別途対処が必要だ。
AI 基礎設施
AMDはROCm 10をリリースし、Hyperloom、AMD Skills、統合CLIを組み込んだROCm.AIの一般提供を開始した。同社は同一ハードウェアで推論性能が平均3.3倍、トレーニング性能が平均2.4倍向上するとしているが、この数値は最適化プロセス全体による効果であり、ランタイムをアップグレードするだけで得られる性能向上とはみなせない。