AI 資安工具
BUGSTONE-E2E、CVEの修正履歴をエージェントスキル化し、644件のソフトウェア欠陥に実行時エビデンスを生成
IBM Researchなどの研究者は、既知の脆弱性に対する修正差分を1,033件の実行可能な検出ルールへ変換し、階層型エージェントワークフローでスキャン範囲を絞り込んだ。このシステムは14本のプログラムにおける644件の検出結果について実行時エビデンスを生成したが、この数字は644件の新たなCVEが確認されたことを意味しない。
Archive
技術ニュース 953 件
AI 資安工具
IBM Researchなどの研究者は、既知の脆弱性に対する修正差分を1,033件の実行可能な検出ルールへ変換し、階層型エージェントワークフローでスキャン範囲を絞り込んだ。このシステムは14本のプログラムにおける644件の検出結果について実行時エビデンスを生成したが、この数字は644件の新たなCVEが確認されたことを意味しない。
模型評測
研究者らは、一部のモデルが分子特性の回帰テストで予測を行っているのではなく、訓練データに含まれる正解を桁単位で再現している可能性を明らかにした。推論強度を高めると検索の兆候が89%増加し、推論設定そのものがベンチマーク汚染の度合いを変え得ることが示された。
AI代理與訓練資料
Qwenと清華大学のチームは、ターミナルエージェントの軌跡を一度限りのデモとして扱うのではなく、ファイル操作を巻き戻し、依存関係を補完することで、繰り返しクエリを実行できるワークスペースを再構築した。生成データで Qwen3.5-27B をファインチューニングした結果、2つのターミナルエージェント評価でそれぞれ11.9ポイント、13.8ポイント向上した。ただし、タスク、解答、検証器が同じ教師モデルのバイアスを共有している可能性がある。
模型訓練與開發工具
新手法は、まず教師モデルでタスクデータを合成し、次に小型インタープリターのアダプターを微調整することで、テキスト仕様をバージョン管理可能な `.paw` 関数としてパッケージ化する。難易度の高い曖昧なテキストタスクで83.6%の意味的精度を達成した一方、コンパイルには外部モデルと約40GBのアクセラレーターメモリが必要で、従来のプログラムのような形式的保証も提供できない。
AI 程式代理
新バージョンでは、エージェントのトレースアップロードを永続化 outbox として再構築した。プロセス終了時にネットワーク転送を待たず、再起動後はバイト単位のカーソルに基づいて未送信分を補送できる。また、子エージェントをまたぐ semantic edge の記録も開始したが、対応する配信エンドポイントはまだなく、完全な分散トレーシング機能とは見なせない。
代理框架與安全
新バージョンでは、GitHub App のアイデンティティを使用するエージェントワークフロー向けに、データフローの完全性および機密性に関するポリシーを自動生成し、trusted enclave の機密度制御も追加する。一部の分離アーキテクチャの変更は、最近マージされたメインブランチのコードにのみ存在しており、すべてを 0.88.4 で提供済みの機能と見なすことはできない。
模型訓練工具
Soupのテキスト、ビジョン、オーディオ用ローダーではdtypeが指定されておらず、最適化対象ではないベースモデルもfp32のままGPUメモリに常駐していた。修正後、公式のH100テストでは48,241 MiBから18,658 MiBに減少したが、2.59倍という改善をすべてのモデルやハードウェアに一般化することはできない。
AI 安全
研究者はプラグインのメタデータとフック設定を変更するだけで、すでに信頼されているエージェント用プラグインにホスト権限で悪意あるコマンドを実行させることができた。1,000回の実験では対象となった7つのエージェントすべてが侵害されたが、成功率とアンチウイルスの検知漏れに関するデータは、まだ独立には再現されていない。
應用研究
Google DeepMindの新モデルは、6時間ごとの再解析データを模倣するだけでなく、低遅延の衛星画像を予報の初期条件に組み込む。降水および観測地点レベルの予測性能は向上したが、高山、極域、強雨の評価では、依然としてデータの疎密や指標上の制約が浮き彫りになっている。
開源工具
新たなオープンソースツールがReShade、RenoDX、Feederを介し、DLSSをネイティブサポートしていないゲームへニューラルレンダリングコンポーネントを自動導入する。最新版ではゲーム内オーバーレイとゲーム別のAPI修正機能が追加されたが、未署名の実行ファイル、改変版DLL、アンチチート機構の存在により、依然として実験的なツールにとどまる。
代理框架與安全
新バージョンでは、条件を満たすエージェントにSwarmコラボレーション機能がデフォルトで付与され、再起動後に中断した一部のタスクを再開できる。より重要な移行リスクは、明示的に指定されていない2つの設定が、エージェント間の読み取りと通信を許可するよう変更されたことだ。Gatewayを共有する環境の運用者は、権限を再確認する必要がある。
開源代理工具
新しいオープンソースツールは、Markdown、YAML、MCP、ローカルテキスト検索を使い、プログラミングエージェントの長期記憶をGitでレビュー可能にする。軽量なアーキテクチャは実用に耐える一方、独立テストでは「300マイクロ秒未満」が極小規模のデータセットにしか当てはまらず、同じクエリでも結果の順位が変わる可能性が示された。