AI security
CrowdStrike SafeMind、レッド・ブルーのエージェント閉ループで検知ルールを生成・リプレイ、評価は依然として提携企業主導
CrowdStrikeとNVIDIAはSafeMindを発表した。攻撃エージェントがテレメトリを生成し、Nemotron防御エージェントが検知ルールの作成、検査、リプレイを担う。クローズドテストでは特化モデルが汎用フロンティアモデルを上回ったものの、モデルの重み、データセット、完全な評価プロトコルはまだ公開されていない。
Archive
技術ニュース 960 件
AI security
CrowdStrikeとNVIDIAはSafeMindを発表した。攻撃エージェントがテレメトリを生成し、Nemotron防御エージェントが検知ルールの作成、検査、リプレイを担う。クローズドテストでは特化モデルが汎用フロンティアモデルを上回ったものの、モデルの重み、データセット、完全な評価プロトコルはまだ公開されていない。
AI coding agents
上海人工知能研究所のチームが、既存の coding agent の外側に計画・実装・検証を反復する制御ループを加える Harness-of-Harness を提案した。3ラウンドの実験では平均相対向上率が52.25%に達したが、各条件での生成は1回のみで、実行可能な HoH-lite も依然として「近日公開」とされている。
AI 程式開發工具
Clineは、長時間のセッションで状態が更新されるたびに会話ログ全体がブロードキャストされ、Hubのメモリ使用量が数十GBまで膨らむ問題を修正し、状態スナップショットのみを送信するよう変更した。新版ではcheckpoint、サブエージェントのキャンセル、リモートMCP接続の動作も厳格化されたが、モデルを固定していないデプロイでは、デフォルトモデルの大幅な更新によって結果が変わる可能性がある。
開放模型/推論架構
RWKVチームは、13.3BパラメータのG1jベースモデルを公開し、Transformers、LoRA、TileLangによる推論サポートをパッケージ化した。固定サイズの再帰状態により、コンテキストとともに増大するKV cacheを回避できる一方、安全性や能力の評価は示されておらず、成熟したチャットアシスタントと直接みなすことはできない。
模型與語音 AI
Metaの新しい音声モデルは、同一のデコードループで文字起こし、話者ラベル、発話境界を出力し、動的な待機メカニズムによって精度とレイテンシーのバランスを取る。英語のストリーミング評価では首位に立ち、API価格も低い一方、多言語での品質、セッション上限、非公開のモデル重みが導入判断の制約となっている。
世界模型與電腦視覺
Atlasは、テキスト、画像、カメラ姿勢、深度データを単一の自己回帰型拡散アーキテクチャに統合し、制御されたカメラワークを生成するとともに、点群や3D Gaussian splatを出力できる。ベンダーによる評価では、疎視点再構築で専用モデルを上回ったが、論文や重み、物理シミュレーションの検証はまだ公開されておらず、現時点では早期アクセスに限定されている。
AI 程式開發工具
MetaはMuse Codeのベータ提供を終了し、セッション間メッセージング、サブエージェント・ワークフロー、確認可能な巻き戻し操作を追加した。同時公開されたTypeScript SDKはMuse Session Protocolを公開するが、互換性が保証されないpre-1.0のDeveloper Preview段階にある。
模型與開發者平台
Alibaba CloudはQwen3.8-Maxのホステッドスナップショットを更新し、エンジニアリング規模のソフトウェア開発、複数ツールの連携、視覚理解を重点的に強化する一方、100万tokenのコンテキストを維持した。Code Arenaでは暫定首位に立つが、サンプル数が少なく順位区間も重複しているため、他のフラッグシップモデルを安定的に上回ったと証明するには不十分だ。
時間序列基礎模型
Google Researchの3億3,000万パラメータのTimesFM-3は、1回のフォワードパスで複数の時系列を共同予測し、過去共変量と既知の将来共変量も取り込める。コードはApache 2.0だが、新版の重みには別途非商用ライセンスが適用されるため、本番デプロイでは旧版と同じ前提を踏襲できない。
生成式介面/世界模型
RunwayのSolarisは、クリック、ドラッグ、テキスト入力を動画モデルへの条件信号として直接扱い、次の720pインターフェース画面をリアルタイムで合成する。この研究プレビューは、HTML/CSSでインタラクションを記述しない可能性を示す一方、レイテンシ、コスト、モデルの重み、再現可能な評価はまだ公開されていない。
模型評測研究
Ai2がBenchMIRTをオープンソース化し、3万4,000問超に対するモデルの回答パターンから、安全性や一般推論などの潜在能力を分離した。実験では、一部の安全性ベンチマークが主に推論性能を反映していることや、厳選した約1割の問題でも能力順位をおおむね維持できることが示された。ただし、データの対象は2025年初頭までのモデルに限られる。
多模態模型與開發者平台
Googleは3つのGemini Flashモデルにagentic video processingを追加した。モデルは動画全体を固定フレームレートで事前処理するのではなく、必要に応じて映像、音声、文字起こしを読み込める。公式発表ではtokenを最大88%、コストを66%削減できるとしているが、短い動画でのTime to First Tokenと評価の再現性は、なお検証が必要だ。