全ニュース

技術ニュース 968 件

代理安全

StepGuard、ツール実行前にエージェントのアクションを審査。ただしタスクごとに推論時間が約2.53秒増加

上海人工知能研究所などのチームが、4BパラメータのStepGuardを発表した。安全/危険な軌跡のペアとBalance-GRPOを用いて、過剰なブロックと見逃しを調整する。2つのエージェント環境で攻撃成功率を大幅に低減した一方、訓練コーパスとデータ生成器はまだ公開されておらず、規範上の違反も見逃すことがある。

推論與評測

AgentX 1.0、393件の実エージェント軌跡で100万token規模の推論負荷をリプレイ

SemiAnalysisは、長いコンテキスト、マルチターン、サブエージェントの並行実行に対応するAgentXを公開した。これにより、推論システムの比較は、固定長プロンプトのスループットだけに依存しなくなる。データはリクエストのタイミングとKV cache再利用の形状を保持しているが、ソースはClaude Codeに集中しており、測定対象はプログラミングタスクの正答率ではなく、サービングシステムの効率である。

代理系統

Perplexity、完全なエージェントスタックをDGX Sparkへ移行――難しい処理のみ同意を得てクラウドに送信

Portable Computerは、27Bモデル、プランナー、ツールルーティング、永続タスクキュー、検索インデックスをローカルで実行し、権限プロンプトによってデータの外部送信を制御する。初版はLinuxとDGX Sparkのみをサポート。公式スコアは未公開の社内ワークロードに基づくため、独立した検証結果とはみなせない。

本地推論/開源執行期

llama.cpp 0.3.0、ハイブリッドアテンションKVキャッシュ、MTP、DeepSeek 4のテンソル分割を追加

llama.cpp 0.3.0は、dots3-noteのDSA/スライディングウィンドウ・ハイブリッドアテンションをネイティブサポートし、GLM-4.5-Airにmulti-token predictionを導入した。DeepSeek 4では複数GPUにまたがるテンソル分割が利用可能になったが、リリースノートにはスループット、レイテンシ、VRAM使用量の比較は示されていない。

AI 程式開發/代理評測

DeepRepoQA、モンテカルロ木探索でファイルをまたぐコード関係を追跡。ただし評価は依然としてLLMジャッジに依存

DeepRepoQAは、コーディングエージェントに単一路径を探索させるのではなく、MCTSで複数のリポジトリ探索分岐を比較し、行番号付きの証拠から回答を合成する。公式報告ではSWE-QAで4~7ポイントの向上を達成したが、データ汚染、推論コスト、限定的なクロス言語テストについては、なお検証が必要だ。

模型發布與推論架構

Qwen3.8-Flash-Next、線形アテンションとブロック疎検索を組み合わせ、Qwen4アーキテクチャを先行公開

AlibabaはQwen3.8-Flash-Nextの重みを公開した。Gated DeltaNetで履歴状態の大部分を圧縮し、Qwen Sparse Attentionで完全なコンテキストから情報を検索する。モデルは262K tokenをネイティブにサポートするが、公式が示す100万tokenでの性能とエージェント評価については、今後も独立した再現検証が必要だ。

檢索與 RAG 工具

Sentence Transformers、多ベクトルモデルのドメイン微調整レシピを公開—ただしインデックスコストは依然として密ベクトルを大幅に上回る

Sentence Transformersは`MultiVectorEncoder`向けの完全なトレーニングフローを追加し、ColBERT型モデルをペアデータから直接ドメイン適応できるようにした。医療検索の実験では、教師あり事前調整前のチェックポイントのほうが新しいドメインに適応しやすいことが示されたが、この結論は単一のデータセットと限られたモデルファミリーに基づいている。

AI 安全

root権限があればPixel Cameraのハードウェア鍵で偽造画像に署名可能、C2PA検証も通過

セキュリティ研究者はKeystorkを使ってカメラアプリになりすまし、Android StrongBoxに任意のAI画像向けの有効なContent Credentialsを生成させた。この攻撃では秘密鍵をエクスポートする必要はない。明らかになったのは、署名側が侵害されると正規の鍵が悪用され得るという弱点であり、C2PAの署名アルゴリズムが破られたわけではない。

AI 代理與私隱

Claude ChatとCoworkが永続メモリを統合、ただし2つのインターフェースを個別に無効化することは不可能

Anthropicは、チャットと業務タスクを実行するCoworkで、編集可能な同一のメモリを共有するようにし、会話中に随時更新する方式へ変更した。センシティブなトピックはデフォルトで保存されないが、一般消費者向けプランではメモリがデフォルトで有効になっており、ユーザーが一方のインターフェースからのアクセスだけを阻止することはできない。