全ニュース

技術ニュース 966 件

AI 程式開發工具

Claude Code 2.1.248にrestrictedモードが追加、デフォルトでコマンド実行とWebFetchを無効化

新しいフラグによりファイルツールを作業ディレクトリ内に制限し、ユーザー設定とプロジェクト設定を読み飛ばすことで、評価プラットフォームや共有ホスト上でのエージェント実行を容易にする。起動引数でツールを再び追加できるため、OSレベルのサンドボックスではない。

AI 推論系統

Atlas、純Rust/CUDA推論エンジンで単一GB10上のvLLMに挑み、高並行時のスループットで最大22.5%高速化

Atlasは、DGX Spark上でQwen3.8-27B-NVFP4を使用した再現可能なベンチマークを公開し、並行数1~128のすべてでvLLMを上回った。ただし、結果は単一モデルかつ短い入力・長い出力のワークロードに限られており、一般的なデータセンター環境へそのまま一般化することはできない。

RAG/向量檢索

txtai 9.13はColBERTのマルチベクトルを単一インデックスに圧縮、大規模コーパスではFaissの再調整が必要

txtai 9.13はLEMURを正式に統合し、学習ベースの固定次元ベクトルによってtoken単位のMaxSimスコアを近似する。初期テストではインデックス容量と検索品質を両立したが、デフォルトのIVFは大規模データセットで再現率を大幅に低下させる可能性がある。

AI 代理安全

AWS、3段階のStrands hookでエージェントのツールフローを検査、ただし権限制御の代替にはならず

AWSは、モデル入力、ツール引数、ツール出力の各段階でBedrock Guardrailsを呼び出し、プロンプトと回答だけを検査する場合の空白を埋める手法を提示した。サンプルではツールごとに異なるルールを適用できる一方、レイテンシー、誤検知率、構造化されたアクションに対する安全性評価は公表されていない。

模型後訓練研究

BPCO、単一ロールアウトでLLM criticを訓練し、GRPOの複数応答によるグループ内比較を代替

BPCOは、制約付きvalue head、Monte Carlo target、長さ適応型GAEを組み合わせ、criticが単一応答からtoken単位のadvantageを推定できるようにする。著者らは1.5Bから30B-A3Bまでのモデルで複数サンプル手法と同等以上の性能を達成したが、総訓練コストが低いことはまだ実証していない。

AI 代理基礎設施

SandboxAQ Switch、Matrixルームで複数のAIエージェントを接続。ただしライセンスは派生サービスの販売を禁止

SwitchはSlack、Teams、Discordなどのチャンネルを共有ルームにマッピングし、Codex、Claude Codeなどのエージェントが共通コンテキストを維持できるようにする。コードはセルフホストできるが、Commons Clauseにより商用再販が制限され、コスト保護機能や一部のセキュリティ制御もまだ完成していない。

軟體代理與評測

ASIL、画面クリックを構造化状態に置き換え、ソフトウェアエージェントの成功率を6.6%から81.6%へ向上

ASILでは、エージェントがJSON形式のソフトウェア状態を読み取り、ファイルパーサー、ネイティブスクリプト、サービスAPIを通じて意味的なアクションを実行する。380件のタスクで画面操作を大幅に上回ったが、この比較ではエージェントが参照できる情報と操作の粒度も同時に変わっているため、単純にモデル能力の向上と解釈することはできない。

代理與實體系統

Anthropic、AIエージェントによる研究・製造設備の制御を統一ドライバーで実現するMHSをプレビュー

Model Hardware Standardは、設備の状態と操作を、検出可能な`read`や`write`などのプリミティブとして抽象化し、MCP、CLI、またはプログラミングインターフェースからオーケストレーションできるようにする。すでに液体ハンドラー、ロボットアーム、量子コンピューター用レーザーで利用されているが、仕様とコードはまだ公開されておらず、安全性に関する根拠の大半はパートナー企業による概念実証に基づいている。

推論基礎設施

vLLM、Ironwood TPUで16K埋め込みをサポート、StepPoolが分割prefillの状態を保持

GoogleとvLLMは、Qwen3埋め込みモデル向けにテンソルのアラインメント、コンパイルのウォームアップ、分割をまたいで蓄積可能なpooling状態を追加した。公式発表では4基のIronwood TPU上で約8万4,000 token/sを記録したが、同等コストのGPUとの比較や実環境での検索品質テストはまだ示されていない。

多模態模型

Gemini Omni 1.1 Flash、10秒間のコンテキストを利用して動画を延長、4K出力は実際にはアップスケーリング

Googleは対話型動画モデルを正式版へ移行し、開始・終了フレーム間の補間、最長40秒までのシーン延長、4段階の解像度制御を追加した。新しいインターフェースによりワークフローの制御性は高まったが、1080pと4Kはいずれもアップスケーリングで生成され、複雑な動きや文字の一貫性には依然として限界がある。

多模態評測/AI 安全

SHROOM-Visions、4言語・2万件のデータでVLMのハルシネーションを評価、中国語の最高IoUもわずか0.53

新たな共有タスクでは、回答全体が信頼できるかを判定するだけでなく、視覚言語モデルのハルシネーションを文字単位で特定し、分類することが求められる。27チームが600超のシステムを提出したが、非公開テストと隣接順位の不安定さにより、導ける結論には限界がある。

AI coding/軟體工程研究

RAMP、リポジトリ内のAI設定ファイルで成熟度を分類:未設定プロジェクトではcoding agent導入後の複雑性増加率が約2倍に

研究チームは、企業の441リポジトリを基に4段階のRepository AI Maturity Profileを構築し、coding agentを導入した509件のオープンソースプロジェクトを再分析した。共通ルールやagent設定を備えるリポジトリは品質指標が良好だったが、観察研究であるため、設定ファイル自体が改善をもたらしたとはまだ証明できない。