AI 程式開發工具
Claude Code 2.1.248にrestrictedモードが追加、デフォルトでコマンド実行とWebFetchを無効化
新しいフラグによりファイルツールを作業ディレクトリ内に制限し、ユーザー設定とプロジェクト設定を読み飛ばすことで、評価プラットフォームや共有ホスト上でのエージェント実行を容易にする。起動引数でツールを再び追加できるため、OSレベルのサンドボックスではない。
Archive
技術ニュース 966 件
AI 程式開發工具
新しいフラグによりファイルツールを作業ディレクトリ内に制限し、ユーザー設定とプロジェクト設定を読み飛ばすことで、評価プラットフォームや共有ホスト上でのエージェント実行を容易にする。起動引数でツールを再び追加できるため、OSレベルのサンドボックスではない。
AI 推論系統
Atlasは、DGX Spark上でQwen3.8-27B-NVFP4を使用した再現可能なベンチマークを公開し、並行数1~128のすべてでvLLMを上回った。ただし、結果は単一モデルかつ短い入力・長い出力のワークロードに限られており、一般的なデータセンター環境へそのまま一般化することはできない。
RAG/向量檢索
txtai 9.13はLEMURを正式に統合し、学習ベースの固定次元ベクトルによってtoken単位のMaxSimスコアを近似する。初期テストではインデックス容量と検索品質を両立したが、デフォルトのIVFは大規模データセットで再現率を大幅に低下させる可能性がある。
AI 代理安全
AWSは、モデル入力、ツール引数、ツール出力の各段階でBedrock Guardrailsを呼び出し、プロンプトと回答だけを検査する場合の空白を埋める手法を提示した。サンプルではツールごとに異なるルールを適用できる一方、レイテンシー、誤検知率、構造化されたアクションに対する安全性評価は公表されていない。
模型後訓練研究
BPCOは、制約付きvalue head、Monte Carlo target、長さ適応型GAEを組み合わせ、criticが単一応答からtoken単位のadvantageを推定できるようにする。著者らは1.5Bから30B-A3Bまでのモデルで複数サンプル手法と同等以上の性能を達成したが、総訓練コストが低いことはまだ実証していない。
AI 代理基礎設施
SwitchはSlack、Teams、Discordなどのチャンネルを共有ルームにマッピングし、Codex、Claude Codeなどのエージェントが共通コンテキストを維持できるようにする。コードはセルフホストできるが、Commons Clauseにより商用再販が制限され、コスト保護機能や一部のセキュリティ制御もまだ完成していない。
軟體代理與評測
ASILでは、エージェントがJSON形式のソフトウェア状態を読み取り、ファイルパーサー、ネイティブスクリプト、サービスAPIを通じて意味的なアクションを実行する。380件のタスクで画面操作を大幅に上回ったが、この比較ではエージェントが参照できる情報と操作の粒度も同時に変わっているため、単純にモデル能力の向上と解釈することはできない。
代理與實體系統
Model Hardware Standardは、設備の状態と操作を、検出可能な`read`や`write`などのプリミティブとして抽象化し、MCP、CLI、またはプログラミングインターフェースからオーケストレーションできるようにする。すでに液体ハンドラー、ロボットアーム、量子コンピューター用レーザーで利用されているが、仕様とコードはまだ公開されておらず、安全性に関する根拠の大半はパートナー企業による概念実証に基づいている。
推論基礎設施
GoogleとvLLMは、Qwen3埋め込みモデル向けにテンソルのアラインメント、コンパイルのウォームアップ、分割をまたいで蓄積可能なpooling状態を追加した。公式発表では4基のIronwood TPU上で約8万4,000 token/sを記録したが、同等コストのGPUとの比較や実環境での検索品質テストはまだ示されていない。
多模態模型
Googleは対話型動画モデルを正式版へ移行し、開始・終了フレーム間の補間、最長40秒までのシーン延長、4段階の解像度制御を追加した。新しいインターフェースによりワークフローの制御性は高まったが、1080pと4Kはいずれもアップスケーリングで生成され、複雑な動きや文字の一貫性には依然として限界がある。
多模態評測/AI 安全
新たな共有タスクでは、回答全体が信頼できるかを判定するだけでなく、視覚言語モデルのハルシネーションを文字単位で特定し、分類することが求められる。27チームが600超のシステムを提出したが、非公開テストと隣接順位の不安定さにより、導ける結論には限界がある。
AI coding/軟體工程研究
研究チームは、企業の441リポジトリを基に4段階のRepository AI Maturity Profileを構築し、coding agentを導入した509件のオープンソースプロジェクトを再分析した。共通ルールやagent設定を備えるリポジトリは品質指標が良好だったが、観察研究であるため、設定ファイル自体が改善をもたらしたとはまだ証明できない。