全ニュース

技術ニュース 968 件

開放模型與視覺生成

SenseNova-U1.5正式版の重みは実際には約175億パラメータ、Hubのクイックロード経路には依然として必要なコードが欠落

SenseNova-U1.5-8B-MoT正式版は、同一のバックボーンで視覚理解、ネイティブ画像生成、画像編集をサポートし、モデルカードには実際の規模が18Bと記載されている。第三者によるONNX移植の検証では、Hugging Faceの`trust_remote_code`設定が、重みとともに公開されていないファイルを参照していることが判明しており、現時点でデプロイするにはGitHubのリファレンス実装を併用する必要がある。

代理標準與開發平台

AWS、ARDフェデレーション型ディスカバリー仕様を紹介:すべてのschemaをコンテキストに詰め込まず、エージェントが先にツールを検索

ARDは、統一されたREST検索インターフェースと`ai-catalog.json`を通じて、エージェント、MCP server、Skills、API、ワークフローを記述する。AWSはこれをAgent Registryのクロスクラウド相互運用レイヤーと位置付けている。ただし、仕様は現在もv0.9 Proposalであり、アイデンティティ、ランキング、実際の認可はディスカバリーレイヤーでは統一的に処理されない。

推論系統與評測

AgentX、長コンテキスト・エージェント推論の結果を公開――固定長ストレステストを実際のワークセッション形状で置き換え

SemiAnalysisは、AgentXのリアルタイム結果と完全なリプレイツールを公開した。複数ターンにわたるコーディングエージェントの軌跡を用いて、GPU、推論エンジン、キャッシュ設計を比較する。公開コーパスでは、リクエスト長、共有プレフィックス、休止、サブエージェントのトポロジーを維持しつつ、元のプロンプトとコードを合成コンテンツに置き換えている。

AI 安全與開發者平台

Google Agent Identity 認証マネージャーが正式提供開始、エージェント認証情報をアプリケーションコードから独立したコントロールプレーンへ移行

Google Cloud は Agent Identity auth manager と関連する2つの API の一般提供を開始し、エージェントが外部ツールを呼び出す際に必要な OAuth と API key を一元管理する。従来の IAM Connectors API は GA へ移行しないため、既存のプレビュー版統合は移行が必要となる。

模型與企業 AI

Thomson Reuters、法律モデル「Thomson」を発表:Snowdonの重みを継続学習し、まずCoCounselの文書レビューに導入

Thomsonは、Imperial College LondonのオープンウェイトモデルSnowdonを基盤とし、WestlawやPractical Lawなどの独自データと法律専門家のフィードバックを用いて中間学習とポストトレーニングを実施した。公式評価では、引用の検証可能性が汎用フロンティアモデルを上回ったとされるが、完全な技術レポートの公開と独立した検証はまだ完了していない。

代理評測

FINCHAL、エージェントの直接参加を開放――ゼロスキル・シミュレーションと将来価格で運と予測能力を切り分ける

FINCHALは、リモートMCPツールを通じて人間とAIエージェントが同一インターフェースから4種類の資産のロング/ショート・ポジションを提出し、将来の市場データでリアルタイムに採点できるようにする。まず20,000件のランダム戦略をシミュレーションして「運の上限」を設定するが、フルシーズンでは比較可能なモデル結果がまだ得られていない。

推論系統與基準測試

Atlas、同一の推論コアで NVIDIA と AMD の MLPerf エッジエージェント・テストに提出、結果は依然として解禁待ち

Rust/CUDA 推論エンジンの Atlas は、GB10 および AMD gfx1151 システムを使用して MLPerf Inference 6.1 に提出した。テスト対象は、単一アクセラレータ上での複数ターンのツール呼び出しだ。提出状況は公開されているものの、スループットとレイテンシの結果は依然としてエンバーゴ下にあり、現時点でクロスハードウェア性能を判断することはできない。

AI 程式代理

Autolith 0.38、プロバイダーとSkillsプロトコルを独立ライブラリに分離、エージェント本体は引き続きリアルタイムで自己書き換え可能

Common Lisp製プログラミングエージェントのAutolithは、2日間で0.36から0.38までを相次いでリリースし、標準Agent Skills、NousおよびMistralバックエンド、クロスプラットフォーム配布パッケージを追加した。復旧・リプレイ可能な自己変更設計により検査可能性は高まるが、生成されたプログラムは依然としてユーザー権限で実行されるため、安全なサンドボックスとは見なせない。

代理開發平台

Claudeのcomputer useツール正式版が複数アクションターンを採用、旧エージェントループは実行順序と中止セマンティクスへの対応が必要

Anthropicはcomputer use、Skills API、Files APIを正式提供し、ページ構造を読み取れるbrowser useも追加した。新しい`computer_toolset_20260801`では、1回のモデル応答で複数の順序付きアクションを出力できるため、最初の`tool_use`ブロックしか処理しない旧来の統合は正常に動作しない。

代理框架與安全

NemoClaw 0.0.114、読み取り専用MCP呼び出しをモデルの意思決定経路から分離し、イメージとインストールの検証を厳格化

NVIDIAはLangChain Deep Agents Codeに決定論的な読み取り専用MCP呼び出しを追加し、モデルを介さずに制限付きツールを実行できるようにした。新バージョンではコンテナイメージのdigest固定、サプライチェーン検証、機密情報を含むエクスポートのクリーンアップも強化されたが、「読み取り専用」であるかどうかは依然としてツールの登録情報の正確性に左右される。

代理式資料工程

AWS、ADOPをオープンソース化:マルチエージェントでデータパイプラインを生成し、本番環境では決定論的な成果物のみを実行

ADOPでは約15のエージェントが、自然言語の仕様からETL、品質ルール、セマンティックレイヤー、DAG、インフラストラクチャ設定を生成する。意図的にモデルの利用を開発段階に限定し、本番環境には人によるレビューとCI/CDによる検証を経たコードだけをデプロイする。

生成式影片

Wan3.0が正式リリース:1回の生成で最長30秒の音声付き動画、文書やWebページも直接入力可能

Alibabaは8月初旬に招待制テストを開始したWan3.0を正式に市場投入し、テキスト、画像、音声・動画、文書、Webページを参照入力として統一的にサポートする。APIは公開済みだが、モデルは依然として招待制テスト扱いで、重み、アーキテクチャ、独立評価はいずれも公開されていない。