全ニュース

技術ニュース 966 件

代理評測

Terminal-Bench-Science 0.1、70件の実践的な科学研究ワークフローでエージェントを評価、最高解決率はわずか30%

Stanford主導のオープンベンチマークは、データ分析、シミュレーション、定理証明、機器校正などの科学研究を再実行可能なターミナルタスクとしてパッケージ化した。Claude Codeと組み合わせたClaude Opus 5が首位となったが、3回の試行後も解決率は30%にとどまり、一般的なcoding benchmarkでの高得点を科学研究へそのまま外挿できないことを示している。

AI 評測與安全

Google、H100セキュアエンクレーブで二重盲検モデル評価を実証—モデル重みと非公開問題セットを相互に開示せず

Google DeepMind、MLCommonsなどの機関は、Gemini 2.5 Flash Liteと非公開の安全性評価問題セットを、検証可能な同一のセキュアエンクレーブ内に投入し、双方が取得できる結果を制限した。この設計はベンチマーク汚染のリスクを低減する一方、信頼は依然としてハードウェアのルートキー、Trusted Computing Base(TCB)、機関横断のコードレビューに依存する。

AI 開發工具

OpenAI、11月12日にCursorへのモデル提供を停止する意向──既存のエージェントルーティングは再検証が必要

OpenAIは、CursorがSpaceXに買収されたことを受けて契約終了手続きを開始し、今後のモデルもCursorには提供しない方針を示した。Cursorの現行ドキュメントでは、ルーティング、エンタープライズ向け許可リスト、ユーザー所有のAPI keyが契約終了後に具体的にどう動作するかはまだ説明されておらず、エンジニアリングチームはモデルの置き換えを無痛の切り替えと捉えるべきではない。

文件 AI/推論最佳化

2段階の表圧縮:まず64個の視覚tokenで表を特定し、次に元の解像度で推論

エディンバラ大学の研究により、低解像度の表は数値の直接読み取りには適さないものの、VLMが関連性を判断するには十分であることが示された。学習不要の2段階フローは、長文書テストでdecoder tokenを41%削減し、すべての表を元の解像度で1回だけ推論する方式より精度が7.1ポイント高かった。

AI 評測/資料科學代理

DeepChart、AIによるグラフ作成のデータ経路を段階別に検証――グラフが実行可能でもデータが正しいとは限らない

DeepChartは1,482件の事例を用いて、データ抽出、数値導出、グラフ描画を個別に評価し、見た目の評価に隠されたデータ・ハルシネーションを明らかにした。超長文の10-Kを入力すると、ソースデータの平均F1が0.385から0.167に低下しており、コンテキストウィンドウの拡大だけでは根拠の特定に代えられないことを示している。

AI 基礎設施/資料中心

AWS、初のVera CPU/Vera Rubinシステムを受領、2年間でNVIDIA GPU 200万基の追加導入を計画

AWSは初のVera CPUサーバーおよびVera Rubin GPUを受領した。両社はさらに、2027~2028年にNVIDIA GPUを200万基追加配備する計画だ。この協業では、NVLink Fusion、NVHBM、Nitro、EFAも異種混載ラック設計に組み込まれるが、容量と性能の大半は依然として将来の計画値にとどまる。

AI 軟體/文件處理

Cohere Parse 5、2.3Bビジュアルモデルで企業文書を処理。ただしベンチマークスコアはグラフとレイアウト位置特定を除外

Parse 5はPDF、プレゼンテーション、画像を、表と読み順を保持したMarkdownに変換する。API料金は1,000ページ当たり1.50米ドル。公式発表のParseBenchスコア79.2は、5つの評価軸のうち3つのみを対象としており、文書理解全体の成績とはみなせない。

Developer platforms / enterprise AI

GitHub、Web版Copilotをagent sessionsへ移行へ。会話の保存期間を28日間からアカウント存続期間へ変更

GitHubは早ければ9月28日から、Web版、モバイル版、cloud agentのエクスペリエンスとポリシーを統一し、デフォルトで有効にする予定だ。同時に、Copilot code reviewのデフォルト分析レベルはLiteからBalancedへ引き上げられ、1回あたりの推定AI creditsコストも大幅に増加する。

AI coding tools / security

Claude Code 2.1.251、シンボリックリンクによる境界外の読み書きを修正し、モデル切り替えフックを追加

Anthropic は、2.1.248 の restricted モード導入に続き、ファイル、プラグイン、設定の信頼境界に関する5種類の問題を修正した。新バージョンではモデル切り替え hook と prompt cache 指標も公開され、企業向けゲートウェイが切り替えをインターセプトし、再キャッシュのコストを追跡できるようになった。

AI 推論系統/開發工具

TensorRT Model Connect、モデルの checkpoint をネイティブ C++ bundle にコンパイル――ただしインターフェースは未確定

NVIDIA は TensorRT Model Connect を公開した。Python ビルドツールを使い、対応する Hugging Face checkpoint を C++ から読み込める TensorRT bundle にパッケージ化する。プロジェクトではモデルファミリー84種とエンドツーエンド manifest 221件を掲げているが、依然として nightly 開発モードであり、サポート一覧への掲載は、すべてのハードウェアで検証済みであることを意味しない。

開放模型/AI 程式設計

GLM-5.3が744B MoEの重みを公開、100万トークンのデプロイには依然としてデータセンター級リソースが必要

Z.aiはAPI公開から2週間後にGLM-5.3の重みをリリースした。モデルはGLM-5.2の基本アーキテクチャを踏襲し、能力向上の大部分はエージェント型コーディングとサイバーセキュリティのポストトレーニングによるものだ。FP8ファイルは依然として約756GBに達し、カスタムライセンスやベンダー主導の評価もあるため、実際の採用前には性能、安全性、法的側面を別途検証する必要がある。

開放模型/持續訓練

Thomson-1.0-Small、200Bトークンの継続学習で専門能力を強化するも、重みのライセンスが本番利用を制限

Thomson ReutersはQwen3.6-35B-A3Bをベースに、総パラメータ数35B、推論時の有効パラメータ数3BのThomson-1.0-Smallを公開した。法律、税務、リサーチエージェントの評価では性能が向上したが、結果の大半は開発チーム自身による測定であり、PolyForm Strictも一般的なオープンソースライセンスではない。