全ニュース

技術ニュース 953 件

AI 程式工具

Qwen Code 0.23、マルチエージェントワークフロー制御と階層型メモリ権限を常駐サービスに統合

新バージョンでは、権限境界を備えたプロジェクト/ユーザーメモリ、一時停止と再試行が可能な Workflow API、並行実行および切り替えが可能な名前付きタスクが追加された。また、プライベート Git 拡張機能とローカル operator API の到達範囲も拡大しており、企業は導入時にネットワークと認証の境界を再確認する必要がある。

模型評測

NVIDIAの競技プログラミングモデル、760基のGPUでテスト時計算をスケール――非公式スコアでIOI人間最高得点を上回る

Nemotron-3-Ultra-CCはIOI 2026の問題で535.4/600点を獲得し、公式の人間最高得点498.27点を上回った。鍵は550Bモデルだけではなく、GenCorrectで大量の候補プログラムを繰り返し生成、テスト、修正する手法にある。この実行では最大760基のGB300が使用された。

代理應用

AWS、テキスト・ボイスメッセージ・通話を横断するWhatsApp AgentCoreリファレンスアーキテクチャをオープンソース化

AWSは、CDKでデプロイ可能な飲食店向けエージェントのサンプルを公開した。3つの分離されたRuntimeが同一のMemoryとMCPバックエンドツールを共有する。音声経路にはNova 2 Sonicのspeech-to-speechを直接採用する一方、WebRTC、TURN、ID連携、固定ネットワークコストについては、引き続き利用者側での管理が必要となる。

AI 安全

ASCII Smuggling、プロンプトインジェクションからメール攻撃へ――不可視Unicodeが分類器のトークン化を撹乱

Microsoftは、フィッシングメールが金融関連のキーワードに不可視のUnicode Tag文字を挿入し、ルールや機械学習分類器が認識するtokenを変化させていることを発見した。攻撃はピーク時に1日230万通を超え、AIレッドチームの技術が従来型のサイバーセキュリティ攻防へ逆流し始めたことを示している。

代理框架

LangChain 1.4、MCPをコアパッケージに統合し、ステートレスプロトコル、ツール一覧のキャッシュ、実行途中の問い合わせをサポート

新しい `langchain.mcp` は、FastMCPによって接続、認証、プロトコルネゴシエーションを統合し、独立したadapterパッケージを置き換える。サーバーはツールの実行途中に追加情報や承認を要求でき、LangChainはその一時停止地点を再開可能なLangGraph interruptへマッピングする。

推論基礎設施

SGLang、GPU不要のSimulatorを正式ドキュメントに追加――レイテンシ予測で推論トラフィックをリプレイ

SGLang SimulatorはCPU上でランタイムコンポーネントをインターセプトし、モデルの実ロードやGPUカーネルの実行なしに、スケジューリング、バッチ処理、多階層KV cacheをシミュレートする。チームは、H20上の2種類のQwen3で主要指標の誤差が5%未満だったとしているが、ハードウェアとモデルのカバレッジは依然として限定的だ。

開源推論系統

Paddock、Rust/CUDA推論エンジンをオープンソース化――単一NVIDIA GPUでのエージェント同時実行に照準

Truesparは、Paddockのスケジューラ、ページングKV cache、メモリ管理、独自CUDA kernelsを公開し、OpenAIおよびAnthropic互換インターフェースも提供する。開発者によるベンチマークでは、一部の単一GPUワークロードでvLLMとSGLangを上回ったが、独立した再現検証はまだなく、tensor parallel、ROCm、Metalには対応していない。

代理訓練研究

DRACO、動的ルーブリックでエージェントの各ステップに強化学習のクレジットを割り当て、タスクの正解を参照せずに訓練

IBM Researchとカーネギーメロン大学のチームは、評価モデルに軌跡グループごとのルーブリックを生成させ、全体報酬を関連するステップへ再配分する手法を開発した。AppWorldでは15.9ポイント向上したが、正確性は依然として、人手で検証されていないモデル評価に左右される。

模型與開發者平台

GPT-6 Astra API、非同期ツール呼び出しとターン途中のステアリングに対応――サイバーセキュリティ能力は初のCritical評価

OpenAIの新たなフラッグシップモデルは、ツールをバックグラウンドで実行しながら推論を継続でき、WebSocket経由で実行途中の修正も受け付ける。強化されたエージェント能力に伴い、新たな移行上の制約が加わったほか、サイバー攻撃能力が初めてCriticalレベルに達した。

代理框架

Pydantic AI 2.40、リアルタイム音声エージェントに再生進捗を補正可能な割り込み機能を追加

新バージョンでは、ユーザーが発話を割り込ませた際、実際に再生された音声バイト数に基づいて応答を中断し、会話状態を同期できる。さらに、帯域外プロンプトキューとイベントリスナーインターフェースが追加され、リアルタイムエージェントですべての制御信号をユーザーターンに偽装する必要がなくなった。

推論系統

llama.cpp 0.4.0、大規模モデル読み込み時のメモリ使用量ピークを遅延テンソル読み込みで低減し、Qwen3.8の新アーキテクチャにも対応

新バージョンでは`--lazy-mode`、量子化処理用ワーキングメモリの上限、行単位のスラブストリーミングが追加され、超巨大テンソルをRAMへ一括ロードする必要がなくなった。Qwen3.8-Flash-NextとNemotron-3-Puzzleも初期対応となったが、前者のパフォーマンス最適化と一部ハードウェアとの互換性には、なお改善の余地がある。