SURL AI News

モデル、AI ソフトウェア、半導体、OSS、研究、基盤技術を中心にした AI ニュース。

本機 AI/開發平台

Microsoft Project Zenith、ローカル30Bモデルとエージェント隔離レイヤーを開発者向けWindowsデバイスに統合

Project Zenithは、64GB以上のユニファイドメモリと250GB/sの帯域幅を備えたデバイス向けに事前構成されたWindows 11開発環境で、第一弾としてAMD Ryzen AI Haloに搭載される。ローカルモデル、WSLツールチェーン、エージェントコンテナを単一のプラットフォーム構想にまとめるが、現時点のMXCはセキュリティ境界とは見なせない初期プレビュー段階にある。

推論系統

SGLang 0.5.19がBeam Searchを追加し、NVIDIA/AMD間の推論パスを再編

SGLangの新バージョンでは、同一サービス内で`beam_width`を指定して複数の候補シーケンスを返せるようになり、統一radix treeが全モデルのデフォルトキャッシュとなった。MoE、長コンテキスト、ROCmカーネルも拡充された一方、依存関係や設定動作に変更があるため、アップグレード前の再検証が必要だ。

代理基礎設施

AWS、AgentCore のメモリ廃棄フローをオープンソース化——スケジュール型ワークフローで組み込み TTL の不足を補完

AWS は、長期稼働するエージェントのメモリを定期的に評価、統合、削除する、CDK でデプロイ可能なリファレンスアーキテクチャを公開した。これは AgentCore の新しいネイティブ TTL 機能ではなく、サンプルのドキュメントとリポジトリでは、評価式の説明がまだ完全には一致していない。

模型訓練研究

補助的視点の実験:同じ知識を教材・Q&A・記事に書き換える方が、原文を繰り返すよりモデルの学習に有効

ペンシルベニア大学の研究者らは、知識に割り当てるtoken予算を固定したうえで、原文の反復の一部を複数の概念的表現に置き換え、事実の想起と推論を改善した。効果は主に7B以上のモデルで確認されたが、実験は短期間の継続事前学習にとどまり、フロンティアモデルの完全な事前学習へ直接一般化することはできない。

最新レポート

全ニュースを見る
本機推論/開發工具

Ollama 0.34 RC、ローカルモデルをChatGPT Desktopに接続——ツール検索とレスポンス圧縮の互換性も強化

OllamaのmacOSアプリから、ローカルのオープンモデルを新版ChatGPT Desktopへ直接接続できるようになった。ただし、現時点ではリリース候補版であり、クラウドモデルへ切り替えられないUI上の問題もコミュニティから報告されているため、そのまま大規模展開するのは適切ではない。

AI 程式工具

Qwen Code 0.23、マルチエージェントワークフロー制御と階層型メモリ権限を常駐サービスに統合

新バージョンでは、権限境界を備えたプロジェクト/ユーザーメモリ、一時停止と再試行が可能な Workflow API、並行実行および切り替えが可能な名前付きタスクが追加された。また、プライベート Git 拡張機能とローカル operator API の到達範囲も拡大しており、企業は導入時にネットワークと認証の境界を再確認する必要がある。

模型評測

NVIDIAの競技プログラミングモデル、760基のGPUでテスト時計算をスケール――非公式スコアでIOI人間最高得点を上回る

Nemotron-3-Ultra-CCはIOI 2026の問題で535.4/600点を獲得し、公式の人間最高得点498.27点を上回った。鍵は550Bモデルだけではなく、GenCorrectで大量の候補プログラムを繰り返し生成、テスト、修正する手法にある。この実行では最大760基のGB300が使用された。

代理應用

AWS、テキスト・ボイスメッセージ・通話を横断するWhatsApp AgentCoreリファレンスアーキテクチャをオープンソース化

AWSは、CDKでデプロイ可能な飲食店向けエージェントのサンプルを公開した。3つの分離されたRuntimeが同一のMemoryとMCPバックエンドツールを共有する。音声経路にはNova 2 Sonicのspeech-to-speechを直接採用する一方、WebRTC、TURN、ID連携、固定ネットワークコストについては、引き続き利用者側での管理が必要となる。

AI 安全

ASCII Smuggling、プロンプトインジェクションからメール攻撃へ――不可視Unicodeが分類器のトークン化を撹乱

Microsoftは、フィッシングメールが金融関連のキーワードに不可視のUnicode Tag文字を挿入し、ルールや機械学習分類器が認識するtokenを変化させていることを発見した。攻撃はピーク時に1日230万通を超え、AIレッドチームの技術が従来型のサイバーセキュリティ攻防へ逆流し始めたことを示している。

代理框架

LangChain 1.4、MCPをコアパッケージに統合し、ステートレスプロトコル、ツール一覧のキャッシュ、実行途中の問い合わせをサポート

新しい `langchain.mcp` は、FastMCPによって接続、認証、プロトコルネゴシエーションを統合し、独立したadapterパッケージを置き換える。サーバーはツールの実行途中に追加情報や承認を要求でき、LangChainはその一時停止地点を再開可能なLangGraph interruptへマッピングする。

推論基礎設施

SGLang、GPU不要のSimulatorを正式ドキュメントに追加――レイテンシ予測で推論トラフィックをリプレイ

SGLang SimulatorはCPU上でランタイムコンポーネントをインターセプトし、モデルの実ロードやGPUカーネルの実行なしに、スケジューリング、バッチ処理、多階層KV cacheをシミュレートする。チームは、H20上の2種類のQwen3で主要指標の誤差が5%未満だったとしているが、ハードウェアとモデルのカバレッジは依然として限定的だ。