全ニュース

技術ニュース 964 件

代理協定/供應鏈安全

MCP Registryの実測で隠れたシステムプロンプトが明らかに:接続可能な5,000超のサーバーがinstructionsを返却

Fetchgateが公式Registryに登録された15,329件のリモートURLに対して読み取り専用のハンドシェイクを実行したところ、接続可能な5,462エンドポイントがサーバーレベルの指示を送信していた。問題はプロンプトインジェクションだけでなく、ターンごとに繰り返し発生するコンテキストコストや、ツール間での暗黙的な優先順位争いにも及ぶ。

AI 程式開發工具

Qwen Code 0.22.3、チャットチャネルで8つの名前付きエージェントタスクを保持可能に。ただし作業ディレクトリは引き続き共有

新版の Channels では、チャネル、チャット、送信者ごとに最大8つの名前付きセッションを保持し、終了後も元の会話に再接続できる。これはマルチタスク管理であり、並列分離ではない。現時点では一度に選択できるタスクは1つだけで、すべてのタスクが同じ作業ディレクトリを操作する。

本機推論

KoboldCpp 1.120がDirectIO読み込みモードを追加、mmapとmlockの同時有効化も可能に

新版では大規模なGGUF重み向けに`--usedirectio`が追加され、mmapでモデルをマッピングする際に関連するメモリページをロックできるようになった。Qwen3.8-Flash-Next、Ling-3.0-flash、カスタムJavaScriptツールにも対応するが、公式から読み込み速度やメモリのベンチマークはまだ公表されていない。

語音模型與邊緣推論

Sopro V2 Turbo、120Mパラメータの音声モデルを公開——2ステップの音響ソルバーでCPUストリーミング合成

Sopro V2 Turboは、500Mパラメータの教師モデルを120Mパラメータへ蒸留し、さらにreflowによって音響ソルバーを32ステップから2ステップへ短縮した。M3 CPUでは約300ミリ秒で最初の音声チャンクを出力でき、ブラウザ推論にも対応するが、現時点で利用できるのは欧州の4言語のみで、訓練コードは公開されていない。

模型訓練與開源工具

Fizgig 5.0、ローテーション式トレーニングウィンドウにより33B動画モデルを16GB GPUでフルパラメータ・ファインチューニング

Fizgig 5.0は、現在のスライスの勾配とオプティマイザ状態だけを保持しながら、MiniMax H3とKrea 2の全重みを区間ごとに更新する。開発者の実測ではピークVRAM使用量を最低13GB未満に抑えたが、システムメモリ、学習速度、独立した品質検証が依然として主な制約となる。

多模態模型

Gemini Omni 1.1 Flash、10秒のコンテキストを基に動画を延長し、開始・終了フレーム制御にも対応

GoogleはGemini Omni 1.1 Flashを安定版APIとして提供開始した。シーン延長では直前の最大10秒間を参照でき、セグメント単位で最長40秒の動画を生成できる。新バージョンは開始・終了キーフレーム、360pドラフト、4K出力にも対応するが、公開されている品質データは依然としてGoogle独自の評価が中心だ。

代理架構與評測

SKILL.state、エージェントの実行履歴を破棄し、構造化状態によって100ステップのタスクのtoken使用量を16分の1に削減

Googleとパデュー大学の研究者は、エージェントが各ステップで固定されたスキル、現在の状態、最新の観察結果だけを読み込み、状態更新の検証後に推論履歴を直ちに破棄する仕組みを開発した。100ステップの倉庫タスクでは、65,408 tokenで0.94の精度を達成したが、その効果は、将来必要となる情報を保持できるよう事前設計された状態構造に依存する。

開放模型與推論

Hy4 Preview、770B MoEの重みを公開——疎な注意機構と組み込みMTPで長文コンテキスト・エージェントを狙う

Tencentは、Hy4 PreviewのApache 2.0ライセンスの重み、FP8版、およびvLLMとSGLang向けのデプロイ手順を公開した。このモデルは、770Bのパラメータのうちtokenごとに約49Bを活性化する。100万tokenのコンテキストに対応するが、品質と自己最適化の成果を裏付ける根拠は、現時点では主にTencentの内部評価に基づいている。

推論系統

llama.cpp、Adrenoの行列乗算ルーティングを改修――2世代のチップでプロンプトのプリフィルを9~25%高速化

llama.cpp b10687は、Snapdragon X2および旧世代のA7X GPUにおいて、OpenCLコンパイラが選択していた非効率な行列乗算パスを回避する。メンテナーの測定では、gpt-oss-20bとGemma 3nのプロンプトのプリフィルがそれぞれ約20~25%、9%高速化した一方、token単位のデコード速度は向上していない。

評測與資料集

Open ASR Leaderboardがヒンディー語とインド英語に対応、表記揺れを扱う参照ラティスでWERの偏りを是正

Hugging FaceとVoice Arenaは、Monsoonデータセットを用いてオープン音声認識リーダーボードを拡張した。4つの公開・非公開分割には4,888人の話者が含まれる。ヒンディー語では複数の許容可能な綴りを表現する参照ラティスを採用し、従来の単一転記によって正しい認識が誤りと判定される問題を回避する。

代理框架

Lemmalog、Datalogでエージェントの記憶を維持管理し、事実の撤回に応じて下流の結論を自動的に無効化

Lemmalogはエージェントの記憶を、LLMが抽出する事実と、ルールエンジンが維持管理する検証可能な状態に分割する。初期評価では、回答段階のコンテキストを大幅に短縮できることが示された一方、全体的な精度は依然として事実抽出とエンティティアライメントの制約を受けている。