全ニュース

技術ニュース 957 件

AI 基礎設施

AWS、HyperPod InstantStartをオープンソース化――人間の操作とAIエージェントを同一の管理APIで駆動

HyperPod InstantStartは、EKS、GPUキャパシティ、トレーニング、推論、ストレージの操作を、再試行可能なステートフルワークフローとしてオーケストレーションし、MCPツールを介してエージェントに実行させる。エージェントがAWS CLIを直接操作することはないが、デプロイ担当者は引き続きIAM、Kubernetes、ネットワーク、サービス横断のコスト管理を自ら担う必要がある。

電腦視覺

Scal3R、多参照フレームへの姿勢クエリで長時間動画の3D再構成ドリフトを補正、追加学習パラメータは約1%のみ

Scal3RはCUT3RまたはSTream3Rのバックボーンを凍結したまま、軽量なクエリトークンを使って複数の過去キーフレームに対する相対姿勢を推定し、オンライン姿勢グラフ最適化に渡す。著者らはKITTIにおいて、平均ATEが最も強力なオンライン競合手法を60%以上下回ったと報告している。ただし、結果はSim(3)アライメント後の値であり、実スケールが保持されていると直接解釈することはできない。

語音模型

VibeVoice-ASR-Streaming、逐次認識と話者帰属を統合し、1.5B・7Bの重みをオープンソース化

Microsoft Researchのストリーミング音声モデルは、音声チャンク、短い先読み、既存のトランスクリプトを交互に処理し、「誰が何を話したか」を直接出力する。公開版は10言語とカスタムホットワードに対応する一方、話者帰属の期待遅延は依然として2秒で、長時間の重複音声では性能が低下する。

推論系統

Declarative Attention、モデル自身がKV cacheの読み取り範囲を指定――長文コンテキストのデコードで参照トークンを3割超削減

KAISTとGoogle DeepMindは、既存モデルが推論テキスト内でグローバル、フォーカス、ローカルの各注意モードを切り替えられるDeclarative Attentionを提案した。著者らは2つのモデルでattended tokensを31.1%~52.0%削減したが、速度向上は依然として主にモデルによる推計であり、精度もわずかに低下した。

代理框架與 MCP

Agno 3.0.6、通知とストリーム再開を断念する代わりにMCPサービスのステートレスな水平スケーリングを実現

Agno 3.0.6はステートレスMCPトランスポートを追加し、session affinityを設定しなくても、どのレプリカでもリクエストを引き継げるようにした。同時にプロトコルバージョンネゴシエーションとServer Cardも導入したが、既存デプロイとの互換性を維持するため、従来のセッション方式が引き続きデフォルトとなる。

向量資料庫與 AI 基礎設施

Qdrant 1.19.1、プリフェッチとバッチ SIMD で量子化ベクトル検索パスを刷新

Qdrant 1.19.1では、TurboQuantのスコアリングにプリフェッチとバッチ化されたSIMDを導入し、HNSW検索およびクエリプレーンでの余分なメモリ割り当てを削減した。シャード転送の障害復旧も強化されたが、プロセッサやデータセットの違いを網羅する総合的な性能比較は、公式にはまだ公表されていない。

AI 輔助科學研究

AIセグメンテーションと人手による校正で雄ショウジョウバエの全中枢神経系コネクトームが完成、1億2,500万シナプスを公開

Google Research、HHMI Janelia、ケンブリッジ大学のチームが、脳と腹側神経索を網羅する雄ショウジョウバエのコネクトームを完成させた。16万6,000個超のニューロンを収録し、データと検索ツールも公開されたが、単一個体の静的な配線図だけでは神経活動や行動の因果関係を直接説明できない。

模型與推論系統

GLM-5.3-Flash、ハイブリッド疎/線形アテンションで100万token推論のコストを圧縮

智譜は、総パラメータ数320B、token当たり18Bをアクティブ化するネイティブ・マルチモーダルモデルGLM-5.3-Flashを公開し、重みをMIT Licenseでリリースした。新アーキテクチャはGLM-5.3と比べ、アテンション計算量を3分の1、KV cacheを約4.4分の1に削減するとしているが、「Flash」といっても一般的なワークステーションで容易にデプロイできるわけではない。

推論系統

Uno、離散拡散で自己回帰モデルを支援し、独立したドラフトモデルなしで並列デコードを実現

Unoは、自己回帰LLMに軽量な拡散重みを追加し、Ψ-Specによって複数のtokenを一度に提案しながら、元のモデルのサンプリング分布を維持する。著者らは最大3倍の高速化を報告しているが、現時点の数値は研究チームが使用した特定のモデル、ハードウェア、推論エンジンに基づくものだ。

世界模型與生成式影音

Runway GWM Worlds 2、スライディングKVキャッシュで720pインタラクティブ映像を連続生成

GWM Worlds 2は、自己回帰拡散、因果映像デコーダー、構造化されたWorldPromptを組み合わせ、テキストによるアクション指示とカメラ信号で連続的な世界をリアルタイム制御できる。システムは依然としてクローズドな研究プレビュー段階にあり、高速なカメラワーク、長期的一貫性、再現可能な評価には明らかな課題が残る。

AI 搜尋與安全

Perplexityの引用監査、関連する3サイトが21万件超のソフトウェアランキングページを生成していたと判明

研究者はSonarへの760回のクエリから7,534件の引用を収集し、ロングテールサイトがレコメンデーションシステムの検索証拠に大量に入り込んでいることを突き止めた。同一運営者が関与している疑いのある3サイトが占める引用は2.4%にすぎず、これらのページが実際に推薦結果を変えたことも研究では証明されていない。