全ニュース

技術ニュース 989 件

AI 基礎設施

Hetzner、OpenAI互換の推論APIを試験提供――単一のFP8 MoEモデルで欧州ホスティング需要を検証

Hetznerは実験的なLLM推論サービスをひっそりと公開した。現在利用できるのはQwen3.6-35B-A3B-FP8のみで、既存のOpenAI SDKからbase URLを差し替えるだけで接続できる。コミュニティによる低負荷テストでは、最初のtokenが返るまでの時間の中央値は153ミリ秒、生成速度は約224 token/sだった。ただし、SLA、課金、プロダクション利用の保証はない。

AI 研究與推論

100万tokenは利用可能なメモリを意味しない:実測で少数のretrieval headsが長文コンテキストのボトルネックと判明

未公開の27Bハイブリッドモデルを対象とした推論時の実験では、約100万tokenにおける埋め込み情報の再取得率は21.4%にとどまり、3.3万token時の92.9%を大きく下回った。位置スケーリング、attention temperature、高精度KV cacheのいずれも問題を顕著には改善せず、検索能力は18個のattention headに高度に集中していた。

AI 評測與安全

QuantiBias、量子化モデルは短形式の安全性テストを通過しても、自由回答ではなお約4分の1がステレオタイプを生成すると指摘

QuantiBiasはモデルとプロンプトを固定し、重みの精度のみを変更して、量子化前後における多言語の自由回答バイアス、回答拒否、選択式問題の性能を測定した。著者らは、一般的な短形式の安全性指標はおおむね横ばいだった一方、独立した評価モデルが自由回答の約24~27%をステレオタイプ支持と判定したことを明らかにした。

推論與量化

DiffusersがNunchaku Liteをネイティブ統合、W4A4を中核に拡散モデルのVRAM使用量とレイテンシを削減

Hugging Face DiffusersはNunchaku Liteのチェックポイントを直接読み込み、4-bitの重みとアクティベーションで拡散Transformerを実行できるようになった。公式の単一GPUテストでは、ピークVRAM使用量を最大で約半減し、1.8倍の高速化を達成したが、対応ハードウェアの範囲と画質検証は依然として限定的だ。

機器人與模擬

NVIDIA、医療ロボット向け物理シミュレーションフレームワークをオープンソース化、8,192の並列環境でカテーテル方策を訓練

NVIDIAはMedical Physics SimulationをIsaac for Healthcareに統合し、血管、柔軟な器具、接触摩擦、X線センシングをシミュレーションしたうえで、GPU並列環境を用いてロボット方策を訓練する。公式デモでは、5時間以上かかっていた訓練を2分未満に短縮したが、シミュレーション速度は臨床的有効性や安全認証を意味するものではない。

代理框架與標準

GitHub MCP ServerがステートレスMCPを先行サポート、新版では接続フェーズと共有sessionストレージを廃止

GitHub MCP Serverは、7月28日に仕様確定予定のMCP `2026-07-28`をすでにサポートしている。リモートリクエストは`initialize`ハンドシェイクやプロトコル層のsessionに依存しなくなった。新設計により水平スケーリングは簡素化されるが、Tasks、エラーコード、カスタムクライアントには依然として互換性対応が必要だ。

AI security research

32体のKimi K3エージェントが協調してRedisのメモリ脆弱性を発見、公式が複数のバージョンブランチを修正

研究者は、32体のKimi K3エージェントを使ってfuzz harnessの自動生成、クラッシュ解析、Redisのリモートコード実行PoC作成を行い、最速の攻撃チェーンは27分で完成したと主張している。Redisは関連する`RESTORE`のメモリ問題を修正済みだが、攻撃には有効な認証情報と特定コマンドの実行権限が必要であり、エージェントの自律性や「19件のゼロデイ」という主張は、現時点では主に研究者自身の説明に基づいている。

AI coding tools

AlibabaがOpen Code Reviewをオープンソース化、決定論的パイプラインでLLMのレビュー範囲とコメント位置を制約

Open Code Reviewは、ファイルのフィルタリング、ルールのマッチング、コメント位置の特定を決定論的なプログラムに任せたうえで、LLMエージェントにリポジトリ内のコンテキストを検索させ、欠陥を判定させる。公式の自己評価では、token使用量はClaude Codeのおよそ9分の1だが、precisionと引き換えにrecallが低く、既存のテストや静的解析を直接置き換えるものではない。

AI 程式工具

Antigravity CLI 1.1.6、カスタムエージェントの定義をMarkdownに移行し、ツール継承とコマンドポリシーをバージョン管理下へ

Google Antigravity CLIは、`agent.md`を使ってメインエージェントとサブエージェントを作成する仕組みを追加し、frontmatterでMCPの継承、可視性、コマンド実行ポリシーを制御できるようにした。新バージョンではコード検索のストリーミング表示とエージェント監視も改善されたが、ファイルベースのポリシーが信頼できるセキュリティ境界として機能するかは、引き続き実証が必要だ。

模型與開發者平台

Microsoft、MAI-Image-2.5-ProとMAI-Voice-2-Flashを発表、自社開発モデルで品質とコストの曲線を切り分け

Microsoftは、最高画質の画像生成モデルと高スループットの音声モデルをFoundryのパブリックプレビューで同時に提供開始し、それぞれ高精度な編集とリアルタイム音声エージェントをターゲットに据えた。公式は本番環境における複数のコストおよびレイテンシデータを公表したが、プロバイダー横断の比較には依然として一貫性と再現性のあるテスト条件が欠けている。

語音 AI/推論系統

SGLang-OmniがMOSS-Transcribe-Diarizeに対応、複数話者文字起こしを連続バッチ処理サービスに統合

SGLang-OmniにMOSS-Transcribe-Diarizeのデプロイ経路が追加され、OpenAI互換エンドポイントからセグメントごとのタイムスタンプ、テキスト、話者ラベルを一度に出力できるようになった。これにより、0.9Bのオープンモデルをオンラインサービスへ導入しやすくなる一方、公式性能データに使用された3つの評価データセットは、現時点で完全には公開されていない。

開放模型/代理基礎設施

Solar Open 2、ハイブリッド線形アテンションで250B MoEのコンテキストを100万tokenに拡張

UpstageはSolar Open 2の重みを公開した。総パラメータ数250B、token当たりの有効パラメータ数15Bで、長時間にわたるエージェント型ワークフローを処理する。softmax attentionとKV cacheを維持するのは全レイヤーの4分の1にすぎないが、100万tokenの処理能力と韓国語オフィスエージェントでの性能は、依然として主にチームによる自己評価に基づいている。