全ニュース

技術ニュース 970 件

AI 評測與可靠性

ASR Benchmark Fitting、3種類のプローブで「答えの暗記」を定量化。一部モデルは誤った参照トランスクリプトを18~30%の確率で再現

Hume AIとHugging Faceは、音声が公開テストセットの正解と矛盾する場合でも、一部の高スコア音声モデルが参照トランスクリプトの内容を出力することを発見した。Open ASR Leaderboardには「Benchmark Fitting」タブが追加されたが、こうした挙動は、モデルがテストデータを直接見たことの証明にはならない。

邊緣 AI 與工具呼叫

Needle 2、4,500万パラメータのツールモデルを14MBに圧縮し、スキーマ文法でオンデバイス呼び出しを制約

Cactus Computeはこのほど、Needle 2のPython API、クロスプラットフォーム実行、Apache 2.0ライセンスを整備し、モデルカードも継続的に更新している。ピークメモリ28MBでツール選択と構造化抽出を実行するが、速度と精度に関する情報は依然として主に公式テストに基づいている。

AI 安全與代理基礎設施

Semantica 0.6.6、エージェントの知識パイプラインにおけるSSRF、インジェクション、認証情報漏えい経路を封鎖

Semantica 0.6.6は、ナレッジグラフのインポート、バックアップ、エクスポート、外部リクエストに関する複数種類の脆弱性を集中的に修正した。メンテナーは、すべてのデプロイ環境にアップグレードを推奨している。新バージョンでは、出典記録を保持できる事実の撤回機構とCrewAI統合も追加された。

推論系統

Yutori、ブラウザエージェントの推論アーキテクチャを公開:100Kの長い入力と短いツール出力、プレフィックスキャッシュでステップ当たりのコストを削減

YutoriのNavigatorは、ブラウザタスクごとに視覚言語モデルを数十回連続で呼び出し、履歴コンテキストは最大約100K tokenまで増加する。Together AIはvLLMのプレフィックスキャッシュとレイテンシ目標別のルーティングでこの負荷を処理するが、2倍の速度と4~5分の1の低コストという数値は、依然としてベンダーが公表した比較結果である。

代理框架

Hermes Agent 0.20.5、5プロバイダーによるAPIキー不要の検索に対応、スケジュールタスクごとに推論強度を設定可能に

Nous Researchは、APIキー不要のウェブ検索、スケジュールタスクのメモリ、実行停止への保護機能をHermes Agent 0.20.5に導入した。パッチ版と位置付けられているものの、約323件のPRがマージされており、完全な移行ガイドは0.21.0を待つ必要がある。

AI inference runtimes

Diffusers 0.40、Modular Pipelineを安定版APIへ移行する一方でJAX/Flaxを削除

Hugging Faceは、MiniMax H3、MiniMax Music 3、Wan-Animate-2をコンポーザブルなブロックとして直接組み込めるようにし、従来型のDiffusionPipelineラッパーを提供しない方針を採った。新バージョンでは、限定的なtensor parallel、低ビット量子化バックエンド、セキュリティ修正も追加されたが、Flaxの削除とLoRA出力の変更を伴う。

AI coding tools

Slack Codeはエージェントワークフローを共有チャンネルに移行、ただしカスタムエージェントAPIの全面公開はまだ先

Slack Codeでは、Claude、Devin、Copilot、ChatGPT、Vercelのエージェントが、プロジェクト専用チャンネル内で計画、コード差分、リアルタイムプレビューを提示できる。複数人でエージェントを監督するためのインターフェースは改善されるが、実行サンドボックス、認証情報、リポジトリ権限は引き続き各エージェントプロバイダーが管理する。

推薦系統

NVIDIA、生成レコメンデーションスタックのKVとbeam searchを刷新、5Kコンテキスト推論を2.27倍高速化

NVIDIAは、HSTU、動的embedding、Semantic IDによる生成レコメンデーションを、実行可能なPyTorchリファレンススタックとしてまとめた。「長い履歴、数tokenのみの生成、非常に大きなbeam width」というレコメンデーション特有の負荷に合わせ、キャッシュとデコード経路を刷新している。ただし、現時点のデータはNVIDIA製ハードウェアと合成構成に限られる。

推論系統

LFM2.5にDSparkドラフトモデルを追加、H100のデコードスループットが最大3.18倍に

Liquid AIは、3種類のLFM2.5モデル向けに約3億パラメータのDSparkドラフトチェックポイントを公開し、llama.cppとSGLangに統合した。公式テストでは、モデル、データ分布、ハードウェアによって高速化の度合いが大きく変動しており、ピーク値をすべてのワークロードで得られる効果とみなすことはできない。

多模態代理與評測

RuleMazeは視覚的プランニングをツール呼び出しに分解し、3Bモデルの未知ルール成功率を56.3%から88.0%に向上

RuleMazeは、実行可能な検証器を用いて、マルチモーダルモデルが迷路を理解し、自然言語のルールを守りながら経路計画を完遂できるかを評価する。DMPは知覚、移動、ルール検証を分離することで通常のファインチューニングを大幅に上回ったが、テストは依然として合成グリッドに限定され、検証器にも人手による修正が加えられている。

電腦操作代理

TMI、交錯するコンピューター操作からタスクツリーを再構築、ステップ記述精度が30.3%から74.9%に向上

Task Model Inductionは、画面と入力のログ全体を単一のワークフローに圧縮するのではなく、まず非連続のタスクを分離し、その後に目標階層とループ制御フローを再構築する。生成されたエージェントスキルのホールドアウト問題における精度は、最良ベースラインの14.29%から18.57%に向上した。一方、パイプライン全体がフロンティアモデルに依存し、生の操作トレースには重大なプライバシーリスクが伴う。

AI 代理與評測

AI4AI-Bench、エージェントに10種類の学習アルゴリズムの書き換えを要求――最高システムの平均スコアはわずか0.250

AI4AI-Benchは、ハイパーパラメータ調整と学習手法そのものの変更を分けて評価し、コーディングエージェントにゼロから再実行可能な学習コードの提出を求める。6システムによる290回のテストでは、4割超が元のアルゴリズムを下回った。推論強度を高めても、主にエージェントが中核的な学習メカニズムへ手を加えやすくなるだけだった。