全ニュース

技術ニュース 968 件

AI 安全與標準

TRACEがLinux Foundation傘下へ:エージェントの実行場所をハードウェアで証明、ただし動作の正しさまでは保証せず

Linux FoundationはTRACE仕様を受け入れ、AIエージェントのモデル、実行環境、ポリシー、ツール呼び出しに関するポータブルな暗号学的証拠の確立を目指す。現行のv0.2は依然としてDeveloper Previewであり、記録と検証済み環境との関連性は証明できるものの、エージェントがタスクを完了したことや、ポリシー自体の安全性までは証明できない。

代理評測與可靠性

TRACE、成功・失敗の軌跡からエージェントのSkillsを書き換え、隠しテストでの一貫成功率を70%に向上

小米(Xiaomi)のチームが提案したTRACEは、成功/失敗軌跡の対比結果を用いて検索可能なSkill Bankを反復的に改善し、基盤モデルの重みは変更しない。CAR-benchの隠しテストセットでは3回すべて成功する割合を高めた一方、平均token数、コスト、レイテンシーも増加した。

AI 開發工具

Gradio、AIパイプラインを実行可能なノードグラフに変換――ただしキャンバスとAPIの並列実行セマンティクスには依然として差異

Gradioは、組み込みの`gr.Workflow`を正式に紹介した。同一のノードグラフを視覚的なデバッグやSpacesへのデプロイに利用でき、RESTエンドポイントも自動生成される。インタラクティブキャンバスでは同じ階層のノードを並列実行できるが、生成されたAPI経由で呼び出す場合は現在も逐次実行されるため、キャンバス上の結果をそのまま性能テストに流用することはできない。

代理開發平台

Dify 1.17、エージェント環境を復元可能なスナップショットとしてパッケージ化、実行バックエンドと環境変数も刷新

Dify 1.17.0では、E2B実行バックエンド、ビルド時のhome snapshot、バージョン管理されたSkills、階層型コンテキスト圧縮が追加され、エージェントは起動するたびに一貫したツールとファイルの状態を取得できる。ただし、これは無停止で適用できる小規模アップデートではない。データベースマイグレーション、Compose設定、複数の環境変数が変更されており、セルフホスト環境のユーザーはデプロイ構成を改めて確認する必要がある。

AI 代理與開源工具

Headlong、Bashの無限ループで常時稼働エージェントを実装――質問がなくても自ら思考・実行

Laude InstituteとMITは、1万行未満のBashで構成されたHeadlongを公開した。メッセージを新たなセッションではなく、継続的な思考軌跡に対する非同期の観察として扱う。長期記憶や自発的行動の研究に利用できる一方、tokenコスト、権限の分離、ユーザー間のデータ境界が常在的なリスクとなる。

應用研究/科學資料工程

Astro-COLIBRI、制約付きLLMで天文通報を解析し、10年分の自由記述を68,393件の観測データに変換

新たなパイプラインは、NASA GCN Circularsに記載された測光、赤方偏移、観測時刻をイベント単位の構造化データへ変換し、すでにリアルタイムで稼働している。内部監査ではフィールド判定の正解率99.80%を記録したが、時刻の解釈と観測施設の帰属が依然として主な誤りの原因であり、研究利用時には原文の確認が必要だ。

影片生成/推論系統

NVIDIA、MiniMax H3に2段階生成を導入し、GB200 1基で10秒動画のレイテンシを14.9秒に短縮

H3 Super Accelerationは、まず低解像度かつ4ステップのノイズ除去でドラフトを作成し、その後LTXとSol-Attnに引き渡して3ステップで高解像度の精細化を完了する。公式測定では、768pの10秒動画はSGLangベースライン比で27.7倍高速だったが、この高速化はサンプリング経路を変更するものであり、同等品質を維持した純粋なカーネル最適化ではない。

代理開發工具

Agent Lightning 1.0.1、エージェント最適化プロセスをSkillとしてパッケージ化し、試行ごとのコスト、レイテンシー、正確率の測定を要求

Microsoftは、Claude Code、Codex、GitHub Copilotで利用できるAgent Lightning Skillを追加した。これにより、コーディングエージェントは固定benchmark上で、編集可能な別のエージェントを改良できる。これは予算制約下での実験ルール一式であり、対象エージェントに対して強化学習を自動実行するものではない。

推論系統

Ray 2.58、KV-cache/token-aware routingを完成。ただし新ルーターは依然alpha

Ray Serve LLMは、プロンプトのトークン化、キャッシュヒットの推定、レプリカ選択をingressに集約し、tokenを推論エンジンへ直接渡すようになった。この設計により、prefillとトークン化の重複を削減できる一方、公式から新バージョンの性能データは公表されておらず、コントロールプレーンにも追加の同期コストが生じる。

RAG 與推論工程

AWS、小型モデルでRAGの根拠を先に圧縮:入力tokenを10分の1に削減する一方、リクエスト遅延は12〜19%増加

新アーキテクチャでは、検索とメインモデルの間に低コストのモデル呼び出しを1回追加し、質問に関連する原文の一部とソース識別子だけを保持する。AWSの社内テストでは約30%のコスト削減を記録したが、評価は単一の企業コーパスとLLM judgeに依存している。

AI 安全與評測

Anthropic、ファインチューニング型「嘘発見器」を検証:ドメイン内AUROCは0.95に上昇するも、嘘の種類が変わると約0.70に低下

研究チームは8つのオープンモデルファミリーを用いて、プレッシャーのかかる状況のデータ約20万件を生成し、LoRAでモデルを訓練して、自身が嘘をついているかを判定させた。検出器が主に学習したのは迎合や能力の否認といった表面的なパターンで、未知のタイプに対してはプロンプト方式のベースラインをわずかに上回るにとどまった。

世界模型與生成影片

ReWorld、姿勢インデックス付きランドマークバンクでKV予算を固定し、インタラクティブ世界モデルが遠くまで移動しても元の景観へ帰還可能に

ReWorldは、短期的な動作制御と長期的なシーン記憶に異なる注意範囲を割り当て、固定容量のランドマークバンクに履歴を保存する。著者らは704×1280のリアルタイムストリーミングと64秒間の帰還軌跡を実演したが、現時点で公開されているのは論文とデモページのみで、重みやコードは未公開だ。