代理系統/評測
TWIN、プログラムエージェントに未知のゲームをリアルタイムで再構築させ、ARC-AGI-3スコアを7.8から93.3へ向上
TWINでは、エージェントがまず未知の環境を実行可能なPython世界モデルとして記述し、過去の履歴を完全に再現できた場合にのみ、実環境での行動を許可する。同一の基盤モデルによるARC-AGI-3のスコアは、直接操作時の7.8から93.3へ向上した。
Archive
技術ニュース 972 件
代理系統/評測
TWINでは、エージェントがまず未知の環境を実行可能なPython世界モデルとして記述し、過去の履歴を完全に再現できた場合にのみ、実環境での行動を許可する。同一の基盤モデルによるARC-AGI-3のスコアは、直接操作時の7.8から93.3へ向上した。
AI 安全與標準
Anthropicは、対応する新しいClaudeモデルがテキスト生成時に不可視のシグナルを埋め込み、生成ファイルには署名ベースの来歴データを付加できると説明した。一方で、短文、書き換え、翻訳は検出精度を低下させ、シグナルが見つからなくてもClaudeによる生成を否定できないと警告している。
AI 基礎設施
Groqは8月16日、FreeおよびDeveloperプランで2つのLlamaエンドポイントを廃止した。現在、旧モデルIDを使用するとエラーが返される。公式はGPT-OSSまたはQwenへの移行を推奨しているが、モデルファミリーをまたぐ移行となるため、ツール呼び出し、構造化出力、プロンプトの挙動を改めて検証する必要がある。
AI API/推論成本
DeepSeekはV4 FlashとProに時間帯別料金を導入し、ピーク時間帯の価格をオフピークの2倍に設定した。最も大きな影響を受けるのは通常の入力ではなく、長い会話やコーディングエージェントで大量に使用されるキャッシュヒットtokenだ。
雲端 AI/模型生命週期
OracleがGrok 3、Grok 4、および複数のFast、Mini、Codeエンドポイントに設定した8月15日の廃止日を迎えた。これはモデルエイリアスの透過的な切り替えではない。OCIユーザーはモデルIDを変更し、推論パラメータ、画像の制限、リージョンでの提供状況を改めて検証する必要がある。
本機推論
新版では、モデルの前処理レイヤーにある2つの互換性上の問題を修正した。WebP 画像は事前にトランスコードされ、Qwen renderer も system message が必ず先頭にあることを要求しなくなった。新モデルや kernel に関する変更ではないものの、マルチモーダル処理やエージェント対話が推論コアに到達する前に失敗する事態を防げる。
代理框架
新版では、`run_input`をまだ取得していなくても`UIEventStream`を作成でき、`AGUIEventStream`がthread IDとrun IDを自身で保持するようになった。Temporal sandboxとの互換性やフォールバックモデルのtracingの帰属も修正され、長時間稼働するエージェントワークフローにおける診断上の盲点が減少する。
生成模型推論系統
GCacheは、隣接するノイズ除去ステップ間の局所的な差異を比較するだけでなく、キャッシュ誤差が最終的な画像や動画に及ぼす累積的な影響を推定する。動的計画法でキャッシュの更新点を選択し、さらにBayesian optimizationによって理論上の重みを実際の生成品質に整合させる。
代理評測與開發工具
SkillShapleyは、`skill.md`の意味的な手順を協力ゲームのプレイヤーとみなし、Shapley valueによって各手順のタスク成功率への貢献を測定する。近似手法のBAESは、複数の「1手順のみ異なる」比較を生成できるスキル構成を優先的にテストし、エージェントを個別に実行するコストを削減する。
AI 程式工具/代理安全
新版では、Linuxのmemory cgroupを使用して、エージェントが実行するビルドやテストにメモリ上限を設定できるようになり、暴走したプロセスがセッション全体を停止させる事態を防ぐ。Windowsの特殊パスによる検証回避、MCPの再接続ループ、サンドボックスのアイドル時にCPUの1コアを占有する問題も修正された。
AI 程式工具/模型基礎設施
CursorはSpaceXAIへの参加を確認し、両社はGrok Build、Grok Bot、Grok API、Cursorを共同で改良する。今回の取引により、GPUインフラ、コーディングモデルのトレーニング、数百万人規模の開発者向けチャネルが垂直統合されるが、モデル、データ、APIの移行スケジュールはまだ発表されていない。
AI 代理/科學研究
OmniScientistは、画像、波形、軌跡を先にテキスト要約へ圧縮するのではなく、知覚能力を仮説、実験、執筆の全工程に行き渡らせる。完全版システムは、予算化された特徴量のみを受け取るバージョンとのブラインドテストで85%の勝率を記録したが、評価は依然として主にモデル審査員によるものだ。