機器人與世界模型
CLAP、異種ロボットの行動空間を統一し、動画世界モデルを異なる形態にまたがるシミュレーターとして活用
CLAPはまず、ラベルなし動画から潜在行動を通じて物理法則を学習し、その表現をロボットのエンドエフェクタ座標へ再接続する。研究チームはコードと複数のcheckpointを公開しているが、生成動画における物理的なハルシネーションが、安全性の重要な制御に直接利用するうえでの制約となっている。
Archive
技術ニュース 964 件
機器人與世界模型
CLAPはまず、ラベルなし動画から潜在行動を通じて物理法則を学習し、その表現をロボットのエンドエフェクタ座標へ再接続する。研究チームはコードと複数のcheckpointを公開しているが、生成動画における物理的なハルシネーションが、安全性の重要な制御に直接利用するうえでの制約となっている。
模型訓練系統
Puro-2Bは、2段階のデータカリキュラム、ブロック単位FP8、MuonH最適化をコンシューマー向けGPUクラスターに統合した。著者らによると、4,370ドルの短縮学習版は平均スコアでQwen2-1.5Bを上回ったが、このコストに含まれるのはアクセラレーターのレンタル相当額のみだ。
代理框架與開發工具
PRAXISTでは、複数の研究エージェントが世代を重ねながら変更案を提示し、評価結果、メカニズム、系譜を監査可能なエビデンスグラフに記録することで、各ラウンドでの再探索を回避する。著者らは75タスクのMLE-benchでメダル60個、モデル費用3,054ドルと報告しているが、システムは公開されたばかりであり、成績とコストはいずれも主に開発チームによる測定値だ。
模型訓練與推理
TTPO は多数決の回答をそのまま正解とは見なさず、コンセンサスと一致する軌跡を蒸留し、さらに grouped RL によって高い確信度を伴う不一致の誤りを罰する。著者らの報告では、Qwen3-1.7B の3つの数学コンテストにおける Avg@12 は 38.0 から 45.2 に向上した。ただし、これはテスト問題を直接使用してパラメータを更新するトランスダクティブな設定である。
LLM 推論/測試時計算
Prefix Slidingは生成中に中間部分の推論tokenを破棄し、システムプロンプト、タスクのプレフィックス、直近数千tokenのみを保持するため、再学習なしで適用できる。研究では、長時間推論の総思考時間を約3分の1に短縮できると報告されているが、現行実装はフォーク版のvLLMとFlashAttentionに依存しており、出力が短いタスクや初期の詳細を振り返る必要があるタスクでは効果が限定的だ。
視覺模型/自監督學習
LeVJEPAは、単一のエンコーダ、クロスビュー不変性損失、表現崩壊を防ぐSIGRegを採用し、EMAターゲットネットワーク、stop-gradient、ピクセルデコーダへの依存をなくした。著者らは、同一のデータと学習期間において計算量に5.6~20.8倍の差があると報告しているが、現時点の結果は、チームが再学習したモデルによる凍結エンコーダのベンチマークに限られる。
推論系統
FreeTokenは、固定ルールによるMoEエキスパートのオフロードをやめ、実測したメモリ帯域幅とPCIe帯域幅に基づいて、CPUでの実行とGPUキャッシュへの配置を動的に分担する。開発者らは、RTX 5090で284Bモデルを毎秒22~25 tokenで実行できると報告しているが、テストは依然として開発チーム自身によるもので、完全な重みの保持には大量のメインメモリが必要だ。
AI 晶片與資料中心
MetaのMTIA 300は、1.2TB/sのネットワークI/Oと16基のメッセージエンジンをアクセラレータに直接統合し、collectiveが主要な計算アレイを占有しないようにした。公式発表では、150B規模の推薦モデルにおいて、比較対象のGPUクラスタより通信時間を3.9倍短縮したとしているが、システム全体のトレーニングコストを比較するのに十分な完全なデータはまだ提供されていない。
AI 評測與安全研究
Anthropicの自動アラインメント研究エージェントは、文献調査、データ設計、モデルのポストトレーニングを自律的に行い、10種類の安全性問題で評価ギャップを26%から96%縮小した。制約付きの人間による提案ベースラインも上回ったが、比較ではエージェントにより長い反復時間が与えられており、実証されたのは測定可能な失敗を修正する能力に限られる。
AI 安全
Pandex は、企業の AI 向けドキュメントに、未登録のパッケージやドメインを参照するインストールコマンドが数百件含まれていることを発見した。その後、Claude、Codex、Hermes は実際の企業環境で、研究者が設置したビーコンを実行した。問題は llms.txt 形式そのものではなく、エージェントが信頼できるドキュメントをそのまま実行可能なコマンドへ昇格させ、パッケージの所有権や配布元の検証を迂回している点にある。
代理評測
Stanford主導のオープンベンチマークは、データ分析、シミュレーション、定理証明、機器校正などの科学研究を再実行可能なターミナルタスクとしてパッケージ化した。Claude Codeと組み合わせたClaude Opus 5が首位となったが、3回の試行後も解決率は30%にとどまり、一般的なcoding benchmarkでの高得点を科学研究へそのまま外挿できないことを示している。
AI 評測與安全
Google DeepMind、MLCommonsなどの機関は、Gemini 2.5 Flash Liteと非公開の安全性評価問題セットを、検証可能な同一のセキュアエンクレーブ内に投入し、双方が取得できる結果を制限した。この設計はベンチマーク汚染のリスクを低減する一方、信頼は依然としてハードウェアのルートキー、Trusted Computing Base(TCB)、機関横断のコードレビューに依存する。