AI 安全與多代理系統
IO Factory、10万体のシミュレーション人格でAI影響工作を再現──ただし現実の説得効果は推定できず
IO Factoryは、ナラティブ計画、エージェントによる投稿、プラットフォーム上の露出、オーディエンス状態の更新、ベースライン比較を、追跡可能なシミュレーションのライフサイクルとして統合した。10万体の模擬市民と1万体の工作エージェントという設定で実行を完了しているが、影響を示すすべての数値は、人為的に設定されたルールとLLMジャッジに基づく。
Archive
技術ニュース 975 件
AI 安全與多代理系統
IO Factoryは、ナラティブ計画、エージェントによる投稿、プラットフォーム上の露出、オーディエンス状態の更新、ベースライン比較を、追跡可能なシミュレーションのライフサイクルとして統合した。10万体の模擬市民と1万体の工作エージェントという設定で実行を完了しているが、影響を示すすべての数値は、人為的に設定されたルールとLLMジャッジに基づく。
代理記憶與搜尋
ReTreeは、探索エージェントの要約、証拠の出典、改訂履歴を依存関係ツリーとして保存する。新しい情報が従来の前提を覆すと、システムは誤りが持ち込まれたノードまで戻り、影響を受けた分岐を削除する。4つの探索ベンチマークでは、各ステップのコンテキストを短縮しながら回答を改善した一方、ハードプルーニングによって、実際には矛盾の影響を受けない情報まで失われる可能性がある。
推理與檢索
ThinkRetrieveは、モデルに思考時間を延ばすよう求めるだけではなく、各推論境界で類似問題の完全な解答を検索し、次の思考コンテキストに挿入する。1.5B~8Bの5モデルすべてで逐次型Test-Time Computeを上回ったが、この手法には大規模かつ厳密に汚染除去された解法データベースが必要となる。
模型可解釋性
ハイデルベルク大学の研究により、スパースオートエンコーダーでは個々のlatentを解釈できても、活性化したlatentの集合全体は人間の概念と安定して対応しないことが分かった。名詞の前に整合性のある形容詞を加えるだけで、元の活性化集合の20~60%が消失する可能性があり、集合の重なりからモデル状態を解釈する手法の信頼性には限界がある。
AI 代理與開發工具
SKILLERは小規模モデルの重みを更新せず、強力なモデルが実行トレースと検証器のフィードバックに基づいてテキスト形式のスキルを反復的に修正する。Qwen3.5‑9BはSWE‑Skills‑Benchで、3回の実行における平均スコアをスキルなしの26.2%から82.8%へ向上させた。ただし、スキル生成は依然としてGPT‑5.4と成功例の参照トレースに依存する。
開放模型與推論系統
MetaはMuse Glimmer 30Bのウェイト、ビジョンエンコーダー、DFlashドラフトモデルを公開した。17GB版では、24GBのVRAM内でテキスト、画像、投機的デコーディングを同時に実行できる。公式測定ではRTX 5090上で平均233.4 token/sを記録したが、安全性評価とデプロイの詳細から、依然として外部の保護策と新しいruntimeが必要であることが分かる。
AI 輔助科學研究
研究チームは、推論モデル、コーディングエージェント、ファイルベースのメモリを用いて約240回の研究セッションを実施し、最終的に `K_G ≥ 6π/11` を提案、著者らが検証した。システムは強力な局所的証明能力を示した一方、探索がボトルネックに陥ったことを自ら認識できず、研究方針や成果の取捨選択には約40回の人間による指示が引き続き必要だった。
AI for Science/代理評測
ChemWorldは、型付き操作、互換性コンパイラ、非公開の化学法則により、研究者が同一の公開インターフェースを維持したまま、世界を規定する単一のルールだけを置き換えられるようにする。オープンソース版は52種類の生成組み合わせと8本の完全なワークフローに合格したが、検証対象はソフトウェアの実行セマンティクスであり、現実の化学的正確性ではない。
AI 程式設計/演化搜尋
EvoMemは、成功したプログラム変異から出典記録付きの戦略カードを抽出し、後続タスクでは最大3枚を検索してLLMを誘導する。9種類のテストで目的指標が平均6.40%向上した一方、結果のばらつきは大きく、実験対象も依然として小規模な研究用ワークロードに限られている。
代理工程
Agentic Configuration Managementは、エージェント、プロンプト、モデル、ツール、ワークフローを、個別にバージョン管理できる構成項目として正規化する。リファレンス実装はLangGraph、CrewAI、OpenAI Agents SDKをサポートするが、現時点の検証は小規模な合成ケースと著者独自のoracleに集中している。
AI 基礎設施
MISA-Tは、プレフィックスヒットだけで推論ノードを選択するのではなく、ワークロードごとにKVキャッシュを同時占有できるsession数も制限する。著者らはStep3.7とQwen3.6-35B-A3Bで、rolloutスループットが43.6%から53.3%向上したと報告しているが、実装はまだ公開されていない。
模型架構與推論
UniF-MoEは、共有エキスパート、FFNの幅、活性化するエキスパート数を個別に決定するのではなく、各tokenが最初に共有チャネルを選択し、その後、残りの需要に応じてルーティング確率を累積する。著者らによるDeiTおよびBERTの実験では、精度とMoEの推論コストが改善されたが、生成型大規模言語モデルや分散expert parallelismではまだ検証されていない。