多代理與可組合泛化
モジュールの可視情報を制限することで再利用可能な潜在通信を促進、10組のペア実験のうち9組で少なくとも20ポイント上回る
Qwen2.5-0.5Bと同一のLoRAを共有する4つのモジュールが、注意マスクの違いだけでまったく異なる合成戦略を学習した。各モジュールが自身の証拠断片しか見られないよう制限すると、サンプル間で転用可能な中間値通信が形成されやすくなったが、事前登録された全体成功基準には0.0012届かなかった。

ある新たな研究が、マルチモジュールAIの設計上の問いに取り組んだ。各モジュールに入力全体を見せると、再利用可能な局所演算を学ぶのではなく、問題全体を記憶するようモデルを促してしまうのだろうか。実験では4つの「LLM cell」を構築し、凍結されたQwen2.5-0.5B-Instruct、同一のrank-8 LoRA、固定順序の連続ベクトル通信チャネルを共有させた。1回のメッセージ送信に使われるのは、モデル幅2つ分のベクトルだけだった。
課題は、自然言語で記述された関数合成を法17の整数上で実行することだった。研究者らは10組のペアモデルを構築した。各ペアは、初期化ビット、訓練順序、token位置、パラメータ数、20,000回の更新が完全に同一で、唯一の違いは注意マスクだった。制限群では、各cellが直接読み取れるのは割り当てられた証拠断片のみで、その他の情報は直前のcellから潜在ベクトルを介して受け取る必要があった。一方、グローバル群は4つの入力断片すべてを見ることができた。
10組中9組のペアでは、2種類の合成深度のいずれにおいても、制限群がグローバル群を少なくとも20パーセントポイント上回った。深度2と深度3におけるペアごとの優位性の中央値は、それぞれ0.7648と0.6050だった。研究者らが通信を遮断すると、すべての制限群がランダム水準まで低下した。さらに重要なのは、別の問題で同じ中間値を表すベクトルパケットを移植したところ、監査対象となった6モデルで、各インターフェースにおける挙動保持率が0.94~1.00に達したことだ。反実仮想値に置き換えると、出力も数学的に予想される答えへと移動した。これは、単純なゼロベクトル・アブレーションよりも、チャネルが交換可能な中間結果を実際に符号化していることを強く裏付けている。
ただし、これは依然として高度に制御された合成タスクであり、一般的なエージェント協調ではない。深度3における制限群の正解率中央値は0.6988で、事前登録された0.70の基準に達しなかった。このため、実験全体は正式には失敗と判定された。以前のバッチもすべて、一般的な言語能力を維持できなかった。また、制限群のcheckpointのうち1つは取得できなかった。次の課題は、この種の「情報所有権の境界」を、モデル本来の能力を損なうことなく、異なるモデル、自然言語による協調、ツールエージェント、現実の長期ワークフローへ拡張できるかどうかだ。