代理記憶與本機 AI
Hillock 0.6、双極性ハイパーベクトルでエージェントの記憶を検索し、しきい値未満ならLLM呼び出しをスキップ
Hillockは、事実トリプル、Hebbian連想重み、1万次元のハイパーベクトルを組み合わせ、ローカルハードウェア上で質問に回答できるデータがあるかを事前に判定する。0.6ではtoken単位のMaxSimとマルチホップ経路エンコーディングが追加されたが、ゲート精度は現時点で約56%にとどまり、依然として研究プロトタイプの段階にある。

オープンソースプロジェクトのHillock 0.6は、文書からの抽出と第1段階の検索を生成モデルなしで処理しようとしている。TALONパイプラインは、まずFastcoref、MiniLM、GLiRELを使ってテキストを主語—述語—目的語のトリプルに変換し、確定的な事実をSQLiteに保存する。概念の共起強度は勾配を使わないHebbian更新によって維持され、対話とクエリは1万次元で各要素が+1または-1のハイパーベクトル空間にマッピングされる。候補となる事実の類似度が固定しきい値を超えた場合に限り、システムはその内容をローカルのOllamaモデルへ渡して回答を生成する。それ以外の場合は、コードにハードコーディングされた回答拒否を直接返す。
0.6のHYDRAは、クエリ全体を単一ベクトルに圧縮する方式を廃止し、ColBERTにならってクエリtokenと事実tokenの間でMaxSimを実行する。1万次元での比較コストを抑えるため、まず2,000次元への射影で候補の大半を除外し、その後に完全な計算を行う。もう一つのHYPERGRAPH-HDC機能は、循環シフトによってHadamardバインディングの可換性を崩し、2ホップ、3ホップの関係の順序をハイパーベクトルへエンコードする。SQLiteには1ホップのトリプルだけを保存し、マルチホップ表現はビットパックされたBLOBとして格納することで、関係経路が大量の行へ直接膨張するのを防ぐ。
この設計の価値は、「証拠がなければ回答を拒否する」という方針を単なるシステムプロンプトではなく、制御フローとして実装した点にある。回答不能なクエリでは、生成モデルを一切起動しない。開発者によれば、パイプライン全体はGTX 1070上で1.2GB未満のVRAMで動作し、CPUのみの実行にも対応する。32件のクエリを使った簡易評価には約1.16秒を要したという。
ただし、これらの数値を一般化するのは時期尚早だ。公開テストに使われたのは、32文からなる文書1件、回答可能な質問22件、意図的に設計されたネガティブ例10件にすぎない。0.6の抽出精度はわずか13.8%、検索正解率は54.5%、ゲート全体の正解率は約56.2%、ネガティブ例のブロック率は60%だった。したがって、固定しきい値は誤った内容を通過させる可能性がある一方、有効な質問を拒否する可能性もある。次の段階では、複数分野のコーパス、異なる言語、継続的に更新される記憶を対象に、再現率、誤拒否率、総計算コストを比較するとともに、トリプル抽出の誤りがマルチホップ経路内で増幅されるかを検証する必要がある。