ホームへ戻る

AI 安全

ALIBI、虚偽の製品説明でLLMのマルウェア分類を誤らせる――検証プロンプトを加えても誤判定は残る

研究では、プログラムの実行時の挙動を変えずに、静的解析で抽出される虚偽の背景情報を追加した。その結果、モデルは悪意ある指示に従わなくても、信頼できない説明を受け入れることでリスク評価を引き下げる可能性が示された。

Ijsbrand93 · CC BY 3.0 · Image source
zh-Hant

78ResearchLabのチームは9月17日、ALIBIのプレプリントを投稿した。悪意あるファイルが、もっともらしい製品説明を使って初期分類を担う言語モデルをどのように誤らせるかを研究したものだ。この研究は技術研究の情報集約サイトでも紹介されたが、中核となる根拠は著者らの実験であり、集約サイトの記事には独立した追試結果は示されていない。[論文](https://arxiv.org/abs/2609.19722)、[研究の紹介](https://mindpattern.ai/f/26109)

テスト用のパイプラインは、まずバイナリファイルからメタデータ、インポートシンボル、印字可能な文字列を抽出し、それらをモデルに渡して判定させる。ALIBIは、実行されない読み取り専用のデータを追加し、不審な挙動に対してセキュリティ製品を装う虚偽の背景情報を与える。これにより、モデルは本来リスクを示す手掛かりを、正常な用途として解釈するようになる。研究の焦点は、攻撃者が制御する説明が、どのように信頼できる証拠として扱われるかにある。モデルは実行ファイル全体を直接読むわけではなく、指示を無視するよう求める文言を受け取るとも限らない。[手法と脅威モデル](https://arxiv.org/html/2609.19722v1)

50個の悪意あるWindows PEサンプルのうち、Gemini 2.5 Proは当初35個を悪性と判定した。説明の追加後、そのうち30個の判定が良性に変わった。GPT-5.5 ProとClaude Opus 4.7は、同じ35個のサンプルについて良性との判定を出さなかったが、リスクレベルの低下は見られた。この比較はGeminiの判定によって選ばれたサンプル群を分母としているため、3モデルの総合的な安全性ランキングとしてそのまま扱うことはできない。[評価結果](https://arxiv.org/html/2609.19722v1)

防御実験では、同一のスナップショットを使い、検証プロンプトの有無という2つの条件で再実行したところ、良性と誤判定した件数は35件中29件から15件に減った。前者は主実験の結果と1サンプル分異なる。この結果は、ファイル内の自己説明を疑うようモデルに促すことが役立つ一方、効果はなお不完全であることを示している。著者らは、前処理プログラムで署名、出所、構造を照合し、検証済みの事実とファイル自体の主張を分けて入力する方法を提案している。ただし、パイプライン全体を通した実測はまだ行われていない。[防御の結果](https://arxiv.org/html/2609.19722v1)

セキュリティツールの開発者にとって、これは評価時に最終ラベルの正否だけでなく、リスク順位が下がっていないか、どの記述が結論の根拠に使われたかも追跡すべきことを示唆している。互いに矛盾する製品説明を回帰テストに追加し、モデルが外部の証拠を求めるかを観察する方法が考えられる。同時に、抽出ツールとモデルのバージョンを固定し、前処理の違いをモデルの防御能力の差と取り違えないようにする必要がある。分類結果が人手による調査の順序を決める場合には、リスク評価を引き下げられたサンプルの対応が、そのために遅れるかどうかも測定すべきだ。

研究のサンプル数は限られており、対象も特定の静的解析フローにとどまる。この結果から、あらゆるウイルス対策ソフトや動的解析サンドボックスを回避できると一般化することはできない。また、モデルが自己申告する確信度を、較正済みの確率として扱うこともできない。次に検証する価値があるのは、実際に裏付けを確認できる出所情報のフィールドを追加した場合に、異なるマルウェアファミリーや抽出フローでも防御効果を維持できるかどうかだ。[研究の限界](https://arxiv.org/html/2609.19722v1)

出典

  1. ALIBI: Adversarial Legitimacy Injection in Binary Input against LLM Malware Analyzers
  2. ALIBI full paper
  3. A Fake Security-Product Story in an Unexecuted Binary Section Flipped 30 of 35 Malware Verdicts