AI 研究
AlphaFoldデータベースにウイルスタンパク質複合体の予測8,028件を収録、推論パイプラインもオープンソース化
共同チームが2,812組のウイルスプロテオームを対象に、高信頼度の複合体予測とGPU計算パイプラインを公開した。導入には大容量GPUとクラスター環境が必要で、構造予測は実験による検証も欠かせない。

EMBL-EBI、Google DeepMind、NVIDIAなどのチームは9月24日、新たなウイルスタンパク質複合体予測を公開した。この共同プロジェクトは23のウイルス科、2,812組のウイルスプロテオームを対象とし、高信頼度のヘテロ二量体5,279件とホモ二量体2,749件を作成した。前者は異なるタンパク質、後者は同じタンパク質で構成される。AlphaFoldのパンデミック対策ポータルにはほかのデータも統合されているため、この8,028件がポータルの全収録データというわけではない。[公式発表](https://www.ebi.ac.uk/about/news/technology-and-innovation/alphafold-database-adds-viral-protein-complexes-to-support-pandemic-preparedness/)、[データベースの更新](https://alphafold.ebi.ac.uk/)
技術面の要点は、配列検索、構造推論、品質フィルタリングをつなぎ、大規模なパイプラインにしたことだ。同時に公開されたBioNeMo Structure Prediction Pipelineでは、MMseqs2 GPU検索を使って多重配列アラインメントを作成する。フォールディング段階では、AlphaFold2-Multimerの重みとBioNeMo Inference Runtimeを組み合わせたOpenFold2を利用できる。後処理ではタンパク質の接触界面を評価し、立体的な衝突を確認したうえで、構造ファイルとデータ一覧を出力する。[リポジトリの説明](https://github.com/NVIDIA-BioNeMo/BioNeMo-Structure-Prediction-Pipeline)
研究チームは候補構造をそのまま利用することも、自分たちの標的にパイプラインを適用することもできる。各段階はコンテナ化されたジョブとしてSlurmに投入され、ローカルストレージまたはS3互換ストレージを介してデータを受け渡す。入力のチェックサムと実行記録も保存される。この設計により、環境構築や計算の重複を減らし、後続の実験に優先順位を付けられる候補リストを提供できると期待される。データとパイプラインが一緒に公開されたことで、予測の出所を確認するための基盤も得られる。[NVIDIAの発表](https://blogs.nvidia.com/blog/open-protein-dataset/)、[パイプラインの構成](https://github.com/NVIDIA-BioNeMo/BioNeMo-Structure-Prediction-Pipeline)
導入のハードルは依然として高い。ドキュメントでは、少なくとも80 GBのGPUメモリとクラスター用コンテナ環境が必要とされ、利用者は配列データベース、重み、参照データも用意しなければならない。公開版では各段階で個別にデータを受け渡す必要があり、単一のコマンドで全工程を完了する仕組みはまだない。また、設定では`public`のデフォルト構成を明示的に選ぶ必要があり、そうしないと`internal`が選択される。[ハードウェア要件](https://github.com/NVIDIA-BioNeMo/BioNeMo-Structure-Prediction-Pipeline)、[バージョンの制限](https://github.com/NVIDIA-BioNeMo/BioNeMo-Structure-Prediction-Pipeline/blob/main/docs/status.md)
高い信頼度スコアもモデルによる判断であり、予測された結合形状は実験で確認する必要がある。EMBL-EBIは、構造だけからウイルス変異の影響や実際の挙動を推測することはできないと明記している。結果をほかのモデルの学習や評価に使う場合は、出所と信頼度の情報を保持し、実験で得られた構造と照合して誤差を調べ、候補を検証済みのラベルとして扱わないことが望ましい。今後は、ウイルス科ごとの実験検証、入力配列長ごとのリソース要件、パイプライン全体の処理量を追う必要がある。ジョブが正常に完了したことだけでは、科学的な精度や異なるハードウェア間での性能は証明されない。[研究上の制約](https://www.ebi.ac.uk/about/news/technology-and-innovation/alphafold-database-adds-viral-protein-complexes-to-support-pandemic-preparedness/)、[検証の範囲](https://github.com/NVIDIA-BioNeMo/BioNeMo-Structure-Prediction-Pipeline/blob/main/docs/status.md)