科學 AI/推論最佳化
Anthropic 公開 36 組生物模型加速套件,將數值一致性納入執行模式
Claude 協助開發的 36 組套件,以共享 GPU 核心加速生物模型並降低記憶體需求。官方區分輸出完全一致與近似加速,但公開版本不承諾持續維護。

Anthropic 於 9 月 17 日公開由 Claude 協助開發的 36 組生物模型推論最佳化套件,涵蓋結構預測、蛋白質設計與基因體模型。官方在結構預測測試中報告,容許少量數值差異時平均約加速四倍;要求輸出完全一致時則約為 1.6 倍,兩種口徑必須分開看。[研究公告](https://www.anthropic.com/research/claude-uplifts-biomolecular-modeling)
技術核心是 FlashPairformer,針對分子結構模型反覆使用的三角注意力與三角乘法提供 GPU 核心。共享執行層依裝置、資料型別與張量形狀選擇實作,並以介面連接 PyTorch、JAX 及不同核心後端,讓多個模型重用最佳化成果。[共享核心文件](https://raw.githubusercontent.com/anthropics/uplifting-biomolecular-modeling/main/common/opt_core/README.md)
套件把行為拆成四種模式:off 執行固定版本的上游程式,exact 追求相同輸出,fast 接受記錄在案的數值差異,big 優先降低顯示記憶體需求。這讓研究者可先決定容許的誤差,再選效能策略;各模型實際提供的模式仍有差異。[專案說明](https://github.com/anthropics/uplifting-biomolecular-modeling)
以 Boltz-2 為例,exact 使用 CUDA Graph 與移出迴圈的不變計算,fast 再接入低精度三角運算;big 則分塊處理,並可把成對表徵按列分散至同一主機的多張 GPU。但文件指出,每次呼叫仍有約 25 秒啟動、載入權重及特徵處理成本,小型輸入的端到端收益因此較低。部分 A100 輸入長度也無法維持逐位元一致,exact 會回報未啟用並以錯誤碼結束。[Boltz-2 文件](https://raw.githubusercontent.com/anthropics/uplifting-biomolecular-modeling/main/boltz2/README.md)
重現流程也被包進發布內容:各套件列出上游版本、相依套件與權重摘要值,並提供容器或虛擬環境路徑。執行前可先檢查模式能否啟用,日誌則記錄實際採用的最佳化。這些資訊有助區分模型差異、執行環境差異與加速核心失效,降低只比較單一秒數造成的誤判。[重現與執行紀錄](https://github.com/anthropics/uplifting-biomolecular-modeling)
部署限制同樣具體:這是固定上游版本的參考發布,Anthropic 明言不計畫持續更新,也不接受合併請求;原創程式採 Apache 2.0,上游程式仍各有授權。對研究團隊而言,可立即利用的是可檢查的核心與模式切換機制,後續應在自家資料上分別量測冷啟動、穩態推論、峰值記憶體及結果誤差,再確認上游升級後是否仍相容。[版本與維護說明](https://github.com/anthropics/uplifting-biomolecular-modeling)