AI 推論基礎設施
NVIDIA Dynamo、共有HBMウェイトでスタンバイエンジンを事前ウォームアップし、フェイルオーバーを283秒から7.3秒に短縮
Dynamoの実験的なShadow Engine Failoverでは、2つの推論プロセスが同一のGPUウェイトをマッピングすることで、プロセスのクラッシュ後にモデルを再ロードする必要をなくす。NVIDIAによるGLM-5.2のテストでは復旧時間が約39分の1に短縮されたが、現時点では主にvLLMのみをサポートし、GPU、ノード、クロスノードの障害には対応できない。