OUTILS · NVIDIA
NVIDIA TensorRT : l'inférence multi-GPU intégrée à Dynamo-Triton
Les besoins en calcul de l'IA générative dépassent un seul GPU. TensorRT 11.0 permet désormais d'exécuter un réseau sur plusieurs GPU via des collectifs NCCL.
Les exigences de calcul et de mémoire de l'IA générative dépassent désormais les capacités d'un seul GPU. NVIDIA TensorRT multi-device inference est une fonctionnalité permettant d'exécuter un réseau TensorRT sur plusieurs GPU via des collectifs distribués NCCL, tout en conservant les optimisations d'inférence de TensorRT. Elle est entièrement supportée à partir de TensorRT 11.0.