OUTILS
AirLLM : faire tourner un modèle 70B sur un seul GPU de 4 Go
Une bibliothèque open source permet l'inférence de modèles à 70 milliards de paramètres sur du matériel grand public à mémoire très limitée.
Hacker News (filtré IA)·@Anon84·3 août 2026
AirLLM est un outil open source qui permet d'exécuter des LLM de grande taille, comme des modèles à 70 milliards de paramètres, sur un GPU disposant de seulement 4 Go de mémoire. La technique repose sur un chargement séquentiel des couches du modèle plutôt que leur maintien complet en mémoire, au prix d'une latence accrue. Le projet vise à démocratiser l'accès à l'inférence de grands modèles sans infrastructure coûteuse.