Toutes les news taguées avec ce sujet.
Un projet open source promet d'exécuter un modèle de 125 milliards de paramètres sur une seule RTX 4090, à haute vitesse.
Le projet Debian publie un portail dédié à l'inférence de modèles d'IA, pensé pour s'intégrer à son écosystème logiciel libre.
Une nouvelle méthode réduit l'empreinte mémoire du KV cache en LLM tout en limitant la perte de précision, même à 2 bits.
Un article technique détaille une optimisation du prompt lookup decoding, une méthode de génération accélérée dans llama.cpp.
Liquid AI publie LFM2.5-VL-DSpark, un modèle vision-langage optimisé par une architecture de sparse mixture-of-experts pour une inférence plus rapide.
Nori Agentic dévoile Nori LLM, un modèle revendiquant un débit d'inférence supérieur à 1M tokens/s, une performance qui bouleverse les standards de vitesse actuels.
Nesbox offre un environnement d'exécution virtualisé ultra-léger et performant, intégrant nativement le passage de contexte GPU pour les charges de travail IA et graphiques.
Le nouveau modèle Mercury 2.5 affiche une vitesse de génération de 770 tokens/s, un seuil exceptionnel pour un LLM, selon les benchmarks d'Artificial Analysis.
Déporter le calcul IA vers l'edge ou le cloud plutôt que de tout faire embarqué améliorerait performance et autonomie des robots.
Un nouveau benchmark évalue la capacité des agents à implémenter des fonctionnalités d'inférence en production, révélant un écart critique entre succès local et validité réelle.
Analyse des coûts et de la viabilité économique de l'inférence sur les modèles à poids ouverts, face aux solutions propriétaires.
NVIDIA lance Confidential Computing pour sécuriser l'inférence des LLM en production via des CVMs et GPUs chiffrés, protégeant données sensibles et modèles propriétaires.
Les besoins en calcul de l'IA générative dépassent un seul GPU. TensorRT 11.0 permet désormais d'exécuter un réseau sur plusieurs GPU via des collectifs NCCL.
Un développeur détaille la construction d'une base de données combinant recherche et inférence, entièrement écrite en Zig, sans dépendances externes.
NVIDIA présente AIPerf, un outil pour mesurer rigoureusement la performance d'inférence LLM au-delà des scripts artisanaux.
Un décryptage technique de l'architecture de DeepSeek-V4.1 Flash, centré sur ses optimisations agressives de compression du cache clé-valeur.
NVIDIA explique comment l'architecture Groq 3 LPX améliore l'efficacité énergétique et l'interactivité de l'inférence sur sa future plateforme Vera Rubin.
NVIDIA détaille les compromis entre architectures denses et Mixture-of-Experts, à travers l'exemple de Nemotron 3.5 Lightning.
Présenté à Hot Chips 2026, ce nouveau processeur promet d'accélérer l'inférence des modèles génératifs grâce à une architecture mémoire 3D-DRAM innovante.
NVIDIA détaille une technique d'optimisation d'inférence qui sépare l'encodage visuel du prefill et du decode, avec des gains jusqu'à 5x.
NVIDIA présente PAIR, un système qui répartit l'inférence entre appareils d'un même réseau pour soutenir les workflows multi-agents.
Baseten explore les compromis entre coût, latence et débit pour optimiser le déploiement des LLM en production.
NVIDIA propose une méthode pour calibrer les ressources GPU d'inférence face aux contraintes de latence, de trafic et de budget.