Toutes les news taguées avec ce sujet.
NVIDIA détaille le déploiement de systèmes de recommandation génératifs HSTU, qui transforment la recommandation en modélisation séquentielle.
Une jeune pousse issue du programme YC S25 présente un moteur d'inférence qui s'optimise automatiquement pour les workflows d'agents IA.
Une méthode sans entraînement permet de quantifier en 8 bits l'état récurrent des architectures à attention linéaire, sans perte notable de qualité.
NVIDIA détaille comment travail parallèle, isolation par famille de modèles et validation GPU ont façonné ce projet open source pensé pour les agents de code.
Un patch d'agent de codage IA peut réussir tous les tests mais échouer une fois le modèle chargé et confronté à de vraies requêtes.
Un billet technique détaille l'adaptation du modèle GLM-5.3-Flash pour en faire un système de décision rapide inspiré du concept de 'System One'.
Un framework sans entraînement qui accélère les LLMs de diffusion en s'attaquant au goulot d'étranglement mémoire du cache KV.
Installation en un clic pour exécuter un modèle de 27 milliards de paramètres sur du matériel grand public.
La startup H Company dévoile des techniques d'optimisation mémoire pour réduire la consommation VRAM.
Zhipu AI détaille l'architecture technique développée en interne pour servir efficacement ses modèles GLM à grande échelle.
Un framework exploitant les similarités des tâches robotiques pour accélérer l'inférence des modèles Vision-Language-Action.
NVIDIA optimise l'inférence agentic en edge sur Jetson AGX Thor via TensorRT-LLM.
Une nouvelle approche par transport discret pour la génération de langage en une étape sans distillation.
L'analyse des tendances matérielles qui redéfiniront l'exécution des modèles d'IA d'ici 2026.
Un langage spécifique pour automatiser et optimiser la conception des infrastructures d'inférence de grands modèles de langage.
Le système SQD améliore le débit et l'efficacité énergétique des LLM en optimisant la répartition des tâches sur du matériel hétérogène.
Un dépôt GitHub questionne les gains réels des stratégies récentes de cache KV face à la simple politique LRU.
L'exécution de DeepSeek v4.1 flash affiche une vitesse de 23 secondes par token sur une configuration M1 de 2020.
BioNeMo Inference Runtime accélère la prédiction de structures biomoléculaires à grande échelle sur GPU.
NVIDIA explique comment son stack NIM maximise la concurrence sur GPU pour les workloads d'IA agentic.
Une méthode décompose les normalizing flows pour isoler des statistiques pivots robustes aux paramètres nuisibles.
Nouveau modèle textuel optimisé pour le temps réel et l'efficacité.
vLLM ajoute le support du décodage spéculatif pour les GPU AMD, promettant une accélération de l'inférence LLM sur cette plateforme.
Georgi Gerganov réagit à l'acquisition d'HuggingFace par Nvidia et évoque l'impact sur le développement futur de llama.cpp et ggml.
L'infrastructure d'inférence nécessite une optimisation globale mémoire, stockage et réseau pour réduire latence et coûts.
Un nouveau cadre exploite le parallélisme des opérateurs sur les SoC hétérogènes pour optimiser latence et débit.
Le modèle Qwen 2.5 72B est désormais proposé sur l'inférence Cerebras, atteignant une vitesse de 1500 tokens par seconde.
Troisième volet d'une série sur le co-design de modèles IA, avec cinq règles pratiques pour choisir la longueur et le mécanisme de draft.
Une optimisation d'inférence 35x plus rapide permet désormais le streaming vidéo génératif en temps réel et interactif.