Toutes les news taguées avec ce sujet.
Une bibliothèque open source permet l'inférence de modèles à 70 milliards de paramètres sur du matériel grand public à mémoire très limitée.
Un service de tokenisation avec état qui élimine la répétition coûteuse pour les agents, accélérant le traitement jusqu'à 437x.
LocalAI explique les raisons techniques et stratégiques de l'écriture de moteurs C++ dédiés à l'inférence.
Un projet démontre la faisabilité de faire tourner un modèle BitNet sur le microprocesseur 6502.
OpenAI révèle que GPT 5.6 a réduit ses propres coûts d'infrastructure grâce à l'optimisation autonome de kernels et speculative decoding.
Une méthode de réplication prédictive du cache KV optimise l'inférence lors des pics de charge.
AMD publie un guide technique détaillant l'optimisation de kernels d'attention decode via Gluon sur ses futurs accélérateurs MI450.
L'analyse économique de la flambée des coûts de calcul pour les labs d'IA face à la croissance des revenus.
OpenAI dévoile GPT-5.6, optimisant l'efficacité de l'inférence et des workflows agents pour maximiser l'intelligence par dollar.
Une attaque par charge de travail peut dégrader la précision des systèmes d'inférence distribué en exploitant la contention réseau.
Le modèle Kimi K3 est désormais accessible au travers de l'API d'inférence de Telnyx.
Une discussion technique explore ce que recouvre réellement le paramètre 'effort' proposé par certains fournisseurs de LLM.
Un partenariat pour une inférence ultra-rapide à haut débit.
Un modèle 48B en open-weights optimisé pour l'efficience.
Hugging Face intègre Nunchaku pour accélérer l'inférence Stable Diffusion via la quantification 4-bit.
NVIDIA ajoute un suivi de progression et une annulation à la volée pour les longues compilations de moteurs TensorRT.
Analyse technique des méthodes pour optimiser les ressources de calcul.
Une nouvelle méthode de gestion mémoire pour les modèles MoE promet jusqu'à 72% d'économies GPU sans perte de précision.
Un projet démontre une inférence de classification d'images entièrement chiffrée, avec un temps de calcul ramené à 200 millisecondes.
Inférence d'un modèle 26B sur du matériel obsolète via optimisation logicielle.
Une méthode sans apprentissage pour conditionner divers modèles stochastiques complexes via des SDE rétrogrades.
Un projet open source propose un moteur d'inférence bas niveau optimisé pour faire tourner Qwen 3.6 35B sur les GPU Blackwell.
Microsoft Azure AI Foundry intègre les modèles Hugging Face via un service de calcul managé, simplifiant le déploiement en production.
PAW compile des spécifications en langage naturel en adaptateurs légers exécutables localement, rivalisant avec un LLM 32B avec 50× moins de mémoire.
Une approche multi-agents légère intégrée à l'API de vLLM permettrait de dépasser les performances des grands modèles frontier sans coût supplémentaire.