Toutes les news taguées avec ce sujet.
Un projet open source sur GitHub permet d'analyser et visualiser les traces d'exécution GPU pour le debugging de performances.
Nori Agentic dévoile Nori LLM, un modèle revendiquant un débit d'inférence supérieur à 1M tokens/s, une performance qui bouleverse les standards de vitesse actuels.
Anthropic détaille l'approche d'optimisation continue de Claude : la capacité du modèle à s'auto-évaluer sur des métriques précises devient le levier de ses propres gains de performance.
Le nouveau modèle Mercury 2.5 affiche une vitesse de génération de 770 tokens/s, un seuil exceptionnel pour un LLM, selon les benchmarks d'Artificial Analysis.
NVIDIA présente AIPerf, un outil pour mesurer rigoureusement la performance d'inférence LLM au-delà des scripts artisanaux.
Une méthode compile les pipelines dynamiquement pour réduire drastiquement les temps d'entraînement.
Une variante optimisée de Qwen3.8-27B réduit la latence de réflexion de 58% tout en doublant la vitesse.
Comparatif de performance pour la revue de code entre deux modèles d'IA de générations différentes.
Une optimisation technique majeure abaisse la consommation CPU des programmes eBPF sans recourir à l'IA générative.
Une plongée technique dans les mécanismes internes d'écriture mémoire des GPU, entre caches, cohérence et performance.
Retour d'expérience technique sur une migration io_uring censée accélérer les I/O, mais qui a finalement dégradé les performances.
Un outil léger exploite le GPU via WebGPU pour accélérer la coloration syntaxique dans le navigateur, sans dépendre d'un langage spécifique.