Toutes les news taguées avec ce sujet.
NVIDIA propose une approche pour mutualiser l'infrastructure GPU tout en garantissant l'isolation des locataires.
Un service de tokenisation avec état qui élimine la répétition coûteuse pour les agents, accélérant le traitement jusqu'à 437x.
Une nouvelle technologie mémoire pourrait permettre aux GPU d'intégrer plusieurs téraoctets, repoussant les limites actuelles.
Face à la montée des workloads agentiques et à contexte long, NVIDIA plaide pour une co-conception de l'attention et du hardware GPU.
AMD publie un guide technique détaillant l'optimisation de kernels d'attention decode via Gluon sur ses futurs accélérateurs MI450.
Le fabricant chinois Hygon présente un processeur haute densité et une puce IA visant à rivaliser avec Intel et Nvidia sur le marché du calcul serveur.
Une nouvelle librairie Python fait le pont entre l'écosystème scientifique et les bibliothèques CUDA-X pour accélérer les calculs sur GPU.
Un article compare les GPU sous-utilisés à des flottes d'avions immobilisées, soulignant le coût caché de la mauvaise allocation des ressources de calcul.
Des clusters identiques H100 ou GB200/GB300 NVL72 peuvent afficher jusqu'à 12% d'écart de performance selon la configuration logicielle et système.
Un benchmark interne montre que le self-hosting du modèle Kimi K3 améliore la résolution de tâches de 20% pour un surcoût matériel équivalent.
Face au manque de données cliniques réelles, NVIDIA propose une approche de simulation GPU pour entraîner des robots médicaux.
Utiliser une carte graphique de gaming RTX 5070 hébergée sur une machine distincte pour des tâches de calcul Linux.
Un nouvel outil open source promet des graphiques interactifs composables, avec accélération GPU pour des performances élevées.
Bloomberg publie une librairie open-source dédiée à la découverte causale dans des séries temporelles multivariées, non-stationnaires et à haute dimension.
Une méthode accélère les calculs de Sinkhorn utilisés en Flow Matching jusqu'à 4x, sans compromettre la précision des résultats.
Analyse des spéculations sur une possible intentionnalité derrière la rareté des composants.
NVIDIA détaille les outils de débogage intégrés à l'OptiX Toolkit pour diagnostiquer erreurs API, frames noires et bugs GPU concurrents.
L'absence de marché secondaire mature pour les clusters GPU pose un vrai problème de valorisation des actifs IA.
NVIDIA détaille l'architecture Rubin, pensée pour les workflows agentiques multi-étapes et le raisonnement à grande échelle.
AMD détaille l'intégration de SPIR-V dans sa pile ROCm, une étape vers plus de portabilité pour la compilation GPU.
Un billet technique détaille la chasse aux « fantômes VRAM », ces fuites de mémoire GPU qui plombent l'entraînement des modèles.
NVIDIA comble un manque de longue date en ajoutant un support matériel GPU pour une primitive clé de la cryptographie moderne.
Spectral Compute veut affranchir CUDA de Nvidia et permettre son exécution sur d'autres architectures GPU.
Un ingénieur teste d'anciennes cartes graphiques données pour obsolètes face à des workloads IA et compute actuels.
Un projet open source propose un moteur d'inférence bas niveau optimisé pour faire tourner Qwen 3.6 35B sur les GPU Blackwell.
H Company détaille des techniques pour diagnostiquer et corriger les fuites de VRAM lors de l'entraînement de modèles d'IA.
Une analyse décortique comment Nvidia alimente financièrement ses propres clients cloud pour soutenir la demande en GPU, créant une boucle de financement potentiellement fragile.
NVIDIA présente les performances de Presto, moteur SQL distribué open source, optimisé pour ses GPU GB200 NVL72 dans des contextes analytiques et agents IA.
Cerebrium détaille une technique de snapshots mémoire pour restaurer des workloads CUDA en moins d'une seconde et contourner les cold starts GPU.