Toutes les news taguées avec ce sujet.
Un framework exploitant les similarités des tâches robotiques pour accélérer l'inférence des modèles Vision-Language-Action.
Une nouvelle méthode de quantisation repousse les limites de compression des LLM ternaires sans perte significative de performance.
Une nouvelle approche BPO optimise les politiques d'IA sans estimateur de valeur, améliorant le raisonnement mathématique.
Un langage spécifique pour automatiser et optimiser la conception des infrastructures d'inférence de grands modèles de langage.
Une optimisation technique majeure abaisse la consommation CPU des programmes eBPF sans recourir à l'IA générative.
Les Tree Tensor Networks prouvent que des minima locaux bénins n'excluent pas une difficulté d'apprentissage intrinsèque.
Une méthode de sparsification de l'attention aligne directement le classement du contexte sur l'impact prédictif, sans bloquer les gradients.
Un développeur parvient à atteindre 50 Go/s sur l'Apple Neural Engine en exploitant le DMA pour contourner les limitations.
NVIDIA explique comment son stack NIM maximise la concurrence sur GPU pour les workloads d'IA agentic.
Une loi exacte explique l'interaction entre lr et weight decay dans les réseaux normalisés.