Toutes les news taguées avec ce sujet.
800 modèles entraînés révèlent que le texte IA dans les corpus web profite d'abord puis nuit à la qualité du pretraining, selon les volumes disponibles.
Common Crawl publie un guide pour accéder à ses archives web via un bucket hébergé sur Hugging Face, facilitant leur usage pour l'entraînement de modèles.
Une nouvelle géométrie fonctionnelle décompose les mises à jour internes des Transformers en composantes parallèles et perpendiculaires, avec des implications concrètes.
Une étude systématique montre que les pertes spécifiques par tâche sont plus fiables que la reconstruction pour évaluer les tokenizers d'images.
Une étude compare recettes de modèles et corpus de données de 2019 à 2025 pour isoler la source réelle des gains de performance en pré-entraînement.
Un nouveau schéma de quantification FP4 simplifie le pré-entraînement en basse précision et améliore les performances face à la recette NVIDIA existante.
Une nouvelle architecture à état $O(n)$ et routage dynamique sparse compense 75% des couches denses d'un Transformer.