Toutes les news taguées avec ce sujet.
Une méthode de décodage contrastif sans entraînement exploite les états intermédiaires des Transformers bouclés pour gagner en précision et en efficacité.
Une étude théorique d'un transformer minimal révèle des transitions dynamiques complexes entre diffusion, chaos et condensation de l'attention.
La bibliothèque Transformers de Hugging Face intègre nativement les modèles quantifiés au format GGUF de llama.cpp.
Un outil interactif qui décompose le fonctionnement interne des modèles Transformer, étape par étape et en direct dans le navigateur.
Une étude identifie deux mécanismes distincts expliqués par le gating de la voie de valeur dans les modèles de langage : abstention et filtrage du bruit.
Des interventions architecturales permettraient de modifier les lois d'échelle, avec des gains de calcul croissants selon la taille du modèle.
Une nouvelle géométrie fonctionnelle décompose les mises à jour internes des Transformers en composantes parallèles et perpendiculaires, avec des implications concrètes.
Une méthode de sparsification de l'attention aligne directement le classement du contexte sur l'impact prédictif, sans bloquer les gradients.
Une étude remet en cause l'idée que la généralisation structurelle est intrinsèquement plus difficile que la lexicale pour les Transformers.
Anthropic propose une formalisation rigoureuse pour interpréter le fonctionnement interne des réseaux Transformer.
Une étude interroge la nécessité des encodages de position pour la généralisation de distance chez les transformers.
Un framework robuste qui personnalise les modèles de recherche par région au niveau des gradients, évitant l'effondrement des transformers.
Une nouvelle architecture à état $O(n)$ et routage dynamique sparse compense 75% des couches denses d'un Transformer.