Toutes les news taguées avec ce sujet.
Queen, un modèle de 4 milliards de paramètres, combine un moteur d'échecs silencieux et un LM pour atteindre le niveau Grand Maître tout en expliquant ses décisions.
Une méthode de distillation remplace le décodage neuronal coûteux par une combinaison linéaire de blendshapes, accélérant l'animation d'avatars 3D jusqu'à 1000x.
Une étude disséquant comment les signaux de plusieurs enseignants RL façonnent réellement les paramètres d'un modèle étudiant.
Une nouvelle méthode remplace l'estimation de score par une classification adversariale, supprimant le modèle auxiliaire coûteux de la distillation par correspondance de distribution.
Une nouvelle technique filtre les erreurs du critique dans la distillation par correspondance de distribution, réduisant les artefacts visuels tout en accélérant la génération vidéo.
Une étude montre que les poids MLP des ViT Softmax se transfèrent tels quels vers les ViT linéaires, tandis que l'attention doit être distillée pour combler l'écart de performance.
Une méthode d'entraînement assistée par un enseignant réduit le coût de communication des agents IA tout en améliorant l'atteinte de leurs objectifs sociaux.
Une nouvelle méthode combine signaux du vérificateur et du modèle enseignant dans GRPO pour affiner l'apprentissage du raisonnement mathématique token par token.
Une méthode de distillation on-policy corrige les biais d'exposition amplifiés par la quantification sub-3-bit, restaurant la performance des modèles sur les tâches de raisonnement long.
Une méthode pour transférer les bénéfices d'un harnais d'agent optimisé vers un modèle, sans dépendre de ce harnais au déploiement.
Une méthode de distillation adaptative améliore les agents RL en désactivant le professeur une fois l'étudiant performant.
Un nouvel algorithme couple calibration du modèle enseignant et apprentissage de l'élève pour limiter la propagation d'erreurs lors du transfert de compétences.
Le patron de Y Combinator plaide pour que les laboratoires open-weight américains adoptent la distillation, technique déjà utilisée par des acteurs chinois comme DeepSeek.
Une méthode distille le raisonnement d'LLMs dans un classifieur léger avec adaptation locale par type de produit.
Une étude montre que la distillation on-policy peut atteindre des performances quasi-optimales avec une seule donnée d'entraînement.
Une méthode de compilation qui transforme une description textuelle en petit modèle spécialisé, autonome et réutilisable, sans dépendre d'un LLM distant.
Une analyse explore les contraintes théoriques qui lient la qualité d'échantillonnage aux coûts de calcul lors de la distillation de modèles de diffusion.
SAGE interroge un VLM seulement en cas d'incertitude pour distiller une politique RL légère, autonome à l'évaluation.