Toutes les news taguées avec ce sujet.
Une nouvelle méthode généralise l'auto-distillation on-policy en introduisant un paramètre β pour équilibrer stabilité et performance.
VAD isole les preuves visuelles dans la distillation multimodale on-policy pour améliorer la reconstruction des cibles.
Une expérience montre que les modèles dérivés par distillation de DeepSeek perdent ses mécanismes de censure.
Un système hybride LLM/SLM étend la recherche au-delà du match strict pour révéler produits substituts et complémentaires en e-commerce.
Une nouvelle technique de distillation par trajectoire réduit le nombre d'étapes de débruitage sans sacrifier la diversité des générations vidéo.
Un nouveau mécanisme de relais enseignant-élève réduit l'échec en cascade lors de la distillation, avec des gains mesurables sur le raisonnement mathématique.
Une étude systématique en environnement contrôlé décortique comment les modèles acquièrent et affinent la capacité de planification longue durée.
Une nouvelle méthode améliore la distillation on-policy en corrigeant les déséquilibres du CFG.
Un nouveau cadre transfère le raisonnement logique de modèles textuels vers des modèles audio via un alignement on-policy.
Des informations suggèrent que le modèle K3 de Moonshot a été élaboré en distillant Fable, un LLM concurrent.
Analyse de l'essor des modèles chinois, de la distillation et des enjeux géopolitiques pour l'écosystème open-source.
TREK combine distillation et GRPO pour débloquer les prompts difficiles que le modèle étudiant ne sait pas résoudre seul.
Une méthode transfère le signal RLVR d'un petit modèle vers un plus grand, sans relancer le RL coûteux sur la cible.
Une nouvelle méthode amplifie les biais furtifs des LLM en concentrant les divergences de distribution dans un adaptateur KV-cache, les rendant détectables.
Des chercheurs montrent que la génération de paires QA synthétiques pour le fine-tuning introduit des biais structurels et des vulnérabilités d'injection souvent ignorés.
Agents-A1 démontre qu'élargir l'horizon agentic d'un modèle MoE 35B suffit à rivaliser avec des LLM mille fois plus grands.
Un nouveau paradigme de distillation pour LLM et VLM qui contourne l'illusion de privilège en routant dynamiquement la supervision token par token.