Toutes les news taguées avec ce sujet.
Une méthode cible uniquement les tokens-pivots les plus déterminants pour affiner les dLMs, avec un gain de performance à faible coût d'entraînement.
Une étude identifie la découverte de primitifs mathématiques comme principal goulot d'étranglement du raisonnement des LLM, et propose une méthode de correction par auto-distillation.
Une méthode entraîne un petit modèle « conseiller » à guider des LLM figés plus puissants, avec des gains mesurés sur BFCL-v3 et EnvScaler.