Toutes les news taguées avec ce sujet.
Un modèle GPT-2 125M entraîné exclusivement sur du français révèle l'importance des benchmarks natifs et la sensibilité au tokenizer.
Une étude systématique montre que les pertes spécifiques par tâche sont plus fiables que la reconstruction pour évaluer les tokenizers d'images.