Toutes les news taguées avec ce sujet.
Un nouveau tokenizer baptisé Gigatoken promet des performances de traitement inédites, selon un thread partagé sur X.
Une méthode pour agrandir le vocabulaire d'un modèle déjà entraîné sans repartir de zéro, appliquée à LFM2.5-8B-A1B.
Une méthode de 'transplantation' de vocabulaire améliore considérablement l'ASR edge pour le Bengali sans ré-entraînement complet.