Toutes les news taguées avec ce sujet.
Un tour d'horizon de l'évolution des méthodes de classification de texte, du comptage de mots aux architectures modernes de langage.
Un benchmark inédit teste la détection de citations et allusions bibliques en danois ancien, entre méthodes lexicales classiques et encodeurs neuronaux fine-tunés.
Un nouveau dataset multimodal vise à combler le manque de ressources non anglophones pour détecter le hate speech en contexte mexicain.
Une page Notion présente une approche alternative d'entraînement des modèles de langage basée sur des méthodes contrastives.
L'apprentissage contrastif surpasse l'approche par classification pour la vérification de paternité, atteignant 98,4 % de précision sur le benchmark PAN21.
Un billet explore l'idée provocatrice d'utiliser la compression gzip comme méthode de modélisation du langage, sans réseau de neurones.
Un modèle hybride nommé SLITE combine analyse structurelle et distributionnelle pour rivaliser avec RoBERTa, tout en restant explicable.
Hugging Face publie la v1 de sa lib tokenizers avec des benchmarks de vitesse et de scalabilité pour l'encode et le decode.
Un jeu de données Hugging Face répertorie 307 figures du Mahabharata, annotées selon leurs traits et schémas décisionnels.
Une étude évalue si des classifieurs entraînés sur le secteur du BTP restent performants en métallurgie et en chimie-plastique.
Une étude sur 2,86 millions de posts durant l'élection américaine de 2024 modélise six théories de l'hostilité intergroupe en un cadre commun.
Une étude révèle que les embeddings modélisent mal les mesures physiques objectives, privilégiant la similarité textuelle.
Une étude décompose BPE et UnigramLM en deux axes distincts pour identifier ce qui explique réellement leurs différences de performance.
Une étude remet en cause l'idée que la généralisation structurelle est intrinsèquement plus difficile que la lexicale pour les Transformers.
Le modèle Fable 5.1 parvient à décrypter le Cyphral Distich, une énigme cryptographique non résolue depuis 1654.
Le lab Pleias publie GoldenSwag, un jeu de données disponible sur Hugging Face.
Une initiative complète pour combler le sous-représentation de l'arabe dans les modèles audio.
Un nouvel algorithme améliore la classification automatique des commentaires dans le code source pour distinguer documentation et annotations.
Une étude arXiv explore une structure géométrique commune aux espaces d'embeddings, ouvrant la voie à leur traduction sans supervision directe.
Un nouveau benchmark collaboratif rassemble des exemples multimodaux conçus pour faire échouer les meilleurs systèmes de traduction actuels.
Hugging Face dévoile NeoMME, un encodeur efficace et nativement multimodal pour le multilingue.
Un cadre basé sur des LLM améliore la cohérence spatiale et le suivi des entités dans la traduction texte-langue des signes au-delà de la phrase isolée.
Un framework améliore l'extraction biomédicale en RAG via un chunking sémantique adaptable.