Toutes les news taguées avec ce sujet.
Un nouveau benchmark révèle que même les agents IA les plus avancés peinent à retrouver les travaux antérieurs clés derrière une découverte scientifique.
Une méthode d'optimisation bi-niveau fait évoluer conjointement les requêtes de recherche et les solutions, sans modifier les paramètres du LLM.
Un nouveau benchmark révèle que l'efficacité, pas seulement la précision, distingue vraiment les harnais pour LLM en contexte long.
Un benchmark inédit teste la détection de citations et allusions bibliques en danois ancien, entre méthodes lexicales classiques et encodeurs neuronaux fine-tunés.
Une étude auditant 22 modèles frontières révèle un phénomène massif de mémorisation littérale sur les benchmarks de propriétés moléculaires.
Une étude montre que les embedders s'accrochent aux mots plutôt qu'à la structure, avec un Hit@1 à 0% en maths sur les cas les plus déguisés.
Un framework identifie les paires d'étiquettes que les LLM confondent et génère des règles ciblées pour les départager, sans fine-tuning.
Un nouveau framework RAG identifie les tokens décisifs pendant la génération pour déclencher une récupération de contexte plus précise et efficace.