Toutes les news taguées avec ce sujet.
Une méthode cible uniquement les tokens-pivots les plus déterminants pour affiner les dLMs, avec un gain de performance à faible coût d'entraînement.
Cloudflare dévoile Clef, une famille de modèles de décision à poids ouverts, accompagnée d'une plateforme de fine-tuning par renforcement.
Un framework léger découple direction et taille de pas d'optimisation, avec garanties théoriques et gains de performance sur plusieurs LLM.
Un nouvel optimiseur réduit de 174× la mémoire d'état par rapport à AdamW8bit, rendant possible le fine-tuning complet de modèles 30-32B sur du matériel limité.
ServiceNow-AI dévoile une méthode pour synthétiser des jeux de données destinés à entraîner des agents IA en contexte professionnel.
NVIDIA détaille le fine-tuning de son modèle Nemotron pour améliorer la reconnaissance vocale des dialectes arabes régionaux, souvent mal couverts par les benchmarks multilingues.
Une étude sur GPT2 et DistilGPT2 montre que délier les embeddings améliore précision et efficacité mémoire en entraînement différentiellement privé.
Une méthode de fine-tuning basée uniquement sur des explications rétrospectives rivalise avec GRPO sur SWE-bench, sans reward ni verifier.
Une méthode qui fige les anciens adaptateurs LoRA et n'autorise que des lectures en une seule direction pour ajouter de nouvelles compétences sans interférence.
Un fine-tuning auto-supervisé basé sur la confiance réduit de 25% les tokens générés par les modèles de raisonnement, sans perte de précision.
Un billet technique détaille l'adaptation du modèle GLM-5.3-Flash pour en faire un système de décision rapide inspiré du concept de 'System One'.
Un article de blog décortique le RLCD, une technique d'entraînement par renforcement citée comme clé du modèle Jev.
L'atténuation de l'oubli catastrophique lors du fine-tuning pour la traduction préserve les capacités générales, mais échoue sur les instructions de contrôle spécifiques à la traduction.
Un nouveau modèle du monde corrige les raisonnements bruités des agents LLM plutôt que de simuler les retours des outils.
Une méthode de transfert séquentiel par LoRA permet de prédire la sévérité de la dépression via des LLM, même avec peu de données cliniques et à travers les barrières linguistiques.
Le fine-tuning des encodeurs visuels pour la reconstruction réduit la dimensionnalité effective des latents, rendant le flow matching sous-optimal. La prédiction x₀ résout ce problème.
Une méthode pour transférer les bénéfices d'un harnais d'agent optimisé vers un modèle, sans dépendre de ce harnais au déploiement.
Une infrastructure convertit les dépôts de code scientifique en environnements exécutables pour entraîner et évaluer des agents IA.
Un chercheur entraîne un petit LLM spécialisé pour optimiser les plans d'exécution de requêtes SQL, surpassant l'optimiseur natif de PostgreSQL.
ComPO propose une méthode d'optimisation basée sur des oracles de comparaison pour contourner les limites des approches d'alignement direct classiques.
Retour d'expérience sur l'usage des modèles OpenAI, du fine-tuning et de la mémoire pour automatiser la gestion des e-mails.
Une étude empirique sur huit jeux de données CGM montre que le fine-tuning léger surpasse les modèles zero-shot pour la prévision glycémique.
Tiny Aya L2-Thinker prouve qu'un mélange data-centric optimisé généralise le raisonnement L2 à 60 langues sans supervision extensive.
Un développeur raconte comment il a entraîné un système IA à捕capturer ses préférences esthétiques et éditoriales spécifiques.
Une étude montre que l'imitation naïve d'un expert dégrade les performances des petits modèles agentiques, contrairement à une correction ciblée sur leurs propres trajectoires.
Un nouveau benchmark et une méthode de synthèse par exécution permettent à un modèle open-source de 9B de rivaliser avec un 27B non affiné.
Une méthode de compilation qui transforme une description textuelle en petit modèle spécialisé, autonome et réutilisable, sans dépendre d'un LLM distant.
Hugging Face montre comment améliorer les sorties structurées d'un petit modèle via GRPO avec TRL, en seulement 100 étapes d'entraînement.
Nemotron-3-Ultra-CC dépasse le meilleur score humain à l'IOI 2026, une première pour un système d'IA sur ce type d'épreuve.
Une étude montre que le feedback utilisateur améliore réellement les révisions de modèles, mais que les juges LLM échouent à le reconnaître.