Toutes les news taguées avec ce sujet.
Un nouveau cadre organise les chemins d'optimation pour améliorer l'efficacité du Parameter-Efficient Fine-Tuning.
Contrairement aux prédictions de consolidation du secteur, de plus en plus de labs se lancent dans l'entraînement de modèles ouverts performants et rentables.
Un outil open source implémentant une boucle autonome d'amélioration par fine-tuning pour les modèles d'IA.
Un projet open source propose des scripts légers pour tester SFT, DPO et GRPO sur du matériel grand public limité à 8 Go de VRAM.
Un pipeline automatisé génère des environnements d'entraînement pour apprendre à des modèles compacts à coder des programmes entiers, de zéro à la maintenance.
Un framework léger adapte les modèles CT pour aligner vision et langage au niveau anatomique.
L'étude remet en cause l'intérêt du pré-entraînement des Q-fonctions lors du fine-tuning online en RL.
Une nouvelle méthode de routage ajuste dynamiquement le nombre d'experts activés selon l'incertitude du modèle, token par token.
Un nouveau mécanisme de relais enseignant-élève réduit l'échec en cascade lors de la distillation, avec des gains mesurables sur le raisonnement mathématique.
Une étude factorielle contrôlée de 1 215 runs isole l'effet de l'architecture, de la variante et de la taille des modèles sur l'entity matching.
Un fine-tuning par renforcement peu coûteux permet à un petit modèle open-weights de dépasser les SOTA sur une tâche de revue de catalogue.
Une méthode sélective réduit de moitié les paramètres entraînables du fine-tuning LoRA en ciblant les matrices les plus informatives.
Un framework transforme des cas cliniques en jeux interactifs structurés via une architecture à double moteur.
Vingt-six modèles ASR en licence Apache-2.0 couvrent 27 langues africaines, avec des taux d'erreur mots comparables aux baselines monolingues.
Une nouvelle solution permet de simplifier et d'accélérer le fine-tuning du modèle Nemotron 3 Nano via Prime Intellect Lab.
Un nouveau benchmark et corpus d'instruction en cinghalais-anglais pour corriger le biais occidental de l'alignement des valeurs des LLM.
Une nouvelle approche exploite la structure spectrale des poids pour accélérer et fusionner des modèles entraînés par RLVR, avec des gains d'efficacité mesurables.
Deux nouveaux adaptateurs inspirés de Mamba ajoutent une mémoire dynamique au LoRA, avec des gains mesurables sur le raisonnement multi-sauts.
Un framework task-aware et budget-aware qui optimise le fine-tuning des LLM en sélectionnant 1% à 10% des données.
Une alternative lisse au clipping de PPO et GRPO testée sur Llama-3.2-1B pour le post-entraînement de LLM par RLHF.
Un nouveau benchmark et une métrique VLM permettent de conditionner la similarité visuelle selon un aspect précis (forme, couleur, etc.).
Une méthode qui transforme les évaluations par rubrique en diagnostic précis des capacités faibles d'un modèle, pour générer des données de fine-tuning ciblées.
Un leaderboard open source mesure la rapidité des différentes méthodes de fine-tuning LoRA sur des tâches standardisées.
Hugging Face intègre NVIDIA NeMo Automodel à Diffusers pour accélérer l'entraînement distribué.
NVIDIA montre comment des agents de codage automatisés accélèrent l'adaptation de modèles de raisonnement visuel pour la production vidéo.
Une approche basée sur LoRA fusionne progressivement plusieurs modalités pour la reconnaissance d'actions en formation médicale.
Un développeur détaille un projet où un agent, lui-même entraîné par renforcement, orchestre l'entraînement RL d'autres modèles à faible coût.
Un framework de reinforcement learning affine les politiques robotiques pré-entraînées pour les tâches de manipulation industrielle à contact précis.
Les paramètres jugés critiques dans les LLMs ne sont pas pour autant les meilleurs cibles d'entraînement — une étude remet en question le concept de Super Weights.
Une méthode de régularisation sans état qui améliore la compressibilité des réseaux de neurones avec moins de 1 % de surcoût à l'entraînement.