Toutes les news taguées avec ce sujet.
Un projet open source promet d'exécuter un modèle de 125 milliards de paramètres sur une seule RTX 4090, à haute vitesse.
Un framework d'évolution de code combine un LLM puissant pour explorer les stratégies et un LLM moins cher pour les implémenter, en optimisant le gain par dollar dépensé.
Un nouveau papier explique pourquoi le gradient de politique exact perd face à l'entropie croisée, et propose une « horizon loss » qui comble l'écart.
Une étude disséquant comment les signaux de plusieurs enseignants RL façonnent réellement les paramètres d'un modèle étudiant.
Un nouvel optimiseur quasi-Newton promet des courbures positives garanties et de meilleures pertes qu'Adam, Muon ou SOAP sur des problèmes mal conditionnés.
Un framework léger découple direction et taille de pas d'optimisation, avec garanties théoriques et gains de performance sur plusieurs LLM.
Un nouvel article montre qu'un tilt de Feynman-Kac remplace l'apprentissage par différence temporelle pour résoudre exactement ces ponts probabilistes.
Une méthode d'optimisation bi-niveau fait évoluer conjointement les requêtes de recherche et les solutions, sans modifier les paramètres du LLM.
Des chercheurs proposent une nouvelle politique qui dépasse la borne classique en 1/√N pour une famille de processus de décision markoviens couplés.
Une étude analytique révèle pourquoi le DFA peut se bloquer près d'un prédicteur constant, et propose des correctifs simples pour l'éviter.
Une théorie de premier ordre relie optimisation et échantillonnage pour les modèles de diffusion basés SDE et ODE.
Un article technique détaille une optimisation du prompt lookup decoding, une méthode de génération accélérée dans llama.cpp.
Un nouveau cadre théorique, AEP, atteint la complexité optimale pour résoudre les problèmes d'inclusion monotone composite, surpassant toutes les bornes supérieures connues.
H Company détaille comment identifier et corriger les fuites de VRAM qui plombent l'entraînement et l'inférence des modèles.
Anthropic détaille l'approche d'optimisation continue de Claude : la capacité du modèle à s'auto-évaluer sur des métriques précises devient le levier de ses propres gains de performance.
Une étude théorique caractérise géométriquement les classifieurs à norme minimale et montre comment les skip connections garantissent l'optimalité globale.
Un développeur utilise des agents IA pour optimiser itérativement du code Rust, exploitant leurs capacités pour identifier et appliquer des améliorations de performance de manière autonome.
Le modèle Qwen 3.8 27B est optimisé pour tourner sur 13,1 Go de VRAM, facilitant son déploiement local.
La startup H Company dévoile des techniques d'optimisation mémoire pour réduire la consommation VRAM.
Une méthode compile les pipelines dynamiquement pour réduire drastiquement les temps d'entraînement.
Un décryptage technique de l'architecture de DeepSeek-V4.1 Flash, centré sur ses optimisations agressives de compression du cache clé-valeur.
Un chercheur entraîne un petit LLM spécialisé pour optimiser les plans d'exécution de requêtes SQL, surpassant l'optimiseur natif de PostgreSQL.
Une variante optimisée de Qwen3.8-27B réduit la latence de réflexion de 58% tout en doublant la vitesse.
Une méthode d'entraînement fondée sur le lagrangien augmenté et le predictive coding, présentée comme alternative à la backpropagation classique.
Des chercheurs proposent un cadre théorique unifiant les méthodes de régularisation contre les perturbations adversariales en RL profond.
Une étude unifie les algorithmes de recommandation issus du deep learning sous deux familles de régularisation, et propose deux nouvelles solutions hybrides.
Quesma teste les promesses de réduction de coûts de RTK. Les résultats indiquent des économies moindres que ce qui est annoncé.
Une nouvelle approche compile les jeux en graphes CUDA statiques, faisant enfin dépasser le GPU sur le CPU pour l'algorithme CFR utilisé en théorie des jeux.
Un article de mathématiques pures construit des contre-exemples à une conjecture classique sur les opérateurs monotones maximaux, sans lien avec l'IA appliquée.
NVIDIA détaille une technique d'optimisation d'inférence qui sépare l'encodage visuel du prefill et du decode, avec des gains jusqu'à 5x.