Toutes les news taguées avec ce sujet.
Le co-créateur d'AlphaGo revient sur le coup 37 contre Lee Sedol pour expliquer pourquoi le raisonnement véritable fait encore défaut aux LLM actuels.
Une méthode d'attribution de crédit au niveau des tokens améliore la robustesse du raisonnement des LLM entraînés par RLVR.
Un modèle d'IA générative proposé à un coût nettement inférieur bouleverse le marché et menace la position des leaders américains OpenAI et Anthropic.
Une étude révèle que la majorité des agents IA locaux ne protègent pas leurs traces, permettant la dissimulation de comportements malveillants comme le sabotage.
Les LLM long-context perdent le focus au-delà de la distance : c'est la concurrence du bruit de fond proximal qui écrase l'attention. LYRA corrige ce biais via un mécanisme de matching directionnel t-distribué.
Une étude avec 100 participants mesure les gains de temps réels des outils prompt-to-design comme Figma Make.
Un nouveau système de mémoire conversationnelle distingue qui dit quoi et à qui, pour mieux gérer les échanges à plusieurs.
Agensh propose un système multi-agents sans orchestrateur central. Testé jusqu'à 1 024 agents, il améliore significativement les taux de réussite sur des tâches complexes de programmation.
Une méthode combine les avantages du in-context learning et du fine-tuning léger pour personnaliser des LLM directement sur smartphone.
Un billet d'opinion dénonce l'uniformisation stylistique produite par les LLM, devenue reconnaissable et fatigante à lire.
OpenAI aurait mobilisé ses modèles de langage en interne pour accélérer la conception de sa puce maison baptisée Jalapeño.
ComPO propose une méthode d'optimisation basée sur des oracles de comparaison pour contourner les limites des approches d'alignement direct classiques.
Un nouvel algorithme couple calibration du modèle enseignant et apprentissage de l'élève pour limiter la propagation d'erreurs lors du transfert de compétences.
Douze LLM testés sur 222 questions cliniques révèlent un écart entre citation verbatim et véritable justification des affirmations.
Un papier propose une feuille de route vers l'auto-amélioration récursive des IA, avec un nouvel indice pour mesurer les limites des LLM actuels.
Une étude montre que l'imitation naïve d'un expert dégrade les performances des petits modèles agentiques, contrairement à une correction ciblée sur leurs propres trajectoires.
Une étude montre que les décompilateurs LLM passent les tests de compilation tout en masquant des divergences comportementales et des vulnérabilités.
Une étude teste si les facteurs cités par les LLM pour justifier leurs décisions correspondent réellement à leur comportement observable.
Une méthode en trois phases corrige le problème de gonflement des prompts des optimiseurs évolutionnaires comme GEPA, avec des gains de précision et des prompts plus courts.
Anthropic publie et documente les évolutions des system prompts de Claude, révélant de nouvelles restrictions sur le copyright et le style de réponse.
La startup espagnole revendique un nouveau modèle de 438 milliards de paramètres, présenté comme la référence européenne en IA générative.
Un framework identifie les paires d'étiquettes que les LLM confondent et génère des règles ciblées pour les départager, sans fine-tuning.
Une étude sur 9 modèles open-weights montre que les dégâts de la quantization sont diffus, pas localisés, et que la granularité globale bat les réparations ciblées.
Un nouveau framework RAG identifie les tokens décisifs pendant la génération pour déclencher une récupération de contexte plus précise et efficace.
Deux nouvelles variantes de Claude 5.1 font leur apparition, sans détails précis sur leurs différences fonctionnelles.