Toutes les news taguées avec ce sujet.
Dwarkesh Patel décline en vidéo sa thèse sur l'inflation potentielle des coûts de compute liée à l'essor de modèles plus performants.
Un RL à grande échelle est déployé sur 365 000 environnements pour des tâches SWE, terminal et recherche.
Intel dévoile cinq recommandations techniques pour déployer efficacement des agents logiciels complexes sur une infrastructure scalable.
Une équipe de recherche fait passer l'apprentissage par renforcement pur (« zero RL ») à l'échelle du trillion de paramètres, avec des capacités de raisonnement qui émergent sans supervision.
Des chercheurs proposent de faire de la vérification un nouvel axe de scaling pour les LLM, sans entraînement supplémentaire.
Un essai de réflexion sur le compromis fondamental entre largeur (MoE, parallélisme) et profondeur (chaînes de raisonnement) dans l'architecture des modèles de langage.
Retour d'expérience détaillé sur le passage à l'échelle du coding agentique chez Lovable, après une dépense de 85 000 $ en tokens.
Agents-A1 démontre qu'élargir l'horizon agentic d'un modèle MoE 35B suffit à rivaliser avec des LLM mille fois plus grands.