Toutes les news taguées avec ce sujet.
Un nouveau cadre couple génération discrète de tokens et trajectoire latente continue pour améliorer les modèles de diffusion textuelle.
Un rapport du MIT Technology Review Insights analyse le virage agentique des entreprises et les défis d'architecture, de gouvernance et de souveraineté qu'il soulève.
Un papier de recherche propose une architecture repensant la gestion du contexte dans les modèles de langage.
Une méthode de décodage contrastif sans entraînement exploite les états intermédiaires des Transformers bouclés pour gagner en précision et en efficacité.
Une étude sur GPT2 et DistilGPT2 montre que délier les embeddings améliore précision et efficacité mémoire en entraînement différentiellement privé.
Une nouvelle architecture MoE à rôles séparés améliore la cohérence du routing et la qualité de génération vidéo, sans surcoût de paramètres actifs.
Un billet revient sur les choix d'architecture de Pi.dev qui écarte le protocole MCP au profit d'une approche alternative pour connecter ses agents.
Un projet open source propose une architecture alternative aux transformers pour les modèles de langage, entièrement codée en Rust.
Une page Notion présente une approche alternative d'entraînement des modèles de langage basée sur des méthodes contrastives.
Unreal Labs dévoile Unreal Agent, une approche inédite pour la conception et l'exécution d'agents autonomes dans des environnements complexes.
Une étude identifie deux mécanismes distincts expliqués par le gating de la voie de valeur dans les modèles de langage : abstention et filtrage du bruit.
Un essai critique remet en question la pertinence du Model Context Protocol, désormais standard de facto pour connecter les LLM aux outils externes.
L'architecture RISC-V remplace progressivement les microcontrôleurs propriétaires dans les GPU Nvidia, jusqu'à prendre en charge le pilote graphique.
Un papier propose de faire échanger des LLMs via leurs caches internes plutôt que par du texte généré, pour transmettre du sens plus directement.
Martin Fowler analyse les limites structurelles des grands modèles de langage.
Des interventions architecturales permettraient de modifier les lois d'échelle, avec des gains de calcul croissants selon la taille du modèle.
Un décryptage technique de l'architecture de DeepSeek-V4.1 Flash, centré sur ses optimisations agressives de compression du cache clé-valeur.
L'étude démontre mathématiquement que l'architecture en arbres des systèmes multi-agents réduit drastiquement la remontée d'informations.
Une nouvelle géométrie fonctionnelle décompose les mises à jour internes des Transformers en composantes parallèles et perpendiculaires, avec des implications concrètes.
NVIDIA détaille les compromis entre architectures denses et Mixture-of-Experts, à travers l'exemple de Nemotron 3.5 Lightning.
Un dépôt open source rassemble des implémentations PyTorch de plusieurs architectures récentes de modèles de langage.
Un nouveau cadre sans entraînement transforme le traitement du contexte long en convolution hiérarchique, réduisant latence et risque de surapprentissage.
Analyse prospective sur les futures architectures LLM et le raisonnement latent.
L'éditeur de code Zed révèle comment l'approche agentielle résout enfin la promesse de son architecture.
Une nouvelle architecture à état $O(n)$ et routage dynamique sparse compense 75% des couches denses d'un Transformer.