Toutes les news taguées avec ce sujet.
Un projet open source promet d'exécuter un modèle de 125 milliards de paramètres sur une seule RTX 4090, à haute vitesse.
Alibaba met à jour son modèle de génération d'images Qwen avec cette version 2.1, sans détails techniques disponibles à ce stade.
Une méthode de distillation adaptative améliore les agents RL en désactivant le professeur une fois l'étudiant performant.
Installation en un clic pour exécuter un modèle de 27 milliards de paramètres sur du matériel grand public.
Le modèle Qwen 3.8 27B est optimisé pour tourner sur 13,1 Go de VRAM, facilitant son déploiement local.
Une variante optimisée de Qwen3.8-27B réduit la latence de réflexion de 58% tout en doublant la vitesse.
Une pipeline multicanaux combine DeBERTa et MC Dropout pour détecter les hallucinations, réduisant drastiquement le taux d'erreur de Qwen2.5.
Le modèle Qwen 3.8 adopte une approche de préremplissage similaire au raisonnement de GPT-5.5 Pro.
Une méthode sépare la génération de tests de la réparation pour améliorer les performances des agents.
Le modèle Qwen 2.5 72B est désormais proposé sur l'inférence Cerebras, atteignant une vitesse de 1500 tokens par seconde.