Toutes les news taguées avec ce sujet.
Un nouveau cadre couple génération discrète de tokens et trajectoire latente continue pour améliorer les modèles de diffusion textuelle.
Une nouvelle architecture MoE à rôles séparés améliore la cohérence du routing et la qualité de génération vidéo, sans surcoût de paramètres actifs.
Une théorie de premier ordre relie optimisation et échantillonnage pour les modèles de diffusion basés SDE et ODE.
Le fine-tuning des encodeurs visuels pour la reconstruction réduit la dimensionnalité effective des latents, rendant le flow matching sous-optimal. La prédiction x₀ résout ce problème.
Une méthode injecte des traces de raisonnement d'un modèle enseignant pour débloquer l'exploration en RL sur les modèles de diffusion.
Une méthode sans entraînement pour générer de nouvelles vues dans les scènes avec miroirs en exploitant le contenu réfléchi.
Une installation artistique interactive permet de manipuler physiquement un processus de diffusion via un téléviseur CRT.
Une analyse explore les contraintes théoriques qui lient la qualité d'échantillonnage aux coûts de calcul lors de la distillation de modèles de diffusion.