Toutes les news taguées avec ce sujet.
Une nouvelle méthode remplace l'estimation de score par une classification adversariale, supprimant le modèle auxiliaire coûteux de la distillation par correspondance de distribution.
Une nouvelle architecture fait tourner les mêmes blocs Transformer plusieurs fois par étape de diffusion, surpassant des modèles 6,5x plus gros à compute réduit.
Une étude théorique montre que la fenêtre de non-localité, où le contexte local devient insuffisant, s'inscrit dans la fenêtre de spéciation sémantique.
Un nouveau cadre théorique relie modélisation de distribution et flux de gradient de Wasserstein pour améliorer la génération d'images en une seule étape.
Une méthode apprenant une interface commune pour contrôler précisément la couleur des objets via des codes hex.
Une méthode compile les pipelines dynamiquement pour réduire drastiquement les temps d'entraînement.
Une nouvelle approche par transport discret pour la génération de langage en une étape sans distillation.
Un backbone de diffusion masquée traite langage, vision, buts et actions comme des tokens discrets pour la robotique conditionnée par instructions.
Une méthode sans entraînement unifiant édition guidée par instruction et par sujet, surpassant les baselines sans training sur FiVE.