Toutes les news taguées avec ce sujet.
Un cadre FSL quantifié pour optimiser l'énergie des DNN sur appareils mobiles contraints.
Un projet démontre la faisabilité de faire tourner un modèle BitNet sur le microprocesseur 6502.
MixFrag optimise le déploiement des ViT via une allocation de précision adaptative.
Un projet démontre la faisabilité de faire tourner un petit modèle LLM sur ESP32, un microcontrôleur à très bas coût.
Hugging Face intègre Nunchaku pour accélérer l'inférence Stable Diffusion via la quantification 4-bit.
Une nouvelle méthode de gestion mémoire pour les modèles MoE promet jusqu'à 72% d'économies GPU sans perte de précision.
La précision et la perplexité ne suffisent pas à évaluer la quantization : une nouvelle métrique comportementale révèle des divergences invisibles.