OUTILS · Hugging Face
Un LLM en 1 bit tourne directement dans le navigateur
Une démo Hugging Face fait tourner un modèle quantifié en 1 bit dans le navigateur grâce à WebGPU, sans serveur ni backend.
La démo « Bonsai WebGPU » exécute un LLM quantifié en 1 bit entièrement côté client, via WebGPU. L'inférence se fait localement dans le navigateur, sans envoi de données vers un serveur distant, illustrant les progrès de la quantification extrême et du calcul IA embarqué sur le web.