OUTILS
WebLLM : moteur d'inférence haute performance pour LLM dans le navigateur
WebLLM permet d'exécuter de grands modèles de langage directement dans le navigateur grâce à WebGPU, sans serveur.
Hacker News (filtré IA)·@saikatsg·2 septembre 2026
WebLLM est un moteur d'inférence haute performance intégrant WebGPU pour faire tourner des LLM localement dans le navigateur. Il ne nécessite aucune installation serveur et assure la confidentialité des données, avec un support pour divers modèles open-weights comme Llama 3.