Toutes les news taguées avec ce sujet.
Un outil open source permet de faire tourner des LLM au format GGUF sur n'importe quel GPU grâce à l'API graphique Vulkan, sans dépendre de CUDA.
La bibliothèque Transformers de Hugging Face intègre nativement les modèles quantifiés au format GGUF de llama.cpp.