Toutes les news taguées avec ce sujet.
Un article technique détaille une optimisation du prompt lookup decoding, une méthode de génération accélérée dans llama.cpp.
La bibliothèque Transformers de Hugging Face intègre nativement les modèles quantifiés au format GGUF de llama.cpp.
Georgi Gerganov réagit à l'acquisition d'HuggingFace par Nvidia et évoque l'impact sur le développement futur de llama.cpp et ggml.