Toutes les news taguées avec ce sujet.
Do Inference Now Deploy, collection open-source de samples C++, combine ONNX Runtime et TensorRT RTX pour déployer des modèles en local.
Un runtime d'inférence basé sur MLX multiplie par près de 7 la capacité de contexte exécutable localement sur MacBook, sans toucher à la quantification.
Deux accélérateurs MI350P refroidis par liquide et un Threadripper 96 cœurs : AMD promet de faire tourner des modèles à mille milliards de paramètres.