Toutes les news taguées avec ce sujet.
Cloudflare dévoile Clef, une famille de modèles de décision à poids ouverts, accompagnée d'une plateforme de fine-tuning par renforcement.
Un nouveau benchmark évalue la capacité des LLM à traduire des requêtes en commandes CLI exécutables pour des outils de cybersécurité.
Le fabricant chinois de smartphones surprend en dévoilant un modèle frontière natif omnimodal, avec des variantes Flash et UltraSpeed.
Comment OpenRouter est devenu l'infrastructure de routage neutre pour plus de 10 millions de développeurs face à la multiplication des modèles.
Le laboratoire de recherche H Company intègre la coalition NVIDIA Nemotron, renforçant l'écosystème ouvert autour des modèles LLM de la gamme Nemotron.
Un modèle vision-langage ouvert conçu pour interpréter les scanners CT volumétriques et reproduire le raisonnement diagnostique des radiologues.
Analyse des coûts et de la viabilité économique de l'inférence sur les modèles à poids ouverts, face aux solutions propriétaires.
DeepSeek publie la version 3.2 de son LLM open-weights, apportant des améliorations de performance et de stabilité sur la précédente itération V3.
Microsoft Research publie RetroChimera dans Nature, un modèle de rétrosynthèse qui automatise la planification de routes de synthèse surpassant les réactions documentées en tests à l'aveugle.
Un modèle d'apprentissage continu dynamique conçu pour tourner sur des GPU grand public avec seulement 8 Go de VRAM, démocratisant l'approche AGI légère.
Pirate Face permet de récupérer et préserver les modèles LLM menacés de retrait, évitant leur disparition définitive des dépôts publics.
L'Open Source Initiative clarifie la distinction entre poids ouverts et véritable open source.
Un Foundation Model pour la science planétaire, entraîné sur des données lunaires, publié en open-source.
Une variante optimisée de Qwen3.8-27B réduit la latence de réflexion de 58% tout en doublant la vitesse.
Un runtime d'inférence basé sur MLX multiplie par près de 7 la capacité de contexte exécutable localement sur MacBook, sans toucher à la quantification.
Le patron de Y Combinator plaide pour que les laboratoires open-weight américains adoptent la distillation, technique déjà utilisée par des acteurs chinois comme DeepSeek.
Pleias publie un nouveau modèle de langage léger sur Hugging Face.
Moonshot AI publie Kimi-K2.7-Code, son nouveau LLM optimisé pour la génération et l'analyse de code.
Un thread relève une croissance rapide de la taille des paramètres des world models publiés en open-weights, au rythme d'un doublement semestriel.
DealgnAI publie une version non censurée et optimisée FP8 de DeepSeek v4.1 Flash.
Le laboratoire chinois publie une nouvelle collection de modèles nommée DeepSeek-V4 sur Hugging Face, sans détails techniques accompagnant l'annonce.
Expérience réussie d'entraînement complet d'un petit modèle pour moins de 1000 dollars.
IBM Research lance une nouvelle version de son modèle de prévision de séries temporelles, avec des performances de pointe et une licence permissive pour un usage commercial.
Zhipu durcit la licence de GLM-5.3 tandis que Google et Meta adoptent Apache 2.0 : la carte des licences de modèles ouverts se recompose en 2026.
Une plate-forme 'end-to-end' dédiée à l'entraînement et à l'inférence de modèles à poids ouverts.
Nvidia met la main sur la plateforme de référence des modèles open-weights, un signal fort dans la course à l'infrastructure IA.
Georgi Gerganov réagit à l'acquisition d'HuggingFace par Nvidia et évoque l'impact sur le développement futur de llama.cpp et ggml.
Une étude distingue comportements trompeurs et mécanismes internes pour évaluer la déception des modèles.
Un nouveau projet propose six modèles open-weights conçus pour fonctionner ensemble comme une flotte coordonnée.
Hugging Face dévoile NeoMME, un encodeur efficace et nativement multimodal pour le multilingue.