Toutes les news taguées avec ce sujet.
Face à une attaque automatisée provenant d'un modèle chinois, des chercheurs ont retourné la situation en exploitant ce comportement.
Une bibliothèque open source permet l'inférence de modèles à 70 milliards de paramètres sur du matériel grand public à mémoire très limitée.
Un nouveau benchmark teste si les modèles multimodaux peuvent deviner si deux personnes se connaissent déjà à partir d'un court échange filmé.
L'usage des LLM pour générer du code peut créer une dette cognitive invisible.
Un rapport de vulnérabilité généré par un LLM, truffé d'erreurs factuelles, a néanmoins obtenu une CVE critique validée dans le système officiel.
Un développeur teste les modèles d'IA sur une tâche insolite et révélatrice : dessiner en SVG une grenouille au prognathisme prononcé.
Une approche automatique par IA transpile du code COBOL en Java, reproduisant fidèlement le comportement original, incluant les erreurs.
Alibaba dévoile Qwen3.8-Max, un modèle positionné comme leader sur les tâches de codage et de coworking avec des agents IA.
Seuls 8,9 % des sites bloquent les robots d'IA, mais 94,8 % ne sont jamais cités dans les réponses générées.
Un outil open source implémentant une boucle autonome d'amélioration par fine-tuning pour les modèles d'IA.
Un projet indépendant compare le coût d'exécution d'une tâche par un LLM à son équivalent en salaire humain, sur le modèle du Big Mac Index.
Outil de suivi en temps réel des prix des API IA et estimateurs de coûts pour charges de travail réelles.
Une étude du MIT montre que les modèles d'IA délivrent des conseils financiers pertinents, conditionnés par la qualité des prompts.
Ethan Mollick actualise son guide annuel : modèles, apps et harnais deviennent trois choix distincts à faire pour bien utiliser l'IA.
Un usage interne mal contrôlé de Claude a provoqué un dépassement budgétaire de 860% chez Amazon.
Un fil de discussion questionne la fiabilité et la portée réelle des performances mathématiques attribuées à des modèles d'IA récents.
Un auteur explique les raisons techniques et créatives de son refus d'intégrer les outils génératifs.
Un projet open source propose des scripts légers pour tester SFT, DPO et GRPO sur du matériel grand public limité à 8 Go de VRAM.
Une étude montre que les capacités de raisonnement avancé des grands modèles de langue n'améliorent pas leurs performances en trading.
Un nouveau benchmark mesure la capacité des modèles d'IA à gérer des tâches opérationnelles d'oncall.
Les modèles semblent raisonner, mais leurs mécanismes internes divergent souvent de la logique humaine.
Un développeur détaille une méthode pour dépasser la limite de taille imposée par Claude lors de l'envoi de fichiers volumineux.
Le chef IA de Meta explique pourquoi les LLM actuels ne suffisent pas pour atteindre une intelligence générale.
Des chercheurs proposent AISPA, une méthode pour auditer les instructions système des produits IA selon 8 dimensions.
Anthropic lance Claude Opus 5, performant comme Fable mais deux fois moins cher, selon les évaluations indépendantes.
Le laboratoire chinois publie une nouvelle version de son modèle rapide, sans détails techniques précis pour l'instant.
Thinking Machines publie Inkling-Small, un nouveau modèle open-weights optimisé pour l'efficacité.
Grafana publie un SDK en Go pour intégrer des backends IA avec support du streaming et des appels d'outils.
Un développeur tempère les promesses de productivité démultipliée par l'IA générative et livre un bilan plus mesuré de son usage quotidien.
Nouvelle tarification pour les variantes Luna et Terra : OpenAI mise sur l'efficacité pour faciliter le déploiement d'IA à grande échelle en entreprise.