OUTILS · Pleias
Pleias publie Common Corpus, un vaste jeu de données ouvert pour l'entraînement de LLM
Le laboratoire français Pleias met à disposition une collection massive de textes libres de droits destinée à l'entraînement de modèles de langage.
Common Corpus est une collection de données textuelles publiée par Pleias sur Hugging Face, composée de contenus dans le domaine public ou sous licences ouvertes. Elle vise à fournir une alternative transparente et légalement sûre aux corpus d'entraînement traditionnels des LLM, souvent opaques sur leurs sources.