À propos du projet

spaCy est une bibliothèque de traitement avancé du langage naturel (NLP) en Python et Cython, conçue pour des produits réels. Elle fournit des pipelines pré-entraînés pour plus de 70 langues, une vitesse de pointe et des modèles de réseaux neuronaux pour des tâches telles que l'étiquetage, l'analyse syntaxique, la reconnaissance d'entités nommées (NER) et la classification de texte. Elle prend en charge l'apprentissage multitâche avec des transformateurs pré-entraînés comme BERT, un système d'entraînement prêt pour la production, ainsi qu'un packaging et un déploiement faciles des modèles. spaCy est sous licence MIT et comprend des visualiseurs pour la syntaxe et la NER, une extensibilité avec des composants personnalisés, et une intégration avec PyTorch et TensorFlow. L'installation est possible via pip ou conda, avec des options pour télécharger des modèles entraînés et compiler à partir des sources. Le projet inclut une documentation complète, un cours en ligne et un support communautaire via GitHub Discussions et Stack Overflow.