À propos du projet

Stanza est la bibliothèque officielle de traitement du langage naturel en Python du Stanford NLP Group. Elle permet d'exécuter des outils NLP précis dans plus de 60 langues humaines et inclut un wrapper Python officiel pour accéder au logiciel Java Stanford CoreNLP. Caractéristiques principales - Pipeline neuronal avec modèles pré-entraînés pour la tokenisation, l'expansion des mots multi-tokens, l'étiquetage POS/morphologique, la lemmatisation, l'analyse syntaxique de dépendances et la reconnaissance d'entités nommées (NER) - Prise en charge de tous les treebanks Universal Dependencies v2.8, ainsi que des modèles NER pour les langues largement parlées - Packages de modèles biomédicaux et cliniques en anglais pour l'analyse syntaxique et la NER à partir de littérature biomédicale et de notes cliniques - Accès complet aux fonctionnalités de Java Stanford CoreNLP via un client Python - Entraînement de modèles à partir de données personnalisées au format CoNLL-U ou BIOES - Notebooks de démonstration interactifs disponibles sur Google Colab Installation Stanza nécessite Python 3.6 ou version ultérieure et peut être installé via pip ou Anaconda : ``` pip install stanza conda install -c stanfordnlp stanza ``` Utilisation de base ``` import stanza stanza.download('en') nlp = stanza.Pipeline('en') doc = nlp('Barack Obama was born in Hawaii.') doc.sentences[0].print_dependencies() ``` Les conseils de performance incluent le traitement par lots de documents (séparés par des lignes vides) pour maximiser la vitesse du pipeline plutôt que de traiter une phrase à la fois. Pour l'entraînement de modèles personnalisés, les utilisateurs doivent cloner le dépôt et exécuter l'entraînement à partir des sources. Le tokeniseur, l'expandeur MWT, l'étiqueteur POS, le lemmatiseur et l'analyseur de dépendances nécessitent des données au format CoNLL-U ; les modèles NER nécessitent le format BIOES. Licence : Apache License, Version 2.0