Sobre o projeto

Stanza é a biblioteca oficial de processamento de linguagem natural em Python do Stanford NLP Group. Ela oferece suporte para a execução de ferramentas precisas de PNL em mais de 60 idiomas humanos e inclui um wrapper oficial em Python para acessar o software Java Stanford CoreNLP. Principais Recursos - Pipeline neural com modelos pré-treinados para tokenização, expansão de tokens multi-palavra, etiquetagem POS/morfológica, lematização, parsing de dependências e reconhecimento de entidades nomeadas (NER) - Suporte a todos os treebanks do Universal Dependencies v2.8, juntamente com modelos de NER para idiomas amplamente falados - Pacotes de modelos de inglês biomédico e clínico para análise sintática e NER a partir de literatura biomédica e notas clínicas - Acesso completo à funcionalidade do Java Stanford CoreNLP por meio de um cliente Python - Treinamento de modelos a partir de dados personalizados no formato CoNULL-U ou BIOES - Notebooks de demonstração interativos disponíveis no Google Colab Instalação O Stanza requer Python 3.6 ou superior e pode ser instalado via pip ou Anaconda: ``` pip install stanza conda install -c stanfordnlp stanza ``` Uso Básico ``` import stanza stanza.download('en') nlp = stanza.Pipeline('en') doc = nlp('Barack Obama was born in Hawaii.') doc.sentences[0].print_dependencies() ``` Dicas de desempenho incluem agrupar documentos em lotes (separados por linhas em branco) para maximizar a velocidade do pipeline, em vez de processar uma sentença por vez. Para treinamento de modelos personalizados, os usuários devem clonar o repositório e executar o treinamento a partir do código-fonte. O tokenizador, o expansor de MWT, o etiquetador POS, o lematizador e o parser de dependências exigem dados no formato CoNLL-U; os modelos de NER exigem o formato BIOES. Licença: Apache License, Versão 2.0