Sobre o projeto
Stanza é a biblioteca oficial de processamento de linguagem natural em Python do Stanford NLP Group. Ela oferece suporte para a execução de ferramentas precisas de PNL em mais de 60 idiomas humanos e inclui um wrapper oficial em Python para acessar o software Java Stanford CoreNLP.
Principais Recursos
- Pipeline neural com modelos pré-treinados para tokenização, expansão de tokens multi-palavra, etiquetagem POS/morfológica, lematização, parsing de dependências e reconhecimento de entidades nomeadas (NER)
- Suporte a todos os treebanks do Universal Dependencies v2.8, juntamente com modelos de NER para idiomas amplamente falados
- Pacotes de modelos de inglês biomédico e clínico para análise sintática e NER a partir de literatura biomédica e notas clínicas
- Acesso completo à funcionalidade do Java Stanford CoreNLP por meio de um cliente Python
- Treinamento de modelos a partir de dados personalizados no formato CoNULL-U ou BIOES
- Notebooks de demonstração interativos disponíveis no Google Colab
Instalação
O Stanza requer Python 3.6 ou superior e pode ser instalado via pip ou Anaconda:
```
pip install stanza
conda install -c stanfordnlp stanza
```
Uso Básico
```
import stanza
stanza.download('en')
nlp = stanza.Pipeline('en')
doc = nlp('Barack Obama was born in Hawaii.')
doc.sentences[0].print_dependencies()
```
Dicas de desempenho incluem agrupar documentos em lotes (separados por linhas em branco) para maximizar a velocidade do pipeline, em vez de processar uma sentença por vez.
Para treinamento de modelos personalizados, os usuários devem clonar o repositório e executar o treinamento a partir do código-fonte. O tokenizador, o expansor de MWT, o etiquetador POS, o lematizador e o parser de dependências exigem dados no formato CoNLL-U; os modelos de NER exigem o formato BIOES.
Licença: Apache License, Versão 2.0
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.