Об этом проекте
Stanza — официальная библиотека обработки естественного языка на Python от Стэнфордской группы NLP. Она обеспечивает точные NLP-инструменты для более чем 60 языков и включает официальную Python-обёртку для доступа к Java-версии Stanford CoreNLP.
Ключевые возможности
- Нейросетевой конвейер с предобученными моделями для токенизации, разворачивания многословных токенов, частеречной и морфологической разметки, лемматизации, синтаксического анализа зависимостей и распознавания именованных сущностей (NER)
- Поддержка всех древьев Universal Dependencies v2.8, а также моделей NER для широко распространённых языков
- Пакеты моделей для биомедицинского и клинического английского языка для синтаксического анализа и NER в биомедицинской литературе и клинических записях
- Полный доступ к функциональности Java Stanford CoreNLP через Python-клиент
- Обучение моделей на пользовательских данных в форматах CoNLL-U или BIOES
- Интерактивные демонстрационные блокноты на Google Colab
Установка
Stanza требует Python 3.6 или новее и устанавливается через pip или Anaconda:
```
pip install stanza
conda install -c stanfordnlp stanza
```
Базовое использование
```
import stanza
stanza.download('en')
nlp = stanza.Pipeline('en')
doc = nlp('Barack Obama was born in Hawaii.')
doc.sentences[0].print_dependencies()
```
Советы по производительности: для максимальной скорости обрабатывайте документы пакетами (разделяя их пустыми строками), а не по одному предложению за раз.
Для обучения пользовательских моделей необходимо клонировать репозиторий и запускать обучение из исходного кода. Токенизатор, разворачиватель MWT, теггер частей речи, лемматизатор и синтаксический анализатор требуют данных в формате CoNLL-U; модели NER — в формате BIOES.
Лицензия: Apache License, Version 2.0
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.