Об этом проекте

Stanza — официальная библиотека обработки естественного языка на Python от Стэнфордской группы NLP. Она обеспечивает точные NLP-инструменты для более чем 60 языков и включает официальную Python-обёртку для доступа к Java-версии Stanford CoreNLP. Ключевые возможности - Нейросетевой конвейер с предобученными моделями для токенизации, разворачивания многословных токенов, частеречной и морфологической разметки, лемматизации, синтаксического анализа зависимостей и распознавания именованных сущностей (NER) - Поддержка всех древьев Universal Dependencies v2.8, а также моделей NER для широко распространённых языков - Пакеты моделей для биомедицинского и клинического английского языка для синтаксического анализа и NER в биомедицинской литературе и клинических записях - Полный доступ к функциональности Java Stanford CoreNLP через Python-клиент - Обучение моделей на пользовательских данных в форматах CoNLL-U или BIOES - Интерактивные демонстрационные блокноты на Google Colab Установка Stanza требует Python 3.6 или новее и устанавливается через pip или Anaconda: ``` pip install stanza conda install -c stanfordnlp stanza ``` Базовое использование ``` import stanza stanza.download('en') nlp = stanza.Pipeline('en') doc = nlp('Barack Obama was born in Hawaii.') doc.sentences[0].print_dependencies() ``` Советы по производительности: для максимальной скорости обрабатывайте документы пакетами (разделяя их пустыми строками), а не по одному предложению за раз. Для обучения пользовательских моделей необходимо клонировать репозиторий и запускать обучение из исходного кода. Токенизатор, разворачиватель MWT, теггер частей речи, лемматизатор и синтаксический анализатор требуют данных в формате CoNLL-U; модели NER — в формате BIOES. Лицензия: Apache License, Version 2.0