このプロジェクトについて

Stanzaは、Stanford NLP Groupの公式Python自然言語処理ライブラリです。60以上の人間言語にわたって正確なNLPツールを実行するためのサポートを提供し、Java製Stanford CoreNLPソフトウェアにアクセスするための公式Pythonラッパーを含みます。 主な機能 - トークン化、複数語トークン展開、POS/形態素タグ付け、見出し語化、依存構文解析、固有表現認識(NER)のための事前学習済みモデルを備えたニューラルパイプライン - すべてのUniversal Dependenciesツリーバンクv2.8のサポート、および広く話されている言語向けのNERモデル - 生物医学文献および臨床ノートからの構文解析とNERのための生物医学・臨床英語モデルパッケージ - Pythonクライアントを通じたJava Stanford CoreNLP機能への完全なアクセス - カスタムのCoNULL-UまたはBIOES形式データからのモデル訓練 - Google Colabで利用可能なインタラクティブなデモノートブック インストール StanzaにはPython 3.6以降が必要で、pipまたはAnaconda経由でインストールできます。 ``` pip install stanza conda install -c stanfordnlp stanza ``` 基本的な使用法 ``` import stanza stanza.download('en') nlp = stanza.Pipeline('en') doc = nlp('Barack Obama was born in Hawaii.') doc.sentences[0].print_dependencies() ``` パフォーマンスのヒントとして、1文ずつ処理するのではなく、文書をまとめて(空行で区切って)バッチ処理することでパイプライン速度を最大化できます。 カスタムモデル訓練の場合、ユーザーはリポジトリをクローンし、ソースから訓練を実行する必要があります。Tokenizer、MWT expander、POS tagger、lemmatizer、dependency parserにはCoNLL-U形式のデータが必要で、NERモデルにはBIOES形式が必要です。 ライセンス: Apache License, Version 2.0