このプロジェクトについて
Stanzaは、Stanford NLP Groupの公式Python自然言語処理ライブラリです。60以上の人間言語にわたって正確なNLPツールを実行するためのサポートを提供し、Java製Stanford CoreNLPソフトウェアにアクセスするための公式Pythonラッパーを含みます。
主な機能
- トークン化、複数語トークン展開、POS/形態素タグ付け、見出し語化、依存構文解析、固有表現認識(NER)のための事前学習済みモデルを備えたニューラルパイプライン
- すべてのUniversal Dependenciesツリーバンクv2.8のサポート、および広く話されている言語向けのNERモデル
- 生物医学文献および臨床ノートからの構文解析とNERのための生物医学・臨床英語モデルパッケージ
- Pythonクライアントを通じたJava Stanford CoreNLP機能への完全なアクセス
- カスタムのCoNULL-UまたはBIOES形式データからのモデル訓練
- Google Colabで利用可能なインタラクティブなデモノートブック
インストール
StanzaにはPython 3.6以降が必要で、pipまたはAnaconda経由でインストールできます。
```
pip install stanza
conda install -c stanfordnlp stanza
```
基本的な使用法
```
import stanza
stanza.download('en')
nlp = stanza.Pipeline('en')
doc = nlp('Barack Obama was born in Hawaii.')
doc.sentences[0].print_dependencies()
```
パフォーマンスのヒントとして、1文ずつ処理するのではなく、文書をまとめて(空行で区切って)バッチ処理することでパイプライン速度を最大化できます。
カスタムモデル訓練の場合、ユーザーはリポジトリをクローンし、ソースから訓練を実行する必要があります。Tokenizer、MWT expander、POS tagger、lemmatizer、dependency parserにはCoNLL-U形式のデータが必要で、NERモデルにはBIOES形式が必要です。
ライセンス: Apache License, Version 2.0
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.