프로젝트 소개

Stanza는 스탠퍼드 NLP 그룹의 공식 Python 자연어 처리 라이브러리입니다. 60개 이상의 인간 언어에 걸쳐 정확한 NLP 도구를 실행할 수 있도록 지원하며, Java Stanford CoreNLP 소프트웨어에 접근하기 위한 공식 Python 래퍼를 포함합니다. 주요 기능 - 토큰화, 다중 단어 토큰 확장, POS/형태소 태깅, 표제어 추출, 의존 구문 분석, 개체명 인식(NER)을 위한 사전 학습 모델이 포함된 신경망 파이프라인 - 모든 Universal Dependencies 트리뱅크 v2.8 지원, 그리고 널리 사용되는 언어를 위한 NER 모델 - 생의학 및 임상 영어 모델 패키지: 생의학 문헌과 임상 노트의 구문 분석 및 NER - Python 클라이언트를 통한 Java Stanford CoreNLP 기능 전체 접근 - 사용자 지정 CoNLL-U 또는 BIOES 형식 데이터로부터의 모델 학습 - Google Colab에서 사용 가능한 대화형 데모 노트북 설치 Stanza는 Python 3.6 이상이 필요하며 pip 또는 Anaconda로 설치할 수 있습니다: pip install stanza conda install -c stanfordnlp stanza 기본 사용법 import stanza stanza.download('en') nlp = stanza.Pipeline('en') doc = nlp('Barack Obama was born in Hawaii.') doc.sentences[0].print_dependencies() 성능 팁: 한 번에 한 문장씩 처리하기보다 문서를 함께 배치(빈 줄로 구분)하여 파이프라인 속도를 최대화하는 것이 좋습니다. 사용자 지정 모델 학습의 경우, 사용자는 저장소를 복제하고 소스에서 학습을 실행해야 합니다. Tokenizer, MWT expander, POS tagger, lemmatizer, dependency parser는 CoNLL-U 형식 데이터가 필요하고, NER 모델은 BIOES 형식이 필요합니다. 라이선스: Apache License, Version 2.0