프로젝트 소개
Hugging Face Tokenizers는 연구와 프로덕션 모두를 위해 설계된 고성능 토큰화 라이브러리입니다. Python 및 Node.js용 바인딩이 포함된 Rust 코어 구현을 제공하며, 업계 표준 토큰화 엔진을 목표로 합니다.
주요 기능은 다음과 같습니다:
- 다양한 토큰화 모델 지원: BPE, Unigram, WordPiece, WordLevel.
- 전체 파이프라인 구성 요소: Normalizer, PreTokenizer, Model, PostProcessor, Decoder.
- 하드웨어에 최적화된 커널(NEON, AVX-512, SSE, SIMD128)과 이식 가능한 폴백을 통해 속도와 효율성 최적화.
- 모듈식 사용을 위한 하위 크레이트: `tk-encode`(추론 엔진), `bitcannon`(비트스트림 사전 토큰화), `tk-serialize`(리더), `tk-convert`(레거시 변환), `tk-train`(학습), `bitmap_gen`(개발 전용 테이블 생성기).
- `from_pretrained`를 통한 Hugging Face 모델과의 손쉬운 통합.
- v1.0.0 로드맵에는 학습 복원, 제로 카피 배치 인코딩, PyTorch/JAX/NumPy 상호 운용을 위한 dlpack API 등이 포함됩니다.
설치: `pip install --pre tokenizers`
사용 예시:
```python
from tokenizers import Tokenizer
tokenizer = Tokenizer.from_pretrained("meta-llama/Llama-3.1-8B")
tokenizer.encode("Hello, y'all! How are you 😁 ?")
```
이 라이브러리는 Hugging Face와 커뮤니티에 의해 활발히 개발되고 있으며, 성능과 폭넓은 언어 지원에 중점을 두고 있습니다.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.