프로젝트 소개

Hugging Face Tokenizers는 연구와 프로덕션 모두를 위해 설계된 고성능 토큰화 라이브러리입니다. Python 및 Node.js용 바인딩이 포함된 Rust 코어 구현을 제공하며, 업계 표준 토큰화 엔진을 목표로 합니다. 주요 기능은 다음과 같습니다: - 다양한 토큰화 모델 지원: BPE, Unigram, WordPiece, WordLevel. - 전체 파이프라인 구성 요소: Normalizer, PreTokenizer, Model, PostProcessor, Decoder. - 하드웨어에 최적화된 커널(NEON, AVX-512, SSE, SIMD128)과 이식 가능한 폴백을 통해 속도와 효율성 최적화. - 모듈식 사용을 위한 하위 크레이트: `tk-encode`(추론 엔진), `bitcannon`(비트스트림 사전 토큰화), `tk-serialize`(리더), `tk-convert`(레거시 변환), `tk-train`(학습), `bitmap_gen`(개발 전용 테이블 생성기). - `from_pretrained`를 통한 Hugging Face 모델과의 손쉬운 통합. - v1.0.0 로드맵에는 학습 복원, 제로 카피 배치 인코딩, PyTorch/JAX/NumPy 상호 운용을 위한 dlpack API 등이 포함됩니다. 설치: `pip install --pre tokenizers` 사용 예시: ```python from tokenizers import Tokenizer tokenizer = Tokenizer.from_pretrained("meta-llama/Llama-3.1-8B") tokenizer.encode("Hello, y'all! How are you 😁 ?") ``` 이 라이브러리는 Hugging Face와 커뮤니티에 의해 활발히 개발되고 있으며, 성능과 폭넓은 언어 지원에 중점을 두고 있습니다.