À propos du projet
Hugging Face Tokenizers est une bibliothèque de tokenisation haute performance conçue pour la recherche et la production. Elle fournit une implémentation centrale en Rust avec des liaisons pour Python et Node.js, et vise à être le moteur de tokenisation standard de l'industrie.
Les principales caractéristiques incluent :
- Prise en charge de plusieurs modèles de tokenisation : BPE, Unigram, WordPiece et WordLevel.
- Composants complets du pipeline : Normalizer, PreTokenizer, Model, PostProcessor et Decoder.
- Optimisé pour la vitesse et l'efficacité, avec des noyaux adaptés au matériel (NEON, AVX-512, SSE, SIMD128) et des solutions de repli portables.
- Sous-crates pour une utilisation modulaire : `tk-encode` (moteur d'inférence), `bitcannon` (pré-tokenisation par flux de bits), `tk-serialize` (lecteur), `tk-convert` (conversion héritée), `tk-train` (entraînement) et `bitmap_gen` (générateur de tables réservé au développement).
- Intégration facile avec les modèles Hugging Face via `from_pretrained`.
- La feuille de route pour la v1.0.0 inclut la restauration de l'entraînement, l'encodage par lots avec zéro-copie, l'API dlpack pour l'interopérabilité PyTorch/JAX/NumPy, et plus encore.
Installation : `pip install --pre tokenizers`
Exemple d'utilisation :
```python
from tokenizers import Tokenizer
tokenizer = Tokenizer.from_pretrained("meta-llama/Llama-3.1-8B")
tokenizer.encode("Hello, y'all! How are you 😁 ?")
```
La bibliothèque est activement développée par Hugging Face et la communauté, avec un accent sur la performance et une large prise en charge des langues.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.