Sobre el proyecto

Hugging Face Tokenizers es una biblioteca de tokenización de alto rendimiento diseñada tanto para investigación como para producción. Proporciona una implementación central en Rust con enlaces para Python y Node.js, y aspira a ser el motor de tokenización estándar de la industria. Las características clave incluyen: - Compatibilidad con múltiples modelos de tokenización: BPE, Unigram, WordPiece y WordLevel. - Componentes completos del pipeline: Normalizer, PreTokenizer, Model, PostProcessor y Decoder. - Optimizada para velocidad y eficiencia, con kernels adaptados al hardware (NEON, AVX-512, SSE, SIMD128) y alternativas portables. - Subcrates para uso modular: `tk-encode` (motor de inferencia), `bitcannon` (pre-tokenización de flujo de bits), `tk-serialize` (lector), `tk-convert` (conversión heredada), `tk-train` (entrenamiento) y `bitmap_gen` (generador de tablas solo para desarrollo). - Fácil integración con modelos de Hugging Face mediante `from_pretrained`. - La hoja de ruta para v1.0.0 incluye restaurar el entrenamiento, codificación por lotes con zero-copy, API dlpack para interoperabilidad con PyTorch/JAX/NumPy y más. Instalación: `pip install --pre tokenizers` Ejemplo de uso: ```python from tokenizers import Tokenizer tokenizer = Tokenizer.from_pretrained("meta-llama/Llama-3.1-8B") tokenizer.encode("Hello, y'all! How are you 😁 ?") ``` La biblioteca es desarrollada activamente por Hugging Face y la comunidad, con un enfoque en el rendimiento y un amplio soporte de idiomas.