Sobre o projeto

Hugging Face Tokenizers é uma biblioteca de tokenização de alto desempenho projetada tanto para pesquisa quanto para produção. Ela fornece uma implementação central em Rust com bindings para Python e Node.js, e tem como objetivo ser o motor de tokenização padrão do setor. Os principais recursos incluem: - Suporte a vários modelos de tokenização: BPE, Unigram, WordPiece e WordLevel. - Componentes completos de pipeline: Normalizer, PreTokenizer, Model, PostProcessor e Decoder. - Otimizada para velocidade e eficiência, com kernels adaptados ao hardware (NEON, AVX-512, SSE, SIMD128) e alternativas portáveis. - Subcrates para uso modular: `tk-encode` (motor de inferência), `bitcannon` (pré-tokenização de bitstream), `tk-serialize` (leitor), `tk-convert` (conversão legada), `tk-train` (treinamento) e `bitmap_gen` (gerador de tabelas apenas para desenvolvimento). - Integração fácil com modelos Hugging Face via `from_pretrained`. - O roadmap para v1.0.0 inclui restaurar o treinamento, codificação em lote com zero-copy, API dlpack para interoperabilidade com PyTorch/JAX/NumPy e mais. Instalação: `pip install --pre tokenizers` Exemplo de uso: ```python from tokenizers import Tokenizer tokenizer = Tokenizer.from_pretrained("meta-llama/Llama-3.1-8B") tokenizer.encode("Hello, y'all! How are you 😁 ?") ``` A biblioteca é desenvolvida ativamente pela Hugging Face e pela comunidade, com foco em desempenho e amplo suporte a idiomas.