このプロジェクトについて

Hugging Face Tokenizersは、研究と本番環境の両方のために設計された高性能トークン化ライブラリです。Rustによるコア実装とPythonおよびNode.js向けのバインディングを提供し、業界標準のトークン化エンジンを目指しています。 主な機能は次のとおりです。 - 複数のトークン化モデルをサポート:BPE、Unigram、WordPiece、WordLevel。 - 完全なパイプラインコンポーネント:Normalizer、PreTokenizer、Model、PostProcessor、Decoder。 - 速度と効率のために最適化され、ハードウェアに適応したカーネル(NEON、AVX-512、SSE、SIMD128)とポータブルなフォールバックを備えています。 - モジュール式利用のためのサブクレート:`tk-encode`(推論エンジン)、`bitcannon`(ビットストリーム事前トークン化)、`tk-serialize`(リーダー)、`tk-convert`(レガシー変換)、`tk-train`(トレーニング)、`bitmap_gen`(開発専用テーブルジェネレーター)。 - `from_pretrained`によるHugging Faceモデルとの簡単な統合。 - v1.0.0のロードマップには、トレーニングの復活、ゼロコピーによるバッチエンコーディング、PyTorch/JAX/NumPy相互運用のためのdlpack APIなどが含まれます。 インストール:`pip install --pre tokenizers` 使用例: ```python from tokenizers import Tokenizer tokenizer = Tokenizer.from_pretrained("meta-llama/Llama-3.1-8B") tokenizer.encode("Hello, y'all! How are you 😁 ?") ``` このライブラリはHugging Faceとコミュニティによって活発に開発されており、パフォーマンスと幅広い言語サポートに重点を置いています。