このプロジェクトについて
Hugging Face Tokenizersは、研究と本番環境の両方のために設計された高性能トークン化ライブラリです。Rustによるコア実装とPythonおよびNode.js向けのバインディングを提供し、業界標準のトークン化エンジンを目指しています。
主な機能は次のとおりです。
- 複数のトークン化モデルをサポート:BPE、Unigram、WordPiece、WordLevel。
- 完全なパイプラインコンポーネント:Normalizer、PreTokenizer、Model、PostProcessor、Decoder。
- 速度と効率のために最適化され、ハードウェアに適応したカーネル(NEON、AVX-512、SSE、SIMD128)とポータブルなフォールバックを備えています。
- モジュール式利用のためのサブクレート:`tk-encode`(推論エンジン)、`bitcannon`(ビットストリーム事前トークン化)、`tk-serialize`(リーダー)、`tk-convert`(レガシー変換)、`tk-train`(トレーニング)、`bitmap_gen`(開発専用テーブルジェネレーター)。
- `from_pretrained`によるHugging Faceモデルとの簡単な統合。
- v1.0.0のロードマップには、トレーニングの復活、ゼロコピーによるバッチエンコーディング、PyTorch/JAX/NumPy相互運用のためのdlpack APIなどが含まれます。
インストール:`pip install --pre tokenizers`
使用例:
```python
from tokenizers import Tokenizer
tokenizer = Tokenizer.from_pretrained("meta-llama/Llama-3.1-8B")
tokenizer.encode("Hello, y'all! How are you 😁 ?")
```
このライブラリはHugging Faceとコミュニティによって活発に開発されており、パフォーマンスと幅広い言語サポートに重点を置いています。
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.