প্রকল্প সম্পর্কে

Hugging Face Tokenizers হলো একটি উচ্চ-কর্মক্ষমতা সম্পন্ন টোকেনাইজেশন লাইব্রেরি, যা গবেষণা ও প্রোডাকশন উভয়ের জন্যই ডিজাইন করা হয়েছে। এটি Python এবং Node.js-এর জন্য বাইন্ডিংসহ একটি Rust কোর ইমপ্লিমেন্টেশন প্রদান করে এবং শিল্প-মানের টোকেনাইজেশন ইঞ্জিন হওয়ার লক্ষ্য রাখে। প্রধান বৈশিষ্ট্যগুলোর মধ্যে রয়েছে: - একাধিক টোকেনাইজেশন মডেলের সমর্থন: BPE, Unigram, WordPiece, এবং WordLevel। - সম্পূর্ণ পাইপলাইন উপাদান: Normalizer, PreTokenizer, Model, PostProcessor, এবং Decoder। - গতি ও দক্ষতার জন্য অপ্টিমাইজড, হার্ডওয়্যার-অভিযোজিত কার্নেল (NEON, AVX-512, SSE, SIMD128) এবং পোর্টেবল ফলব্যাকসহ। - মডুলার ব্যবহারের জন্য সাব-ক্রেট: `tk-encode` (ইনফারেন্স ইঞ্জিন), `bitcannon` (বিটস্ট্রিম প্রি-টোকেনাইজেশন), `tk-serialize` (রিডার), `tk-convert` (লিগ্যাসি কনভার্সন), `tk-train` (ট্রেনিং), এবং `bitmap_gen` (শুধুমাত্র ডেভেলপমেন্টের জন্য টেবিল জেনারেটর)। - `from_pretrained`-এর মাধ্যমে Hugging Face মডেলগুলোর সাথে সহজ ইন্টিগ্রেশন। - v1.0.0-এর রোডম্যাপে রয়েছে ট্রেনিং পুনরুদ্ধার, জিরো-কপিসহ ব্যাচ এনকোডিং, PyTorch/JAX/NumPy ইন্টারঅপের জন্য dlpack API, এবং আরও অনেক কিছু। ইনস্টলেশন: `pip install --pre tokenizers` ব্যবহারের উদাহরণ: ```python from tokenizers import Tokenizer tokenizer = Tokenizer.from_pretrained("meta-llama/Llama-3.1-8B") tokenizer.encode("Hello, y'all! How are you 😁 ?") ``` লাইব্রেরিটি Hugging Face এবং কমিউনিটি দ্বারা সক্রিয়ভাবে বিকশিত হচ্ছে, যেখানে কর্মক্ষমতা এবং বিস্তৃত ভাষা সমর্থনের উপর বিশেষ গুরুত্ব দেওয়া হচ্ছে।