প্রকল্প সম্পর্কে

Whisper হলো একটি Transformer sequence-to-sequence মডেল যা বৈচিত্র্যময় অডিওর একটি বৃহৎ আকারের ডেটাসেটের উপর প্রশিক্ষিত। এটি একটি মাল্টিটাস্কিং সিস্টেম হিসেবে কাজ করে যা বিভিন্ন কাজকে টোকেনের একটি সিকোয়েন্স হিসেবে যৌথভাবে উপস্থাপন করার মাধ্যমে একটি ঐতিহ্যগত স্পিচ-প্রসেসিং পাইপলাইনের একাধিক পর্যায়কে প্রতিস্থাপন করতে পারে। এর মূল ক্ষমতাগুলোর মধ্যে রয়েছে: - বহুভাষিক স্পিচ রিকগনিশন (ট্রান্সক্রিপশন) - ইংরেজিতে স্পিচ ট্রান্সলেশন - কথিত ভাষা শনাক্তকরণ - Voice activity detection প্রকল্পটি ছয়টি মডেল সাইজ (tiny, base, small, medium, large, এবং turbo) প্রদান করে যাতে ব্যবহারকারীরা তাদের উপলব্ধ VRAM-এর উপর ভিত্তি করে ইনফারেন্স গতি এবং নির্ভুলতার মধ্যে ভারসাম্য বজায় রাখতে পারেন। ছোট মডেল সাইজগুলোর জন্য শুধুমাত্র ইংরেজি সংস্করণ উপলব্ধ রয়েছে। Whisper একটি কমান্ড-লাইন ইন্টারফেসের মাধ্যমে অথবা একটি Python লাইব্রেরি হিসেবে ব্যবহার করা যেতে পারে। অডিও প্রসেসিংয়ের জন্য এর ffmpeg প্রয়োজন এবং দ্রুত টোকেনাইজেশনের জন্য এটি OpenAI-এর tiktoken ব্যবহার করে।