عن المشروع

Hoho Avatar هي مجموعة أدوات تعتمد على المصدر أولاً، مصممة لبناء تجارب شخصيات افتراضية تفاعلية مع الصوت. وتتميز بمحرك TypeScript يعمل عبر المتصفح يقوم بتحليل تدفقات صوت PCM أحادية القناة لتشغيل رسوم الشخصيات المتحركة، وتحديداً إدارة خمس حالات للفم والرمش التلقائي لشخصيات PNG ذات الطبقات التي يتم رندرتها عبر Canvas 2D. تشمل القدرات الرئيسية ما يلي: - تكامل الصوت: يدعم مصادر صوتية متنوعة بما في ذلك إدخال الميكروفون المباشر، وملفات الصوت المحلية، وتدفقات TTS (عبر KittenTTS). - دعم وكلاء الصوت: يتضمن بوابة للتكامل مع وكلاء Azure OpenAI Realtime الصوتيين لإجراء محادثات ثنائية الاتجاه بالكامل. - إدارة الأصول: يستخدم تنسيق شخصيات محدد يعتمد على JSON لتعريف طبقات الجسم والعين والفم. ويتضمن 'Skill' يعتمد على Codex لإنشاء هذه الأصول والتحقق من صحتها. - بنية نمطية: تفصل بين الحصول على الوسائط، وتحليل الحركة (PCMAnalyzer و MouthClassifier)، والرندرة، مما يسمح بالتوسع المستقبلي المحتمل إلى رندرة Live2D أو 3D. توفر مجموعة الأدوات مجموعة من الشخصيات النموذجية وتطبيقاً تجريبياً لاستعراض التفاعل الصوتي في الوقت الفعلي وتشغيل الصوت المحلي.