MoneyPrinterTurbo একটি ওয়ান-স্টপ AI শর্ট ভিডিও জেনারেশন টুল, শুধু একটি বিষয় বা কীওয়ার্ড দিলেই স্বয়ংক্রিয়ভাবে স্ক্রিপ্ট, ভয়েসওভার, ফুটেজ, সাবটাইটেল, ব্যাকগ্রাউন্ড মিউজিক ও এডিটিং সম্পন্ন করে 9:16, 16:9, 1:1 HD ভিডিও তৈরি করে, এবং WebUI, API, CLI ও AI Agent—এই চারভাবে ব্যবহার করা যায়।
ওপেন সোর্স। নতুন সম্ভাবনা।
মানসম্মত ওপেন-সোর্স প্রজেক্ট আবিষ্কার করুন, বেনামে প্রজেক্ট জমা দিন এবং নিজের প্রজেক্ট দাবি করে সম্পাদনা করুন।
কৌতূহল নিয়ে ওপেন সোর্স আবিষ্কার করুন।
THE FIRST COLLECTIONMimora is a free, fully local pronunciation trainer for English and Spanish. It uses on-device TTS, speech recognition, and a local LLM to generate phrases and score user attempts with word-level feedback, requiring no cloud or API keys.
Unsloth হলো একটি ডেস্কটপ অ্যাপ্লিকেশন এবং ফ্রেমওয়ার্ক যার মাধ্যমে Windows, macOS এবং Linux-এ লোকালি লার্জ ল্যাঙ্গুয়েজ মডেল (LLMs) এবং ডিফিউশন মডেল চালানো ও ট্রেনিং করা যায়।
Zara হলো একটি পরীক্ষামূলক লোকাল-ফার্স্ট AI অ্যাসিস্ট্যান্ট এবং Linux ডেস্কটপ কো-পাইলট, যা ইনটেন্ট হ্যান্ডলিং এবং রিজনিংয়ের জন্য সিম্বলিক লজিক (Prolog) এবং LLM-এর সমন্বয় ঘটায়।
VoxCPM2 হলো OpenBMB-এর একটি টোকেনাইজার-মুক্ত টেক্সট-টু-স্পিচ সিস্টেম যা ২ বিলিয়ন প্যারামিটারের ডিফিউশন অটোরেগ্রেসিভ মডেল ব্যবহার করে ৩০টি ভাষা, টেক্সট বর্ণনা থেকে ভয়েস ডিজাইন, নিয়ন্ত্রিত ভয়েস ক্লোনিং এবং ৪৮kHz অডিও আউটপুট সমর্থন করে।
একটি MCP সার্ভার যা পিয়ানো এবং গিটার মাধ্যমে AI-কে সুরগতিশীলতা শেখানোর জন্য ডিজাইন করা হয়েছে। এতে ১২০টি নোটযুক্ত গান, ছয়টি সাউন্ড ইঞ্জিন, ব্রাউজার-ভিত্তিক কম্পোজিশন ককপিট এবং টুল-ইউস ট্রেসের একটি পাবলিক ডেটাসেট রয়েছে।
Velo AI Studio একটি ওপেন-সোর্স, ব্রাউজার-ভিত্তিক ভিডিও সৃষ্টি টুল, যা স্ক্রিপ্ট, অডিও এবং AI-উত্পন্ন ভিজুয়াল আসেট থেকে নারেটেড ভিডিও সংগঠন করতে ডিজাইন করা হয়েছে।
TaleWeaver একটি স্ব-হোস্টেড ব্রাউজার-ভিত্তিক এআই টেক্সট-অ্যাডভেঞ্চার ইঞ্জিন, যাতে রয়েছে এআই গেমমাস্টার, অ্যাডভেঞ্চার এডিটর, আরপিজি মেকানিক্স, ভয়েস বর্ণনা/স্পিচ ইনপুট এবং ডকার/এসকিউলাইট ডিপ্লয়মেন্ট।
OpenMontage একটি ওপেন-সোর্স, এজেন্টিক ভিডিও প্রোডাকশন সিস্টেম যা AI কোডিং অ্যাসিস্ট্যান্টগুলোকে পূর্ণাঙ্গ ভিডিও স্টুডিওতে রূপান্তরিত করে এবং রিসার্চ থেকে ফাইনাল রেন্ডার পর্যন্ত এন্ড-টু-এন্ড পাইপলাইন সমর্থন করে।
ChatTTS একটি ওপেন-সোর্স টেক্সট-টু-স্পিচ মডেল, যা সংवाद পরিস্থিতির জন্য তৈরি করা হয়েছে, ইংরেজি এবং চীনা ভাষা সমর্থন করে, বহু স্পিকার আউটপুট এবং হাসি, বিরাম এবং প্রসোডির উপর সূক্ষ্ম নিয়ন্ত্রণ প্রদান করে।
GPT-SoVITS একটি ওপেন-সোর্স ফিউ-শট ভয়েস কনভার্সন এবং TTS সিস্টেম যা শূন্য-শট (৫ সেকেন্ড) এবং ফিউ-শট (১ মিনিট) ভয়েস ক্লোনিং, চীনা, জাপানি, কোরিয়ান, ক্যান্টোনিজ এবং ইংরেজি ভাষায় সাপোর্ট করে। এতে অডিও সепারেশন, ASR এবং ডেটাসেট প্রস্তুতির জন্য WebUI টুলস অন্তর্ভুক্ত রয়েছে।
pyVideoTrans একটি ওপেন-সোর্স ভিডিও অনুবাদ টুল যা ভাষান্তর, অডিও ট্রান্সক্রিপশন, AI ডাবিং এবং সাবটাইটেল অনুবাদের পূর্ণাঙ্গ কাজের ধারা প্রদান করে। এটি স্থানীয়ভাবে এবং বিভিন্ন অনলাইন API-এর মাধ্যমে ব্যবহার করা যায়।
ESPnet হল PyTorch-ভিত্তিক এন্ড-টু-এন্ড স্পিচ প্রসেসিং টুলকিট, যা ASR, TTS, স্পিচ অনুবাদ, এনহ্যান্সমেন্ট, ডায়ারাইজেশন ইত্যাদি সহ পুনরুত্পাদনযোগ্য রেসিপি এবং প্রিট্রেইন্ড মডেল অফার করে।
Unreal Engine 5-এর জন্য একটি লোকাল মাল্টিমোডাল LLM প্লাগইন, যা টেক্সট, স্পিচ-টু-টেক্সট এবং টেক্সট-টু-স্পিচের জন্য অফলাইন ইনফারেন্স প্রদান করে।
FunTTS হলো একটি ইউনিফাইড ইন্টারফেস সমৃদ্ধ টেক্সট-টু-স্পিচ লাইব্রেরি, যা বিভিন্ন ওপেন সোর্স TTS ইঞ্জিনের নিরবচ্ছিন্ন সুইচিং সমর্থন করে এবং সাবটাইটেল জেনারেশন, মাল্টি-রোল সংলাপ ও অ্যাসিনক্রোনাস প্রসেসিংয়ের মতো সুবিধা প্রদান করে।