NVIDIA NeMo Speech एक Apache-2.0 PyTorch फ्रेमवर्क है जो स्पीच AI मॉडल बनाने, अनुकूलित करने और तैनात करने हेतु है, जिसमें ASR, TTS और स्पीच LLMs शामिल हैं, साथ ही पूर्व-प्रशिक्षित चेकपॉइंट्स और Docker/uv इंस्टॉल पथ उपलब्ध हैं।
ओपन सोर्स। नई संभावनाएँ।
उत्कृष्ट ओपन-सोर्स प्रोजेक्ट खोजें, गुमनाम रूप से प्रोजेक्ट सबमिट करें और अपने प्रोजेक्ट का दावा कर उसे संपादित करें।
जिज्ञासा के साथ ओपन सोर्स खोजें।
THE FIRST COLLECTIONEclipse Deeplearning4J (DL4J) एक JVM-आधारित डीप लर्निंग इकोसिस्टम है जो Java, Scala, Kotlin आदि का समर्थन करता है। इसमें Keras, TensorFlow, ONNX से मॉडल आयात; रैखिक बीजगणित के लिए ND4J; स्वचालित अवकलन के लिए SameDiff; ETL के लिए DataVec शामिल है और यह CPU/GPU पर Windows, Linux, macOS पर चलता है।
FaceSwap एक डीप लर्निंग-आधारित टूल है जो तस्वीरों और वीडियो में चेहरे पहचानने और बदलने का काम करता है। यह CLI और GUI इंटरफेस के साथ एक्सट्रैक्ट, ट्रेन और कन्वर्ट स्टेज प्रदान करता है, CUDA GPU त्वरण का समर्थन करता है।
AirSim Microsoft का ओपन-सोर्स सिम्युलेटर है जो ड्रोन और कारों के लिए है, जिसे Unreal Engine प्लगइन के रूप में बनाया गया है और एक प्रयोगात्मक Unity रिलीज़ भी है। यह PX4 और ArduPilot के साथ सॉफ्टवेयर- और हार्डवेयर-इन-द-लूप सिमुलेशन का समर्थन करता है, और AI अनुसंधान के लिए छवियों को एकत्र करने और वाहनों को नियंत्रित करने हेतु क्रॉस-लैंग्वेज APIs प्रदान करता है।
VoxCPM2 एक टोकन-रहित टेक्स्ट-टू-स्पीच सिस्टम है जिसमें 30 भाषाओं का समर्थन, टेक्स्ट से वॉइस डिज़ाइन, नियंत्रित वॉइस क्लोनिंग और 48kHz ऑडियो आउटपुट वाली 2B डिफ्यूज़न ऑटोरेग्रेसिव मॉडल शामिल है।