Flow एक एकल-बाइनरी, उच्च-प्रदर्शन ETL इंजन और वर्कफ़्लो ऑर्केस्ट्रेटर है जो Go में लिखा गया है। इसमें एक एम्बेडेड विज़ुअल वेब बिल्डर, डिक्लेरेटिव XML पाइपलाइन, क्रॉस-डेटाबेस समर्थन, और अंतर्निहित ऑडिट टेलीमेट्री शामिल है।
ओपन सोर्स। नई संभावनाएँ।
उत्कृष्ट ओपन-सोर्स प्रोजेक्ट खोजें, गुमनाम रूप से प्रोजेक्ट सबमिट करें और अपने प्रोजेक्ट का दावा कर उसे संपादित करें।
जिज्ञासा के साथ ओपन सोर्स खोजें।
THE FIRST COLLECTIONएक शैक्षिक रिपॉजिटरी जो Python का उपयोग करके बुनियादी सिद्धांतों से सुपरवाइज्ड मशीन लर्निंग सिखाती है, जिसमें गणितीय आधार और व्यावहारिक कार्यान्वयन शामिल हैं।
माइक्रोसॉफ्ट द्वारा शुरूआती लोगों के लिए 10 सप्ताह, 20 पाठों की डेटा साइंस पाठ्यक्रम, परियोजना-आधारित पाठ, क्विज़ और 50+ भाषाओं में अनुवाद सहित।
FiftyOne एक ओपन-सोर्स टूल है जो उच्च-गुणवत्ता वाले डेटासेट और कंप्यूटर विज़न मॉडल बनाने के लिए उपयोग किया जाता है। यह उपयोगकर्ताओं को दृश्य AI डेटा को विज़्युअलाइज़, लेबल, मूल्यांकन और क्यूरेट करने की अनुमति देता है।
OpenRefine एक Java-आधारित ओपन-सोर्स पावर टूल है जिसे वेब ब्राउज़र इंटरफ़ेस के माध्यम से अव्यवस्थित डेटा की सफाई, परिवर्तन और मिलान के लिए डिज़ाइन किया गया है।
Great Expectations (GX Core) डेटा गुणवत्ता के लिए एक ओपन-सोर्स Python लाइब्रेरी है, जो डेटा के लिए यूनिट टेस्ट बनाने का एक फ्रेमवर्क प्रदान करती है ताकि निरंतरता और विश्वसनीयता सुनिश्चित की जा सके।
VectorBT एक ओपन-सोर्स Python बैकटेस्टिंग लाइब्रेरी है जो रणनीति अनुसंधान को वेक्टराइज़ करती है: यह हजारों पैरामीटर संयोजनों को NumPy सरणियों में पैक करती है और उन्हें Numba और वैकल्पिक Rust इंजन से तेज़ करती है, साथ ही पोर्टफोलियो विश्लेषण और इंटरैक्टिव Plotly विज़ुअलाइज़ेशन प्रदान करती है।
एक डेटा रिसर्च और एनालिसिस प्लेटफॉर्म जो उपयोगकर्ताओं को विज़ुअलाइज़ेशन और विश्लेषण के लिए कस्टम डेटासेट आयात करने में सक्षम बनाता है।
Evidence ड्रैग-एंड-ड्रॉप BI टूल्स का एक ओपन-सोर्स, कोड-आधारित विकल्प है: SQL और markdown के साथ तेज़, इंटरैक्टिव रिपोर्ट बनाएं, फिर जेनरेट की गई स्टैटिक साइट को पब्लिश या सेल्फ-होस्ट करें।
Apache Superset डेटा एक्सप्लोरेशन और विज़ुअलाइज़ेशन के लिए उपयोग किया जाने वाला एक आधुनिक, एंटरप्राइज़-रेडी बिज़नेस इंटेलिजेंस वेब एप्लिकेशन है।
tsfresh एक Python पैकेज है जो समय-श्रृंखला डेटा से स्वचालित रूप से सैकड़ों विशेषताएँ निकालता और चुनता है, जिसमें सांख्यिकी, सिग्नल प्रोसेसिंग और परिकल्पना परीक्षण शामिल हैं, जो मशीन लर्निंग के लिए प्रासंगिक विशेषताएँ उत्पन्न करता है।
IPython कई प्रोग्रामिंग भाषाओं, मुख्य रूप से Python में कंप्यूटिंग के लिए एक शक्तिशाली इंटरैक्टिव कमांड शेल है, जो बेहतर आत्मनिरीक्षण (introspection) और शेल एकीकरण प्रदान करता है।
पैंडास पायथन में एक शक्तिशाली लाइब्रेरी है जो रिलेशनल या लेबल्ड डेटा के साथ काम करने के लिए तेज़, लचीले और अभिव्यंजक डेटा स्ट्रक्चर प्रदान करती है।
Apache Airflow एक ऐसा प्लेटफॉर्म है जिसका उपयोग कोड के रूप में वर्कफ़्लो को प्रोग्रामेटिक रूप से लिखने, शेड्यूल करने और मॉनिटर करने के लिए किया जाता है, जो आमतौर पर डेटा पाइपलाइनों और AI/ML ऑर्केस्ट्रेशन के लिए उपयोग होता है।
Trino बिग डेटा एनालिटिक्स के लिए डिज़ाइन किया गया एक तेज़ वितरित SQL क्वेरी इंजन है, जिसे पहले PrestoSQL के नाम से जाना जाता था।
एक समृद्ध MySQL टर्मिनल क्लाइंट जिसमें ऑटो-कम्प्लीशन, सिंटैक्स हाइलाइटिंग और डेटाफ्रेम इंटीग्रेशन जैसी सुविधाएँ हैं।
marimo एक रिएक्टिव Python नोटबुक है जो कोड और आउटपुट के बीच निरंतरता सुनिश्चित करती है, जिसे git-फ्रेंडली और डिप्लॉयमेंट के लिए शुद्ध Python फाइलों के रूप में स्टोर किया जाता है।
Statsmodels एक Python लाइब्रेरी है जो सांख्यिकीय मॉडलिंग, अर्थशास्त्र और डेटा विश्लेषण के लिए उपयोग की जाती है। यह रिग्रेशन, टाइम सीरीज, सर्फाइवल एनालिसिस और अन्य कई सुविधाओं का समर्थन करती है।
प्राकृतिक भाषा निर्देशों के आधार पर AI मॉडल द्वारा नए कॉलम जोड़कर pandas DataFrames को समृद्ध करने के लिए एक Python पुस्तकालय।
NVIDIA cuDF एक GPU-त्वरित DataFrame लाइब्रेरी है जो सारणीबद्ध डेटा प्रोसेसिंग के लिए है, जो CUDA-X सुइट का हिस्सा है। यह pandas-संगत API, Polars GPU इंजन, और Dask बैकएंड प्रदान करता है।