ओपन सोर्स। नई संभावनाएँ।

उत्कृष्ट ओपन-सोर्स प्रोजेक्ट खोजें, गुमनाम रूप से प्रोजेक्ट सबमिट करें और अपने प्रोजेक्ट का दावा कर उसे संपादित करें।

Topic: data-cleaning清除
millerjohnkerl
नया

Miller (mlr) एक कमांड-लाइन टूल है जो CSV, TSV, JSON और JSON Lines जैसे नाम-अनुक्रमित डेटा को प्रोसेस करता है, तथा awk, sed, cut, join और sort की भूमिकाओं को जोड़ता है। यह स्ट्रीमिंग, फॉर्मेट रूपांतरण, सांख्यिकी और पाइप-अनुकूल वर्कफ़्लो का समर्थन करता है।

डेवलपर टूलडेटाCLI & terminal
skrubskrub-data
नया

डेटाफ्रेम के साथ मशीन लर्निंग के लिए पायथन लाइब्रेरी

कृत्रिम बुद्धिमत्ताडेवलपर टूलRAG & knowledge
dataflowOpenDCAI
नया

DataFlow एक LLM-संचालित डेटा तैयारी फ्रेमवर्क है जो कच्चे PDF, टेक्स्ट और निम्न-गुणवत्ता वाले QA को पुन: प्रयोज्य ऑपरेटर-आधारित पाइपलाइनों, विज़ुअल WebUI और एजेंट-सहायता प्राप्त ऑर्केस्ट्रेशन के माध्यम से उच्च-गुणवत्ता वाले प्रशिक्षण डेटा में बदलता है।

कृत्रिम बुद्धिमत्ताडेटाTraining & evaluation

nf-core/fastqrepair is a bioinformatics pipeline for recovering corrupted FASTQ.gz files, fixing uncompliant reads, removing unpaired reads, and re-pairing disordered reads. It outputs clean FASTQ files and QC reports.

डेटाडेवलपर टूलData integration
fiftyonevoxel51

FiftyOne एक ओपन-सोर्स टूल है जो उच्च-गुणवत्ता वाले डेटासेट और कंप्यूटर विज़न मॉडल बनाने के लिए उपयोग किया जाता है। यह उपयोगकर्ताओं को दृश्य AI डेटा को विज़्युअलाइज़, लेबल, मूल्यांकन और क्यूरेट करने की अनुमति देता है।

कृत्रिम बुद्धिमत्ताडेटाTraining & evaluation
gseq-tableStefanBethge
नया

CSV, JSON और Excel डेटा के string-first ETL और स्प्रेडशीट-शैली टेबल रैंगलिंग के लिए Go लाइब्रेरी, जिसमें immutable/mutable API, schema inference और row-level reject handling शामिल है।

डेटाडेवलपर टूलData integration