Miller (mlr) एक कमांड-लाइन टूल है जो CSV, TSV, JSON और JSON Lines जैसे नाम-अनुक्रमित डेटा को प्रोसेस करता है, तथा awk, sed, cut, join और sort की भूमिकाओं को जोड़ता है। यह स्ट्रीमिंग, फॉर्मेट रूपांतरण, सांख्यिकी और पाइप-अनुकूल वर्कफ़्लो का समर्थन करता है।
ओपन सोर्स। नई संभावनाएँ।
उत्कृष्ट ओपन-सोर्स प्रोजेक्ट खोजें, गुमनाम रूप से प्रोजेक्ट सबमिट करें और अपने प्रोजेक्ट का दावा कर उसे संपादित करें।
डेटाफ्रेम के साथ मशीन लर्निंग के लिए पायथन लाइब्रेरी
DataFlow एक LLM-संचालित डेटा तैयारी फ्रेमवर्क है जो कच्चे PDF, टेक्स्ट और निम्न-गुणवत्ता वाले QA को पुन: प्रयोज्य ऑपरेटर-आधारित पाइपलाइनों, विज़ुअल WebUI और एजेंट-सहायता प्राप्त ऑर्केस्ट्रेशन के माध्यम से उच्च-गुणवत्ता वाले प्रशिक्षण डेटा में बदलता है।
nf-core/fastqrepair is a bioinformatics pipeline for recovering corrupted FASTQ.gz files, fixing uncompliant reads, removing unpaired reads, and re-pairing disordered reads. It outputs clean FASTQ files and QC reports.
FiftyOne एक ओपन-सोर्स टूल है जो उच्च-गुणवत्ता वाले डेटासेट और कंप्यूटर विज़न मॉडल बनाने के लिए उपयोग किया जाता है। यह उपयोगकर्ताओं को दृश्य AI डेटा को विज़्युअलाइज़, लेबल, मूल्यांकन और क्यूरेट करने की अनुमति देता है।
CSV, JSON और Excel डेटा के string-first ETL और स्प्रेडशीट-शैली टेबल रैंगलिंग के लिए Go लाइब्रेरी, जिसमें immutable/mutable API, schema inference और row-level reject handling शामिल है।