À propos du projet
nf-core/fastqrepair est un pipeline bioinformatique spécialisé conçu pour gérer et réparer des fichiers FASTQ/FASTQ.gz corrompus ou non conformes, couramment utilisés dans l'analyse de données de séquençage génomique. Le pipeline résout plusieurs problèmes critiques de qualité des données : il récupère des lectures à partir de fichiers FASTQ gzippés corrompus, assure que les lectures récupérées sont bien formées, réapparie des lectures devenues désordonnées et supprime des lectures non appariées.
Le flux de travail intègre plusieurs outils établis : `gzrt` pour récupérer des données à partir de fichiers gzip corrompus, `wipertools` (de fastqwiper) pour rendre les lectures bien formées, `bbmap/repair.sh` pour réapparier des lectures, `FastQC` pour les contrôles de qualité et `MultiQC` pour agréger et signaler les résultats de contrôle de qualité. Cette combinaison permet aux utilisateurs de transformer des données de séquençage brouillées en fichiers FASTQ propres et prêts à l'analyse, accompagnés de rapports complets de contrôle de qualité.
Pour utiliser le pipeline, les utilisateurs préparent un fichier CSV de samplesheet spécifiant les noms des échantillons et les chemins de fichiers FASTQ correspondants (supportant les données mono-extrémité et bi-extrémité). Le pipeline est exécuté via Nextflow, prenant en charge divers profils pour différents environnements informatiques (local, Docker, Singularity, Conda, etc.). Il produit des fichiers FASTQ propres et des rapports textuels détaillés des actions de nettoyage effectuées. Le projet fait partie du framework de pipeline communautaire nf-core, garantissant des flux de travail bioinformatiques standardisés, reproductibles et bien documentés.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.