Sobre el proyecto

RetroSeek es un pipeline computacional de extremo a extremo para detectar, categorizar y anotar integraciones de retrovirus endógenos (ERV) en ensamblajes genómicos. Está construido sobre el gestor de flujos de trabajo Snakemake y pone énfasis en la paralelización, modularidad, resiliencia y reproducibilidad, dirigido a estaciones de trabajo, clústeres HPC y entornos en la nube. Capacidades principales - Obtención automatizada de genomas mediante NCBI Datasets, con generación de una base de datos BLAST por genoma y de un arreglo de sufijos con GenomeTools. - Búsqueda de homología configurable con BLAST+ (tBLASTn de sondas contra los genomas) combinada con descubrimiento de LTR de novo mediante LTRharvest y LTRdigest, reconciliada en tracks de candidatos de ERV de alta confianza. - Detección de LTR solos: identifica los LTR individuales que quedan cuando los dos LTR de un provirus se recombinan y escinden la secuencia intermedia, utilizando brazos LTR como cebo blastn y restando los flancos de elementos intactos y los LTR aislados junto a secuencia codificante. Las proporciones solo/intacto se emiten como proxy de edad del linaje. - Clasificación taxonómica por locus que asigna a cada locus de ERV válido una llamada de género calibrada (rango, confianza, mosaico, clase de ERV), usando ubicación filogenética para POL/GAG y LCA ponderada en los demás casos, frente a una referencia completa de géneros construida a partir de NCBI. - Salidas de ubicación filogenética: evidencia .jplace lista para iTOL, árboles de calor por genoma, tablas EDPL de incertidumbre de ubicación y una comparación de cofilogenia de los complementos de ERV frente a la ascendencia del huésped. - Capa modular de análisis en R (GenomicRanges / plyranges) que produce matrices de solapamiento, detección de puntos calientes mediante GLM binomial negativo determinista y tablas de pares de sondas. - Agregación configurable de metadatos entre rangos fusionados (list, concatenate, best, majority, first, strict). - Figuras listas para publicación: un PDF vectorial de varias páginas por etapa en un sistema visual seguro para daltonismo, con filas de especies huésped junto a la filogenia del huésped. Flujo de trabajo e interfaz La CLI delega en Snakemake y agrupa las etapas por fase: setup (descarga de genomas, obtención de Pfam, construcción de referencia, extracción de sondas), indexación (bases de datos BLAST, arreglos de sufijos), descubrimiento (candidatos LTR, dominios LTR, BLAST), análisis (análisis de rangos, escaneo de dominios, clasificación, segmentación, detección de LTR solos, detección de puntos calientes, detección de pares, árboles de ubicación) y figuras (gráficos globales, gráficos circulares). Las etapas pueden combinarse y ejecutarse en orden de dependencias; las ejecuciones se reanudan desde puntos de control tras una interrupción y aceptan cualquier indicador de Snakemake, como --cores, --profile o -n. Un atajo --downstream ejecuta todas las etapas de análisis y figuras. El lanzador valida la configuración, las herramientas y la biblioteca Pfam antes de comenzar y se niega a iniciar si una búsqueda pesada se volvería a ejecutar sin intención. Requisitos y reproducibilidad Un único entorno conda/mamba (data/config/environment.yml) proporciona Python 3.11, R 4.3, Bioconductor, BLAST+, GenomeTools, NCBI Datasets y bibliotecas de apoyo. Se requiere una dirección de correo electrónico válida para la API de NCBI Entrez, con una clave de API opcional para consultas más rápidas. La configuración es YAML exclusivamente de valores con valores predeterminados relativos al repositorio, de modo que una prueba de humo con un genoma de juguete funciona directamente; las ejecuciones de producción apuntan a almacenamiento externo mediante una configuración local ignorada por git. Notas de estado El README indica que --hotspot-detection es experimental (funcional, pero está poco probado) y que --generate-circle-plots está actualmente roto, fallando en el momento de graficar porque lee métricas por locus reemplazadas en una refactorización posterior. La documentación cubre arquitectura, uso, configuración, metodología de LTR solos, convenciones de desarrollo y registros de decisiones arquitectónicas. El proyecto tiene licencia MIT y fue desarrollado en el laboratorio Ní Leathlobhair del Moyne Institute, Trinity College Dublin.