Sobre o projeto

O RetroSeek é um pipeline computacional ponta a ponta para detetar, categorizar e anotar integrações retrovirais endógenas (ERV) em montagens genómicas. É construído sobre o gestor de fluxos de trabalho Snakemake e enfatiza a paralelização, modularidade, resiliência e reprodutibilidade, visando estações de trabalho, clusters HPC e ambientes de nuvem. Capacidades principais - Aquisição automatizada de genomas através do NCBI Datasets, com geração de base de dados BLAST por genoma e de suffix-array do GenomeTools. - Pesquisa de homologia configurável com BLAST+ (tBLASTn de sondas contra genomas) combinada com descoberta de LTR de novo via LTRharvest e LTRdigest, reconciliadas em faixas de candidatos ERV de alta confiança. - Deteção de Solo-LTR: identifica os LTRs únicos deixados quando os dois LTRs de um provírus se recombinam e excisam a sequência intermédia, usando os braços LTR como isco de blastn e subtraindo flancos de elementos intactos e LTRs isolados junto a sequência codificante. As razões solo/intacto são emitidas como proxy da idade da linhagem. - Classificação taxonómica por locus, atribuindo a cada locus ERV válido uma chamada de género calibrada (rank, confiança, mosaico, classe ERV), usando posicionamento filogenético para POL/GAG e weighted-LCA nos restantes casos, contra uma referência abrangente de géneros construída a partir do NCBI. - Resultados de posicionamento filogenético: evidência .jplace pronta para iTOL, heat-trees por genoma, tabelas de incerteza de posicionamento EDPL e uma comparação de co-filogenia entre os complementos ERV e a ancestralidade do hospedeiro. - Camada modular de análise em R (GenomicRanges / plyranges) produzindo matrizes de sobreposição, deteção determinística de hotspots por GLM binomial negativo e tabelas de pares de sondas. - Agregação configurável de metadados em faixas fundidas (list, concatenate, best, majority, first, strict). - Figuras prontas para publicação: um PDF vetorial multi-página por etapa num sistema visual seguro para daltonismo, com linhas das espécies hospedeiras ao lado da filogenia do hospedeiro. Fluxo de trabalho e interface A CLI delega ao Snakemake e agrupa as etapas por fase: setup (download de genomas, obtenção de Pfam, construção de referência, extração de sondas), indexação (bases de dados BLAST, suffix arrays), descoberta (candidatos LTR, domínios LTR, BLAST), análise (análise de faixas, varrimento de domínios, classificação, segmentação, deteção de solo-LTR, deteção de hotspots, deteção de pares, árvores de posicionamento) e figuras (gráficos globais, gráficos circulares). As etapas podem ser combinadas e executadas por ordem de dependência; as execuções retomam a partir de checkpoints após interrupção e aceitam qualquer flag do Snakemake como --cores, --profile ou -n. Um atalho --downstream executa todas as etapas de análise e de figuras. O lançador valida a configuração, as ferramentas e a biblioteca Pfam antes de iniciar e recusa começar se uma pesquisa pesada for rerun inadvertidamente. Requisitos e reprodutibilidade Um único ambiente conda/mamba (data/config/environment.yml) fornece Python 3.11, R 4.3, Bioconductor, BLAST+, GenomeTools, NCBI Datasets e bibliotecas de suporte. É necessário um endereço de email válido para a API NCBI Entrez, com uma chave de API opcional para consultas mais rápidas. A configuração é YAML apenas com valores e predefinições relativas ao repositório, para que uma execução de teste com um genoma de brinquedo funcione de imediato; as execuções de produção apontam para armazenamento externo através de uma configuração local ignorada pelo git. Notas de estado O README indica que --hotspot-detection é experimental (funcional mas pouco testado) e que --generate-circle-plots está atualmente quebrado, falhando no momento do gráfico porque lê métricas por locus substituídas por uma refatoração posterior. A documentação cobre arquitetura, utilização, configuração, metodologia de solo-LTR, convenções de desenvolvimento e registos de decisões arquiteturais. O projeto tem licença MIT e foi desenvolvido no laboratório Ní Leathlobhair no Moyne Institute, Trinity College Dublin.