منصوبے کے بارے میں
RetroSeek جینوم اسمبلیوں میں endogenous retroviral (ERV) انٹیگریشنز کی شناخت، درجہ بندی اور تشریح کے لیے ایک مکمل کمپیوٹیشنل پائپ لائن ہے۔ یہ Snakemake ورک فلو مینیجر پر بنائی گئی ہے اور متوازی کاری، ماڈیولرٹی، مضبوطی اور قابلِ تولیدیت پر زور دیتی ہے، اور ورک سٹیشنز، HPC کلسٹرز اور کلاؤڈ ماحول کے لیے ہے۔
بنیادی صلاحیتیں
- NCBI Datasets کے ذریعے خودکار جینوم حصول، فی جینوم BLAST ڈیٹا بیس اور GenomeTools suffix-array کی تیاری کے ساتھ۔
- BLAST+ کے ساتھ قابلِ ترتیب ہومولوجی سرچ (جینومز کے خلاف probes کا tBLASTn) اور LTRharvest اور LTRdigest کے ذریعے de novo LTR دریافت کا امتزاج، جو اعلیٰ اعتماد ERV امیدوار ٹریکس میں ہم آہنگ کیے جاتے ہیں۔
- Solo-LTR شناخت: جب پرووائرس کے دو LTRs دوبارہ ملاپ کر کے درمیانی ترتیب کو نکال دیتے ہیں تو بچ جانے والے واحد LTRs کی شناخت، LTR بازوؤں کو blastn bait کے طور پر استعمال کرتے ہوئے اور intact-element flanks اور کوڈنگ ترتیب کے پاس موجود تنہا LTRs کو منہا کرتے ہوئے۔ Solo/intact تناسب lineage-age proxy کے طور پر جاری کیا جاتا ہے۔
- فی لوکس ٹیکسونومک درجہ بندی جو ہر درست ERV لوکس کو calibrated genus call (rank، confidence، mosaic، ERV class) تفویض کرتی ہے، POL/GAG کے لیے phylogenetic placement اور بصورت دیگر weighted-LCA استعمال کرتے ہوئے، NCBI سے بنائے گئے genus-comprehensive reference کے خلاف۔
- Phylogenetic placement کے نتائج: iTOL-ready .jplace شواہد، فی جینوم heat-trees، EDPL placement-uncertainty ٹیبلز اور ERV complements بمقابلہ میزبان ancestry کا co-phylogeny موازنہ۔
- ماڈیولر R تجزیہ لیئر (GenomicRanges / plyranges) جو overlap matrices، deterministic negative-binomial GLM hotspot detection، اور probe-pair ٹیبلز تیار کرتی ہے۔
- merged ranges کے پار قابلِ ترتیب metadata aggregation (list، concatenate، best، majority، first، strict)۔
- اشاعت کے لیے تیار اعداد و شمار: colour-blind-safe visual system میں فی مرحلہ ایک multi-page vector PDF، جس میں میزبان انواع کی قطاریں میزبان phylogeny کے ساتھ ہوتی ہیں۔
ورک فلو اور انٹرفیس
CLI، Snakemake کو delegate کرتی ہے اور مراحل کو phase کے لحاظ سے گروپ کرتی ہے: setup (جینوم ڈاؤن لوڈ، Pfam fetch، reference build، probe extraction)، indexing (BLAST ڈیٹا بیسز، suffix arrays)، discovery (LTR امیدوار، LTR domains، BLAST)، analysis (ranges analysis، domain scan، classification، segmentation، solo-LTR detection، hotspot detection، pair detection، placement trees) اور figures (global plots، circle plots)۔ مراحل کو یکجا کیا جا سکتا ہے اور dependency order میں چلایا جا سکتا ہے؛ رنز interruption کے بعد checkpoints سے دوبارہ شروع ہوتے ہیں اور کوئی بھی Snakemake flag جیسے --cores، --profile یا -n قبول کرتے ہیں۔ ایک --downstream شارٹ کٹ تمام analysis اور figure مراحل چلاتا ہے۔ launcher شروع کرنے سے پہلے config، tools اور Pfam library کی توثیق کرتا ہے اور اگر کوئی بھاری سرچ غیر ارادی طور پر دوبارہ چلنی ہو تو شروع کرنے سے انکار کر دیتا ہے۔
تقاضے اور قابلِ تولیدیت
ایک واحد conda/mamba ماحول (data/config/environment.yml) Python 3.11، R 4.3، Bioconductor، BLAST+، GenomeTools، NCBI Datasets اور معاون لائبریریاں فراہم کرتا ہے۔ NCBI Entrez API کے لیے ایک درست ای میل پتہ درکار ہے، تیز queries کے لیے اختیاری API key کے ساتھ۔ کنفیگریشن values-only YAML ہے جس میں repo-relative defaults ہیں تاکہ toy-genome smoke run بغیر کسی اضافی ترتیب کے کام کرے؛ production رنز gitignored local config کے ذریعے external storage کی طرف اشارہ کرتے ہیں۔
حالت کے نوٹس
README بیان کرتا ہے کہ --hotspot-detection تجرباتی ہے (فعال مگر کم tested) اور یہ کہ --generate-circle-plots فی الحال ٹوٹا ہوا ہے، plot کے وقت ناکام ہوتا ہے کیونکہ یہ per-locus metrics پڑھتا ہے جو بعد کے refactor نے بدل دیے۔
دستاویزات architecture، usage، configuration، solo-LTR methodology، development conventions اور architectural decision records کا احاطہ کرتی ہیں۔ پروجیکٹ MIT لائسنس یافتہ ہے اور اسے Ní Leathlobhair lab، Moyne Institute، Trinity College Dublin میں تیار کیا گیا۔
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.