منصوبے کے بارے میں

ڈیپ لیک ایک ڈیٹا بیس ہے جو AI کے لیے ڈیپ لرننگ ایپلیکیشنز کے لیے موزوں اسٹوریج فارمیٹ پر مبنی ہے۔ یہ دو بنیادی استعمال کے کیسز فراہم کرتا ہے: LLM ایپلیکیشنز (RAG، ویکٹر اسٹور) کے لیے ڈیٹا اور ویکٹر اسٹور کرنا اور تلاش کرنا، اور ڈیپ لرننگ ماڈلز کی تربیت کے دوران ڈیٹاسیٹس کا انتظام کرنا۔ README میں ظاہر کردہ اہم صلاحیتیں: - ملٹی موڈل اسٹوریج: ایمبیڈنگز، آڈیو، ٹیکسٹ، ویڈیوز، امیجز، DICOM، PDFs، تشریحات، اور مزید - سرور لیس آرکیٹیکچر: کلائنٹ سائیڈ پر چلتا ہے، مقامی طور پر، میموری میں، یا صارف کے اپنے کلاؤڈ (S3، GCP، Azure، کوئی بھی S3 مطابقت پذیر اسٹوریج جیسے MinIO) پر تعینات کیا جا سکتا ہے - مقامی کمپریشن کے ساتھ سست NumPy جیسا انڈیکسنگ: میڈیا کو مقامی فارمیٹس (JPEG، PNG، MP4) میں اسٹور کرتا ہے، صرف ضرورت پڑنے پر لوڈ کرتا ہے - PyTorch اور TensorFlow کے لیے بلٹ ان ڈیٹا لوڈرز ڈیٹاسیٹ شفلنگ کے ساتھ - ویکٹر تلاش اور استفسار کی صلاحیتیں - ڈیٹا ورژننگ اور لینیج ٹریکنگ - ڈیپ لیک ایپ میں فوری ویژولائزیشن (باؤنڈنگ باکسز، ماسک، تشریحات) - 100+ پہلے سے لوڈ کردہ مشہور ڈیٹاسیٹس (MNIST، COCO، ImageNet، CIFAR، GTZAN، وغیرہ) - انٹیگریشنز: LangChain، LlamaIndex (ویکٹر اسٹور)، Weights & Biases (لینیج)، MMDetection، MMSegmentation موازنے آرکیٹیکچرل فرق کو نمایاں کرتے ہیں: Chroma، Pinecone، Weaviate (ویکٹر ڈیٹا بیس جنہیں سرور تعیناتی کی ضرورت ہوتی ہے) کے برعکس، ڈیپ لیک کلائنٹ سائیڈ کمپیوٹنگ کے ساتھ سرور لیس ہے۔ DVC (فائل پر مبنی ورژننگ) کے برعکس، ڈیپ لیک تیز اسٹریمنگ کے لیے چنکڈ کمپریسڈ ارے استعمال کرتا ہے۔ TFDS (صرف TensorFlow، مقامی ڈاؤن لوڈ کی ضرورت) کے برعکس، ڈیپ لیک کلاؤڈ سے PyTorch اور TensorFlow دونوں میں اسٹریم کرتا ہے۔ Zarr (خام ارے اسٹوریج) کے برعکس، ڈیپ لیک استعمال کے کیس کے لیے موزوں فارمیٹس اسٹور کرتا ہے اور پروسیسنگ کو شفاف طریقے سے سنبھالتا ہے۔ Intel، Bayer Radiology، Matterport، ZERO Systems، Red Cross، Yale، Oxford استعمال کرتے ہیں۔ `pip install deeplake` کے ذریعے دستیاب ہے۔