عن المشروع
ديب ليك هي قاعدة بيانات للذكاء الاصطناعي تعتمد على تنسيق تخزين مُحسَّن لتطبيقات التعلم العميق. وهي تخدم حالتَي استخدام رئيسيتين: تخزين البيانات والمتجهات والبحث عنها لتطبيقات نماذج اللغة الكبيرة (التوليد المعزز بالاسترجاع، مخزن المتجهات)، وإدارة مجموعات البيانات أثناء تدريب نماذج التعلم العميق.
القدرات الرئيسية الموثقة في ملف README:
- تخزين متعدد الوسائط: التضمينات، الصوت، النص، الفيديو، الصور، ملفات DICOM، وملفات PDF، والتعليقات التوضيحية، وغيرها.
- بنية غير خادمية: تعمل من جهة العميل، ويمكن نشرها محليًا أو في الذاكرة أو على سحابة المستخدم الخاصة (S3 أو GCP أو Azure أو أي تخزين متوافق مع S3 مثل MinIO).
- ضغط أصلي مع فهرسة كسولة شبيهة بـ NumPy: يخزّن الوسائط بتنسيقاتها الأصلية (JPEG وPNG وMP4) ولا يحمّلها إلا عند الحاجة.
- محمّلات بيانات مدمجة لـ PyTorch وTensorFlow مع دعم خلط مجموعات البيانات.
- قدرات البحث والاستعلام المتجهي.
- إصدار البيانات وتتبع سلسلة المصدر.
- عرض فوري في تطبيق Deep Lake (مربعات الإحاطة والأقنعة والتعليقات التوضيحية).
- أكثر من 100 مجموعة بيانات شائعة محمّلة مسبقًا (مثل MNIST وCOCO وImageNet وCIFAR وGTZAN).
- التكاملات: LangChain، وLlamaIndex (كمخزن متجهات)، وWeights & Biases (لسلسلة المصدر)، وMMDetection، وMMSegmentation.
تُبرز المقارنات فروقًا معمارية: على عكس قواعد البيانات المتجهية مثل Chroma وPinecone وWeaviate التي تتطلب نشر خادم، تعمل ديب ليك دون خادم مع معالجة من جهة العميل. وعلى عكس DVC المعتمد على إصدار الملفات، تستخدم ديب ليك مصفوفات مضغوطة ومقسّمة للبث السريع. وعلى عكس TFDS المرتبط بـ TensorFlow فقط والذي يتطلب تنزيلًا محليًا، تبث ديب ليك من السحابة إلى كل من PyTorch وTensorFlow. وعلى عكس Zarr المخصص لتخزين المصفوفات الخام، تخزّن ديب ليك تنسيقات محسّنة حسب حالة الاستخدام وتتعامل مع المعالجة بشفافية.
تستخدمها Intel وBayer Radiology وMatterport وZERO Systems وRed Cross وYale وOxford. وهي متاحة عبر الأمر `pip install deeplake`.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.