প্রকল্প সম্পর্কে

ডিপ লেক হলো AI-এর জন্য একটি ডেটাবেস যা গভীর-শিক্ষণ অ্যাপ্লিকেশনের জন্য অপ্টিমাইজড স্টোরেজ ফরম্যাট দ্বারা চালিত। এটি দুটি প্রধান ব্যবহারের ক্ষেত্রে কাজ করে: LLM অ্যাপ্লিকেশনের জন্য ডেটা ও ভেক্টর সংরক্ষণ এবং অনুসন্ধান (RAG, ভেক্টর স্টোর), এবং গভীর শিক্ষণ মডেল প্রশিক্ষণের সময় ডেটাসেট পরিচালনা। README-তে প্রদর্শিত মূল ক্ষমতাগুলি: - মাল্টিমোডাল স্টোরেজ: এমবেডিং, অডিও, টেক্সট, ভিডিও, ছবি, DICOM, PDF, অ্যানোটেশন এবং আরও অনেক কিছু - সার্ভারলেস আর্কিটেকচার: ক্লায়েন্ট-সাইডে চলে, স্থানীয়ভাবে, মেমরিতে বা ব্যবহারকারীর নিজস্ব ক্লাউডে (S3, GCP, Azure, MinIO-এর মতো যেকোনো S3-সামঞ্জস্যপূর্ণ স্টোরেজ) স্থাপনযোগ্য - নেটিভ কম্প্রেশন সহ লেজি NumPy-সদৃশ ইনডেক্সিং: মিডিয়া নেটিভ ফরম্যাটে (JPEG, PNG, MP4) সংরক্ষণ করে, প্রয়োজনে লোড করে - ডেটাসেট শাফলিং সহ PyTorch এবং TensorFlow-এর জন্য অন্তর্নির্মিত ডেটালোডার - ভেক্টর সার্চ এবং কোয়েরি ক্ষমতা - ডেটা ভার্সনিং এবং লিনিয়েজ ট্র্যাকিং - ডিপ লেক অ্যাপে তাৎক্ষণিক ভিজ্যুয়ালাইজেশন (বাউন্ডিং বক্স, মাস্ক, অ্যানোটেশন) - ১০০+ প্রি-লোডেড জনপ্রিয় ডেটাসেট (MNIST, COCO, ImageNet, CIFAR, GTZAN, ইত্যাদি) - ইন্টিগ্রেশন: LangChain, LlamaIndex (ভেক্টর স্টোর), Weights & Biases (লিনিয়েজ), MMDetection, MMSegmentation তুলনাগুলি স্থাপত্য পার্থক্য তুলে ধরে: Chroma, Pinecone, Weaviate (সার্ভার স্থাপনের প্রয়োজন এমন ভেক্টর ডেটাবেস) থেকে ভিন্ন, ডিপ লেক ক্লায়েন্ট-সাইড কম্পিউট সহ সার্ভারলেস। DVC (ফাইল-ভিত্তিক ভার্সনিং) থেকে ভিন্ন, ডিপ লেক দ্রুত স্ট্রিমিংয়ের জন্য খণ্ডিত সংকুচিত অ্যারে ব্যবহার করে। TFDS (শুধুমাত্র TensorFlow, স্থানীয় ডাউনলোড প্রয়োজন) থেকে ভিন্ন, ডিপ লেক ক্লাউড থেকে PyTorch এবং TensorFlow উভয়েই স্ট্রিম করে। Zarr (কাঁচা অ্যারে স্টোরেজ) থেকে ভিন্ন, ডিপ লেক ব্যবহার-কেস-অপ্টিমাইজড ফরম্যাট সংরক্ষণ করে এবং প্রক্রিয়াকরণ স্বচ্ছভাবে পরিচালনা করে। Intel, Bayer Radiology, Matterport, ZERO Systems, Red Cross, Yale, Oxford ব্যবহার করে। `pip install deeplake` দিয়ে উপলব্ধ।