منصوبے کے بارے میں

Apache DataFusion ایک قابل توسیع کوئری انجن ہے جسے ان ڈویلپرز کے لیے ڈیزائن کیا گیا ہے جو اعلیٰ کارکردگی والے ڈیٹا بیس اور تجزیاتی سسٹمز بنا رہے ہیں۔ Rust میں لکھے گئے اور اپنے ان میموری فارمیٹ کے لیے Apache Arrow کا استعمال کرنے والے اس انجن میں ایک مکمل کوئری پلانر اور ایک کالم نار، اسٹریمنگ، ملٹی تھریڈڈ، اور ویکٹرائزڈ ایگزیکیوشن انجن شامل ہے۔ اہم صلاحیتوں میں شامل ہیں: - APIs: کوئری کرنے کے لیے SQL اور DataFrame دونوں انٹرفیس فراہم کرتا ہے۔ - ڈیٹا سپورٹ: CSV، Parquet، JSON، اور Avro فارمیٹس کے لیے بلٹ ان سپورٹ۔ - قابل توسیع (Extensibility): ڈیٹا ذرائع، کوئری زبانوں، فنکشنز، اور آپریٹرز کی تخصیص کی اجازت دیتا ہے۔ - ایکو سسٹم: اس میں DataFusion Python، DataFusion Java، DataFusion Comet (Spark accelerator)، اور DataFusion Ballista (distributed execution) جیسے ذیلی منصوبے شامل ہیں۔ یہ انجن ڈومین مخصوص کوئری انجن، نئے ڈیٹا بیس پلیٹ فارمز، اور ڈیٹا پائپ لائنز بنانے کے لیے موزوں ہے۔ اس میں کمپریشن، کرپٹوگرافک ایکسپریشنز، اور Parquet ماڈیولر انکرپشن کے لیے مختلف اختیاری خصوصیات شامل ہیں۔