منصوبے کے بارے میں

llm-router-gate ایک Python CLI اور SDK ہے جو اُن ڈویلپرز کے لیے ڈیزائن کیا گیا ہے جنہیں واحد‑شاٹ LLM API کالز کی درست وضاحت درکار ہے۔ یہ درخواستوں کو Anthropic، OpenRouter، یا مقامی llama.cpp سرورز کی طرف بھیجتا ہے، ردعمل کو سٹریم کرتا ہے جبکہ مکمل HTTP پرت کو ظاہر کرتا ہے — جس میں ہیڈرز، خام SSE ایونٹس، اور حتمی پے لوڈ شامل ہیں۔ یہ ٹوکن کی گنتی اور لاگت کے تخمینے ساتھ ماخذ فراہم کرتا ہے، جس سے صارفین فراہم کنندگان کا موازنہ، خالی جوابات کی ڈیبگنگ، یا ڈپلائمنٹ سے پہلے پرامپٹ کی لاگت کی توثیق کر سکتے ہیں۔ یہ ٹول جان بوجھ کر چیٹ ہسٹری، ریٹریز، یا سسٹم پرامپٹس سے گریز کرتا ہے، اور LLM کے لیے 'curl -v' کی طرح کام کرتا ہے ساتھ ہی ایک بلٹ‑ان کیلکولیٹر بھی۔ یہ ٹرائی‑اسٹیٹ ریزننگ ٹوگلز کی حمایت کرتا ہے، سٹریم آؤٹ پٹ میں جواب اور ریزننگ چینلز کو الگ کرتا ہے، اور سرور کے مستند فیلڈز یا بیک اپ ہیورسٹکس سے ٹوکن استعمال کی رپورٹ دیتا ہے۔ سیکیورٹی نوٹ: یہ تمام ہیڈرز بشمول API کیز لاگ کرتا ہے — شیئر کرنے سے پہلے انہیں ریڈیکٹ کریں۔ Python ≥3.14 کی ضرورت ہے اور ڈپینڈنسی مینجمنٹ کے لیے uv استعمال کرتا ہے۔ بیک اینڈز پر ایبسٹریکشن لیئر کے بغیر ڈیبگنگ، بینچ مارکنگ، یا LLM کے رویے کی توثیق کے لیے مثالی ہے۔