عن المشروع
PaperQA2 هو حزمة Python مفتوحة المصدر وأداة سطر أوامر مصممة لاسترجاع التوليد المعزز (RAG) بدقة عالية على الأدب العلمي وأنواع المستندات الأخرى. يبتلع ملفات PDF وملفات نص عادي و Markdown و HTML وملفات Microsoft Office (docx و xlsx و pptx) وملفات رمز مصدر، ثم ي回答 استفسارات المستخدم مع استشهادات مُؤسسة في النص تشير إلى صفحات ومقاطع محددة.
يتابع النظام سير عمل وسيط ثلاثي المراحل: (1) البحث عن الأوراق، حيث يولد LLM استفسارات الكلمات الرئيسية لإيجاد أوراق مرشحة وتجزئةها إلى فهرس بحث نصي كامل محلي؛ (2) جمع الأدلة، حيث يتم تضمين الاستفسار، يتم تصنيف أعلى كي تشانك، يتم تلخيص كل تشانك في السياق، ويعيد LLM تصنيف وتحديد تلخيصات الأكثر صلة؛ (3) توليد الإجابة، حيث يتم وضع أفضل التلخيصات في سؤال وتوليد إجابة. يمكن لوكيل اللغة استدعاء هذه الأدوات في أي ترتيب، مما يتيح التعديل التكراري للاستفسارات والإجابات.
تتضمن الميزات الرئيسية جلب البيانات الوصفية تلقائيًا من Scholar السيمانتيك و Crossref و Unpaywall (بما في ذلك عدد الاستشهادات وفحص السحب)، التضمين الحساس للبيانات الوصفية للمستندات، إعادة تصنيف LLM وتلخيص سياقي (RCS)، وواجهة تخصيص قوية. يستخدم العمود الافتراضي تضمين OpenAI والنماذج مع قاعدة بيانات نماذج Numpy، ولكن PaperQA2 يدمج مع LiteLLM لدعم تقريبا أي مزود LLM، بما في ذلك Claude و Gemini و النماذج المضيفة محليًا عبر llama.cpp. كما يتم دعم نماذج التضمين المحلية عبر Sentence Transformers.
توفر أداة سطر الأوامر `pqa` استخدامًا سريعًا: انتقل إلى دليل من الأوراق و चल `pqa ask 'ما هو PaperQA2؟'` لتسجيل الدخول، البحث، والإجابة في خطوة واحدة. توفر الإعدادات المجمعة (جودة عالية، سريع، wikicrow، contracrow، debug، tier1_limits) تكوينات مسبقة الضبط لمختلف الحالات، بما في ذلك اكتشاف التناقض وكتابة مقالات بالنمط ويكيبيديا. يمكن تكوين الحد من معدل التكرار لكل نموذج لاستيعاب قيود مستوى API.
توفر مكتبة Python واجهات برمجة تطبيقات متزامنة و غير متزامنة. توفر وظيفة `ask` غلافًا مريحًا، بينما يسمح `agent_query` ومانيبرا مباشرة ل对象 `Docs` بالتحكم الدقيق على استهلاك المستندات والاستفسار. يدعم كائن `Docs` إضافة الملفات والعناوين ورمز، مع أساليب لاسترجاع الأدلة والاستفسار. يتم فهرسة جميع الإجابات السابقة وتخزينها للبحث لاحقًا.
أضافت التحديثات الأخيرة (ديسمبر 2025) دعمًا متعدد الوسائط للجداول والرسومات واللغات غير الإنجليزية والمعادلات الرياضية؛ قراء نموذجية جديدة لملفات PDF (Docling و Nvidia nemotron-parse)؛ تحليل مستندات Microsoft Office؛ تلخيص سياقي متعدد الوسائط حيث يتم تمرير كائنات الوسائط إلى نموذج تلخيص LLM؛ وطبقة HTTP مبسطة باستخدام httpx. انتقل المشروع من إصدار.semantic إلى إصدار التقويم في ديسمبر 2025.
يتم ترخيص PaperQA2 تحت Apache 2.0 ويتطلب Python 3.11+. يعتمد على مكتبات بما في ذلك Scholar السيمانتيك و Crossref و Unpaywall و Pydantic و tantivy و LiteLLM و pybtex. يتم تطوير المشروع بواسطة Future House وتم نشره في أبحاث مراجعة الأقران التي تظهر أداءً خارقًا للإنسان على مهام الاستفسار العلمي والتلخيص واكتشاف التناقض.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.