Об этом проекте
DeepEval — это фреймворк с открытым исходным кодом для оценки систем на базе больших языковых моделей (LLM), работающий по принципу Pytest, но адаптированный для ИИ-приложений. Он позволяет разработчикам проводить сквозное тестирование LLM-приложений как «черных ящиков», анализировать полные траектории агентов или проверять отдельные этапы, такие как использование инструментов и поиск информации.
Основные возможности включают:
- Широкий набор готовых метрик:
- Универсальные: G-Eval и DAG.
- Агентные: завершение задач, корректность инструментов, точность целей и соблюдение плана.
- RAG: релевантность ответов, достоверность, полнота и точность контекста.
- Многоходовые диалоги: удержание знаний, полнота беседы и соблюдение ролей.
- Мультимодальные: преобразование текста в изображение, редактирование изображений и их согласованность.
- Прочие: галлюцинации, суммаризация, предвзятость, токсичность и корректность JSON.
- Генерация синтетических наборов данных: возможность создания одноходовых и многоходовых датасетов для тестирования.
- Бенчмаркинг: поддержка популярных тестов, таких как MMLU, HellaSwag и HumanEval.
- Оптимизация промптов: автоматическая оптимизация запросов на основе результатов оценки.
- Широкая интеграция: совместимость с такими фреймворками, как LangChain, LangGraph, Pydantic AI, CrewAI, LlamaIndex, OpenAI, Anthropic и Google ADK.
Фреймворк поддерживает как локальное выполнение с использованием NLP-моделей, так и паттерны «LLM как судья», а также легко встраивается в CI/CD-среды для автоматизированного контроля качества.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.