Об этом проекте

LLM Router — это бэкенд-сервис на базе FastAPI, предназначенный для динамической маршрутизации пользовательских запросов к наиболее подходящей Большой языковой модели (LLM) среди OpenAI, Google Gemini и Mistral. Система оценивает модели по балльной шкале, балансируя полезность, стоимость и надёжность, а не только сырую производительность. Сервис поддерживает три режима маршрутизации: полный авто (система выбирает лучшую модель), полуавто (пользователь выбирает провайдера, система определяет модель) и ручной (пользователь задаёт и провайдера, и модель). В системе реализован Retrieval-Augmented Generation (RAG) на основе эмбеддингов Mistral и косинусного подобия, поддерживающий файлы форматов .txt, .md и .pdf. Пользователи могут загружать документы через эндпоинт /upload и очищать данные через /clear-data. Для каждого пользователя поддерживается память диалога объёмом в 2 хода для ответов, учитывающих контекст. Архитектура разделяет принятие решений и выполнение: логика маршрутизации выбирает модель, тогда как клиентские модули осуществляют реальные API-вызовы. Модели исключаются из рассмотрения при превышении лимитов токенов. Ответы содержат метаданные: провайдер, модель, уверенность, количество использованных токенов и оценку стоимости. Поддержка WebSocket обеспечивает потоковую передачу ответов в реальном времени. В планах развития: настройка на основе обратной связи, интеграция локальных LLM и A/B-тестирование. Проект находится в активной разработке, при этом ключевые функции — маршрутизация с учётом намерений, оптимизация затрат и RAG — уже реализованы.