Об этом проекте

llm-router — это лёгкий обратный прокси-сервер в виде одного бинарного файла, разработанный для оптимизации затрат при использовании API LLM, таких как Claude. Он расположен между вашим приложением и LLM-провайдерами, интеллектуально направляя каждый запрос к самой дешёвой модели, способной его обработать: Haiku для простых запросов, Sonnet для умеренных задач или Opus для сложного рассуждения. Система включает семантическое кэширование (с использованием сходства Джаккарда без внешних эмбеддингов), дедликацию идентичных конкурентных запросов и выполнение многошаговых агентных рабочих процессов, заданных как DAG, с отслеживанием зависимостей и параллельным выполнением. Система в реальном времени отслеживает состояние и нагрузку бэкендов, автоматически избегая деградированных или перегруженных моделей. Поддерживается ML-assisted routing с калибровкой обратной связи и предоставляются подробные отчёты о затратах и экономии. Настраивается через YAML, работает с Anthropic, Ollama, vLLM или любым OpenAI-совместимым бэкендом. Построен на основе методов из 7 научных работ и open-source систем, не требует внешних зависимостей и включает 57 тестов. Идеален для снижения расходов на API при сохранении производительности и надёжности в production-средах.