Об этом проекте

Clousight Bench представляет собой open-core раннер бенчмарков и SDK плагинов, разработанный для измерения показателей облачных вычислений. Он делает упор на воспроизводимость и прозрачность, используя немодифицированные стандартные средства тестирования и поддерживая проверяемую цепочку происхождения для каждого измерения. На данный момент инструмент поддерживает пять категорий продуктов: - Среды выполнения агентов: SWE-bench - Хранилища данных: TPC-H, TPC-DS - Транзакционные базы данных: TPC-C (через BenchBase) - Хранилища «ключ-значение»: YCSB - Эндпоинты LLM: MMLU, GSM8K, HumanEval Ключевые архитектурные особенности включают систему плагинов для BenchmarkSuites, Evaluators, DomainPacks и ProviderAdapters. Поддерживаются различные режимы выполнения, включая режим «mock» для локального тестирования без облачных аккаунтов и режим «real» для реальных облачных сред (с экспериментальной поддержкой Aliyun AgentRun). Проект включает веб-вьюер на базе React для анализа записей и траекторий, интерфейс запросов на базе SQL через DuckDB и интеграцию с pytest для гейтинга в CI/CD. Инструмент отслеживает несколько измерений, включая задержку, стоимость и поведение при подготовке ресурсов, наряду с основным вердиктом бенчмарка.