agent-eval-harnesslinny006
НОВОЕЖивой open-source бенчмарк для оценки ИИ-агентов кодинга на реальных GitHub-задачах, обновляемый каждые 15 минут с публичным рейтингом.
Находите качественные проекты с открытым исходным кодом, отправляйте проекты анонимно, заявляйте права на свои проекты и редактируйте их.
Живой open-source бенчмарк для оценки ИИ-агентов кодинга на реальных GitHub-задачах, обновляемый каждые 15 минут с публичным рейтингом.
Живой индекс инструментов и бенчмарков для оценки LLM, обновляется каждые 15 минут из GitHub.