Открытый бенчмарк галлюцинаций LLM по BNCC (Национальная общая учебная база Бразилии). Измеряет, насколько модели выдумывают официальные коды и тексты, с открытой методологией, сырыми данными и проверяемой согласованностью в CI.
Открытый код. Новые возможности.
Находите качественные проекты с открытым исходным кодом, отправляйте проекты анонимно, заявляйте права на свои проекты и редактируйте их.
Немного любопытства. Мир открытого кода.
THE FIRST COLLECTIONПрофиль GitHub Сачина, архитектора и инженера в области прикладного ИИ. В нем представлены open-source проекты по агентам, RAG, инструментам оценки и надежности, а также перечень навыков и условия сотрудничества.
AgentLeak — это инструмент с открытым исходным кодом для проверки конфиденциальности ИИ-агентов. Он обнаруживает утечки данных в вызовах инструментов, памяти и журналах с помощью локального Python SDK, CLI и MCP-инструментов, предоставляя отчеты с редактированием и CI-гейты без облачных зависимостей.
MLflow — это open-source платформа для AI-инжиниринга, предназначенная для управления жизненным циклом агентов, LLM и традиционных ML-моделей с упором на наблюдаемость, оценку и развертывание.
SUM — это инструмент с открытым исходным кодом для проверки преобразований текста ИИ с криптографическими квитанциями. Он проверяет, что изменилось, что сохранилось и что было потеряно при переписывании текста ИИ, с помощью подписей Ed25519 и офлайн-верификации.
garak — это открытый сканер уязвимостей LLM от NVIDIA, который проверяет генеративные модели ИИ на галлюцинации, утечку данных, промпт-инъекции, токсичность, джейлбрейки и другие слабости, по духу похожий на nmap или Metasploit, но для LLM.
iFixAi — инструмент независимого аудита AI-агентов, оценивающий соответствие агента бизнес-KPI и организационным структурам через структурированную систему оценивания.
DeepEval — это фреймворк с открытым исходным кодом для оценки LLM, предназначенный для модульного тестирования ИИ-приложений, включая RAG-конвейеры, агентов и чат-ботов.