Об этом проекте

CocoIndex — это инкрементальный движок для длинноцикловых AI-агентов, который преобразует разнообразные источники данных, включая кодовые базы, заметки с встреч, Slack, PDF и видео, в живой, постоянно обновляемый контекст для LLM-приложений. Он использует декларативный Python-native подход, при котором пользователи определяют желаемое целевое состояние, а движок обеспечивает синхронизацию, обрабатывая только дельту (изменения), а не переиндексируя целые наборы данных. Ключевые возможности: - Инкрементальная обработка: минимизирует вычислительные затраты и расходы на эмбеддинги за счёт кэширования неизменных данных и перезапуска трансформаций только для изменённых исходных байтов или обновлённого кода. - Конечная lineage: обеспечивает прослеживаемость от целевых векторов или узлов графа обратно к точному исходному байту для аудита и отладки. - Разнообразные коннекторы: поддерживает широкий спектр источников (Local FS, Blob Stores, Базы данных, Очереди сообщений) и целевых хранилищ (Реляционные БД, Векторные БД, Графовые БД, Feature Stores). - Production-ready core: построен на базе Rust, обеспечивая надёжность, включая циклы повторных попыток, экспоненциальное замедление и очереди мёртвых писем. Типичные сценарии использования включают создание AST-aware семантических индексов кода для coding-агентов, RAG-конвейеры для PDF-документов, автоматическое извлечение тем из Hacker News и преобразование транскриптов встреч в知识овые графы.