Sobre o projeto

GrooveSeek é um servidor MCP para busca híbrida — semântica mais texto completo — sobre uma base de conhecimento de arquivos Markdown, com texto simples, PDF, documentos do Office e código-fonte disponíveis como opções. O comando é `groove`. De fábrica, sem arquivo de configuração e com o modelo padrão, ele indexa Markdown em inglês com frontmatter YAML. Conteúdo multilíngue ou japonês exige `--model bge-m3`; todos os outros formatos de arquivo são habilitados em `groove.toml`. Como funciona: Markdown (e opcionalmente .txt, .pdf, .docx, .xlsx, .pptx, além de código-fonte Rust desde a v1.2.0, Python desde a v1.3.0 e PHP desde a v1.5.0, cujas gramáticas são baixadas e colocadas manualmente) é analisado com frontmatter YAML e dividido em chunks baseados em títulos — ou, para código-fonte, um chunk por definição. Os embeddings são gerados com FastEmbed por padrão (BGE-small-en-v1.5, ou BGE-M3 para bases de conhecimento multilíngues) e armazenados em SQLite com sqlite-vec para busca por similaridade vetorial. Uma configuração confiável pode, em vez disso, optar por um endpoint de embedding compatível com OpenAI. Os clientes se conectam via stdio (padrão, um cliente) ou Streamable HTTP (vários clientes), então funciona com Claude Code, Cursor ou qualquer cliente compatível com MCP. Um monitor de arquivos de sincronização ao vivo mantém o índice atualizado em edições manuais, `git pull` e scripts externos. Um esquema TOML opcional pode validar convenções de frontmatter através de `groove validate`, e desde a v1.9.0 as chaves extras que ele declara são armazenadas por `groove index` para que `groove search --field` possa filtrá-las. A superfície MCP expõe seis ferramentas — `search`, `get_document`, `list_topics`, `get_connection_graph`, `get_best_practice`, `rebuild_index` — quatro prompts, e a base de conhecimento como recursos `kb://`. Com `--transport http`, o servidor também responde em `/ui`, uma visão do operador mostrando versão, contagens de documentos e chunks, modelo de embedding, estado do monitor, tempo de atividade e pid, com busca através do mesmo endpoint `/mcp` que os clientes usam. A instalação é via binários pré-compilados para Linux x86_64 e aarch64, macOS Apple Silicon e Windows x86_64, com checksums SHA-256 e atestados de artefatos do GitHub; builds para Mac Intel devem vir do código-fonte. O runtime ONNX e o SQLite são vinculados estaticamente, e os modelos de embedding são baixados do HuggingFace na primeira execução. Compilar a partir do código-fonte é `cargo build --release`. O início rápido é `groove index --kb-path /path/to/knowledge-base`, depois uma entrada em `.mcp.json` apontando para `groove serve --kb-path ...`, ou consultas diretas com `groove search "..." --limit 3`. A documentação cobre comandos, chaves de configuração, receitas de clientes, o pipeline de recuperação (RRF, reranking, MMR, parent retriever), filtros, citações com deslocamentos de bytes, avaliação contra um conjunto de consultas de referência, arquitetura e garantias de estabilidade; uma versão em japonês de cada página é fornecida, e as páginas são publicadas como um site. Receitas de implantação para configurações pessoais stdio, compartilhadas em NAS e HTTP em intranet estão incluídas. Versões anteriores à 1.0.0 são beta sem garantia de compatibilidade; a partir da 1.0.0 o documento de estabilidade declara o que está congelado e o que deliberadamente não está, incluindo a interface web e a API Rust. Licenciado duplamente sob MIT ou Apache-2.0.