Sobre o projeto

Este repositório contém uma série de experimentos e implementações de NLP. As principais capacidades incluem: - Modelos de Vetores de Palavras: Implementações de Continuous Bag of Words (CBOW) e Skip-gram, incluindo scripts de treinamento e geradores de exemplos. - Processamento de Texto: Ferramentas para tokenização, mapeamento de vocabulário e leitura de dados do corpus BNC. - NLP Clássico: Implementação do algoritmo tf-idf e construção/geração de tabelas n-gram baseadas nos exercícios de Jurafsky e Martin. - Modelos Avançados: Uma implementação tutorial de um modelo Transformer usando PyTorch e uma implementação do distance-dependent Chinese Restaurant Process (CRP). - Utilitários: Um framework de command-pattern para estruturar programas com interfaces de linha de comando.