Sobre o projeto

TabPFN é um modelo de fundação tabular projetado para realizar tarefas de classificação e regressão em conjuntos de dados tabulares em uma única passagem direta. Construído sobre uma arquitetura de transformador treinada em conjuntos de dados sintéticos, ele elimina a necessidade de pré-processamento complexo de dados, escalonamento de características ou codificação one-hot. A biblioteca fornece estimadores compatíveis com scikit-learn (`TabPFNClassifier` e `TabPFNRegressor`) que executam localmente com PyTorch e suporte a CUDA, sendo altamente otimizada para aceleração por GPU. Ela suporta conjuntos de dados com até 1.000.000 de linhas e 20.000 características (na versão 3.5), lida nativamente com valores ausentes e oferece extensões para interpretabilidade (explicações baseadas em SHAP), detecção não supervisionada de outliers e extração de embeddings aprendidos.