Sobre el proyecto

TabPFN es un modelo fundacional tabular diseñado para realizar tareas de clasificación y regresión en conjuntos de datos tabulares en una sola pasada hacia adelante. Construido sobre una arquitectura transformer entrenada con conjuntos de datos sintéticos, elimina la necesidad de preprocesamiento complejo de datos, escalado de características o codificación one-hot. La biblioteca proporciona estimadores compatibles con scikit-learn (`TabPFNClassifier` y `TabPFNRegressor`) que se ejecutan localmente con PyTorch y soporte de CUDA, lo que la hace altamente optimizada para la aceleración por GPU. Admite conjuntos de datos de hasta 1.000.000 de filas y 20.000 características (en la versión 3.5), maneja valores faltantes de forma nativa y ofrece extensiones para interpretabilidad (explicaciones basadas en SHAP), detección de valores atípicos no supervisada y extracción de embeddings aprendidos.