这个项目能做什么

LimiX是一个开源项目,为结构化(表格)数据提供大型基础模型,称为LDM。该仓库发布了LimiX模型系列的推理代码和预训练检查点,包括LimiX-2(4亿参数)、LimiX-2M(2百万)和LimiX-16M(1600万)。 核心能力:单个预训练模型可在一次前向传播中执行分类、回归和缺失值填补,无需任务特定的参数更新。LimiX-2使用上下文机制网络(CMN)范式,通过上下文条件掩码建模进行预训练,学习联合表示p(x, y | D_context),而非传统表格先验拟合网络的目标中心目标p(y | x, D_context)。预训练数据是合成的,由结构因果模型生成,涵盖多样的图结构、功能机制和观测过程。项目声称CMN设计还带来因果意识,特征注意力编码直接因果关系。 用法:需要Python >= 3.12。克隆后通过`pip install -e .`安装,可选配CUDA匹配的PyTorch(推荐torch==2.9.1)和flash-attn轮子。公共入口点是`inference.predictor.LimiXPredictor`,根据检查点架构版本路由到v1_0或v2_0;配置必须与模型匹配(LimiX-2 / V2.0使用`*_v2.json`)。 提供命令行工具`LimiX-infer`,需要`--task_type`、`--data_dir`和`--model_path`。任务类型包括Classification、Regression和Feature_imputation,别名cls / reg / imputation。`--data_dir`期望一个基准根目录,每个数据集一个子目录,包含train/test CSV(以及用于填补的掩码CSV),最后一列是目标。可选标志包括device(cuda或cpu)、gpuid、gpu_num_per_predictor、autobatch、show_progress和seed。 Python API暴露`LimiXPredictor(device, model_path, inference_config, ...)`,选项包括mix_precision、outlier_remove_std、softmax_temperature、average_before_softmax、categorical_features_indices、inference_with_DDP、use_data_cache和seed。其`predict(x_train, y_train, x_test, task_type, unique_dataset_name)`返回分类的类别概率、回归的原始目标尺度预测,或缺失值填补的填补特征矩阵。示例脚本涵盖分类(乳腺癌数据集)、回归(糖尿病数据集)和缺失值填补。 打包的推理配置区分检索和无检索变体:LimiX-2的V2.0配置,以及LimiX-16M和LimiX-2M的检索/无检索配置,其中检索被描述为提高准确性,无检索更快。 README报告了在TabArena、TALENT和BCCO上的基准评估,以及跨12.5M到406.2M参数配置的扩展研究。这些是项目自身报告的结果;此处不提供独立验证。 许可:代码在Stable AI Technology Co., Ltd.许可证1.0版(2026年9月)下发布,源自Apache License 2.0,模型使用受非商业许可约束。提供了arXiv论文、技术报告、项目页面、HuggingFace和ModelScope模型/数据集托管以及BCCO分类和回归基准数据集的链接。