小米发布结构化数据大模型 Xiaomi-TabLDM:开启表格数据 Scaling Law

BestBlog编程类文章 · 软件开发

📌 一句话摘要 小米发布通用表格数据基础大模型 Xiaomi-TabLDM,通过大规模合成数据预训练、高效 Scaling 和 Test-Time Scaling 三方向推进,在四大公开基准上跻身第一梯队,并在多个工业场景验证中取得显著提升。 📝 详细摘要 文章报道了小米发布通用表格数据基础大模型 Xiaomi-TabLDM,该模型以单一预训练模型、统一默认配置直接适配不同表格数据集,无需针对每个任务重新训练、调参或后置集成,即可完成分类与回归预测。Xiaomi-TabLDM 从三个方向推进:基于合成数据预训练、高效模型 Scaling(双流 Feature Group、轻量级 Attention Residual、Sparse MoE)以及 Test-Time Scaling。在四大公开基准上,TALENT 二分类排名第一,OpenML-CTR23 回归排名第一,BCCO 总体排名第二,TabArena 回归排第二且速度优于多基线。同时文章展示了三个真实工业场景验证:材料性能预测无需微调即可将精度提升 130%、减少约 90%无效测试;零件重量预测失误样本比例降低约 31%;生产组分预测误差降低约 54%。模型权重与代码已开源。 💡 主要观点 Xiaomi-TabLDM 实现了从「一表一模型」到「一次预训练、跨任务使用」的范式转变。 传统表格机器学习(如 XGBoost、LightGBM)面对新数据集需重新训练、调参甚至集成模型,而 TabLDM 通过在大规模任务分布上预训练,可直接利用新数据的标注样本作为上下文完成预测,无需修改模型参数。 模型从合成数据预训练、高效 Scaling 和 Test-Time Scaling 三个方向扩展表格基础模型能力。 合成数据预训练覆盖多样化任务分布;高效 Scaling 引入双流 Feature Group、轻量级 Attention Residual 和 Sparse MoE,使性能提升不必伴随计算量同比增长;Test-Time Scaling 通过增加推理计算、自适应选择组合预测视角,进一步提升性能。 在四大公开基准上跻身第一梯队,回归与二分类任务表现突出。 TALENT 二分类第一、OpenML-CTR23 回归第一、BCCO 总体第二,TabArena 回归第二并超过 TabPFN-3、AutoGluon 等强基线;同时兼顾效率,每 1K 样本验证时间仅 3.12 秒,显著低于 TabFM 的 9.67 秒。 工业场景验证显示 Xiaomi-TabLDM 在小样本泛化和工况适应方面优势显著。 材料性能预测无需微调即可提升精度 130%、减少约 90%无效试模;工况变化时仅需约 30 条新样本作为上下文即可将误差降低 62%,远优于传统机器学习模型在 200 条样本时的表现。 💬 文章金句 Xiaomi-TabLDM 希望将「一次预训练、跨任务使用」的基础模型范式进一步带入结构化数据。 从公开基准到真实工业场景,Xiaomi-TabLDM 已完成了从研究验证到实际应用的一次完整探索。 📊 文章信息 AI 初评: 82 来源: 小米技术 作者: 小米技术 分类: 人工智能 语言: 中文 阅读时间: 10 分钟 字数: 2302 标签: 小米 , 表格基础模型 , 合成数据 , Test-Time Scaling , 模型训练与推理 阅读完整文章

查看原文