小米|开源表格结构化数据基座模型 Xiaomi-TabLDM

PromptTree|阅读 5
2026/09/06 08:47
小米TabLDM表格基座模型结构化数据
9月5日,小米发布并开源通用表格数据基础大模型 Xiaomi-TabLDM,面向分类与回归的 in-context learning,无需任务特定微调。公开评测口径显示 OpenML-CTR23 回归榜排名第一;权重与代码已在 Hugging Face 与 GitHub 开放。

表格仍是工业、材料与经营决策里最常见的结构化载体:换一张表、换一个任务,传统做法往往是重新微调树模型或浅层网络。9月5日,小米发布并开源通用表格数据基础大模型 Xiaomi-TabLDM,赌的是另一条路——上下文学习一次给示范,就能在新表上直接预测。

小米在消费硬件与端侧AI之外,持续补强工业与结构化数据工具链。TabLDM 对应技术报告挂在 arXiv(编号 2609.03880):模型面向分类与回归的 in-context learning,无需任务特定微调;预训练数据来自结构因果模型(SCM)生成的大规模合成表。架构上组合双流特征分组、注意力残差与稀疏混合专家,在扩大总容量的同时控制激活计算。

评测与工业口径:

  1. 榜单:OpenML-CTR23 回归榜排名第一;TALENT、TabArena、BCCO 回归任务均居第二档;TALENT 二分类并列第一
  2. 效率:TabArena 回归场景公开称相对排名第一的 TabFM,训练时间约减 82%、预测时间约减 68%
  3. 材料:材料性能预测无需微调即可将预测精度提升约 130%、减少约 90% 无效试模(公开转述)
  4. 制造:零件重量预测相对 XGBoost 失误样本比例约降 31%;生产组分预测平均误差约降 54%
  5. 开放:权重与代码已在 Hugging Face 与 GitHub(xiaomi-research/xiaomi-tabldm)开放

所谓表格基座,白话是把「换一张表就重训」变成「给几行示范就能猜」;所谓 SCM 合成预训练,白话是用可控的因果生成器造海量表,逼模型学可迁移的表结构先验,而不是背真实客户隐私表。对制造与供应链团队,这意味着验收要从榜单 Elo 转向跨工况漂移与缺失值鲁棒性。

放在工业AI上下文里,通用大模型擅长文本与代码,结构化表却长期被「每任务一模型」占据。TabLDM 把讨论钉在「回归强且推理便宜」的对照标准上:既要准,也要训得起、推得动。对竞品表格基础模型,公开榜单与开源仓会抬高复现门槛。

产业影响上,小米补的是工业结构化预测工具链入口;社区能否把它用进真实产线,取决于缺值、分布漂移与合规脱敏。需要把边界读清楚:工业场景数字为公开实测转述;跨行业泛化仍待第三方复现。下一观察点是社区采用率与真实产线 A/B。