清华稳准智能联合发布LimiX-2,结构化数据基础模型登顶国际评测榜单
近日,清华大学计算机系崔鹏教授团队联合源自清华系的稳准智能科技,正式发布新一代结构化数据基础模型LimiX-2。该模型在涵盖分类、回归、缺失值插补等维度的10项国际权威结构化数据基准测试中全面登顶,性能超越此前所有state-of-the-art(SOTA)方案,标志着我国在结构化数据智能处理领域的技术突破与生态开放迈出关键一步,将显著降低各行业应用结构化数据AI技术的门槛,为千行百业智能化升级提供核心支撑。

崔鹏团队十余年技术沉淀,破解结构化数据建模核心难题
作为我国数据智能领域的顶尖学者,崔鹏教授是国家杰出青年科学基金获得者,两度斩获国家自然科学二等奖,获评国际计算机协会(ACM)杰出科学家,其开创的「因果启发的稳定学习」新范式早已突破传统机器学习在数据分布偏移场景下的性能局限,为AI模型的可靠性与泛化性研究奠定重要理论基础。2022年OpenAI推出ChatGPT引发大模型技术浪潮后,崔鹏教授敏锐捕捉到结构化数据方向大模型的技术潜力,迅速将研究方向从因果稳定学习拓展至结构化数据通用大模型(LDM)领域,依托既有理论积累,团队先后攻克结构因果数据合成、模型结构设计、跨场景泛化等核心难题。2025年8月,团队联合稳准智能开源发布LimiX系列首个版本,此次推出的LimiX-2是团队历时半年迭代升级的最新成果。
LimiX-2实现多任务统一建模,轻量化版本同步刷新性能极限
本次发布的LimiX-2基于「因果稳定学习理论」打造,将结构化数据建模为变量与缺失性的联合分布,采用掩码联合分布建模进行预训练,其目标函数具备阶段性、上下文条件性特征,可根据特定数据集的上下文信息对查询子集进行预测,推理阶段无需重新训练即可快速适配新场景。
模型集成了以下9类核心能力:
- 基础预测任务:分类、回归
- 数据处理任务:缺失值插补、数据密度估计、数据生成
- 高阶分析任务:高维表征抽取、因果推断、因果发现
- 泛化任务:分布外泛化预测
无需为不同任务设计专用架构或开展定制化训练,LimiX-2即可在多类场景中实现性能突破。在本次国际评测中,LimiX-2覆盖样本量、特征维度、类别数量、特征类型比例、缺失率、样本特征比等广泛数据分布情形,全面超越梯度提升树、深度表格网络、近期表格基础模型及自动化集成方法,登顶10大基准测试榜单。此前团队推出的轻量化版本LimiX-2M仅2M大小即实现性能超越众多大参数模型,重新定义了表格理解的性能极限。
全场景落地赋能新型工业化,开源生态加速技术普及
目前LimiX系列大模型已在多个领域实现落地应用:稳准智能联合中网发布的电力交易数据大模型「易准」、联合彩讯股份打造的运营商行业垂类数据大模型均基于LimiX技术底座开发,可应用于电力系统寻