苹果公布 SimpleDesign 蛋白质设计模型,可联合生成序列与三维结构

苹果团队推出SimpleDesign蛋白质联合设计模型,延续简化架构研究思路

9月12日IT之家援引公开信息,苹果公司研究人员本月初正式发布了名为SimpleDesign的蛋白质设计模型,相关研究论文以预印本形式上线arXiv平台,编号为arXiv:2609.03377,后续将发表于《Transactions on Machine Learning Research》2026年刊。该研究由苹果机器学习研究团队联合Mila研究所共同完成,是苹果此前推出的SimpleFold蛋白质结构预测项目的延伸,将此前验证过的简化通用架构研究思路,拓展到了蛋白质设计这一更广泛的领域。

当前主流蛋白质协同设计普遍采用多阶段生成流程

蛋白质的功能由其氨基酸序列折叠形成的三维结构决定,设计具备特定功能的新蛋白质需要同时生成物理合理、相互匹配的序列与结构,这一任务被称为蛋白质协同设计。目前行业内的先进协同设计模型普遍遵循多阶段生成逻辑:

  1. 首先训练独立的自编码器,将三维蛋白质结构压缩为离散的“潜在空间标记”;
  2. 随后训练生成模型处理上述标记,输出新的氨基酸序列与对应结构标记;
  3. 最后通过结构解码器将生成的结构标记转换回连续三维坐标。
    这一流程虽然能实现可用的生成效果,但引入了额外的架构复杂度,生成质量高度依赖结构编码器-解码器的性能,存在明确的优化瓶颈。

SimpleDesign跳过多阶段流程直接在数据空间实现端到端生成

SimpleDesign的核心创新是挑战了“结构必须标记化”的行业共识,跳过了上述中间步骤,直接在原始数据空间完成训练与生成。该模型直接学习蛋白质三维结构坐标与氨基酸序列的联合数据分布,将氨基酸作为离散标记处理,将三维Cα坐标作为连续值处理,通过单阶段端对端的训练目标完成优化,无需额外训练结构编码器与解码器。
在架构设计上,SimpleDesign采用基于Transformer的多模态骨干网络,分别处理序列与结构两种不同模态的输入,同时共享全局自注意力层,大幅简化了模型结构。训练该模型使用了超过200万组序列-结构配对数据,数据主要来自AFESM数据集,该数据集整合了AlphaFold数据库的预测结构及额外的实验样本。

联合采样机制适配多类蛋白质设计场景

在推理生成阶段,SimpleDesign采用联合采样机制:从完全掩码的氨基酸序列和纯高斯噪声的三维结构坐标出发,迭代完成序列解掩码与结构去噪两个过程。其中序列解掩码采用线性时间步计划,结构去噪采用对数间隔的时间步计划,研究发现同步推进两个过程的耦合采样计划能获得最优生成效果。
通过调整序列与结构的时间步观测级别,该模型可以覆盖从标准蛋白质折叠、逆折叠到完全协同设计的连续任务区间,能够适配不同的蛋白质设计需求。

测试显示生成结果具备高一致性与物理合理性

SimpleDesign的生成效果通过“自洽性”指标进行评估:将模型生成的氨基酸序列输入外部结构预测工具ESMFold得到预测结构,再与模型直接生成的结构进行对比。测试结果显示,该模型生成的结果一致性达标,输出的氨基酸序列符合自然蛋白质的演化规律,生成的三维结构满足物理真实性要求,达到了当前蛋白质协同设计模型的先进水平。