苹果研究人员在一项新研究中介绍了 SimpleDesign。这是一套更精简的 AI 模型,可以同时生成蛋白质序列和结构。细节如下。
先说一点背景
去年 9 月,苹果研究人员发表过一篇论文,题目是《SimpleFold:蛋白质折叠没你想的那么复杂》。文中给出了一种更精简的方法,能根据氨基酸序列预测蛋白质的三维结构。

简单来说,SimpleFold 用流匹配模型,直接从氨基酸序列生成蛋白质的三维结构。
我们此前更详细讲过流匹配。一句话概括:它从带噪声的随机起点出发,学一条相对直接的路径,走到最终结果。这和扩散模型不同。扩散模型通常是一步步去噪,直到得到最终输出。
这两种方法最常见的应用,至少从历史上说,是图像生成。不过也有研究者(包括苹果团队)把扩散模型用到文本和代码生成上。
回到 SimpleFold。苹果基本是把流匹配和通用 Transformer 模块(文本生成里很常见)配在一起,从而避开蛋白质折叠模型里那些更吃算力的做法,比如 DeepMind 著名的 AlphaFold。
现在,苹果研究人员又拿出了 SimpleDesign。它把 SimpleFold 里那套“更简单、更通用的架构”思路,从只预测三维结构,扩到了蛋白质设计这个问题上。
SimpleDesign
苹果研究人员在新论文《SimpleDesign:蛋白质序列与结构联合设计模型》里写道:
现有模型往往依赖多阶段训练:先训练自编码器,把数据变成潜在表示;再在这些潜在表示上训练生成模型,也就是在潜空间里做生成。我们假设,要做出表现不错的联合设计模型,并不一定需要这种多阶段训练。因此我们提出 SimpleDesign:一个直接在数据空间训练、效果不错的多模态蛋白质设计模型。
换句话说,很多现有蛋白质设计模型要走多步流程,SimpleDesign 则在一次端到端训练里,同时学会生成氨基酸序列和连续的三维结构。

眼下不少蛋白质联合设计模型是这样干活的:先单独训练一个模型,把蛋白质结构转成离散表示,也就是“token”;再训练生成模型,用这些表示去生成新的蛋白质序列和结构。
SimpleDesign 跳过了中间这一步。它直接从成对的氨基酸序列和三维坐标学习,而不是先把蛋白质结构压成另一套分词表示。

苹果团队训练 SimpleDesign 的方式相当有意思。
他们先准备了 200 多万组蛋白质序列-结构对,主要来自 AFESM 数据集。该数据集把 AlphaFold 数据库里的预测结构和其他样本合在了一起。
训练时,他们会同时破坏每一对里的两边:序列里的氨基酸被随机遮成掩码 token,对应的三维结构也会被加上噪声。
两边被打乱的程度还会变。如果序列大体完整、结构被破坏得很厉害,任务就接近蛋白质折叠,模型要从已知序列恢复结构。
反过来,如果结构大体完整、序列被大量遮住,任务就接近逆向折叠。模型要生成一段能形成给定结构的序列。
两边都被部分打乱时,模型就要同时处理这两个问题,相当于在练蛋白质联合设计。
论文称,尽管训练流程简单得多,SimpleDesign 在蛋白质联合设计、结构生成和序列生成这几项基准上,仍然给出了有竞争力的结果。

研究人员还发现,SimpleDesign 能生成看起来合理的蛋白质结构;它给出的氨基酸序列,整体上也达到或超过了多数竞品多模态模型。
最后他们也写明:SimpleDesign 的结果目前还只停留在计算机评估。生成出的蛋白质没有经过实验验证,还不能确认它们在真实生物体系里真的会折叠、会工作,或者足够安全。
即便如此,结果已经相当值得看。整篇论文对 SimpleDesign 的架构、训练过程、基准和结果写得更细,值得读一读。
要看完整论文,点这个链接。
















