SynthID Bio 为 AI 设计蛋白质添加水印
Google DeepMind News··作者 Pushmeet Kohli, David Stutz, Ali Cowen-Rivers and Jeremy Ratcliff
关键信息
SynthID Bio 会引导蛋白质序列中的氨基酸选择,并调整预测结构的原子坐标;其序列实验覆盖了针对 VEGF-A、SARS-CoV-2 刺突蛋白 RBD 和 PD-L1 的结合物。相关成果仍处于早期阶段,验证仅限于特定实验室测试;其中针对 AlphaFold 3 的方法据称具有接近完美的检测能力,并能抵抗数字噪声和轻微坐标变化。
资讯摘要
Google DeepMind 将 SynthID Bio 定位为一种概念验证技术,用于把不易察觉但可以检测的签名直接嵌入 AI 生成的生物设计中。与只附着在数字文件上的水印不同,其蛋白质序列水印旨在让编码产物完成实体合成后仍可验证。针对蛋白质结合物,研究人员将 AlphaProteo 与支持 SynthID Bio 的 ProteinMPNN 版本结合,通过细微引导氨基酸选择来写入水印。湿实验评估了针对 VEGF-A、SARS-CoV-2 刺突蛋白受体结合域和 PD-L1 的设计。
DeepMind 表示,带水印与不带水印的设计在命中率、结合亲和力和天然序列多样性方面表现相当,并由此获得了其所称首批带水印且具有生物学功能的蛋白质结合物。对于预测的蛋白质结构,团队对 AlphaFold 3 扩散网络的一小部分进行了微调,使生成的原子坐标天然携带可检测签名。该公司称,这种结构水印方法在保持预测准确性和关键结构特征分布的同时,实现了接近完美的检测能力,并可承受数字噪声和轻微坐标修改。DeepMind 强调,该技术是多层防御体系中的一个环节,而不能取代模型安全措施、客户审查或 DNA 合成筛查。
资讯正文
利用水印技术为合成生物学服务
这是在保留生物学功能的同时,为 AI 生成的蛋白质添加水印的概念验证。
今天,我们推出 SynthID Bio,将水印技术引入合成生物学。SynthID Bio 将一种不可察觉的签名直接嵌入生物代码,确保水印不仅能在数字模型上得到验证,也能在合成出的实体蛋白质本身上得到验证——同时,在实验室测试中保留其生物学功能。
生成式 AI 正在帮助科学家应对关键的生物学挑战:从预测蛋白质结构(AlphaFold),到设计全新的蛋白质(AlphaProteo 和 ProteinMPNN),以及最近开发新的噬菌体——即感染细菌的病毒。然而,这些工具也带来了新的挑战:新颖的 AI 设计可能绕过传统的 DNA 合成筛查,而被错误标记的合成三维结构则有可能污染公共数据库,并误导后续研究。
SynthID Bio 的工作原理
SynthID Bio 是一系列专为合成生物学开发的水印方法,旨在加强生物安全和科学诚信。
它会根据数据类型调整处理方式:对于序列,它会对氨基酸的选择进行细微引导;对于预测的三维结构,它会调整原子坐标,从而生成可靠的检测信号。
实验表明,这些调整没有损害蛋白质的生物学功能,而这一点对于有效治疗疾病和推进科学研究至关重要。
这是我们带有水印的 VEGF-A 蛋白结合体的预测结构可视化图,其中水印信号通过每个氨基酸对应的颜色表示。
我们使用蛋白质结合体设计方法 AlphaProteo,以及启用了 SynthID Bio 的 ProteinMPNN 版本——ProteinMPNN 是一种广泛使用的蛋白质序列生成方法——验证了我们为蛋白质结合体添加水印的方法。蛋白质结合体是专门设计用来选择性附着到其他蛋白质上的分子。
在针对三种目标蛋白质(VEGF-A、SARS-CoV-2 刺突蛋白 RBD 和 PD-L1)的湿实验室测试中,我们添加水印的设计在命中率、结合亲和力和天然序列多样性方面均与未添加水印的版本相当,成功创造出首批带有水印且具备生物学功能的蛋白质结合体。
在三种目标蛋白质上,对比未添加水印和添加水印的蛋白质设计的结合亲和力,以 KD 衡量。数值越低,表示结合能力越强。
对于蛋白质折叠,SynthID Bio 对 AlphaFold 3 的扩散网络中的一小部分进行微调,将直接在模型权重中添加水印的能力构建起来。这确保预测出的三维坐标天然携带可检测的签名,而不受模型运行者的影响。SynthID Bio 在提供近乎完美的可检测性的同时,保留了 AlphaFold 3 的预测准确性,维持关键结构特征的分布,并能够抵抗数字噪声或轻微的坐标变化。
在 7PPA 上,我们展示了 AF3 预测的结构(左)、真实结构(中)和带水印的结构(右)。
加强生物安全和信息完整性
生物安全依赖于分层防御——可以把它想象成“瑞士奶酪”防御模型:多项彼此独立的安全措施协同运作,弥补相互之间的盲点。模型层面的缓解措施和客户审查等保障机制,分别构成了关键防线,但每一层都可能存在缺口。作为我们更广泛的生物韧性愿景的一部分,SynthID Bio 的水印方法被嵌入生物设计本身,充当重要且切实可行的验证层。
“SynthID Bio 是追踪生物设计来源拼图中的重要一块。”审阅了这项工作的生物安全政策专家、Science Policy Consulting 首席顾问 Sarah Carter 表示,“通过将设计与模型开发者关联起来,这些水印能够让开发者在安全方面发挥引领作用,并帮助合成服务提供商简化对使用过这些模型的客户进行的筛查。”
这一层对于 DNA 合成筛查尤其重要,因为 DNA 合成筛查处于生物安全的前沿。将数字化蛋白质设计转化为实体分子,需要向 DNA 合成服务提供商下单,而这些提供商会将请求与已知威胁数据库进行比对筛查。例如,在过去,一条陌生序列可能会被安全地假定为尚未被发现的自然生物。但由于 AI 能够创造出与已知危险几乎没有相似之处的全新序列,筛查人员已无法再作出这一假设。要验证一份陌生订单并非经过工程改造的威胁,往往需要耗时的人工全面审查,这可能会拖延重要研究。在这种情况下,SynthID Bio 可以提供自动化验证信号,证明订单源自一个内置安全保障措施的可信模型。
“AI 正在拓展科学家能够设计的范围,而 DNA 合成公司在帮助这种创新以负责任的方式扩大规模方面发挥着重要作用。”曾为该论文提供早期反馈的 Twist Bioscience 政策与生物安全副总裁 James Diggans 表示,“对 Twist 而言,水印技术为生物安全工具箱提供了一项前景可观的新补充:它可以强化筛查,将资源集中于值得进一步仔细审查的序列,并随着 AI 设计的生物学不断发展,让生物安全工作更加高效。”
同样,SynthID Bio 还可以帮助维护 Protein Data Bank、UniProt 和 GenBank 等数据库的完整性。这些数据库中有许多向公众开放提交内容,在推动科学进步方面发挥着至关重要的作用;但标注错误的条目可能会对生物安全决策产生远超其本身规模的负面影响,而随着 AI 生成的生物数据不断增加,这一挑战可能只会进一步加剧。作为提交流程的一部分,SynthID Bio 可以帮助确保合成条目得到正确标注,或被标记出来以供进一步审查。
展望未来
尽管没有任何单一的生物安全干预措施能够成为包治百病的“银弹”,SynthID Bio 将我们久经验证的水印工具 SynthID 带入了合成生物学领域。这是朝着可靠识别和追踪 AI 生成的生物序列与结构迈出的重要第一步。
未来的关键挑战包括让水印更能抵御蓄意篡改。SynthID Bio还可以与来源元数据方法结合使用——类似于数字媒体领域的C2PA——或与AI生成生物数据的中央存储库结合,以便更好地识别和追踪AI生成的蛋白质。
为了跟上前沿AI技术日益增强的能力,我们也在研究如何将水印应用于更复杂的生物对象。在与斯坦福大学及Arc Institute的Hie实验室开展的持续合作中,我们将SynthID Bio集成到了先进的基因组模型Evo 2中,为由Evo 2设计的噬菌体基因组添加水印。细菌培养物中的早期实验室测试已证实,这些带水印的噬菌体具有功能。我们相信,这项工作有望应对与基因组设计相关的一些生物安全风险,并将在不久后发布的技术论文中分享更多细节。
要充分实现这项工作的生物安全效益,还需要社区合作与进一步研究。作为我们致力于负责任创新的一部分,我们正在发布方法论文,并将代码和体外数据开源,同时向研究界发布模型权重,以便大家在这项工作的基础上继续推进。通过与生物安全、基因合成和政策领域的合作伙伴开展开放合作,我们可以确保安全性与责任跟上AI驱动的发现步伐。
如希望就这一重要议题与我们展开合作,请将高层次的合作提案发送至synthidbio@google.com。请勿披露任何机密或专有信息。
致谢
该项目由Pushmeet Kohli发起。研究与技术开发由Alexander I. Cowen-Rivers和David Stutz牵头,Pushmeet Kohli提供指导。Guillermo Ortiz-Jimenez、Jeremy Ratcliff、Vinicius Zambaldi、Lindsay Willmore、Josh Abramson、Harshnira Patani、Christina Kouridi、Florian Stimberg、Mel Vecerik、Alex Chu、Sukhdeep Singh、Sumanth Dathathri、Eliseo Papa、Valentin De Bortoli、Arnaud Doucet、Jue Wang和Sven Gowal作出了重要的工程与研究贡献。感谢Adaptyv Bio对体外验证提供帮助。
将这项工作扩展到为噬菌体DNA添加水印,是Google DeepMind与斯坦福大学及Arc Institute的Hie实验室开展的一项合作。Google DeepMind方面的主要贡献者包括Jeremy Ratcliff、Aleks Petrov、Alexander I. Cowen-Rivers、David Stutz、Elisa L. H. Wong、Victor Martin Palacios、Francesca Pietra、Alfred Piccioni、Tristan Oliver Kwan、Tor Lattimore、Sumanth Dathathri和Pushmeet Kohli;Arc Institute和斯坦福大学方面的主要贡献者包括Brian Hie、Samuel King和Aditi Merchant。
此外,我们还要感谢 Rudy Bunel、Anna Cupani、Rob Fergus、Thomas Frerix、Sahra Ghalebikesabi、John Jumper、Jacob Kelly、David La、Victor Martin、Sebastian Nowozin、Stig Petersen、Aleks Petrov、Uchechi Okereke、Sylvestre-Alvise Rebuffi、Rosalia Schneider、Armin Senoner、Richard Shuai、Ashok Thillaisundaram、Elisa L. H. Wong、Zachary Wu 和 Augustin Žídek,感谢他们对这篇研究论文所作的贡献;同时感谢 Julien Bergeron 对 3D 渲染工作的贡献。最后,我们感谢 Demis Hassabis 对这一项目的鼓励与支持。
来源与参考
收录于 2026-10-01