谷歌DeepMind给AI设计的蛋白质嵌入隐形水印
谷歌DeepMind 9月30日推出SynthID Bio,把数字水印技术第一次带进合成生物学:水印直接嵌进AI设计的蛋白质序列与预测的3D结构里,不仅能在线上模型中验证,还能在合成出来的实体蛋白质上检测到,同时不损害蛋白质的生物学功能。

给蛋白质打水印远比给图片难——蛋白质只有20种氨基酸可用,许多位点被功能锁死,一条500氨基酸的蛋白质已算大分子,留给藏信号的空间非常有限。SynthID Bio的做法是接入常用的序列设计工具ProteinMPNN:每确定一个氨基酸位置,系统就用一把类似密码学密钥的信号给出候选氨基酸,只有在不影响蛋白质功能的前提下才会采纳。
效果经过了湿实验检验。在针对VEGF-A、新冠病毒刺突蛋白RBD和PD-L1三种靶蛋白的测试中,带水印的蛋白质结合剂在命中率、结合亲和力(KD值)和自然序列多样性上都与未加水印版本持平,成为首批「带水印且具备生物学功能」的蛋白质结合剂。对蛋白质折叠,团队微调了AlphaFold 3扩散网络的一小部分,把水印能力直接构建进模型权重——无论谁运行模型,预测出的3D坐标都自带可检测特征。
更进一步,DeepMind与斯坦福大学Hie实验室、Arc研究所合作,把水印集成进基因组模型Evo 2,为一种噬菌体设计了带水印的基因组,早期细菌培养实验证实其具备功能,相关技术论文将陆续发布。
用意直指生物安全。DNA合成服务商需要在订单中筛查已知威胁序列,但AI能生成与已知危害几乎不相似的全新序列,筛查人员无法再沿用「陌生序列大概是未发现的天然生物」的旧假设。水印提供了一种自动验证信号,可证明订单出自带有安全机制的受信模型;它还能用于维护蛋白质数据库(PDB、UniProt、GenBank)的完整性,防止错误标注的合成条目误导后续研究。Twist Bioscience生物安全副总裁迪根斯评价称,水印有望强化筛查,让审核资源集中到真正需要细查的序列上。
团队同时坦承局限:水印的抗篡改能力、密钥分发机制、过短蛋白质的可检测性都待加强,也挡不住有人用未加水印的片段稀释信号。DeepMind已公开方法、数据并开放模型权重,希望与基因合成、政策界伙伴一起把「可验证来源」变成AI设计生物的标准配置。
编译自 Google DeepMind博客,原标题:"SynthID Bio: Watermarking methods for synthetic biology"