2026年8月19日,Anthropic发布了一份不寻常的研究报告。不寻常之处不在于又一项AI能力声明,而在于它有实验室数据支撑:Claude模型针对15个蛋白质靶点,自主完成了从选靶、生成结构、计算筛选到提交设计的全流程,最终1,320条设计中354条在真实湿实验室中确认结合,命中14个靶点,整体命中率26.8%——而行业典型水平是10%至15%。这一数字来自合作方Adaptyv Bio的独立测量,而非Anthropic内部自评。
两倍命中率背后:不是运气,是系统性优势
理解这组数字,需要先了解蛋白质从头设计(de novo design)的难度。设计一种全新的结合剂,传统上意味着蛋白质工程师用数月时间完成计算优化与序列筛选。即便有专用机器学习工具辅助,整个流程也通常需要计算专家花费数天乃至数周编排任务。
Claude在这次实验中承担的不是某个环节的加速,而是完整的任务链:自主决定在每个靶点上的设计位点,生成候选蛋白质序列,调用外部专业模型评估结合可行性,再筛选提交。Anthropic在官方博客中写道,整个过程"仅需极少的人工干预"。
结果存在明显的靶点差异,这本身也是有价值的信息。据Adaptyv Bio发布的案例数据,在TREM2靶点上,Claude的命中率达到80%,而此前Adaptyv Bio竞赛中人类参赛者的成绩是38.3%;在RBX1靶点上,单靶点模式下命中率40%,竞赛参赛者的历史成绩是3.7%。在15-PGDH靶点上,Claude设计的最强结合剂亲和力从1.7微摩尔提升至33.4纳摩尔,提高了约50倍。Adaptyv Bio数据还显示,Claude设计的候选蛋白表达成功率达95%,说明序列本身在细胞体系中具有良好的可合成性。
但也有一个明确的失败案例:麦芽糖结合蛋白(MBP)靶点,90条设计全部未能确认结合。Anthropic没有回避这一点。失败案例的存在让整个报告更可信:它说明这不是经过筛选才公开的数据集,而是完整的实验记录。
另一项被低估的结果:化学分析的时间压缩
同一篇博客中,Anthropic还公布了第二项实验,关注度相对较低,但在药物研发效率层面可能更有直接价值。
核磁共振(NMR)和液相色谱-质谱(LC-MS)数据分析,是药物合成后必须完成的质量控制步骤——用于判断化合物的身份和纯度。这项工作传统上需要化学家逐步手动处理,耗时数小时,且通常依赖仪器厂商的专有软件才能读取原始文件。
Anthropic向Claude Opus 5提供了合同实验室的原始文件和两句话的指令,没有提供任何厂商软件。据官方博客披露,Opus 5分别在23分钟和19分钟内返回NMR和LC-MS的完整分析结果,并行处理,总报告约25分钟内完成。精度方面:实验室测定纯度96.33%,Opus 5报告96.4%,误差在0.1个百分点以内;氢原子计数每峰偏差在0.08个¹H以内。
这个案例意味着什么?一个通用语言模型,在没有专用工具的情况下,完成了本属于专业化学软件+人工判读的任务,精度达到实验室水准。这不是未来的预期,而是已经发生的事实。
能力被主动限制:一场公开的权衡声明
实验结果公布的同时,Anthropic做了一件在商业AI公司中并不常见的事:主动声明限制。博客中明确写道,蛋白质设计等双重用途生物研究能力,目前对Claude Fable 5的普通用户不开放,最强模型的生物研究权限正在受控。
这一声明的时间节点颇为微妙。就在报告发布两天后,即2026年8月21日,RAND研究院发布警告:AI正将生物武器的开发门槛大幅降低,可能催生"规模是COVID十倍"的生物威胁。该报告指出,大型语言模型回答生物武器释放相关问题的准确率,已从2024年的15%提升至80%;生物AI预测蛋白质与小分子相互作用的能力,从42%提升至90%。
这两件事放在一起,勾勒出一个清晰的结构性矛盾:AI蛋白质设计能力的商业价值与军民两用风险,正在以同等速度上升,而行业尚无公认的访问控制标准。
Anthropic的回应方式是:公布能力、限制访问、预告"受信任访问计划"。这种处理思路的逻辑是,通过公开验证数据建立科学可信度,同时用访问管控为合规留出空间。但"受信任访问计划"的具体标准、审核机制和监督主体,目前尚未披露。
与人类专家对比的正确读法
外界讨论这项研究时,最常被引用的框架是"AI战胜人类专家"。这个叙事在数字上成立,但机制层面需要更精确的描述。
Adaptyv Bio用于对比的竞赛数据,是不同时间点、不同参与者提交的结果,并非同步设计竞赛。Claude对部分竞赛靶点有访问权限,但被明确要求不能以已有结合剂为起点——这是一项设计约束,用于评估从头设计能力,而非直接的同场比拼。在这个前提下,Claude在6个有对比数据的竞赛靶点中,5个取得了更高亲和力。
更值得关注的不是超越人类的数字本身,而是超越的机制:Claude的优势体现在"以更高密度探索设计空间"——在相同时间内生成并筛选更多候选,而不是每条设计的质量超越人类工程师的直觉判断。这意味着它的边界也很明确:当某个靶点本身在结合动力学上存在根本性难点(如MBP),数量优势无法转化为命中结果。
药物研发真正的瓶颈在哪里
Anthropic在博客中有一句话值得单独拎出来:药物研发中的许多瓶颈"与核心科学能力的提升无关,而更多来自政策和运营层面的限制"。
蛋白质小结合剂(minibinder)不是标准治疗模式,高亲和力结合剂只是药物开发的第一步,后续还有药代动力学优化、毒理测试、临床前验证、监管审批等一系列环节,每个环节都有其独立的时间成本和不确定性。AI加速的是"从想法到候选分子"这段距离,而非"从候选分子到上市药物"的全程。
但即便只加速这一段,意义也相当具体:过去一个项目需要蛋白质工程师耗费数月完成的计算设计阶段,现在可以在一次48小时的自主任务运行中完成,且外部实验室验证命中率超过行业平均两倍。这将药物早期发现的试错成本大幅压低。
独立判断
这项实验的价值,在于它是AI在生命科学领域第一次通过了不由AI自己评判的验证——湿实验室的结合亲和力测量,不存在模型自我评分的空间。354条蛋白质确实结合了,或者没有。这种硬验证的稀缺性,正是它比绝大多数AI能力声明更值得重视的原因。
与此同时,Anthropic同步限制最强模型访问权限,并在公告中主动提及双重用途风险,这是一种主动暴露而非掩盖矛盾的姿态。在AI行业惯于强调能力、回避风险的叙事环境中,这一姿态本身具有参考意义——尽管"受信任访问计划"的具体细节仍需进一步落实才能评价其实质效果。
最终,这项研究划定了一条新的能力基线:通用推理模型,在专业生物工具链的协助下,可以完成此前需要专业团队数月才能完成的计算蛋白质设计任务,且结果经得起第三方实验室检验。这个基线一旦确立,就无法被撤回。接下来的问题,是谁能访问这个能力、在什么条件下访问,以及谁来制定这些条件。
Sources: - [Case study: Benchmarking Claude's protein designs in the wet lab | Adaptyv Bio](https://www.adaptyvbio.com/blog/anthropic-1) - [Claude Runs Autonomous Protein Design Campaign: Wet Lab Confirms Twice Industry Hit Rate | TechTimes](https://www.techtimes.com/articles/325081/20260820/claude-runs-autonomous-protein-design-campaign-wet-lab-confirms-twice-industry-hit-rate.htm) - [How Claude is accelerating protein design and analytical chemistry | Anthropic](https://www.anthropic.com/research/Claude-accelerates-protein-design) - [Anthropic Says Claude Designed Protein Binders For 14 Of 15 Targets | Dataconomy](https://dataconomy.com/2026/08/20/claude-ai-protein-binders-14-of-15-targets/) - [AI could supercharge biological weapons 'ten times' scale of COVID, report warns | BizPacReview](https://www.bizpacreview.com/2026/08/21/ai-could-supercharge-biological-weapons-ten-times-scale-of-covid-report-warns-1655787/) - [Autonomous de novo protein binder design with Claude (Claude Science 1 paper)](https://www-cdn.anthropic.com/30bf50e22a01388bb29bf077ee3f244531594b7a.pdf)© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接