Anthropic优化Fable 5生物安全防护,大幅减少误拦截
Anthropic更新了Claude Fable 5的生物安全分类器,将生物相关回退减少约85%,在保持高风险防护的同时,让更多合法生物与医学查询获得模型支持。
改进 Fable 5 的生物安全防护我们正在更新 Claude Fable 5 的生物安全防护措施,以大幅减少误报(false positives)。Fable 5 用户现在将经历更少的“回退”(fallbacks)——即系统在用户提出生物相关查询后切换到能力较弱的模型。
在我们的测试中,此次更新将我们各产品界面中与生物相关的回退减少了约 85%。1因此,Fable 5 将能够协助处理更广泛的生物学任务。实际上,用户在日常健康和教育问题上应看到更少的回退——例如解读化验结果、理解症状,以及在教育场景中学习生物学。
医疗保健专业人员将在临床任务上获得 Fable 5 更多的支持。我们相信,人工智能对世界产生积极影响的最大机会在于生物学和医学领域,我们正在大力投资,以负责任的方式为生物学家提供前沿模型的访问权限。
目前,对于我们认为具有双重用途(dual-use)的请求——包括病毒学、毒理学和分子设计——Fable 仍会回退到 Opus 5,因此它尚不能用于专业的生物学研究和药物开发。
我们致力于通过可信访问途径(trusted access pathways)来缩小这一差距,为前沿生物学能力提供安全通道。我们为何建立强大的生物安全防护我们的目标是尽快将 Fable 5 的前沿能力交到尽可能多的用户手中。
然而,要做到这一点,我们需要管理如此强大的模型所带来的日益增加的风险。其中一个风险出现在生物学领域:Fable 5 现在可以在一些高度复杂的生物任务上超越专家,并为其他任务提供操作支持。
这意味着它可以为开发新疗法的研究人员提供真正的帮助(这也是我们如此热衷于通过改进分类器和可信访问计划来扩大模型访问权限的原因)。但如果落入不当之手,这些能力可能被恶意行为者利用,例如用于开发生物武器。
我们的能力评估显示,Fable 5 可以为这类行为者提供显著的提升——也就是说,它能提供他们在其他地方无法获得的能力。在生物学中,区分 AI 的有益和有害用途往往很困难。例如,在某些情况下,研究某种疾病的治疗方法需要科学家首先制造出导致该疾病的危险化合物。
这在活疫苗中最为明显,因为科学家需要培养他们旨在预防的同一病原体。某些药物也是如此。为了开发治疗高血压的药物卡托普利(captopril),科学家们分离了蛇毒中能导致人类血压骤降的有毒成分。
随着人工智能前沿不断涌现新的生物学能力,我们需要保持谨慎,确保这些能力带来的新风险不会先于其潜在的科学益处而显现。那些希望利用我们的模型作恶的复杂行为者知道如何利用这种模糊性来掩盖其意图,使危险的任务看起来像普通的研究活动。
美国情报界《2026 年度威胁评估》明确指出,此类行为者确实存在,且包括合成生物学和基因组编辑在内的生物技术进展“可能导致新型生物威胁”。报告指出,一些国家行为者可能维持着活跃的进攻性生物和化学武器计划——这些计划可能因获得前沿 AI 模型的原始能力而加速。
出于对“双重用途”能力(即可能用于有益或有害目的,且两者界限不易划清的能力)的担忧,我们特意在发布 Fable 5 时屏蔽了几乎所有生物学查询。这使我们能够向其他领域的用户提供该模型。
我们知道这会让合法的生物学用户感到沮丧:短期内会出现大量误报,提出生物学相关问题的用户的请求会被阻止并转交给能力较弱的模型。
尽管如此,我们选择做出这一权衡,是因为 Fable 在生物学等双重用途领域被滥用的代价可能是灾难性的。
我们的生物安全防护如何运作我们防止生物学滥用的核心方法之一是使用安全分类器(safety classifiers):较小的自动化 AI 系统,用于检测 Fable 5 何时被要求执行受保护的生物学任务或产生有害输出(我们此前曾撰文介绍过网络安全领域的类似分类器)。
对于 Fable 5,当分类器触发时,模型会将用户的请求重新路由到 Opus 5——这是一个能力较强的模型,但其生物学能力不如 Fable 5,无法为恶意用户提供同等程度的帮助。这就是用户请求被阻止时看到的回退。
开发精确、稳健的分类器并非易事。要让分类器快速且一致地工作,它必须学会区分我们认为“范围内”和“范围外”的主题和查询。调整分类器需要时间和迭代,既要避免误报(分类器对范围外内容触发),也要避免漏报(错过范围内内容)。
我们还要求分类器能够抵御绕过尝试(即越狱,jailbreaks),这需要进一步的研究和测试。
从非常宽泛的生物分类器开始,意味着我们可以在继续研究改进它的同时,让用户访问 Fable 5。另一种选择——在安全防护取得更大进展之前暂缓发布模型——会将模型的普遍访问及其对用户的潜在益处推迟数周或数月。
在过去几周里,我们仔细重写了分类器的“章程”(constitution,由一系列规则组成,帮助模型区分受保护内容和允许内容),并详细列出了良性用途。我们征求了来自 Anthropic 内外多位专家的反馈。
随后,我们基于该章程为分类器开发了更新的训练数据,并对其进行了重新训练,验证了新分类器仍能对有害和双重用途的研究性生物学内容触发,但能允许更广泛的良性和有益用途。如下图所示,这些更新意味着,与 Fable 5 发布时相比,分类器对良性生物学相关请求的触发次数将大幅减少。
结论要完善我们的安全防护,还有更多工作要做。误报将不可避免地存在——即请求属于分类器的安全裕度之内,风险极低,但分类器仍会触发。
如上所述,由于潜在的双重用途风险,Fable 将继续阻止双重用途的专业生物学和药物开发查询。我们完全致力于通过可信访问途径,为研究人员开发一条安全、可扩展的路径,以使用我们最强大的模型。我们希望您继续与我们分享反馈,以便我们进一步改进安全防护。
脚注1 因此,我们预计回退总数(无论是生物学相关还是其他原因)也将减少:在 Claude.ai 上减少约 67%,在 Cowork 上减少 55%,在 Claude Code 上减少 17%,在 Claude Platform 上减少 7%。
相关内容Mariano-Florentino (Tino) Cuéllar 将加入 Anthropic 担任首席全球事务官Mariano-Florentino (Tino) Cuéllar 将加入 Anthropic,担任其首任首席全球事务官。
阅读更多