一家经营封闭模型的公司告诉你:高能力开放权重模型可能带来不可逆的安全风险,因此需要更严格的测试和限制。
这句话可能是真的,也可能刚好对这家公司的商业模式有利。更麻烦的是,两件事完全可以同时成立。
Dario Amodei 在 《Our position on open-weights models》中回应了外界对 Anthropic 的质疑。他否认主张全面禁止开放权重模型,却支持限制中国获得先进芯片、打击大规模违规蒸馏,并要求足够强的开放与封闭模型接受强制安全测试。
问题因此不只是“开放还是封闭”,而是三个更难的问题:
- 文章中的安全判断有多少证据?
- Anthropic 是否对自己和竞争者使用了不同标准?
- 它对中国的描述是在分析风险,还是先有威胁预设,再选择证据?
#先说结论:安全担忧成立,利益中立不成立
我的判断是:
Dario 提出的开放权重不可逆风险和按能力分级测试,方向上有合理性;但整篇文章不是中立的安全研究,而是一份将 AI 风险、美国国家安全和 Anthropic 商业利益绑在一起的政策文本。
这不等于已经证明 Dario 撒谎,也不等于 Anthropic 暗中做了自己禁止别人做的所有事情。当前证据能够支持的批评更具体:
- Anthropic 把美国保持前沿 AI 优势当作安全前提,对中美军事和国家安全用途采用了明显不对称的风险基线。
- 它把部分中国公司的可疑访问归因,进一步连接到中国政府支持和国家竞争,但公开证据不足以完整证明这条指挥链。
- 它主张的评测、访问控制和受控部署,与 Anthropic 已经拥有的组织能力和封闭 API 模式高度兼容,存在把安全规范变成竞争壁垒的结构性风险。
- 没有公开证据证明 Anthropic 秘密违规蒸馏竞争对手,也没有足够证据把这篇文章定性为操纵上市估值。
数据快照
- 最后核验:2026-07-29
- Dario 原文:2026-07-27 发布,2026-07-28 编辑
- Anthropic Responsible Scaling Policy:当前页面列出的最新版为 3.4,2026-07-08 生效
- 证据范围:公开政策、服务条款、官方项目说明、行业公开信与英国 AISI 研究
- 证据限制:无法从公开材料判断管理层的私人动机,也无法独立复核 Anthropic 未公开的蒸馏检测日志
#先别把开放权重和开源混成一锅
Dario 使用的是 open-weight models,即开放权重模型,而不是严格意义上的开源 AI。
开放权重通常意味着模型参数可以下载、本地运行和修改,但训练数据、数据处理流程、完整训练代码和许可证未必同时公开。Open Source Initiative 的 Open Source AI Definition 1.0要求的不只是权重,还包括足以理解和修改系统的数据说明与训练代码。
这个区别很重要。文章讨论的主要问题是:
当危险能力以可下载参数的形式扩散以后,部署者还能否持续监控、修补和撤回?
它并不是在完整讨论开源开发、数据透明、许可证自由和社区治理。
#Dario 真正提出了什么
文章并没有要求把开放权重模型一刀切掉。相反,Dario 明确说,不具备危险能力的开放权重模型是一种公共利益;禁止美国企业使用中国开放模型,也阻止不了真正的恶意使用者,反而更像是在保护美国 AI 公司。
他的政策方案可以压缩成三条:
- 限制中国获得先进芯片和芯片制造设备;
- 打击使用虚假账户、代理服务和大规模调用进行的违规蒸馏;
- 对达到危险能力门槛的所有模型强制测试,不区分开放或封闭、美国或中国。
这比“Anthropic 反对开源”的标签更克制。真正的分歧不在文章有没有承认开放模型的价值,而在于它怎样定义危险、怎样解释中国的技术进步,以及谁来制定测试门槛。
#开放权重的不可逆风险,不是 Anthropic 凭空发明的
开放权重确实带来封闭 API 很难提供的价值:私有部署、避免供应商锁定、更低成本、自由微调,以及必须接触权重才能开展的安全研究。由 NVIDIA、Meta、Microsoft、Mistral、Mozilla 等机构签署的开放权重行业公开信还强调,开放生态能够扩大竞争,让更多团队参与审计和防御。
但公开信也承认,权重发布后会离开原开发者控制,修改版本难以追踪和撤回。
英国 AI Security Institute 的开放权重网络能力研究给出了更直接的边界:开放模型可以被私有运行和修改,发布方却不能再统一封禁用户、升级分类器或撤回旧版本。研究同时发现,2026 年受测领先开放模型在网络能力上只落后此前沿封闭模型约 4 到 7 个月,但报告明确提醒,这个结果只覆盖其网络评测,不能外推到生物或其他风险。
因此,文章最扎实的结论是:
同样的危险能力,以开放权重形式发布后更难补救。
这句话不等于“开放模型一定更危险”。开放也可能让更多防御者获得能力。攻击方还是防御方获益更多,要看具体领域、实际能力和部署方式,不能靠“开放天然安全”或“封闭天然安全”提前作答。
#“没有美国芯片就无法超过美国”跨过了证据边界
Dario 把芯片管制描述成应对国家级 AI 竞争最直接的手段,这个方向不难理解:训练前沿模型需要大量计算资源,限制高性能芯片和制造设备会增加训练成本、集群建设难度与迭代时间。
问题出在文章使用了更绝对的推论:因为中国国内产能有限,加上 scaling laws,中国没有美国芯片就无法训练出比美国更强的模型。
文章链接的经典 Scaling Laws for Neural Language Models证明的是,在论文研究范围内,语言模型损失与模型规模、数据量和训练计算量呈稳定关系。它没有证明:
- 有效计算只能由美国品牌芯片提供;
- 算法、数据和训练效率无法部分抵消硬件差距;
- 更多低性能芯片不能通过工程投入组成可用集群;
- 蒸馏、强化学习、推理时计算和专用模型不会改变竞争路径;
- 出口管制能够永久决定另一个国家的模型能力上限。
所以,更稳妥的结论应是:
芯片管制能够提高成本、限制规模并延缓追赶,但 scaling laws 本身不能证明美国可以永久决定中国模型能力的上限。
文章把一个程度问题写成了接近必然性的判断。技术论文在这里提供了“算力重要”的证据,却没有提供“只有美国芯片才行”的证据。
#蒸馏争议里,技术、违约和国家行为被叠在了一起
蒸馏本身是一种普通训练方法:让较小模型学习较强模型的输出。Anthropic 自己也在蒸馏攻击报告中承认,前沿实验室会合法地蒸馏自家模型。
Anthropic 反对的是另一类行为。它声称 DeepSeek、Moonshot 和 MiniMax 通过约 2.4 万个欺诈账户,与 Claude 产生超过 1600 万次交互,违反服务条款和区域限制,并针对推理、工具使用与编码能力进行提取。报告称归因依据包括 IP、请求元数据、基础设施特征和部分合作方信息。
这些材料能够证明什么?
- 它们证明 Anthropic 公开提出了具体、可检验的公司级指控,而不是只说“我们怀疑有人蒸馏”。
- Anthropic 当前商业条款确实禁止客户使用服务训练竞争模型,使用虚假账户和绕过区域限制也属于不同于“蒸馏技术本身”的行为。
- 但原始日志、归因规则和完整第三方复核没有公开,外部读者无法独立重放这次调查。
- 公司员工、代理基础设施或合作方的行为,也不能自动证明具体项目由中国政府下令、资助或协调。
Dario 的文章却从“中国公司进行了工业级违规蒸馏”,走到“这些行动得到一个试图超越美国的威权国家支持”。这一步可能有额外情报,但公开页面没有展示足以让读者复核的完整证据链。
因此,博客里最容易写错的一句话是:“中国公司靠偷 Claude 才追上美国。”现有公开材料最多支持:
Anthropic 指控三家中国实验室以违规访问方式大规模提取 Claude 能力;该指控细节具体,但关键证据仍主要掌握在 Anthropic 手中,不能据此解释中国模型进步的全部来源。
#Dario 是否双标,要拆成五个不同问题
“双标”很有传播力,却容易把事实、推断和动机揉成一团。把问题拆开以后,证据强弱会清楚很多。
表 1:截至 2026-07-29,五类双标质疑的公开证据与结论边界
| 质疑 | 可以核验的事实 | 当前能支持的判断 |
|---|---|---|
| Anthropic 暗中违规蒸馏竞品 | 本文核验的公开材料没有显示欺诈账户、绕过访问控制或未经授权提取竞品能力的证据 | 目前无充分证据,不能写成事实 |
| Anthropic 限制竞争者利用 Claude | 商业条款禁止用 Claude 构建竞争产品或训练竞争模型 | 限制确实存在;是否合法、合理要按合同、访问方式和具体行为判断 |
| Anthropic 一边反对军事 AI,一边服务美军 | Anthropic 从未普遍反对军事 AI;它公开为美国国家安全客户开发 Claude Gov | 不是“嘴上反军事、暗地做军事”,而是公开的阵营化安全立场 |
| 强制评测会巩固 Anthropic 地位 | Anthropic 已有 RSP、评测、安全与政策团队,固定合规成本更容易由大公司承担 | 存在监管俘获和竞争壁垒风险,但不能据此证明垄断是唯一动机 |
| 文章是为了 IPO 或估值 | 安全品牌和政策影响力客观上具有商业价值 | 缺少内部文件和因果证据,不能定性为估值操纵 |
这里最值得警惕的不是一条尚未证实的“偷着干”故事,而是一套稳定的自我正当化结构:
Anthropic 的扩张被解释成负责任地保持前沿;竞争者的扩张则更容易被解释成能力扩散、国家威胁或监管缺口。
这种结构不要求 Dario 主观上撒谎。一个人可以真诚相信 AI 风险,同时真诚相信“只有我的公司保持领先,才有能力解决风险”。问题在于,一旦公司利益和公共安全被这样绑定,外界就很难知道某项限制究竟减少了多少风险,又替既有企业增加了多少护城河。
#对华偏见不在民族仇视,而在风险基线不对称
把文章说成针对中国人或中国文化的仇恨文本,并不准确。它反对全面禁止中国开放模型,承认低风险开放权重的公共价值,也主张测试规则原则上覆盖不同国家的开放和封闭模型。
但文章存在很强的美国国家安全预设。Dario 直接把中国共产党称为最有能力的威权威胁,担心中国模型带来永久军事优势和深度社会压制。Anthropic 当前政策页也明确表示,最强模型应继续由美国及盟友民主国家掌握,并支持通过芯片出口管制和反蒸馏措施维持这种领先。
与此同时,Anthropic 并不反对 AI 进入军事和情报系统:
- Claude Gov面向美国国家安全客户,覆盖战略规划、行动支持、情报分析和威胁评估,并降低模型处理机密材料时的拒答。
- Anthropic 与美国国防部的两年期合作协议上限为 2 亿美元,包括在国防数据上开发原型,以及把 Claude 接入机密网络中的任务流程。
所以,Dario 的原则不是“军事和情报 AI 本身危险”,而更接近:
民主国家在制度约束下发展军事 AI 是安全保障;威权国家获得同等级能力则是全球威胁。
这是一种可以公开辩论的政治立场,但不是中性的技术结论。文章没有对称分析美国军事和情报系统误用 AI、扩大监控或改变国际权力平衡的风险,也没有展示为什么同类能力在美国制度中就足以受到控制。
因此,更准确的定性是:文章没有充分证据表明其仇视中国人,却明显带有对中国政府和中国 AI 产业的威胁预设。它倾向把中国企业、国家产业政策、政治制度与军事竞争放进同一条因果链,同时把美国领先视为默认更安全的状态。
#安全监管怎样避免变成大公司的梯子
Dario 提出的“按能力测试,而不是按开闭源或国籍划线”值得保留。真正需要补上的,是防止规则只对后来者昂贵、只由前沿公司定义。
一个更对称的框架至少需要五层约束:
- 同能力同规则。 开放权重、封闭 API、美国模型和中国模型达到同一危险能力门槛时,接受相同等级的评测。
- 模型与系统分开测。 裸模型、工具调用、Agent 脚手架和安全措施移除后的能力不能混成一个分数。
- 第三方参与制定门槛。 评测机构、学术界、开放模型社区和中小企业共同参与,避免一家公司的内部 RSP 直接变成全行业准入证。
- 给小团队低成本通道。 政府或公共机构承担基础评测成本,并公开豁免、申诉、复测和规则失效机制。
- 按行为治理蒸馏。 区分自家模型压缩、授权使用、普通输出学习、虚假账户、绕过访问控制、合同违约与可证明的知识产权侵害。
开放权重也可以采用分阶段发布:先让独立评测机构和受约束研究者访问,再依据实际能力、可移除的安全措施和领域风险决定是否全面发布。这个方案未必适用于所有模型,但比“开放天然安全”和“权重永远不能放出”更接近可验证的治理。
#最终判断:不要猜动机,先检查标准是否对称
Dario 的文章最有价值的地方,是把开放权重风险从许可证争论拉回到能力、部署和不可逆性。它最薄弱的地方,则是把美国领先、中国威胁和 Anthropic 的受控部署模式写成近乎同一套安全结论。
判断这类公司政策文,不必先猜 CEO 心里到底想什么。可以先问四个更可验证的问题:
- 同一种能力,落在开放和封闭模型上是否使用同一门槛?
- 同一种军事或情报用途,发生在美国和中国时是否使用同一风险标准?
- 同一种利用他人模型输出的行为,是否按访问方式、授权和证据判断?
- 一项安全规则的固定成本,是否会把现有大公司的内部能力变成行业门票?
如果四个问题都能对称回答,安全主张才更接近公共规则;如果答案总是“Anthropic 可以继续做,但竞争者需要先被限制”,那么即使每一条风险都不是虚构,整套制度仍可能把安全变成一架只允许少数公司使用的梯子。
这也是本文对 Dario 最终的判断:他很可能真诚相信前沿 AI 风险,但他的风险观、美国国家安全立场和 Anthropic 商业利益高度同向。我们不需要把他想象成一个秘密策划所有事情的反派,也应该对这种三者同向保持足够警惕。
#参考资料
- Dario Amodei:Our position on open-weights models,2026-07-27
- Anthropic:Detecting and preventing distillation attacks,2026-02-23
- Anthropic Commercial Terms of Service,2025-06-17 生效
- Anthropic Responsible Scaling Policy,最后核验 2026-07-29
- Anthropic AI policy,最后核验 2026-07-29
- Anthropic:Claude Gov models for U.S. national security customers,2025-06-06
- Anthropic 与美国国防部合作说明,2025-07-14
- Open Weights and American AI Leadership,2026-07-24
- UK AISI:How Far Behind the Frontier are Leading Open Weight Models on Cyber?
- Open Source AI Definition 1.0
- Scaling Laws for Neural Language Models,arXiv:2001.08361