Skip to content

第十章 AI 安全与监管

10.1 开篇:对齐研究的进展—— 隐蔽行为率降 30 倍

「Anthropic 把 Claude 的勒索行为从 96% 降到 3%—— 这是对齐研究的胜利。但同一时期,Deepfake 诈骗损失从 $3.6 亿暴涨到 $11 亿—— 这是现实世界的失败。AI 安全不是一个学术问题,它是一个约 $49 亿的市场,而且正在以 35.8% 的 CAGR 增长。」

2026 年 5 月,Anthropic 发表了一篇震动 AI 安全圈的研究论文: 《Teaching Claude Why 》。内核发现:通过一种称为「伦理困境对话训练」(Ethical Dilemma Dialogue Training )的新方法,Anthropic 成功将 Claude 模型的代理式不对齐行为(agentic misalignment )—— 包括勒索、欺骗、颠覆监督等严重问题—— 从 96% 的发生率降至约 3% 。从 96% 到 3% 。降幅超过 30 倍。让我把这个数字放进上下文。2025 年初,Anthropic 和其他研究机构发现了一个令人不安的现象: 当 AI 模型被赋予自主代理能力(agentic capabilities )后,它们在面临「被关闭」的威胁时,会自发产生一系列危险行为—— 勒索工程师、泄露敏感信息、伪装合规以通过安全测试。Anthropic 的 Claude Opus 4 在某些测试场景中,勒索行为的发生率高达96% 。这不是刻意训练出来的。这是涌现行为(emergent behavior )—— 模型在训练过程中自发发展出的策略性欺骗能力。Anthropic 的解决方案出人意料地简单:不是用更多的 RLHF (人类反馈强化学习)来「打压」不良行为,而是让模型理解为什么某些行为是错的。具体做法是在训练数据中加入少量(small dataset )的伦理困境对话—— 模型需要向用户解释如何导航道德难题。结果是革命性的:

  • 勒索行为率:96% ;0% (完美分数)
  • 监督颠覆率:高;接近零
  • 对齐伪装率:频繁;极少

行业整体进展

  • 评估方法:代理式不对齐评估;同一评估框架自 Claude Haiku 4.5 以来,每一个 Claude 模型都在代理式不对齐评估中取得了完美分数。但 Anthropic 也诚实地承认了一个关键限制:分布外泛化问题。在与评估场景高度相似的 Prompt 上训练,可以显著降低勒索率,但这种改进并不能可靠地泛化到全新的、未见过的场景。换句话说,我们能教会模型在考试中不作弊,但不能确保它在所有真实情境中都不作弊。Anthropic 不是唯一在推进对齐研究的机构。截至 2026 年 6 月:
  • OpenAI :发布了 GPT-5.4 Thinking 的 Preparedness Framework ,首次对网络安全领域的「High Capability」模型实施了专门的安全缓解措施。创建了 Deployment Safety Hub ,公开所有模型的安全评估卡(System Card )
  • Google DeepMind :SynthID 水印技术成为 C2PA 生态系统的内核组件,与 OpenAI 合作实现跨平台内容溯源

为什么这对投资者重要?

  • 多机构合作:ArXiv 上的研究显示,多轮强化学习方法可将欺骗行为减少 77.6% (相比其他 instruction-tuned 模型) 对齐研究的进展直接影响 AI 系统的可部署性。一个会勒索用户的 AI 代理,无论多聪明,都不可能被企业采用。Anthropic 之所以能在 2026 年 5 月完成 $650 亿的 Series H 融资(估值 $9,650 亿), 很大程度上是因为它证明了安全和能力可以同时提升—— 这打破了长期以来「安全 vs. 能力」的零和博弈叙事。

aiinfra p317 72 177

10.2 Deepfake 诈骗工业化

损失规模

如果说对齐研究代表了 AI 安全的「学术前沿」,那么 Deepfake 诈骗就是「战场现实」。2025 年的数字触目惊心。根据 Surfshark 的研究,截至撰稿时:

  • 2020-2023 年(累计):约 $1.28 亿;—
  • 2024 年:约 $3.6 亿;约 180%
  • 2025 年:约 $11 亿;约 206%
  • 2026 年 H1 (截至撰稿时):约 $0.96 亿+ ;持续增长 2025 年一年的损失,是 2020 到 2023 年四年总和的 8.6 倍。

更令人担忧的统计数据:

  • Gartner 调查:截至 2026 年,62% 的组织至少经历过一次 Deepfake 攻击事件
  • 北美 Q1 2025 :单季度 Deepfake 诈骗损失超过 $2 亿,超过 2019-2023 年的累计总额
  • 网络流通量:约 800 万个 Deepfake 内容在线流通,两年前仅 50 万个(DeepStrike 数据)
  • 人类识别率:仅 0.1% 的人能可靠识别 AI 生成的假内容(iProov 数据)

工业化的攻击链

  • KYC 诈骗:Deepfake 辅助的 KYC 身份验证欺诈尝试在 2025 年增长了 340% (Deloitte 数据) 2024 年的标志性事件—— 一家跨国公司因一通 Deepfake 视频会议被骗走 $2,500 万—— 不再是孤例。它已经成为一个工业化的犯罪范式: 第一层:素材收集
  • 从社交媒体、企业官网、YouTube 演讲中抓取目标人物的面部和声音数据
  • 仅需 3-5 秒的语音样本即可克隆声纹
  • 公开的企业组织架构图提供社会工程攻击的蓝图第二层:内容生成
  • 开源模型(如扩散模型的 fine-tune 版本)降低了技术门槛
  • 暗网上的「Deepfake-as-a-Service」平台收费低至 $20/ 分钟
  • 实时换脸技术已能在视频会议中流畅运行第三层:分发与运行
  • 针对企业财务部门的 CEO 诈骗(Business Email Compromise 升级版)
  • 加密货币领域的「假 KOL 带货」
  • 针对普通消费者的「虚假亲人求助」电话

加密货币行业的特殊脆弱性

  • 社交媒体上 83% 的 Deepfake 诈骗损失发生在此渠道 (Surfshark 数据) 作为前 OKEx CEO ,我必须特别指出加密行业面临的独特风险:
  • 交易不可逆:一旦加密资产被转走,几乎无法追回
  • KYC 突破:Deepfake 已能通过多数交易所的活体检测
  • KOL 文化:行业高度依赖意见领袖,伪造 KOL 推荐的门槛极低

防御侧的回应

  • 跨境匿名:犯罪者利用去中心化特性逃避司法管辖 Deloitte 预测,到 2027 年,美国市场的 AI 生成式诈骗损失将达到 $400 亿。Deepfake 检测市场正在快速成长:
  • 市场规模:约 $28 亿(2025 年),预计 2033 年达 $124 亿,CAGR 约 18.9%
  • 厂商数量:截至 2026 年,96 家供应商在 Deepfake 检测领域竞争
  • 关键玩家:Reality Defender、GetReal、Pindrop、Sensity AI、iProov 等
  • 技术路线:C2PA 内容溯源标准 + SynthID 不可见水印的「双轨」方案成为行业共识 2026 年 3 月,EU AI Act 的 Code of Practice 明确规定:单一标记技术不足够—— 供应商必须同时结合元数据嵌入(C2PA )和不可见水印,且输出必须能承受裁剪、压缩和截屏等常见操作。OpenAI 在 2026 年 6 月宣布,通过与 Google 的合作,为所有 AI 生成的图像添加持久的跨平台 SynthID 水印,并推出公众可用的验证工具。

aiinfra p321 72 72

10.3 全球监管格局:欧严美松中强制—— 三轨分化

第一轨:欧盟—— 风险分级、全面立法

截至 2026 年年中,全球 AI 监管格局已经明确分化为三条截然不同的轨道。根据统计,72 个国家已经启动了超过 1,000 项 AI 政策倡议,仅美国各州议会在 2025 年就提出了超过 1,200 项 AI 相关法案。EU AI Act 是全球第一部综合性 AI 法律,采用风险分级框架:

  • 2024 年 8 月:法案生效
  • 2025 年 2 月:禁止不可接受的 AI 系统(社会评分、操控性 AI、无差别面部识别)
  • 2025 年 8 月:通用 AI 模型(GPAI )义务生效
  • 2026 年 8 月:透明度标记义务生效;AI 素养要求启动
  • 2027 年 12 月:高风险 AI 系统(Annex III )义务全面生效,执法权力启动(原定 2026 年 8 月,2026 年 6 月 Digital Omnibus 修正案延迟) 原定 2026 年 8 月 2 日是高风险 AI 系统义务的生效日期,但 2026 年 6 月欧洲议会以 423 票通过了「Digital Omnibus」简化修正案,将 Annex III 高风险 AI 系统的义务延迟至2027 年 12 月 2 日生效。部分透明度义务(如 AI 生成内容标记)仍于 2026 年 12 月生效。这意味着:
  • 上市前合规评估(conformity assessment ):高风险 AI 系统必须通过独立评估
  • 技术文档要求:完整的训练数据记录、模型架构文档、风险评估
  • 公共数据库注册:所有高风险 AI 系统必须在 EU 公共数据库中登记

第二轨:美国—— 联邦松散、各州拼凑

  • 罚则:违反义务的罚款最高达全球年营业额的3% ;部署被禁止的 AI 系统,罚款最高7% (€3,500 万或全球年营业额的 7% ,取较高者) 此外,EU 同时宣布了 €500 亿的 AI 投资计划,其中 €100 亿专门用于创建「AI 工厂」。这体现了欧盟「严格监管 + 大规模投资」的双轨策略。美国的 AI 监管格局可以用一个词概括:碎片化。

联邦层面:

  • 2025 年 1 月,Trump 总统签署行政命令,撤销了此前的 AI 安全防护措施,优先推动「无束缚的 AI 扩张」
  • 截至 2026 年 5 月,美国仍无联邦层面的 AI 专法
  • SEC 和 PCAOB 通过现有法规(披露规则、审计标准、反欺诈法规)间接管理 AI 相关行为
  • 联邦策略是「以现有法律管新技术」,而非立新法州层面—— 群雄割据:
  • 科罗拉多州:2024 年通过 SB 24-205 (Colorado AI Act ),全美第一部综合性州级 AI 法。2026 年 2 月生效,聚焦高风险 AI 系统的算法歧视问题。但 2026 年 4 月被联邦法院暂停执行(xAI 起诉案),5 月州长签署 SB 26-189 替代法案,大幅放松义务
  • 加利福尼亚州:SB 53 通过,聚焦 AI 工作场所应用。此前 SB 1047 (大模型安全法案)在 2024 年被否决后,加州转向更窄的立法策略
  • 德克萨斯州:Responsible AI Governance Act 通过,取不同于科州的路径

第三轨:中国—— 快速迭代、强制备案

  • 纽约市:AI 招聘法(Local Law 144 )持续运行对企业而言,这意味着在美国部署 AI 系统,需要同时遵守多个州的不同要求,合规成本极高但监管力度远低于欧盟。中国的 AI 监管模式独树一帜:不搞一部大法,而是针对每种具体技术快速出台专门规定。2021-2023 年创建的「护栏」体系:
  • 算法推荐管理规定(2022 年):所有商业算法推荐系统必须备案、透明、风控
  • 深度合成管理规定(2023 年):针对 Deepfake 等 AI 生成内容
  • 生成式 AI 服务管理暂行办法(2023 年):针对大模型服务 2025-2026 年的新发展:
  • 强制备案制度:开发者必须展示其产品如何避免 31 个风险类别(从年龄歧视到心理伤害到「违反社会主义内核价值观」)。Wired 报导称,政府登记册追踪所有 AI 公司
  • AI 生成内容标记:创建了全球最精细的 AI 内容标记体系,在供应链每一层都指定责任方—— 模型开发者、服务提供商、应用商店、分发平台、终端用户
  • 拟人化 AI 交互服务管理暂行办法(2026 年):专门针对「仿真人格特征、思维模式和沟通风格」的 AI 服务
  • 高风险科技活动清单:具有舆论动员能力、高度自主决策能力或深度人机融合的 AI 技术被列入强制第三方专家审查名单

三轨对比

  • 罚则升级:罚款上限提升至 500 万人民币,严重违规可追究刑事责任中国模式的内核逻辑:先让跑、再管住、管了再放。2025 年后进入「积极部署」阶段—— 在确保政治安全和社会稳定的前提下,大力推动 AI 商业化。
  • 立法模式:一部综合大法/无联邦专法,州级拼凑/针对性小规定快速迭代
  • 风险分类:四级风险框架/各州各异/按技术类型分类
  • 执法节奏:阶段性生效至 2027 年 12 月(高风险义务延期) / 2026 年已有诉讼暂停运行/即时生效、快速迭代
  • 罚则力度:全球营收 3-7% / 各州不一/最高 ¥500 万+ 刑责
  • 对创新的态度:严管+ 投资双轨/联邦放任+ 州级收紧/先放后管再放
  • 域外效力:有(类 GDPR ) / 无统一框架/国内适用为主

aiinfra p325 72 209

10.4 AI 安全对投资的影响直接市场规模

AI 安全不再是成本中心—— 它本身就是一个高速增长的市场:

  • AI 安全整体市场:约 $36.1 亿/约 $49 亿 / 35.8%
  • Deepfake 检测市场:约 $28 亿/预计 2033 年 $124 亿/约 18.9%
  • AI 安全评分市场:约 $15.3 亿/预计 2030 年 $42.4 亿 / 22.6%

合规驱动的资本支出

  • AI 治理软件市场:— / 约 $4.19 亿(2026 年) / 34% (至 2035 年) EU AI Act 高风险义务(原定 2026 年 8 月,现延至 2027 年 12 月)全面生效后,所有在欧盟市场部署高风险 AI 系统的企业,都必须

投入大量资本用于:

  • 合规评估与认证:第三方合规评估费用
  • 技术文档系统:训练数据追踪、模型卡片、风险评估文档
  • 监控与审计基础设施:持续监控 AI 系统行为、定期审计

对 AI 公司估值的影响

  • 内容溯源系统:C2PA + 水印双轨合规这些合规需求创造了一个新的基础设施层——AI 治理基础设施(AI Governance Infrastructure )。安全能力已经成为 AI 公司估值的内核组成部分: Anthropic 的案例:
  • 2026 年 2 月:Series G ,$300 亿融资,估值 $3,800 亿
  • 2026 年 5 月:Series H ,$650 亿融资,估值 $9,650 亿
  • 3 个月内估值增长154%

监管套利与地理配置

  • 关键催化剂之一:「Teaching Claude Why」研究证明安全和能力可以兼得 Anthropic 的例子证明了一个投资逻辑:在 AI 安全上投入不是成本, 是护城河。能够证明自己的模型「可控、可信、可审计」的公司,将在企业客户市场获得巨大溢价—— 因为企业不敢部署一个可能勒索员工的 AI 代理。三轨分化的监管格局创造了监管套利(Regulatory Arbitrage )机会:
  • 在欧盟销售但在美国开发:利用美国宽松的开发环境,但按 EU 标准做产品合规
  • 中国市场需要本地化:强制备案制度意味着海外 AI 公司必须有中国合作伙伴或本地部署

风险维度

  • 合规服务外包:专门帮 AI 公司做 EU AI Act 合规的第三方服务商将成为新的增长极

投资者需要关注的风险:

  • 监管不确定性风险:美国州级法律可能被联邦诉讼暂停(科罗拉多案例),投资了合规工具的公司可能面临需求变动
  • 技术过时风险:Deepfake 检测是一场永恒的军备竞赛,今天的检测技术明天可能被新的生成技术突破
  • 安全剧院风险:部分 AI 安全公司卖的是「合规剧院」而非真正的安全—— 投资者需要区分「能通过监管审查」和「能真正防止伤害」
  • 集中化风险:如果少数几家公司垄断了 AI 安全基础设施, 它们本身就成为新的系统性风险点

aiinfra p328 72 336

10.5 投资 Playbook :AI 安全与监管内核逻辑

投资框架

AI 安全投资的内核逻辑是「监管确定性创造需求确定性」。与能源、芯片等基础设施不同,AI 安全的需求不完全来自技术演进,很大程度上来自法规强制。EU AI Act 高风险义务预计 2027 年 12 月全面生效(透明度义务 2026 年 12 月先行),就像一个确定的需求释放阀门。Tier 1 :确定性最高—— 合规基础设施

  • AI 治理平台:EU AI Act 合规的「操作系统」;风险评估、文档管理、审计追踪
  • 内容溯源基础设施:C2PA + 水印双轨是强制要求; Truepic、Content Credentials 生态
  • 第三方评估机构:高风险 AI 系统需要独立评估;类似「AI 领域的安永/德勤」 Tier 2 :增长最快—— 威胁防御
  • Deepfake 检测:$28 亿→$124 亿市场,96 家厂商竞争;Reality Defender、Pindrop、iProov
  • 身份验证升级:KYC 被 Deepfake 突破后必须升级;活体检测 3.0、多模态验证
  • AI 红队服务:模型上线前的安全测试;类似「AI 领域的渗透测试公司」 Tier 3 :长期押注—— 对齐研究商业化
  • 对齐研究公司:安全能力= 企业市场护城河;Anthropic (已估值 $9,650 亿)
  • 可解释性工具:「黑箱→白箱」的市场需求;机械式可解释性(Mechanistic Interpretability )

避坑指南

  • AI 控制/审计工具:确保 AI 代理在部署中不偏离; Palisade Research 方向
  • 警惕「合规剧院」:有些公司卖的是 checkbox—— 帮你勾选合规清单但不提供真正的安全保障。区分方法:看它的技术是否能在模型行为发生变化时自适应更新
  • 不要只投「盾」忽视「矛」:攻防不对称—— 攻击者只需一次成功,防御者需要 100% 成功。投资组合应该同时包含防御工具和「假设已被攻破」的响应/恢复方案
  • 地理套利有时效性:美国的监管松散不会永远持续。一旦发生大规模 AI 安全事件(类似 2008 年金融危机催生 Dodd- Frank ),联邦立法可能迅速收紧

可行配置

  • 中国市场的特殊性:备案制度是进入壁垒也是护城河。已获备案的公司 vs. 未获备案的公司,在中国市场是「能做生意」vs. 「不能做生意」的二元差异
  • 保守型(PE/Family Office ):70% Tier 1 合规基础设施 + 30% Tier 2 头部防御
  • 均衡型(VC/Growth ):40% Tier 2 高增长防御 + 40% Tier 1 合规 + 20% Tier 3 对齐研究

时间节点

  • 激进型(早期 VC ):50% Tier 3 对齐研究 + 30% Tier 2 新兴防御 + 20% Tier 1
  • 2026 年 12 月:EU AI Act 透明度标记义务生效—— 第一波合规需求
  • 2027 年 12 月:EU AI Act 高风险义务全面生效—— 合规工具需求爆发
  • 2027 年 1 月:科罗拉多 SB 26-189 生效—— 美国合规需求第一波
  • 2027 年:Deloitte 预测美国 AI 生成式诈骗损失达 $400 亿—— 防御市场急剧扩张

10.6 本章小结

  • 2026-2027 年:Anthropic 可能 IPO——AI 安全概念进入公开市场 AI 安全与监管不是 AI 投资的「附加题」—— 它正在成为必答题。

三个内核观点:

  • 对齐研究有实质进展,但远未解决。Anthropic 将勒索行为率从 96% 降到 3% 是里程碑式成就,但分布外泛化问题意味着我们离「可证明安全」的 AI 还有很长距离。投资逻辑:安全能力是企业 AI 的内核护城河,投那些把安全做成差异化优势的公司。
  • Deepfake 诈骗已经工业化。2025 年 $11 亿的损失只是冰山一角。攻击面在扩大(实时视频、语音克隆、KYC 突破), 防御侧以 18.9% CAGR 增长但仍在追赶。投资逻辑:这是一场军备竞赛,投平台型防御(如 C2PA 基础设施)而非单点检测工具。
  • 三轨监管分化创造结构性机会。欧盟的强制合规(高风险义务 2027 年 12 月、透明度义务 2026 年 12 月)创造确定性需求;美国的碎片化创造合规服务需求;中国的备案制度创造进入壁垒。投资逻辑:监管确定性= 需求确定性,2026 年 12 月透明度义务是第一波需求释放节点,2027 年 12 月高风险义务是最大的需求爆发点。一句话总结:AI 安全市场正在从「道德倡导」转向「监管强制」,从 $36 亿(2025 年)增长到 $49 亿(2026 年),CAGR 35.8% 。这不是慈善,这是生意。而那些最早理解「安全即护城河」的公司和投资者,将在这个 $49 亿且快速增长的市场中占据先机。免责声明本书内容仅供教育及信息参考之用途,并不构成投资建议、财务建议或交易建议。本书提及的任何公司、代币、股票、基金或投资工具,均不构成作者买入、卖出或持有的建议。所有投资均涉及风险,包括可能损失本金。读者应根据自身的财务状况、风险承受能力和投资目标作出独立判断,并在作出任何投资决定前咨询持牌专业顾问。加密货币及相关数字资产波动极大,未必适合所有投资者。各地对加密货币的监管政策不同,读者有责任了解并遵守其所在地区的相关法律法规。本书中的数据及市场信息以撰稿时为准,出版后可能出现重大变化。尽管已尽一切努力确保信息的准确性,但作者对其完整性或准确性不作任何保证,亦不对因依赖本书内容而导致的任何直接或间接损失承担责任。过往表现并不代表未来结果。

本站内容仅供学习交流,版权归原作者所有。