以前我们验证一件事,靠的是"我亲眼看到了""我亲耳听到了"。2026 年,这个最朴素的信任基础正在塌掉。

一张照片、一段几秒钟的录音,就能被生成式 AI 加工成以假乱真的视频或克隆语音。当"眼见为实"不再是可靠的验证手段,骗局的门槛被降到极低。

数字在说话

深度伪造的泛滥速度,远超多数人直觉。据 DeepStrike 分析,2026 年网络上流通的深度伪造内容约 800 万条,较 2023 年的 50 万条增长 16 倍;Sumsub 的数据显示,深度伪造欺诈占全部欺诈尝试的比例从 2022 年的 0.1% 蹿升到 2026 年的 6.5%,三年增长超过 20 倍。CrowdStrike《2026 全球威胁报告》显示,AI 换脸、声纹克隆类网络攻击同比增幅高达 89%。

最经典的案例是 2024 年一家跨国公司香港子公司员工,在视频会议上看到"CFO 和几位同事"要求转账,结果会议里每一张脸、每一个声音都是合成的,最终被骗 2500 万美元。这类"多模态诈骗"已经不是电影情节。更贴近日常的是:骗子用几秒公开音频克隆亲人声音,打来一通"急用钱"的电话;或者用合成视频冒充公众人物带货理财。

攻击成本趋近于零

2026 年,三件事几乎同时达到"生产级"质量:消费级 GPU 上的实时换脸(延迟低于 50 毫秒)、5 秒音频克隆语音、以及质量追平闭源的开源模型。攻击者的边际成本几乎降到零,而防御方却必须工业化。

旧的那套防御——"用已知号码回拨确认"——已经不够了。因为号码可以伪造,声音可以实时克隆。

真正的防线:从"检测假"到"证明真"

最有生命力的防御不是"去识别假货",而是"要求真品证明身份"。这背后是内容溯源(C2PA)机制:拍摄设备对影像做加密签名,证明它确实由某台真实的相机/手机拍摄。Adobe、索尼、尼康,以及 2025 年底的苹果 iPhone 拍摄管线,都已支持 C2PA 签名。换句话说,不是去猜"这段视频是不是假的",而是要求"请出示你的出生证明"。

另一条同样重要的防线是流程,而非技术。前面那起 2500 万美元诈骗案,公司其实有很强的安全端点,但缺一道"超过阈值的转账必须走带外二次确认"的流程控制。成熟的安防体系正在重新启用那些技术时代想淘汰的人工流程:大额转账多通道确认、关键操作双人授权。

普通人能做什么

  • 对高利害请求多一个验证通道:凡是涉及转账、提供验证码、敏感信息的"紧急"来电或视频,走一条独立渠道(比如当面或另一个你确信的号码)再确认一次。
  • 警惕"太像了"的熟悉感:熟悉的声音、熟悉的脸,本身不再是信任依据。
  • 关注内容标识:欧盟 AI 法案要求 AI 生成内容必须披露,国内也在推进生成合成内容标识,看到明确标注的反而更透明。
  • 保护好生物特征素材:减少公开高清晰度正面视频和原声录音,它们是克隆的原材料。

一句话总结:2026 年,"我亲眼所见"不再是足够的验证手段,替代方案是分层的——媒体靠加密溯源、授权靠流程控制、检测只是众多信号中的一环。任何单层防御,都可能在一个新模型发布后过时。

对普通人来说,保持一点"数字时代的适度多疑",本身就是一种免疫力。