“帮我转5000块钱,急用。”电话那头传来的是儿子焦急的声音,连口音和习惯用语都一模一样。李女士下意识就要转账——直到对方说不出昨晚家里的菜名,她才惊觉自己差点被骗。

这不是电影情节。7月21日,国家安全部通过官方微信公众号发文《AI语音合成背后的三大风险,你了解多少?》,首次系统揭露了AI语音深度合成技术带来的三大国家安全与个人信息安全隐患。

一、技术有多可怕?1句话样本复刻你的声音

语音深度合成技术的进步速度远超公众想象。

公众普遍熟悉“AI换脸”,但语音深度合成技术门槛更低、隐蔽性更强。只需3到5秒的原始语音样本,即可生成高度逼真的合成语音。

“很多人在社交媒体发布的‘日常唠嗑’短视频,足以作为不法分子复制声音的‘原料’,”国家安全部在文章中提示,“个人公开在网络上的音视频信息可能被不法分子利用。”

今年初,浙江警方通报的一起电信诈骗案中,诈骗团伙利用AI技术合成了某公司老板的声音,仅用一通电话就骗走了该企业财务人员327万元。

二、三大风险:从个人到国家,层层渗透

国家安全部将风险归纳为三个层面:

第一层:个人信息安全风险。 利用语音深度合成技术伪造虚假音频,冒充他人身份与亲友或同事沟通,进而索要钱财、套取隐私或指令转移财产。随着语音合成技术日益成熟,仿真度不断提升,普通人仅凭听觉几乎无法辨别真伪。

第二层:社会安全风险。 利用技术深度伪造虚假新闻、恶意信息,破坏社会稳定。2025年,某地曾出现一段伪造的“某市发生重大泄露事故”的合成音频在社交平台大量传播,引发市民抢购物资。事后查明,该音频为AI合成,发布者意在通过散播谣言在期货市场获利。

第三层:国家安全风险。 境外机构可能利用语音合成技术冒充我国特定人员实施渗透破坏活动、传播违法有害信息,甚至侵入关键信息基础设施。

国家安全部特别指出,境外机构可能利用语音合成技术冒充关键行业工作人员实施渗透破坏,对国家安全构成现实威胁。

三、企业级风险:4%的漏洞就能突破金融安全防线

金融行业是AI语音合成技术攻击的重灾区。

行业白皮书指出,声纹认证面临的最大风险就是深度伪造语音攻击。国际权威机构最新测试结果显示,在针对特定目标定制生成的攻击样本面前,声纹认证系统极易出现安全漏洞,在特定攻击条件下有高达4%的样本存在突破风险。

对于拥有千万级乃至亿级用户的大型金融或公共服务平台,4%意味着数十万账户存在被攻破可能。尽管金融行业通常配套多重身份核验机制,单一的声纹认证并非唯一防线,但综合风险不容忽视。

更值得关注的是技术迭代速度。2021年时,生成一段可用的合成语音需要数小时录音和大量算力。到了2026年,短视频里3秒钟的“哈哈”就足够复刻一个人的声音。攻击工具也从专业团队流向个人,GitHub上已有大量开源语音克隆项目,普通人经过简单学习即可使用。

四、如何防范?多方联动构建防线

面对这一挑战,国家安全部建议从三个层面构建防护体系:

个人层面: 谨慎在网络平台分享音视频信息;接到涉及转账、密码等敏感内容的电话时,通过其他渠道二次确认;保护个人生物信息,避免在不可信的应用中录入语音样本。

企业层面: 采用多因子身份认证机制,升级AI合成语音检测工具。金融机构应评估现有声纹系统的安全冗余,针对深度伪造攻击场景制定应急预案。

监管与法律层面: 《中华人民共和国人工智能法》已于2025年8月正式施行,明确规定利用人工智能技术实施违法犯罪行为将从重处罚。AI语音的检测与反制技术也在同步提升——深度伪造检测模型已经能做到在特定测试集上识别成功率超98%。

结语

5年前的3秒录音还只能逗人一笑,今天的3秒录音已经能骗过你身边最亲近的人。技术进步从来都是双刃剑。当声音本身可以被凭空制造、被精准模仿时,原有的信任体系正在受到前所未有的冲击。声音可以伪造,但算法可以捕捉伪造痕迹,监管可以划定使用边界。真正的防线,在于“你听到的,不一定是真的”这条意识本身。