深度伪造如何合成人脸与声音?

深度伪造的“伪造”并不是简单的复制粘贴,而是一套生成式建模过程:算法先从目标人物的大量素材中学习其面部与声音的统计特征,再在全新语境下重构出“本人似乎真的说过、做过”的内容。理解这一机制,是判断其能力边界与识别破绽的前提。

1787120302-aiimg6a854aae6ff0d1.00238552.webp

人脸合成:压缩特征,再重绘面孔

主流换脸技术通常基于自编码器结构。编码器将人脸图像压缩为一组低维特征向量,剥离姿态、光照等变量,只保留与身份相关的核心信息;解码器再据此重建图像。训练时让两个人共用编码器、各自使用独立解码器,推理阶段交换解码器,就能把甲的表情与头部动作“翻译”成乙的面孔。另一条路线是生成对抗网络(GAN):生成器负责造图,判别器负责辨假,二者在反复对抗中持续提升,直至生成结果逼真到难以肉眼分辨。无论哪条路线,合成质量都高度依赖素材的数量与多样性——角度越全、表情越丰富,输出越稳定。

声音合成:从频谱特征到波形还原

声音克隆的逻辑类似,只是处理对象从像素变为声学特征。系统先从目标语音样本中提取频谱等声学表示,训练声学模型学习音色、音高与发音习惯的映射关系,最后由声码器将频谱还原为可听的波形。样本越充足,模型对语气、节奏的拟合就越接近真人,甚至能让目标声音“说出”从未讲过的话。

从工程角度看,两类技术都存在固有约束。人脸合成在头发边缘、下颌与脖颈接缝处容易出现融合瑕疵,嘴型与语音的精确同步也难以做到完美;声音克隆则常在情感起伏和长句连贯性上露出僵硬感。这些局限并非偶然失误,而是训练数据覆盖不足与生成机制本身的直接结果,也正是技术鉴别与人工核查可以利用的切入点。

参与讨论

0 条评论

延伸阅读