news 2026/8/2 3:05:01

【论文阅读】UniAVGen: Unified Audio and Video Generation with Asymmetric Cross-Modal Interactions

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
【论文阅读】UniAVGen: Unified Audio and Video Generation with Asymmetric Cross-Modal Interactions

code:UniAVGen - Unified Audio and Video Generation

介绍

解决的问题:现在很多开源“音频-视频生成”要么是两段式:先出视频再配音(或反过来),要么是“端到端”但对人声(尤其是说话、情绪、音色)很弱。两段式最大毛病是:生成时模态是解耦的,视频在“听不见”的环境里生成,音频在“看不见”的环境里生成,于是常见问题是:

  • 口型对不上(lip sync)

  • 语气/情绪和表情/动作不一致

  • 音色/身份信息不稳(这人看起来像 A,说出来像 B)

他们要做的是:一个统一模型,同时支持三类关键任务(图1):

  1. 文本 + 人脸参考图 → 同时生成音频和视频

  2. 给定视频 → 配音(dubbing)

  3. 给定音频 → 音频驱动视频(talking / motion)

方法

总体框架:Dual-Branch Joint Synthesis(双分支联合合成):一条视频分支、一条音频分支,两条都是 DiT 流,并且强调对称设计:结构一样(或尽量对应),这样两边的特征层级、token 语义更容易“对齐”,为跨模态交互打地基。

视频分支建模:

  • 视频先按 16 fps 处理,用预训练 VAE 编到 latent:zv

  • 参考人脸图 Iref和条件视频也编码成 zvref,zvcond

  • 输入拼成:[z0vref,z0vcond,ztv]

  • 文本视频描述 Tv​ 用 umT5 编码成 ev,通过 cross-attn 注入

  • 训练用 Flow Matching,损失是预测向量场:

音频分支建模

  • 音频 24kHz,转 Mel 频谱作为 latent za

  • 可选参考音频 Xaref、条件音频 Xacond 也转成 zaref,zacond

  • 输入拼成:[z0aref,z0acond,zta]

  • 语音内容文本 Ta 经 ConvNeXt V2 blocks 提特征 ea,也通过 cross-attn 注入

  • 同样 Flow Matching,损失是:

Asymmetric Cross-Modal Interaction(ATI)

到底“非对称”在哪?论文专门用图3对比三种交互方式:

  • SGI(全局互看):每个 token 看对方所有 token。简单但训练难收敛,因为没有显式时间对齐。

  • STI(对称时间对齐):按时间段一一对应互看,收敛快,但上下文太窄,信息不够。

  • ATI(本文):时间对齐,但 A→V 与 V→A 用不同策略,各取所长。

A2V:Audio → Video 对齐器(为什么要“窗口”上下文?)

口型/表情不是只由“这一瞬间的音素”决定,还受前后音素影响。
做法是:把 video tokens reshape 成按帧的 Hv,音频也 reshape 成 Ha。

对第 i 帧视频,不只看 i 帧音频,而是拼一个窗口:

然后做 frame-wise cross-attn,让视频帧去 query 这个音频上下文:

直觉:视频每帧需要“听到附近一小段”,这样更容易学到口型-发音的对应。

3.2 V2A:Video → Audio 对齐器(为什么要“插值”?)

音频 token 时间分辨率通常更细:一个视频帧对应一段音频 token。若硬对齐会很粗。
他们令每个音频 token jjj 对应视频帧 i=⌊j/k⌋i=\lfloor j/k\rfloori=⌊j/k⌋,并用相邻两帧做线性插值:

再让音频 token 去 query 这个“平滑的视觉上下文”:

直觉:音频是连续流,视频帧是离散采样;插值能把“嘴巴从帧 i 到帧 i+1 的过渡”传给音频,帮助音色/情绪/身份线索更稳。

一个很关键但容易忽略的训练技巧:他们把交互输出的线性层 Wo 零初始化,避免一开始跨模态信息太强把各自生成能力“带崩”。

Face-Aware Modulation(FAM)

为什么能帮口型对齐?

作者认为 joint AV generation 里真正需要强耦合的是脸部区域。让跨模态交互去处理整张图会:

  1. 浪费容量

  2. 早期训练把背景也“搅乱”,引入伪相关

所以他们做了一个 动态人脸mask预测头,在每个交互层输出软 mask:

并用人脸检测得到的 GT mask 监督;更聪明的是:监督权重 λm​ 逐渐衰减到 0,让模型从“先盯脸学对齐”过渡到“后期放开学更全局的交互”。

mask 怎么用?

  • A2V:只在 mask 位置更新视频特征:

  • V2A:在做插值上下文前,用 mask 加权视频特征,让音频主要从“脸相关”区域拿信息。

MA-CFG(Modality-Aware CFG)

是在推理阶段补哪一刀?

传统 CFG 是单模态:用“有条件输出”和“无条件输出”的差来加强条件控制。
但在 joint AV 里,如果只是分别对音频和视频做 CFG,并不会显式加强“音→视”“视→音”的依赖。

提出 MA-CFG:先做一次 forward 得到“无跨模态交互”的 unimodal baseline uθa,uθv​​,再用“有跨模态交互”的 uθa,v​​ 去引导两个模态:

可以理解成:把 CFG 的“强化差分”从文本条件,挪一部分给跨模态相关性。

实验

训练流程(三阶段)

  1. 先单训音频分支(Emilia 英文子集,160k steps)

  2. 再端到端联合训练(内部真人 AV 数据集,30k steps)

  3. 最后做多任务训练(10k steps,五任务比例 4:1:1:2:2)

指标设计

  • 音频质量:PQ、CU(AudioBox-Aesthetics),以及 WER(Whisper-large-v3)

  • 视频质量:VBench 的 SC/DD/IQ

  • 跨模态一致性:

    • LS:SyncNet 置信度

    • TC、EC:用 Gemini-2.5-Pro 打分(0~1),三次评估取平均

主结果(表1):训练样本 1.3M vs Ovi 30.7M,UniAVGen 在 TC/EC 上更强,LS 也接近最强,视频动态(DD)和画质(IQ)也领先或持平。

消融:ATI 与 FAM 是否真有用?

  • 交互机制消融(表2):从 SGI → STI → ATI,ATI(双向)最好,TC/EC 提升最明显。

  • FAM 消融(表3):带监督的 FAM 明显好于不带;衰减 λm\lambda_mλm​ 的设置最好(TC/EC 最优)。

  • MA-CFG(图6):加了之后情绪与动作更“跟着声音走”。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/2 2:00:09

13、多通道图像噪声特征的盲评估

多通道图像噪声特征的盲评估 1. 改进方法在彩色图像中的性能分析 在彩色图像噪声参数评估方面,我们采用TID2008彩色图像数据库,对基本方法、其改进方法以及另一种方法进行了对比实验。 从直观的可视化分析来看,改进方法在很多图像的噪声参数估计上表现出色,无论是信号无…

作者头像 李华
网站建设 2026/8/1 9:42:44

21、使用克罗托夫函数进行快速合成轨迹的优化

使用克罗托夫函数进行快速合成轨迹的优化 1. 基础概念与定理 在动态系统的研究中,一些关键的概念和定理为后续的分析奠定了基础。首先,第 (n) 相坐标描述了质量的变化,存在如下关系: (\xi_{i}+\sum_{j = 1}^{r_{i}}\xi_{ij}=1)((i = 1,\cdots,k)),且 (0<\xi_{\bet…

作者头像 李华
网站建设 2026/8/1 3:16:19

22、使用克罗托夫函数进行快速合成轨迹研究

使用克罗托夫函数进行快速合成轨迹研究 1. 基础理论与关键公式 在相关研究中,存在如下重要公式: [ \begin{align } &\lim_{l \to \infty} \left[ S_1(1x^l(t_1^l), t_1^l) + \psi_1(1x^l(t_0^l), t_0^l) - \psi_1(1x^l(t_1^l), t_1^l) + S_{12}(12x^l(t_{12}^l), t…

作者头像 李华
网站建设 2026/8/1 10:40:01

显卡健康检测终极指南:用memtest_vulkan一键诊断显卡稳定性

显卡健康检测终极指南&#xff1a;用memtest_vulkan一键诊断显卡稳定性 【免费下载链接】memtest_vulkan Vulkan compute tool for testing video memory stability 项目地址: https://gitcode.com/gh_mirrors/me/memtest_vulkan 你的显卡是否经常出现画面闪烁、游戏崩溃…

作者头像 李华
网站建设 2026/8/2 1:31:29

24、Samba 打印与名称解析全攻略

Samba 打印与名称解析全攻略 1. 向 Windows 打印机打印 1.1 BSD 打印机 许多 Unix 变体使用 BSD 打印系统。以下是为支持由 Windows 2003 系统 maya 共享的 HP DeskJet 932C 打印机,添加到 /etc/printcap 文件的条目: lp|maya - hp932c:\:cm=HP 932C on maya:\:sd=/va…

作者头像 李华
网站建设 2026/8/1 22:59:52

37、Samba故障排除指南

Samba故障排除指南 1. 网络基础测试 在排查Samba相关问题时,首先要确保网络基础环境正常。这可以通过一系列的 ping 命令测试来完成。 1.1 测试本地名称服务 在Samba服务器的shell中执行 ping localhost 命令, localhost 是127.0.0.1回环接口的传统主机名,正常情况…

作者头像 李华