人类的感知天生就是多模态的, 其中音频和视觉是现实世界中最普遍且互补的感知组合, 广泛应用于辅助技术, 教育, 机器人和娱乐内容创作等领域. 随着 Meta MovieGen 和 Google Veo-3 等先进系统的出现, 表明了业界正朝着端到端的视听联合建模和协调合成方向发生战略性转变.
视听智能涵盖了反映声音与视觉在现实中如何共现的广泛任务, 主要分为三个层级: 感知(视听语音识别, 唇语阅读, 主动说话人检测, 声源定位与分离, 事件理解, 跨模态检索以及视听问答等任务), 生成(talking heads, 视频为条件的语音或拟音的生成, 与视觉节奏对齐的音乐生成, 具有长语境连贯性的多模态故事生成与跨模态编辑), 交互(要求模型在物理和时间的约束下理解动态信号并做出响应)
研究者将其分为3大类, 语音(speech), 音乐(器乐和声乐), 一般的声音事件(环境音, 城市噪音, 室内声音或音效等声学场景)
这些模拟信号通过麦克风捕捉后, 会被采样成一维的时间序列数字信号, 也就是我们常说的波形. 这些波形有单声道(1-channel), 立体声(2-channel), 多声道的空间音频格式. 除了原始波形, 音频可以通过短时傅里叶变换转换为频谱图(时频表示)
核心音频特征表示有三种方式, 1) 全局嵌入, 将整段音频映射为单一维度的语义向量, 用于捕捉高级声学和语义特征. 2) 连续密集表示, 不压缩为单一向量, 保留时间和频率结构, 生成降采样的隐层特征序列或特征图; 3) 离散词元表示: 利用向量量化技术和预训练码本, 将连续音频离散化为一系列 Token IDs, 从而支持类似大语言模型的序列生成.
图像和视频数据的形式, 连续的嵌入表示和离散的词元化(典型的VQ-VAE).
模型接收到自然界中原始的听觉信号和视觉信号后, 能够像人一样去"感受"并"解释"这些信号, 从而弄清楚现实环境里正在发生什么.
比如输入一段街道视频和狗叫声,要求模型在画面中把正在发声的狗的轮廓精确抠出来. 这一层级是整个视听感知系统的最底层, 其核心在于处理"从原始信号中直接读取到的结构". 在这个阶段, 模型不需要理解复杂的语义, 而是专注于物理信号的时空对应与对齐.
代表性任务包括视听同步(判断声音和画面是否对齐)以及各类视听分割任务(例如基础的视听分割 AVS, 以及升级版的基于文本指示的 Ref-AVS 和全模态分割 OmniAVS)
比如输入防空警报拉响, 街道破败的视频和声音, 问模型"声音是从哪里传来的?", 模型回答"防空警报器". 这一层级的目标是"将底层信号映射为语义含义". 一旦底层结构对齐, 模型就需要提取出能用语言或结构化形式表达的对象, 事件和查询目标. 与像素级感知不同, 这里要求模型在时间动态中将声音与视觉事件相互关联, 解决声源定位, 跨模态时间对齐以及视听之间初步的因果理解问题
比如画面中一个正在演讲的男人突然停止说话, 并把双手放在了桌子上. 问模型"为什么这个男人停止说话并把手放在桌子上?", 模型在后台进行思考(...他正在集中注意力听...)并给出原因. 又或者, 模型通过对比"狗叫"和"车开过"的发生时间, 推断出结论: "狗叫是因为汽车经过".
这是感知的最高阶段. 它超越了仅仅对输入信号进行"打标签"或回答"是什么"的范畴. 而是要求模型结合多模态证据和物理常识, 来论证和回答"为什么", "机制是怎样的"以及"如果发生改变会怎样". 在这个阶段, 声音和图像流必须联合起来支持多步推断和因果推理.
输入一段prompt"一辆跑车在雨夜的街道上疾驰"生成"跑车飞驰"的无声画面, 输入一段prompt"跑车引擎轰鸣和轮胎溅水的声音"生成一段纯音频.
这类任务在文本, 标签或结构化属性等外部控制信号的引导下, 独立地生成单一模态. 核心技术挑战在于可控性和语义对齐.
拿到"跑车飞驰"的无声画面后, 作为条件, 要求"根据画面配音", 直接出音频.
这种范式是以一种模态为条件来合成另一种缺失的模态, 由于它不再依赖外部文本指令, 而是直接基于多模态线索, 因此要求模型具备极其精细的跨模态时间对齐和因果基础关联能力.
输入一段prompt"一辆跑车在雨夜飞驰", 模型一次出视频和音频.
这是视听生成中最深度的融合范式. 它直接对声音和视觉在生成过程中的"耦合演变"进行联合建模. 无论是基于文本/图像的音视频联合生成, 还是音视频的联合编辑与3D空间合成, 其最终目标都是捕捉整个场景的全局演变, 确保输出的多模态内容在时间, 因果和物理上达到绝对的同步与一致性.
你在厨房做饭, 把机器人的镜头对准正在煎牛排的平底锅, 锅里发出激烈的"滋滋"声. 你直接开口问AI: "听这个声音, 我的火候是不是太大了?你能给我看下五分熟的牛排切开应该是什么样吗?"AI立刻用自然的人声回答:"听起来油爆声确实有些密集, 建议调小火."与此同时, 它的屏幕上实时生成并展示了一段五分熟牛排切开流汁的画面.
这类任务是指系统能够处理多模态输入, 并在交互式对话中生成相应的响应. 根据系统输出重心的不同, 论文将其细分为三类: 1) 以音频为中心, 从多模态上下文中理解信息并生成语音回复; 2) 以视觉为中心, 在对话交互过程中生成或编辑图像和视频; 3) 全模态对话, 在一个统一的接口中支持任意模态(声音, 画面, 文本)的灵活输入与输出组合.
你在客厅休息, 对家里的实体机器人说:"去看看哪里在漏水, 并拿块毛巾处理一下."机器人由于视角限制一开始并没有看到水, 但它听到了微弱的"滴答滴答"声. 它利用双耳麦克风判断声音方位, 结合视觉避开走廊的沙发, 循着声音移动到了洗手间. 看到地上的水渍后, 它伸出机械臂, 准确地从架子上抓取了一块毛巾.
这一范式将视听智能延伸到了物理(或3D数字)环境中, 其核心在于将"多模态理解"转化为具体的"物理动作", 典型应用方向有利用视觉和听觉的线索来引导机器人在空间中寻找目标, 或要求智能体或机器人基于不断接受的视听输入进行推理, 执行具体的动作.
旨在将原始输入数据转化为可以被神经网络高效处理的离散标记或者连续嵌入.
论文的 4.1.1 节主要讲解了视听特征提取与表示(Audio-Visual Feature Extraction and Representation)。这部分的核心思想是:利用无标签视频中视觉和听觉信号天然的同步性,在不需要人工标注的情况下学习跨模态的语义特征并获得共享的视听嵌入表示。
为了实现这一目标,现有的方法主要依赖以下四种技术路径(为了方便您理解,我将相关细节进行了总结提炼):
- 自监督表示学习, 将跨模态的同步性作为监督信号, 其发展历程从早期的代理任务(如预测视听是否对应及时间是否同步), 逐渐演进到了基于聚类的学习, 对比目标, 可扩展的Transformer架构, 以及通过不断进化的自监督目标将特征结构化分解为共享, 独有和协同语音信息的前沿方法.
- 多模态对比学习, 通过在共享的嵌入空间中拉近同步的音视频对, 推远不匹配的样本来实现模态对齐, 该方向的方法涵盖了跨模态语义转移, 序列对齐策略, 并且研究趋势正逐渐放宽对严格同步的假设, 或为特定下游任务(如事件定位)引入专门的对比目标.
- 视听相关性建模, 它超越了全局向量的简单对齐, 通过在网络架构中引入显式的跨模态交互机制来捕捉更深层次的时间和空间依赖关系, 并且能够容忍一定程度的时间未对齐.
- 面向任务的编码器, 这种方法将特定领域的知识或任务专用的监督信号结合进来, 以提升特定应用场景下的表示学习效果, 典型的例子包括使用掩码预测进行的视听语音单元学习, 以及专门用于情感理解的模态感知掩码自编码技术.
最近的多模态VAE已经探索了从同步的音频和视觉输入中学习联合潜在空间, 通过将潜在变量结构化为共享组件和模态特定组件, 这些模型支持跨模态重建, 同时将模态不变语义与模态特定信息分离.
audio tokenization从侧重提升重建质量与降低词元率的量化编解码器, 以及仅捕捉语言内容而丢失声学细节的自监督语义词元, 逐渐演进到了兼顾两者优势的混合设计框架.
visual tokenization起源于VQ-VAE和VQGAN, 随后不仅在码本的扩展性和模型效率上取得了诸多改进, 还成功延伸到了更复杂的视频词元化处理领域.
近期的研究正致力于构建共享或交错的多模态词元表, 以SpeechGPT, AnyGPT和Moshi等系统为代表, 旨在为跨模态的推理与联合生成提供更高效, 具备语义基础的统一词元层级设计.
以生成为中心的方法支持在单模态(文本到图像, 文本到视频, 文本到音频)和跨模态(音频到视频, 视频到音频, 文本到音视频)的视听任务中进行条件合成和编辑, 其中语义一致性和时间同步是关键要求.
介绍了GAN, Diffusion, 自回归(图片, 音频, 视频转换成离散的Token)和掩码自回归("掩码-预测"解码, 允许对部分Token集合进行并行生成)
将音频和视觉输入转换为大语言模型可以处理的表示形式, 从而利用 LLM 强大的语言理解和生成能力来激发多模态智能
通过轻量级适配器将预训练的单模态编码器连接到 LLM 主干网络上, 使 LLM 能够解释和推理多模态输入. 优势在于灵活性高且所需训练较少, 但缺点是间接的特征投影可能会限制细粒度的跨模态对齐, 并且长视频和连续音频流的高维词元会带来巨大的计算开销.
将遵循指令的 LLM 作为"大脑", 通过提示词/工具编排或可学习的桥接接口, 连接外部现成的图像, 视频或音频生成器. 这种设计解耦了高级推理与特定模态的生成, 能够灵活复用最先进的生成工具, 但级联的流水线结构容易面临接口不匹配, 误差积累以及难以维持多生成器间时间同步的问题.
这里是Token化的方法, 中间的MLLM是基模, 通过控制hand输出不同的模态. 目前仍面临如何稳定地对异构音频(语音/音乐/音效)进行词元化以及如何处理长视频上下文等挑战
将多模态 LLM 视为规划器, 将复杂的用户请求分解为多步动作, 动态选择外部感知和生成工具, 并根据中间结果进行迭代推理和完善
系统不仅接收多模态观察(图像, 音频, 语言指令), 还能直接输出连续的机器人控制信号或离散的导航策略, 从而实现感知-推理-动作的闭环.
- 音频感知与觉感知这两部分是多模态对齐的基础, 音频感知不关注高级语义推理, 而是直接从波形或时频层面提取基础结构, 比如检测声音是否存在, 定位声音的时间边界与节拍, 人声活动检测以及将混合声源分离. 相应的, 视觉感知则关注细粒度的场景理解, 通过为每个像素或区域预测空间级输出, 为多模态系统中的目标, 动作和事件提供空间与时间基座.
- 视听事件定位与关联的目标是在无约束的视频中, 找出那些"既能被看到又能被听到"的事件, 并确定它们发生的具体时间和空间区域. 技术演进上, 经历了从跨模态注意力机制, 自适应特征融合, 到利用预训练音视频编码器的发展. 论文特别强调了当前的一个核心趋势, 该领域正利用语义嵌入和大型预训练表征, 从"闭集(只能识别预先设定的类别)"走向"开放词汇"的定位, 从而能在复杂的开放世界中定位未知事件.
- 视听分割, 相比于定位, 分割的要求更精细. 它要求模型在像素级别上, 精确勾勒出正在发声物体的视觉轮廓, 同时必须能自动忽略那些画面中保持安静的物体或画外音. 其技术方法从早期的弱监督特征融合, 进化到了基于 Transformer 的目标查询机制. 当前最大的发展趋势是日益依赖大型基础模型, 研究重心也从像素级融合转向了"基于音频引导的提示与推理"
- 视听时间同步专门研究视频中的声音流和视觉流在时间轴上是否对齐, 如果未对齐, 还需要估计出它们的时间偏移量. 早期的同步研究主要局限于"对口型", 严重依赖人脸嘴部运动与语音的强相关性. 论文指出的最新趋势是, 时间同步正超越单纯的唇部特征, 转向构建规模化, 基于感知约束的"通用跨模态时间对应关系", 以应对现实世界中更广泛的未对齐场景.
中断
烦死了这八股我读不下去了, 我将按照我的节奏提取关键信息.
通过前面的阅读我了解了音视频联合生成任务的分类是理解, 生成和交互. 理解不看, 生成这部分目前有三条路径, 模态间各生成各的, 给一种模态生成另一种模态, 联合生成. 我当前选择联合生成, 然后音频和视频一定是连续的, 那么我们的范围又缩小了.
接下来我们来看看究竟是要做生成还是交互, 对于交互我还不是很熟悉, 虽然前面描述了两种场景, 但是它们怎么实现完全没有头绪. 定位到生成章节的查看信息.
给一段无声视频配上合理且完全同步的原声, 如环境音, 拟音/Foley, 语音或音乐.
早期的V2A主要只能做一些短促的碰撞音效如打鼓, 敲击, 而现在的期望已经变成了处理"开放领域的复杂事件, 支持用户干预控制, 并且能为长视频配音".
- 对齐优先, 重点解决声音和画面卡不上点的问题; 2) 联合训练和可控V2A系统, 重点解决"如何听用户指挥"; 3) 推理引导, 开放世界, 重点解决"复杂场景先想后做".
声音生成需要规划, 这是论文特别强调的一个发展趋势, 最先进的 V2A 系统不再是简单地把视频特征"端到端"映射成声音, 而是先构建一个关于"事件, 声源和时间发生节点"的高层假设.
核心任务是根据声音, 语音或音乐来合成动态的视频画面. 论文指出 A2V 面临着一个更大的难题——高度的模糊性. 因为在现实世界中, "一因多果"太常见了, 同一段音乐, 可以配无数种合理的舞蹈动作, 同一段旁白, 可以搭配无数种不同的画面. 因此模型不仅要保证视频真实, 还必须在"听从指令", "动作卡点"和"用户可控性"之间寻找平衡.
技术路线上 1) 端到端的, 直接把audio注入; 2) pipeline, 先预测3D骨骼轨迹, 再生成视频; 3) 用参考图来锚定长相, 简化成了嘴唇对齐或是怎样的任务.
音频无法完全限定视频是一个开放问题, 尽管现在的系统通过加入参考图, 运动先验或显式控制信号来降低模糊性, 但仍然没有完美解决"生成结果的多样性"与"用户的精确可控性"之间的权衡.
给定一张静态的参考图像和一段驱动音频, 合成一段动态视频, 并要求在整个过程中保持图像身份的一致性与高度的时间连贯性
AI2V从Talking Head演变为支持"音频+图像+文本"联合生成的通用框架, 其中文本提示被作为强有力的辅助控制信号, 用来指定人物的运动轨迹, 情绪变化或场景的具体行为.
以人为中心就不讲了, 在通用领域他们让任意非人物体或场景随着声音动起来, 虽然该领域规模小, 但是大型商业基础模型, 已经原生支持并融合了这种通用的声音图生视频能力.
该任务要求模型仅凭一段文本提示, 同时生成高质量, 忠于文本描述且跨模态绝对同步的视频与音频
模型架构正从早期部分分离, 仅靠特定同步模块如交叉注意力维系的"双分支"设计, 走向更深度的统一建模, 如采用共享注意力块或完全对齐的位置编码. 同时, 研究前沿正在广泛引入多任务融合以及人类偏好对齐等后训练技术来提升质量
该任务要求将单张静态图片转化为带有声音的动态视频
由于必须严格锚定参考图的外观, 它比纯文本生成面临着更严苛的空间与动作推理约束. 方法上, 业界经历了从早期的"级联管线", 例如先利用图生视频模型动起来, 再用视频生成音频模型配音的妥协方案, 发展到了如今被完全集成在单一框架中的联合感知与生成, 这一原生能力已经被广泛应用于当前最前沿的商业基础大模型
该任务旨在对现有的视频和声音同时执行修改操作, 并保证修改后两者的同步状态与语义维持一致.
技术发展从早期的基于指令和零样本的全局风格或内容转换, 深入到了极细粒度的控制阶段. 现代系统已经能够实现对象级别的添加, 替换和完全消除, 基于空间遮罩的联合视听修复, 以及针对配音场景的语音与面部动作同步协同编辑.
要求具身智能体联合使用"看到的"视觉画面和"听到的"声音线索, 在空间中移动并寻找到发声的目标. 典型任务分成根据声音寻找目标与根据声音和线索寻找目标.
方法演进是端到端与记忆增强到语义推理, 后面根据语言增强导航. 这个路径感觉就是发现端到端不可靠, 再寻求解耦和加语言条件.
再往后的两个太"具身"了, 暂时不看
AIGC创意生产, 以人为本的智能服务(数字人, 教育, 元宇宙), 具身.
- 因果事件-声源grounding. 建模延迟, 遮挡, 画外音, 多源混合下的源级, 事件级与因果对齐, 把音画同步推向因果可解释层面
- AV世界模型. 把音视频当作几何, 材质, 动力学, 可供性的互补证据, 并以空间音频推理作为关键能力
- 长程AV上下文记忆. 构建流式 / 情景 / 语义多层, 可选择, 可溯源的 AV 记忆, 而不是简单加长上下文
- 因果AV干预与可控生成. 让生成与编辑支持对物体, 声音, 身份, 情绪, 空间, 时间的局部, 因果且同步的干预
- Verifier与Reward生态. 超越 FAD / FVD / CLIP / SyncNet 这类代理指标, 发展面向 grounding, 物理合理性, 音频不可替代性与任务效用的验证器.
- 交互式与负责任AVI. 在低延迟, 隐私, 版权, 水印与数据合规等安全治理约束下, 把AV模型变成可信赖的实时合作者
感受
这篇读得很快, 因为他太"平"了, 特别是我刚读完WAM的综述, 对比很明显, 它就是把路径平铺直叙出来, 我看不到重点, 他也没有关心哪里大家很好理解, 哪里我一句话代过就行(那么老的论文还拿出来重点讲), 任务分类看似合理实际混乱, 比如ChoreoMuse它分到了Identity-conditioned generation, 但是Talking Head分到了IA2V, 让我觉得作者对这些细分领域并不了解, 就是AI在帮你做, 没有人类的有效的监督. 每段叙述都配了AI图, 这个好评.