复旦发布以人为中心的复杂场景音视频追踪基准

音视频追踪技术要求模型同时结合音频与视觉信息,定位并持续追踪场景中正在发声的人员,过去几年音视频分割(AVS)、音视频实例分割(AVIS)任务虽取得显著进展,但针对动态、拥挤、不连续的复杂人类中心场景,现有模型的音频-视觉对应能力与长期身份关联能力仍未得到充分验证。

复旦大学CVL实验室推出复杂场景音视频追踪专用基准

为解决上述行业痛点,复旦大学计算机视觉与学习(CVL)实验室正式提出AVTrack基准,这也是目前首个专门面向复杂人类中心场景的音视频追踪评测基准,所有配套资源现已向研究社区开放。

AVTrack重新定义音视频追踪任务边界

不同于常规“找到说话的人”的单一目标,AVTrack要求模型完成三层核心任务:首先从音频中识别当前活跃的说话者,其次在每一帧中生成对应人物的像素级分割掩码精准定位位置,最后在人物遮挡、镜头切换、位置互换等复杂情况下维持跨帧的身份一致性。该基准作为独立纯测试集,共包含871段视频,平均时长54秒,覆盖剧集、vlog、动画、真人秀、访谈、舞台表演六大内容来源,累计提供3120条带跨帧身份的像素级实例轨迹,可用于测试模型在陌生复杂场景中的迁移能力。

8类可诊断挑战覆盖真实场景核心痛点

为系统拆解复杂场景下的追踪难点,AVTrack专门标注了8类可诊断挑战属性,全面压测模型极限能力:

  1. 视觉遮挡:发声者被其他人物或物体部分遮挡,造成实例重叠与视觉边界模糊,该属性覆盖AVTrack 80.9%的样本,远高于现有AVISeg数据集的8.6%;
  2. 相对位置变化:多个发声者的相对空间关系随时间改变,要求模型摆脱静态位置依赖维持身份识别,该属性占比70.7%,AVISeg中仅为9.7%;
  3. 背景切换:场景环境快速变化干扰人物识别;
  4. 相机运动变化:镜头移动、抖动带来的视觉特征波动;
  5. 多实例:同一场景中存在多个待追踪的说话人;
  6. 多轮发声:人员交替发言带来的身份切换需求;
  7. 音视频不一致:出现画外音、预录音频等音画不同步情况;
  8. 实例尺度动态变化:人物因距离、镜头远近出现大小波动。

针对性推理方案提升复杂场景追踪表现

针对AVTrack的各类挑战,研究团队同步提出了HyPeR优化方案,通过在模型中引入PAUSE token,在声学模糊阶段促进隐式推理计算,同时设计了包含感知一致性奖励的奖励函数,确保推理结果与原始音频特征保持一致。实验证明,HyPeR相比基座模型取得了显著的绝对性能提升,验证了显式思维链推理结合感知型隐式推理方法,在噪声环境与多说话人复杂音频场景中的有效性。