复杂场景下多模态情感识别
数据处理与时序特征构建

CMU-MOSEI 100 条原始视频 · 质量诊断 · 文本-音频一致性检测 · ASR 局部定位 + MFA 精对齐 · OpenFace68 视觉特征

典型样本
视频文件未随页面部署 请将 assets/videos/ 与 index.html 一同部署
文本时间戳对齐 · MFA 词级区间(点击词跳转播放) 0.00 s
Dataset Quality

数据质量与安全路由

复杂场景下先诊断质量、再决定是否对齐:保守优先,宁可少对齐,不做错误文本-音频强制对齐。人工 100 条核验仅用于评估。

人工 QA 类别分布

100 条人工核验(人工核验100条.xlsx)· 与自动 QA 精确一致率 90%

安全路由 · 零危险放行

仅 HIGH_CONFIDENCE_MATCH 允许进入 MFA 对齐
0 危险假阳性
unsafe false positive = 0

Correspondence QA

HIGH_CONFIDENCE_MATCH 路由在人工 100 条上的指标

时序对齐精度 · 人工逐词边界(68 词)

check5.xlsx 人工逐词参考边界 vs 真实 MFA · 微平均口径

对齐置信度

MFA–ASR 边界分歧分级(不确定性,不是精度)

视觉 QA

100 条场景探针(人工 face_present 对照)
场景状态:正常人脸 82 · 非人脸动态 13 · 混合/待定 5
Multimodal Features

三模态特征与对齐

文本 768 维 BERT 词级表示、音频 69 维帧级声学(词级 mean/std = 136+2)、视觉 OpenFace68 四块独立保留——不拼接不可解释向量。

音频特征 · 声学时频图

典型样本 log-Mel 帧级特征(64 mel → 24 带聚合)+ 波形包络,播放头实时同步
低能量 高能量

视觉特征 · OpenFace68

真实 OpenFace 2.2.0 · 眼中心平移 + 眼距尺度归一化

Action Units · 词级均值

典型样本 AU 强度(35 维 · 仅成功帧平均)
Pipeline

处理流程

Video Inspector

逐样本检视 · 关键点 / 对齐 / 声学 / 异常说明

100 条样本逐条检视:每条视频保留可用模态的完整线索;文本-音频不一致、无脸、非英语等特殊情况在视频左侧说明处理方式。可用左右按钮(或滑动)切换样本,全量表点击任意行直达。

—
视频文件未随页面部署 请部署 assets/videos/ 目录

文本时间戳对齐

词级区间时间轴(点击跳转播放)· 蓝色 = 已对齐,灰色 = 掩码 0(未对齐,不伪造时间)
MFA 已对齐词 无对齐(掩码 0) 人工参考边界 ASR 词区间

样本概要

音频波形与声学特征

真实 16 kHz 单声道 · 播放头同步
All 100 Samples

附件1 全量样本一览

100 条官方样本的标注、自动质量诊断与特征包状态。点击任意行可跳转到逐样本检视。

样本 ID标注强度时长语音语言 人脸率QA 状态路由对齐词数转写文本特征包