复杂场景下多模态情感识别
数据处理与时序特征构建
CMU-MOSEI 100 条原始视频 · 质量诊断 · 文本-音频一致性检测 · ASR 局部定位 + MFA 精对齐 · OpenFace68 视觉特征
典型样本
视频文件未随页面部署
请将
assets/videos/ 与 index.html 一同部署
文本时间戳对齐 · MFA 词级区间(点击词跳转播放)
0.00 s
Dataset Quality
数据质量与安全路由
复杂场景下先诊断质量、再决定是否对齐:保守优先,宁可少对齐,不做错误文本-音频强制对齐。人工 100 条核验仅用于评估。
人工 QA 类别分布
100 条人工核验(人工核验100条.xlsx)· 与自动 QA 精确一致率 90%
安全路由 · 零危险放行
仅 HIGH_CONFIDENCE_MATCH 允许进入 MFA 对齐
0 危险假阳性
unsafe false positive = 0
Correspondence QA
HIGH_CONFIDENCE_MATCH 路由在人工 100 条上的指标
时序对齐精度 · 人工逐词边界(68 词)
check5.xlsx 人工逐词参考边界 vs 真实 MFA · 微平均口径
对齐置信度
MFA–ASR 边界分歧分级(不确定性,不是精度)
视觉 QA
100 条场景探针(人工 face_present 对照)
场景状态:正常人脸 82 · 非人脸动态 13 · 混合/待定 5
Multimodal Features
三模态特征与对齐
文本 768 维 BERT 词级表示、音频 69 维帧级声学(词级 mean/std = 136+2)、视觉 OpenFace68 四块独立保留——不拼接不可解释向量。
音频特征 · 声学时频图
典型样本 log-Mel 帧级特征(64 mel → 24 带聚合)+ 波形包络,播放头实时同步
低能量
高能量
视觉特征 · OpenFace68
真实 OpenFace 2.2.0 · 眼中心平移 + 眼距尺度归一化
Action Units · 词级均值
典型样本 AU 强度(35 维 · 仅成功帧平均)
Pipeline
处理流程
Video Inspector
逐样本检视 · 关键点 / 对齐 / 声学 / 异常说明
100 条样本逐条检视:每条视频保留可用模态的完整线索;文本-音频不一致、无脸、非英语等特殊情况在视频左侧说明处理方式。可用左右按钮(或滑动)切换样本,全量表点击任意行直达。
—
视频文件未随页面部署
请部署
assets/videos/ 目录
文本时间戳对齐
词级区间时间轴(点击跳转播放)· 蓝色 = 已对齐,灰色 = 掩码 0(未对齐,不伪造时间)
MFA 已对齐词
无对齐(掩码 0)
人工参考边界
ASR 词区间
样本概要
音频波形与声学特征
真实 16 kHz 单声道 · 播放头同步
All 100 Samples
附件1 全量样本一览
100 条官方样本的标注、自动质量诊断与特征包状态。点击任意行可跳转到逐样本检视。
| 样本 ID | 标注 | 强度 | 时长 | 语音 | 语言 | 人脸率 | QA 状态 | 路由 | 对齐词数 | 转写文本 | 特征包 |
|---|