音频理解与生成模型 Benchmark 与训练数据集中文教程
本教程聚焦两件事:
1) 训练数据集怎么选、怎么用、怎么做数据工程;
2) Benchmark 怎么跑、怎么对齐协议、怎么公平比较“音频理解/音频生成”模型。
覆盖(但不限于)如下数据集/基准:AVSpeech、AISHELL、seed-tts-eval、CochlScene、ClothoAQA、NonSpeech7k、MMAU、TUT2017、MELD、OpenAudioBench、VocalSound,并补充常用的 AudioSet、ESC-50、UrbanSound8K、FSD50K、VGGSound、Clotho、AudioCaps、LibriSpeech、Common Voice、VoxCeleb、LibriTTS、VCTK、IEMOCAP 等。
如何使用本教程
- 如果你要 快速建立评测管线:优先读 第 7 章(理解 Benchmark) + 第 8 章(生成/TTS 评测) + 第 2 章(方法论)。
- 如果你要 做训练数据与配方(recipe):优先读 第 3–6 章(按任务的数据集) + 第 9 章(训练策略)。
- 如果你要 做自己的数据集/Benchmark:优先读 第 10 章(构建与发布) + 第 2 章(合规与质量)。
章节目录
文件组织:
index.md+chapter1.md+chapter2.md+ ...
第 1 章:全景导论——音频理解 vs 音频生成(chapter1.md)
- 1.1 音频任务谱系:识别、检索、理解、对话、生成
- 1.2 数据集与 Benchmark 的关系:训练集/验证集/测试集/评测集
- 1.3 音频理解模型形态:编码器、检索增强、音频-文本对齐、音频指令微调
- 1.4 音频生成模型形态:TTS、SFX/环境音生成、音乐生成、编解码器与扩散
- 1.5 评测基本原则:可复现、可比性、协议一致、数据泄漏风险
- 1.6 本教程的“数据卡/基准卡”模板与阅读方式
- 1.7 贯穿案例:从数据集选择到 leaderboard 报告
第 2 章:通用方法论——数据集与评测的工程化(chapter2.md)
- 2.1 数据集元信息:采样率/声道/时长/语言/场景/标注粒度
- 2.2 标注类型与任务映射:类别、时间戳、文本、对话轮次、问答对
- 2.3 许可与合规:数据使用边界、隐私与敏感信息、二次分发注意事项
- 2.4 数据质量:噪声、错标、长尾、说话人/场景偏置、重复与近重复
- 2.5 划分与协议:官方划分、交叉验证、域外测试(OOD)
- 2.6 预处理与特征:波形、梅尔谱、log-mel、分段/VAD、响度归一化
- 2.7 评测封装:统一 I/O、可插拔 metrics、版本锁定与实验记录
第 3 章:语音类训练数据集(ASR/说话人/视听语音)(chapter3.md)
- 3.1 中文 ASR:AISHELL(及同类中文语音语料的选型要点)
- 3.2 多语/大规模 ASR:LibriSpeech、Common Voice、(其他常见公开语料)
- 3.3 视听语音与跨模态:AVSpeech(以及视听对齐常见坑)
- 3.4 说话人任务:VoxCeleb(验证/识别/聚类的协议差异)
- 3.5 语音增强/分离:常见混合数据构造与客观指标(SI-SDR 等)
- 3.6 语音数据工程:切分、转写对齐、噪声混合、数据增强与抽样策略
- 3.7 实战小结:从 ASR 训练集到统一评测集的闭环
第 4 章:非语音与环境音数据集(声事件/声学场景/音乐与人声)(chapter4.md)
- 4.1 声事件分类:AudioSet、ESC-50、UrbanSound8K、FSD50K、NonSpeech7k
- 4.2 声学场景分类:TUT2017、(同类场景数据集的协议与特征)
- 4.3 听觉/场景感知扩展:CochlScene(及“场景+听觉表征”的建模思路)
- 4.4 大规模公开视频音频:VGGSound(噪声标注与鲁棒训练)
- 4.5 人声/发声与音乐相关:VocalSound、NSynth、MusicNet(任务如何定义)
- 4.6 时序标注与检测:事件检测(SED)的标注与评测(precision/recall/mAP)
- 4.7 实战小结:从标签噪声到“可用”的训练子集构建
第 5 章:音频描述与音频问答(Captioning / AQA / 指令数据)(chapter5.md)
- 5.1 音频字幕:Clotho、AudioCaps(生成指标与人评的差异)
- 5.2 音频问答:ClothoAQA(题型、答案空间、评测口径)
- 5.3 音频-文本对齐数据:对比学习、检索式训练与负样本策略
- 5.4 指令微调数据:任务混合、格式规范、拒答与安全边界
- 5.5 指标与判分:BLEU/CIDEr/SPICE、LLM-as-a-judge 的注意事项
- 5.6 实战小结:把 AQA/Caption 做成“可复现 benchmark”
第 6 章:情感、对话与社会信号(SER / 多模态对话)(chapter6.md)
- 6.1 多模态对话情感:MELD(音频通道如何使用与常见泄漏)
- 6.2 经典情感语音:IEMOCAP、CREMA-D(标签体系与评测差异)
- 6.3 对话结构建模:轮次、说话人信息、上下文窗口与融合策略
- 6.4 指标与报告:Macro-F1、WA/UA、混淆矩阵与类不平衡
- 6.5 公平性与偏差:口音/性别/年龄/语速对情感模型的影响
- 6.6 实战小结:做一个“可解释”的情感/对话评测报告
第 7 章:音频理解 Benchmark 实操(chapter7.md)
- 7.1 Benchmark 设计要素:任务集合、输入输出规范、难度分层、可扩展性
- 7.2 多任务理解基准:MMAU(任务覆盖、协议、常见实现坑)
- 7.3 通用评测平台:OpenAudioBench(样例组织、打分与可视化)
- 7.4 其他代表性基准:HEAR、AudioBench(如何对齐到你的模型接口)
- 7.5 统一推理格式:prompt 模板、音频分段策略、上下文长度与采样率
- 7.6 误差分析:按类别/时长/SNR/场景分桶,定位模型短板
- 7.7 结果呈现:leaderboard 表格规范、置信区间与显著性检验
第 8 章:音频生成与 TTS Benchmark / 评测集(chapter8.md)
- 8.1 生成任务拆解:TTS、语音转换、音效生成、音乐生成
- 8.2 训练数据:LibriTTS、VCTK、(中文 TTS 常见语料)与数据清洗要点
- 8.3 主观评测:MOS / MUSHRA / ABX 的设计、人数与统计
- 8.4 生成评测集:seed-tts-eval(如何跑通、如何报告结果)
- 8.5 客观指标:WER/Intelligibility、speaker similarity、FAD/CLAPScore 的适用边界
- 8.6 安全与版权:可逆复刻风险、合成语音滥用防护、数据来源审计
- 8.7 实战小结:从“能生成”到“可比较”的完整评测闭环
第 9 章:训练策略与配方(从预训练到对齐)(chapter9.md)
- 9.1 预训练范式:自监督(SSL)、弱监督、跨模态对齐
- 9.2 数据混合:语音+环境音+音乐+问答/字幕,多任务采样策略
- 9.3 指令微调:格式规范、难度课程学习、拒答策略与安全对齐
- 9.4 生成模型训练:codec/diffusion 的数据要求、稳定训练技巧
- 9.5 评测驱动迭代:以 benchmark 为回归测试的训练流程
- 9.6 复现与版本:随机种子、依赖锁定、数据版本与数据卡更新
- 9.7 实战小结:给出一个“可落地”的训练与评测 checklist
第 10 章:构建你自己的数据集与 Benchmark(chapter10.md)
- 10.1 需求定义:任务边界、目标用户、成功标准
- 10.2 数据获取:采集/爬取/授权、隐私脱敏、敏感内容过滤
- 10.3 标注体系:标签层级、问答规范、字幕风格指南与一致性度量
- 10.4 质量控制:抽检、互标、仲裁、噪声建模与清洗流水线
- 10.5 协议与防泄漏:训练/测试隔离、近重复检测、对抗样本与污染防护
- 10.6 发布与维护:数据卡/基准卡、版本策略、基线模型与复现脚本
- 10.7 实战小结:从 0 到 1 发布一个可用 benchmark
第 11 章:附录——速查表、模板与资源(chapter11.md)
- 11.1 数据集/基准速查表(按任务、模态、规模、标注类型整理)
- 11.2 指标速查表(理解/生成/检索/检测/字幕/AQA)
- 11.3 数据卡(Dataset Card)模板(可直接复制)
- 11.4 基准卡(Benchmark Card)模板(可直接复制)
- 11.5 统一 I/O 与评测脚手架建议(目录结构与命名规范)
- 11.6 报告模板:leaderboard、误差分析、消融实验记录表
术语对照(本教程默认约定)
- 训练数据集:用于训练/微调模型的数据(可能包含验证集)。
- 评测集 / Benchmark:用于对模型进行对比评估的固定协议与测试数据(强调可比性)。
- 理解(Understanding):分类、检索、问答、字幕、推理等“读懂音频”的任务。
- 生成(Generation):TTS、音效生成、音乐生成等“产出音频”的任务。
贡献与扩展
欢迎在后续章节中持续补充更多数据集/基准(例如 DCASE 系列任务、空间音频/定位数据集、更多音频-文本指令集合等),并将其整理为统一的“数据卡/基准卡”。