SPGISpeech数据集概述 | AI生成和翻译

首页 2026.07

它是什么

SPGISpeech 是一个包含 5,000 小时专业转录金融音频的语料库,内容为上市公司财报电话会议,由 Kensho Technologies(S&P Global 子公司)发布,相关论文为 SPGISpeech 论文(O’Neill 等人,2021)。它是 ASR 领域标准的“正式商务语音”基准——是 Hugging Face ESB(端到端语音基准) 中 8 个数据集之一,并出现在 hf-audio/open_asr_leaderboard 上,因此你读到的任何 Whisper/Conformer/wav2vec2 论文很可能都会报告其 WER。

为什么它对 ASR 训练有意义

注意事项

  1. 受限数据集。 你必须在 HF 页面上接受 Kensho 的使用条款,load_dataset 才能正常工作——这不是简单的点击同意,而是一份限制重新分发和重新识别的法律协议。接受后,通过标准 HF 认证(huggingface-cli loginHF_TOKEN 环境变量)即可解锁下载。
  2. 大小。 总计 781 GB,但有三种训练配置,你无需全部下载:
子集 大小
S 22GB
M 107GB
L 530GB(M 的超集,而 M 是 S 的超集)
dev 11GB
test 11GB

最小使用示例

from datasets import load_dataset

# 使用 S 配置进行快速迭代/微调实验
spgi = load_dataset("kensho/spgispeech", "S")

sample = spgi["train"][0]
audio_array = sample["audio"]["array"]     # np.float32,16kHz 单声道
sampling_rate = sample["audio"]["sampling_rate"]
transcript = sample["transcript"]

# 仅加载 dev/test,不拉取任何训练集
spgi_test = load_dataset("kensho/spgispeech", "test")

鉴于你从零开始训练 GPT-2/MoE 的工作,如果你希望在不规则文本 ASR 上微调或评估 Whisper/Conformer 风格的编码器-解码器模型,这个数据集是一个不错的选择——标点符号和大小写的要求使得任务比纯音素转录更困难,更接近生产级听写或会议转录产品的需求。

参考资料:


AI生成和翻译,但整理分享仍需精力。如果觉得有帮助,欢迎 捐助支持。 微信:@lzwjavaWeChat QR · X: @lzwjava · 打个招呼 👋

返回 捐助