贡献你的语音
你可以帮助我们和更广泛的开放语音社区为你的语言开发speech-to-text和text-to-speech模型。
语音转文字
当你向计算机说话时,它会将来自你声音的音频转录(transcribes)为文本。实现方式有很多种,但它们都依赖于人们说话的录音。
对于 speech-to-text,重要的是要具备:
- 许多不同的说话者和口音
- 各种录音设备和质量水平
- 通常是 16Khz 音频,16 位采样
- 多种录音环境,包括不同的房间和噪音水平
我们建议用户为 Mozilla's Common Voice 项目做贡献,以用于 speech-to-text。这是一个免费且开放的数据集,通过众包方式从世界各地的人们那里收集口语句子。贡献者还可以通过验证现有录音来提供帮助。
文字转语音
当计算机向你说话时,它会从文本合成(synthesizes)音频。这与 speech-to-text 数据集有不同的要求:
- 单个说话者,或为所有说话者提供等量的数据
- 高质量的录音设备
- 通常是 48Khz,32 位采样
- 安静、受控的录音环境,例如隔音棚
我们建议用户为 LibriVox 项目做贡献,以用于 text-to-speech。这不仅为开放语音社区提供了训练数据,还为所有人提供了免费的有声书。重要的是,所朗读的书籍必须处于公共领域。

