工具说明
采样率表示每秒记录多少个声音采样,常见值包括语音场景的 8、16、22.05 kHz,以及音乐和视频的 44.1、48 kHz。重采样把已有波形映射到新的采样网格,用于满足接口、设备或编辑项目的固定要求。
提高采样率不会增加源文件中不存在的高频细节,只会生成更多样本;降低采样率则需要滤除超过新奈奎斯特频率的内容,否则会产生混叠。选择应以目标系统规范为准。
使用步骤
检查源与目标要求
读取当前采样率,并确认语音模型、视频工程或设备需要的数值。
选择目标采样率
避免无目的地提高,降低时注意是否会损失所需高频。
转换并验证
试听清晰度并在接收软件中确认文件参数。
支持范围与限制
- 常见目标值
- 8 kHz(电话语音)、16 kHz(语音识别)、44.1 kHz(CD)、48 kHz(视频标准)
- 降采样
- 会丢掉高于新采样率一半的频率成分(奈奎斯特极限),不可逆
- 升采样
- 不增加信息量,只是按插值生成更多采样点,通常只为满足下游格式要求
- 输出
- MP3。MP3 只支持有限的采样率集合,超出时会落到最接近的一档
- 典型用途
- 把素材对齐到语音识别模型或视频工程要求的采样率
- 处理位置
- 浏览器内的 FFmpeg WebAssembly,音频文件不上传
典型使用场景
适配语音识别
把录音统一为模型要求的 16 kHz 等输入规格。
匹配视频工程
将音频转换为常见 48 kHz,减少时间线自动重采样。
为语音识别准备输入
多数语音模型在 16 kHz 单声道上训练,把素材重采样到这个规格能减少不必要的计算,识别结果也更稳定。
使用前需要知道的事
- 采样率与比特率不是同一参数,前者描述采样频率,后者描述每秒编码数据量。
- 上采样不会提升真实音质,下采样会限制可表示的最高频率。
- 多次重采样可能累积滤波误差,最好从原始文件一次转换。
相关概念
- Nyquist frequency
- 理论上可表示的最高频率,约为采样率的一半。
- resampling
- 把一组离散音频采样转换到另一采样频率的过程。