DSP音频处理
概念扫盲
1. 延时器 (Delay)
- 一句话定义:将输入信号复制一份,延迟一段时间后再与原信号混合,制造空间感和层次感。
- 核心要点:
- 延迟时间:决定回声的快慢(从几毫秒的镶边效果到几百毫秒的明显回声)。
- 反馈:决定回声重复的次数和衰减速度。
- 混合比:决定原始声与效果声的比例。
- 举例:你在山谷里大喊一声“你好”,几秒后听到“你好…你好…你好…”逐渐消失的回声,这就是最自然的延时效果。
2. 噪声门 (Noise Gate)
- 一句话定义:信号音量低于设定“门槛”时,直接静音或大幅衰减;高于门槛时正常通过。
- 核心要点:
- 门限:触发开关的音量临界点。
- 启动/释放时间:决定门开合的快慢,避免生硬。
- 作用:主要用于消除无声段的底噪、话筒串音。
- 举例:直播时你停止说话,话筒会把空调呼呼声收进去。噪声门设置好后,你一停嘴,背景噪音就被“关在门外”了,直播间瞬间安静。
3. 上行扩展器 (Upward Expander)
- 一句话定义:让声音中较弱的部分变得更响,而较强的部分变化不大,从而提升细节。
- 核心要点:
- 与压缩器相反,它不是压大补小,而是“把小推大”。
- 能让微弱的声音细节(如唇齿音、指尖摩擦琴弦声)变得清晰。
- 使用不当会放大底噪。
- 举例:录制一段轻声耳语,回放时觉得太弱听不清。用上行扩展器后,耳语声被放大到正常音量,但正常说话声没有明显变化,细节就出来了。
4. 下行扩展器 (Downward Expander)
- 一句话定义:让声音中较弱的部分变得更弱,拉开强弱差距,恢复动态对比。
- 核心要点:
- 噪声门是它的极端形式(比率极大)。
- 作用不是消除噪音,而是让“本该弱的声音”更弱,增强冲击感。
- 常用于鼓组,让军鼓的尾音收得更快更干净。
- 举例:打军鼓时,鼓槌敲下去那一下很响(主音),但鼓皮余震较弱。用下行扩展器后,余震声被压得更低,主音就显得更突出、更有力量感。
5. 上行压缩器 (Upward Compressor)
- 一句话定义:让声音中较弱的部分变响,同时保持强音不变,缩小整体动态范围。
- 核心要点:
- 不压强音,只“提升弱音”。
- 使安静段落听起来更接近正常段落,避免听感忽大忽小。
- 常见于“夜间模式”或环境嘈杂时的听力辅助。
- 举例:晚上戴着耳机看电影,爆炸声(强音)震耳,但人物对话(弱音)像蚊子叫。打开“夜间模式”(上行压缩),对话被单独放大,爆炸声不变,就不用反复调音量了。
6. 下行压缩器 (Downward Compressor)(日常简称“压缩器”)
- 一句话定义:让声音中较强的部分变弱,从而让整体音量更平稳。
- 核心要点:
- 核心参数:阈值(多强开始压)、压缩比(压多狠)、启动/释放时间。
- 让演唱更“贴耳”,乐器更融合。
- 是音频处理中最常用的动态工具。
- 举例:歌手唱副歌时突然飙高音,差点把音响震破。压缩器介入,高音一冒头就被“按住”,整体音量就平滑了,听众不会觉得刺耳。
7. 门限限幅器 (Threshold Limiter)
- 一句话定义:设定一个绝对不可逾越的电平“天花板”,信号一旦触及,立即被强硬削平。
- 核心要点:
- 压缩比极高(通常≥10:1),动作极其迅速。
- 主要目的不是美化声音,而是硬性保护后级设备(音箱、功放)。
- “门限”指触发值,“限幅”指动作。
- 举例:舞台调音师在主音箱前加了一台限幅器,设定上限为0dB。无论歌手吼得多用力,信号到0dB就“一刀切”,确保功放和喇叭绝对不会烧毁。
8. 包络限幅器 (Envelope Limiter)
- 一句话定义:不是按瞬间峰值去限制,而是按声音“包络”(音量随时间变化的轮廓)的走势来平滑地限制。
- 核心要点:
- 更“智能”和“音乐化”,不破坏声音的起音和尾音的形态。
- 常用于母带处理,让整体响度提升但不损失动态感。
- 可以理解为“温柔的限幅器”。
- 举例:一段钢琴独奏,强音和弱音跨度极大。包络限幅器不会在最强音出现时生硬地削平它,而是顺着音符自然衰减的“包络曲线”轻轻压一下,让整段钢琴听起来既饱满又自然,不像门限限幅那样有“被拍扁”的感觉。
9. 闪避器 (Ducker)
- 一句话定义:当主信号(A)出现时,自动降低次要信号(B)的音量;主信号消失后,B恢复。
- 核心要点:
- 依赖侧链输入,即用A信号去控制B信号的音量。
- 释放时间决定B恢复的快慢。
- 核心用途是“制造主次空间”。
- 举例:在视频里,你一开始说话(A),背景音乐(B)就自动变小声;你一句话说完,背景音乐又慢慢恢复正常音量。这就是最常见的“人声闪避”效果。
10. 高通滤波器 (High-pass Filter) & 11. 低通滤波器 (Low-pass Filter)
- 一句话定义:高通让高频过、挡低频;低通让低频过、挡高频。两者是频率的“筛选门”。
- 核心要点:
- 高通:切除低频嗡嗡声(如风噪、脚步震动),让声音变干净。
- 低通:切除高频嘶嘶声(如齿音、电路噪音),让声音变温暖。
- 都有一个“截止频率”旋钮,决定从哪里开始切。
- 举例(高通):录制人声时,房间里空调低频轰鸣。打开高通滤波器,旋到80Hz,所有低于80Hz的低频噪音被滤除,人声立刻变得清晰干净。
- 举例(低通):电吉他声音太“炸”、刺耳。打开低通滤波器,旋到8000Hz,刺耳的高频泛音被切掉,声音立刻变得圆润厚实。
ASIO和WDM
| 对比维度 | ASIO | WDM (以DirectSound / WASAPI为例) |
|---|---|---|
| 延迟 (Latency) | 极低,可以做到 2ms - 10ms,人耳几乎无感知。 | 较高,通常 30ms - 200ms,能明显感觉到滞后。 |
| 多任务支持 | 独占模式。一个软件(如Cubase)使用时,其他软件(如浏览器)无法同时发声。 | 共享模式。多个软件可以同时发声(系统会混音),比如你边听歌边看视频。 |
| 采样率/位深 | 固定且精准,完全按工程设置输出,不强制转换。 | 系统统一管理,经常会被Windows强制重采样到同一格式(如48kHz),可能损失音质。 |
| 稳定性 | 极稳定,只要驱动过关,基本不掉链子。 | 容易受系统负载和其他驱动影响,偶尔出现爆音或卡顿。 |
| 硬件要求 | 必须搭配专业声卡(如Focusrite、RME、Audient等),板载声卡通常不支持。 | 任何声卡都支持,包括电脑自带的板载声卡。 |
Dante虚拟声卡 asio
1. Buffer Size(缓冲区大小)
- 一句话定义:电脑CPU一次性处理音频数据包的大小(以采样点数量为单位,如64、128、256、512 samples)。
- 比喻:工厂传送带上的托盘大小。托盘越小(Buffer小),每次运送的原料越少,但运送频率极高(反应快);托盘越大(Buffer大),每次运送原料多,但传送带动起来有惯性(反应慢)。
| 设置 | 效果 | 适合场景 |
|---|---|---|
| 小Buffer(64-128 samples) | 延迟极低,实时响应快,但CPU负载剧增,容易爆音、卡顿。 | 实时演奏(MIDI键盘弹软音源)、录音监听(听湿录干)。 |
| 大Buffer(512-1024 samples及以上) | 延迟明显,但CPU压力小,系统稳定,几乎不会爆音。 | 后期混音(不涉及实时输入)、母线处理、导出音频。 |
操作铁律:录音/演奏时用小Buffer,混音/导出时用大Buffer。
2. ASIO Latency(ASIO延迟)
- 一句话定义:音频信号从“进入声卡”到“经过电脑处理”再到“从声卡输出”所花费的总时间(单位:毫秒 ms)。
- 比喻:工厂传送带从你下单(弹下一个琴键) 到拿到成品(听到声音从耳机发出) 的总耗时。
这个总延迟由两部分组成:
- 输入延迟(Input Latency):话筒/乐器 → 电脑DAW。
- 输出延迟(Output Latency):电脑DAW → 耳机/音箱。
- 往返延迟(Round-Trip Latency,RTL) = 输入延迟 + 输出延迟。这是对人耳感知最关键的数值。
| 延迟数值 | 人耳感知 |
|---|---|
| < 6 ms | 几乎感觉不到,顶尖专业声卡水平。 |
| 6 - 10 ms | 优秀,大多数音乐人可以接受。 |
| 10 - 20 ms | 可察觉,但尚可接受(尤其对键盘手)。 |
| > 20 ms | 明显滞后,会影响演奏和录音节奏。 |
为什么Buffer Size和ASIO Latency是“绑定”的?
Buffer Size越小,ASIO Latency越低;Buffer Size越大,ASIO Latency越高。 但ASIO Latency还受采样率影响(采样率越高,相同Buffer下延迟越低)。
3. Encoding(编码/位深)
- 一句话定义:音频信号在数字化时,用多少“bit”(比特)来记录每一个采样点的动态范围(音量精细度)。
- 比喻:工厂里测量原料重量的量尺精度。
| 位深 | 动态范围 | 特点 | 典型场景 |
|---|---|---|---|
| 16-bit | 约 96 dB | CD音质标准,文件较小,但处理余地有限。 | 最终导出成品(CD、MP3、流媒体)。 |
| 24-bit | 约 144 dB | 录音/混音首选。动态余量巨大,允许录音时留出很大空间(-18dBFS左右),后期拉升音量也不会产生明显底噪。 | 所有专业录音、DAW内部处理。 |
| 32-bit float | 约 1528 dB | 理论上无削波风险(可记录超过0dB的信号),文件体积巨大,主要在高阶录音机或特殊插件中使用。 | 特殊高动态场景(如野外录音)、科学计算。 |
注意:Encoding通常指采样位深,与采样率(44.1kHz、48kHz、96kHz)是两个独立参数。采样率决定“频率范围上限”,位深决定“音量精细度”。
三者关系总览表
| 参数 | 单位 | 控制什么 | 调小后效果 | 调大后效果 |
|---|---|---|---|---|
| Buffer Size | samples(采样点) | CPU一次处理的包大小 | 延迟降低,CPU压力增大 | 延迟升高,CPU压力减小 |
| ASIO Latency | ms(毫秒) | 信号往返总耗时 | 实时反应更快,但系统易爆音 | 实时反应更慢,但系统更稳定 |
| Encoding | bit(比特) | 音量记录的精细度 | 动态范围小,文件小 | 动态范围大,文件大 |
实战场景:你的参数该怎么调?
| 你正在做的事 | Buffer Size | Encoding | 原因 |
|---|---|---|---|
| 用电容麦录人声,需要实时听效果 | 64 - 128 samples | 24-bit | 保证低延迟不抢拍,保留最大后期空间。 |
| 用MIDI键盘弹奏管弦乐音源 | 128 - 256 samples | 24-bit | 键盘手感要求响应迅速,256以下可接受。 |
| 混音、调EQ/压缩、做母带 | 512 - 1024 samples | 24-bit 或 32-bit float | 不录音,不担心延迟,优先保证稳定不爆音。 |
| 最终导出MP3给客户 | 不关键(不影响音质) | 16-bit | 导出的最终成品用16-bit即可。 |
All articles in this blog are licensed under CC BY-NC-SA 4.0 unless stating additionally.
Comment
