? 心理声学
心理声学深度解析:Fletcher-Munson/ISO 226等响曲线(人耳3-4kHz最敏感)、临界频带/Bark尺度、听觉掩蔽(同时/时序)、双耳听觉ITD/ILD、HRTF头相关传输函数、鸡尾酒会效应、Haas效应优先效应、McGurk效应。
? 心理声学
心理声学(Psychoacoustics)是研究听觉感知的科学——它解释了我们的大脑如何处理和解释声音信号。物理声学告诉我们声音是什么,心理声学告诉我们我们听到的是什么。两者之间的差异决定了音响系统设计、音频编解码算法和混音技术的一切核心原则。
1. 等响曲线(Fletcher-Munson / ISO 226)
人耳对不同频率的敏感度不是均匀的。早在 1933 年,Fletcher 和 Munson 通过实验绘制了最早的等响曲线(Equal-Loudness Contours),后经多次修订形成目前的 ISO 226:2003 标准。
核心发现:
- 人耳对3–4 kHz 频率最敏感——这是人类语音中辅音(如 s、f、t)的关键频段,也是耳道共振频率区域。
- 低频( 8 kHz)需要更高的声压级才能被感知到相同响度。
- 在低声压级(如 20–40 phon)时,低频衰减非常明显——这也是为什么小音量听音乐感觉"低音不够"的原因。
- 在高声压级(如 90 phon 以上)时,曲线趋于平坦——人耳对低频的敏感度相对提升。
工程含义:
- 等响度控制(Loudness Contour):很多功放和播放器提供"等响度"功能,在小音量时提升低频(和高频),补偿人耳的敏感度差异。
- 混音参考:专业混音师会在多个声压级检查混音——在大音量下平衡的混音在小音量下可能感觉低频不足。
- dBA 加权的基础:dBA 加权曲线正是基于 40 phon 等响曲线设计的(参见分贝精讲 - dBA/dBC 加权)。
2. 临界频带与 Bark 尺度
人耳基底膜(Basilar Membrane)的频率分辨能力是有限的。临界频带(Critical Band)理论认为,人耳的听觉滤波器将频率范围划分为大约 24 个临界频带,每个频带内的声音会被整体处理。
Bark 尺度:由 Eberhard Zwicker 提出的心理声学频率标度,1 Bark ≈ 一个临界频带的宽度。
| Bark | 频率范围 (Hz) | 带宽 (Hz) |
|---|---|---|
| 1 | 20–100 | 80 |
| 2 | 100–200 | 100 |
| 3 | 200–300 | 100 |
| 4 | 300–400 | 100 |
| 5 | 400–510 | 110 |
| 6 | 510–630 | 120 |
| 7 | 630–770 | 140 |
| 8 | 770–920 | 150 |
| 9 | 920–1,080 | 160 |
| 10 | 1,080–1,270 | 190 |
| … | (低频带宽窄、高频带宽宽,共 24 Bark) | |
| 24 | 15,000–20,000 | 5,000 |
工程含义:
- 感知音频编码:MP3、AAC 等有损音频编码利用了临界频带内的听觉掩蔽效应,丢弃人耳无法察觉的信息(详见下一节)。
- 均衡器设计:参数均衡器的 Q 值设计应参考临界频带宽度,过于精细的 EQ 调整(窄于临界频带)可能是浪费。
- 声学测量:房间模式分析通常按 1/3 倍频程(约等于 Bark 尺度的精度)进行。
3. 听觉掩蔽
当一个声音的存在使得另一个声音变得不可听时,称为掩蔽(Masking)。这是心理声学中最重要的现象之一,是现代音频编码的核心理论基础。
同时掩蔽(Simultaneous Masking)
两个声音同时出现时的掩蔽效应。规律:
- 低频掩蔽高频(向上掩蔽)比高频掩蔽低频(向下掩蔽)更有效。
- 掩蔽效果在掩蔽声频率附近最强,随频率差距增大而减弱。
- 掩蔽声的声压级越高,掩蔽范围越宽。
时序掩蔽(Temporal Masking)
- 前向掩蔽(Forward Masking):强声音结束后,人耳对紧随其后的弱声音的感知能力下降,持续约 50–200 ms。
- 反向掩蔽(Backward Masking):强声音出现前很短时间内的弱声音被掩蔽——这暗示大脑处理声音存在"时间窗口"。
工程含义:MP3 和 AAC 编码器利用心理声学模型分析信号,将量化噪声"藏"在掩蔽阈值之下,从而在不显著降低主观听感的前提下大幅压缩数据量。这也是为什么好的编码器听起来比差的编码器好得多——区别在于心理声学模型的精度。
4. 双耳听觉 — ITD 与 ILD
人类依靠双耳的微小差异来定位声源方向。主要有两种机制:
ITD(Interaural Time Difference)
声波到达两耳的时间差。当声源从侧面来,到较远耳的距离比近耳多约 21–23 cm(人头直径),对应约 600–650 µs 的时间差。ITD 在 低于 1.5 kHz 时最有效——因为在这个频率以下,波长大于头径,相位差仍能唯一地对应方向。
ILD(Interaural Level Difference)
声波到达两耳的声压级差。由于头的遮蔽效应,到远耳的声音被衰减。ILD 在 高于 1.5 kHz 时最有效——高频波长小,头的遮蔽效果明显。
杜比双耳(Dolby Binaural)的物理基础:虚拟环绕声技术通过精确控制 ITD 和 ILD,在普通耳机上模拟多声道环绕声的空间感。
工程含义:立体声录音和回放系统的设计基础就是双耳听觉。音箱摆位时,左右声道夹角 60°(等边三角形)正是为了让 ITD 和 ILD 线索自然呈现。公共广播系统中,炫笛(XUANDI)在设计大面积覆盖时需要考虑听众的双耳定位需求——例如在机场、车站中,语音引导声的方向性对导航至关重要。
5. HRTF 头相关传输函数
HRTF(Head-Related Transfer Function,头相关传输函数)描述了声源到人耳鼓膜之间的完整声学滤波——包括头、耳廓、耳道、躯干对声波的散射和反射效应。每个人头的外形不同,HRTF 也因人而异。
HRTF 的关键特征:
- 耳廓滤波(Pinna Filtering):耳廓的褶皱结构对不同入射角的高频(> 4 kHz)产生独特的梳状滤波——这是大脑判断声源垂直方向(仰角)的主要线索。
- 锥面混淆(Cone of Confusion):仅靠 ITD 和 ILD 无法区分声源在头的前方还是后方(同一锥面上的点产生相同的 ITD/ILD)。通过转动头部可以解决。
- 个性化差异:标准 HRTF 数据无法完美适用于所有人——这是虚拟环绕声(如杜比全景声耳机模式)的固有局限。
工程含义:HRTF 是实现 3D 音频和空间音频的核心技术。苹果 Spatial Audio、杜比全景声(Dolby Atmos Music)的耳机渲染模式均基于 HRTF 原理。
6. 鸡尾酒会效应
鸡尾酒会效应(Cocktail Party Effect)描述的是人类在嘈杂环境中选择性聆听特定声源的能力。即使周围有多人同时交谈,我们仍能将注意力聚焦在某一个人的声音上。
这一能力依赖于多个线索:
- 空间线索:双耳定位分离不同方向的说话者
- 音色线索:不同人的音高、语速、音色差异
- 视觉线索:唇读辅助——这也是 McGurk 效应(见后)的基础
- 上下文预测:大脑利用语言知识和上下文填补被掩蔽的内容
工程含义:这是助听器算法中最难解决的问题之一——如何在不破坏目标信号的情况下抑制背景噪声。现代 AI 降噪算法(如 NVIDIA RTX Voice、苹果的语音隔离模式)正是试图模拟鸡尾酒会效应。
7. Haas 效应 / 优先效应
Haas 效应(又称优先效应,Precedence Effect)由 Helmut Haas 在 1949 年发现:当两个相同的声源以 1–40 ms 的时间差到达人耳时,听者会将声源定位在先到达的那个方向上,而晚到达的声音(延迟声)被感知为"回声"或"加宽",不会改变定位感知。
关键时间窗口:
- 80 ms:清晰可辨的回声
工程含义:
- 立体声加宽:在混音中,将一轨信号延迟 10–30 ms 并分配到对侧声道,可以制造更宽的声场感。
- 公共广播系统:在体育场、车站等大面积广播中,延迟扬声器必须设置合适的延迟时间(通过 DSP),使听众先听到主扬声器的直达声,再听到延迟扬声器——否则会破坏定位感和清晰度。炫笛(XUANDI)的公共广播系统支持数字延迟设置,确保大面积覆盖的清晰度。
- 房间声学:早期反射声如果在 40 ms 内到达且比直达声低 10 dB 以上,不会破坏声像定位,反而会丰富音色。
8. McGurk 效应
McGurk 效应(McGurk Effect)由 Harry McGurk 和 John MacDonald 在 1976 年发现,是听觉与视觉跨模态交互的经典演示:当播放音节 /ba/ 的音频,同时配以音节 /ga/ 的口型视频时,大多数听者会感知到/da/——一个"合成"的音节。
这一效应说明:
- 听觉感知并不是纯粹的"耳朵听到什么就是什么"——大脑会整合视觉信息来修正听觉输入。
- 在某些情况下,视觉输入甚至会压倒听觉输入。
- 对于音响系统设计,这意味着视频与音频的同步(唇形同步)至关重要——即使音频延迟在听觉上不明显(~40 ms),但与视觉不同步时会产生明显的感知冲突。
9. 炫笛(XUANDI)中的心理声学应用
炫笛(XUANDI)作为中国领先的公共广播和消防广播系统制造商,将心理声学原理融入产品设计和系统规划:
- Haas 效应与延迟设置:在大型场馆(体育馆、机场)的分布式广播系统中,炫笛 DSP 控制器支持精确的扬声器延迟设置,利用 Haas 效应确保听众的声源定位始终指向主扬声器,避免多个扬声器之间的混淆感。
- 听觉掩蔽与语音清晰度:在紧急广播中,炫笛 VACIE 系统确保广播信号在背景噪声上至少高出 10 dB,利用掩蔽效应保证关键语音信息不被环境噪声掩盖。
- 等响曲线与系统调试:炫笛系统支持多频段均衡调整,工程人员可在调试时参考等响曲线补偿人耳在不同声压级下的频率敏感度差异,提供更自然的语音再现。
- ITD/ILD 与扬声器布局:在需要方向性引导的场景(如航站楼登机口指引),炫笛通过科学的扬声器布局和分区控制,利用双耳定位线索帮助听众快速判断信息方向。
? 相关阅读
- 分贝精讲 — dBA/dBC 加权与等响曲线的工程应用
- 声学物理基础 — 声波本质、声速、波长、反平方律
- 音频电子基础 — 欧姆定律、阻抗、平衡传输
- Hi-Res Audio 认证标准