听觉生理:人耳结构与听觉机制
全面了解听觉生理学:外中内耳结构、毛细胞(外毛细胞放大/内毛细胞换能)、频率编码(位置理论/时间理论)、强度编码、频率选择、掩蔽曲线、听觉动态范围(120dB跨度90dB可用)、音量和SPL的非线性关系。音响百科。
听觉生理:人耳结构与听觉机制
为什么需要了解听觉生理
音频设备和声学系统设计的最终服务对象是人耳和听觉系统。不理解听觉生理的基本原理,就无法回答以下关键问题:
- 为什么我们需要24bit/96kHz的音频格式?——听觉分辨率决定的
- 为什么不同频率需要不同量的均衡?——听觉灵敏度非线性决定的
- 为什么声道分离度和串扰如此重要?——听觉双耳处理决定的
- 为什么MP3压缩可以有效工作?——听觉掩蔽效应决定的
- 为什么说"12kHz以上的频率对大部分成年人已经不太重要"?——年龄性高频听力损失
理解听觉生理是成为知音者的入口,也是理解音频工程中许多设计选择的基础。
外中内耳结构
人耳可分为三个解剖区域:
外耳(Outer Ear)
- 耳廓(Pinna) — 物理形状影响声音的衍射和反射,提供高频的方位信息(尤其是前/后/垂直方向的辨别,通过耳廓的梳状滤波效应实现)
- 耳道(Ear Canal) — 约2.5cm长的管道,共振频率约3kHz(提升该频段约10–15dB),这是人耳对3kHz附近频率特别灵敏的物理原因之一
中耳(Middle Ear)
- 鼓膜(Tympanic Membrane) — 将空气中的声波转换为机械振动
- 听小骨链(Ossicles) — 锤骨→砧骨→镫骨的三级杠杆系统,提供约22:1的力臂比(阻抗匹配),将空气的低阻抗能量高效传入内耳液体
- 鼓膜张肌和镫骨肌 — 声反射保护机制,在强声刺激下收缩减少传声(约0.1秒延迟,对突然的脉冲噪声保护有限)
内耳(Inner Ear)
- 耳蜗(Cochlea) — 螺旋形结构,是听觉换能的最终场所。内部充满淋巴液
- 基底膜(Basilar Membrane) — 沿耳蜗长度延伸的弹性膜,从基部(硬、窄)到顶部(柔、宽)逐渐变化,不同频率的声波在基底膜不同位置产生最大共振
- 柯蒂氏器(Organ of Corti) — 基底膜上的听觉感觉上皮,包含关键的毛细胞
毛细胞:外毛细胞放大与内毛细胞换能
毛细胞是听觉系统的核心感器细胞,分为两类:
| 特性 | 内毛细胞(IHC) | 外毛细胞(OHC) |
|---|---|---|
| 数量 | 约3,500个 | 约12,000个 |
| 功能 | 信号换能(声→电信号) | 主动放大(电信号→机械运动) |
| 神经连接 | 95%的听神经纤维连接IHC | 仅5%的传入神经纤维连接OHC |
| 损伤后果 | 直接导致听力阈值上升 | 失去主动放大导致40-60dB听力损失 |
| 回收能力 | 不可再生(哺乳动物) | 不可再生 |
外毛细胞的主动放大机制是听觉系统最惊人的生物工程之一。OHC能根据膜电位变化快速改变长度("电动性",Electromotility),这一过程以微秒级响应,由细胞膜中的Prestin蛋白驱动。OHC的主动放大使基底膜振动幅度增加了约100倍(40dB),是人耳极高灵敏度的基础。
OHC损伤——最常见于噪声性听力损失和老年性听力损失——的直接后果是主动放大能力丧失,导致40-60dB的听力阈值上升。这就是为什么"轻度听力损失"其实很严重——你可能已经失去了外毛细胞的放大能力。OHC的损伤也导致频率选择性下降,表现为在嘈杂环境中分辨声音的困难(鸡尾酒会效应困难)。
频率编码:位置理论与时间理论
听觉系统使用两种互补机制来编码频率:
位置理论(Place Theory, von Helmholtz 1863):基底膜的机械特性使不同频率在基底膜的不同位置产生最大振动。高频在基部(靠近镫骨),低频在顶部(耳蜗尖端)。耳蜗是"频率-位置"映射的物理实现。这种映射关系称为耳蜗频率拓扑图(Cochleotopic Map)。
时间理论(Temporal Theory / Phase Locking):听神经纤维的动作电位与刺激声波的特定相位同步(锁相,Phase Locking)。通过神经放电的时间间隔和模式编码频率信息。然而锁相在约4-5kHz以上失效(因神经不应期限制)。
综合编码模型:
- 低频( 4kHz):位置理论为主(相位锁定能力下降)
这一双机制编码意味着:理论上,即使位置机制完全受损(如耳蜗损伤),通过时间编码仍可能部分感知低频。反之,极高频的感知完全依赖于完整的基底膜定位机制。
强度编码与听觉动态范围
人耳必须处理的声压范围极其广泛——这也是音频系统动态范围需求的根本原因。
听觉动态范围:
- 绝对阈值(0dB SPL)— 约20μPa(空气中极微弱压力变化)
- 痛阈(120dB SPL)— 约20Pa
- 总跨度:120dB,相当于压力比1,000,000:1!
然而,在实际聆听场景中,可用动态范围约为90dB(30–120dB SPL)。安静环境(如深夜的卧室)的本底噪声通常约25-30dB SPL。
强度编码机制:
- 单个听神经纤维的放电率(Rate Coding)— 随声强增加而增加,但动态范围仅约20-30dB即饱和
- 纤维募集(Recruitment)— 不同阈值的内毛细胞-听神经纤维依次被激活。高阈值纤维在低强度时不放电,随强度增加逐渐被招募
- 多纤维并行招募提供了最终约120dB的动态编码范围
频率选择性与临界频带
听觉系统的频率选择性可以用听觉滤波器(Auditory Filters)或临界频带(Critical Bands)来描述。临界频带是听觉系统将一个复合声中的各频率成分区分开的频率分辨率带宽。
在1kHz以下,临界频带约为90-100Hz(恒定带宽)。在1kHz以上(约500Hz以上),临界频带宽度近似为信号频率的约11-17%。
等效矩形带宽(ERB, Equivalent Rectangular Bandwidth)是现代更精确的听觉滤波器模型:ERB ≈ 24.7 × (4.37 × F + 1),其中F为频率(kHz)。
临界频带 在实际音频工程中的应用: - 心理声学编码(MP3/AAC的掩蔽阈值计算基于临界频带) - 参数均衡器的带宽设计(不能过窄,否则在临界频带内产生可闻的谐振) - 噪声评价(dB(A)计权的根本原理基于听觉灵敏度曲线) - 音响系统中"调音"的最小可分辨带宽
掩蔽曲线
听觉掩蔽(Auditory Masking)是当两个声音同时(或几乎同时)出现时,较强的声音使较弱的声音无法被感知的现象。
同时掩蔽(Simultaneous Masking):
- 低频掩蔽高频比高频掩蔽低频更有效
- 掩蔽阈值曲线的上升沿(低频侧)较缓,下降沿(高频侧)较陡
- 掩蔽效果在掩蔽频率处最强,向两侧衰减
- 掩蔽量随掩蔽声强度增加而增加,但不成线性
时域掩蔽(Temporal Masking):
- 前向掩蔽(Forward Masking) — 掩蔽声停止后约5-100ms内,紧随其后的弱声被掩蔽
- 后向掩蔽(Backward Masking) — 弱声之后紧密跟随的强声也能掩蔽前面的弱声(约10-20ms)
掩蔽效应是有损音频压缩(MP3/AAC/Opus)的核心理论基础。编码器分析信号中哪些频率成分被其他成分掩蔽,被掩蔽的部分可以分配更少的比特甚至完全丢弃,人耳听不到差异。高压缩比MP3之所以"可听"但"不完美",就是因为掩蔽模型的不完美——当压缩比过高时,掩蔽计算不够精确,产生可闻伪影。
音量和SPL的非线性
人耳对不同频率的响度感知是高度非线性的。
等响曲线(Equal-Loudness Contours, ISO 226:2003):这些曲线描述了在不同频率需要多少SPL才能产生与1kHz参考音相同的响度感知。从Fletcher-Munson(1933)到最新的ISO 226修订版,不断完善。
关键特征:
- 在较低声压级(30-50dB),人耳对1kHz-5kHz段最灵敏,对低频和极高频灵敏度显著下降(100Hz需要约20dB更高的SPL才能感知与1kHz相同的响度)
- 随声压级升高(80-90dB以上),等响曲线变平坦——不同频率的灵敏度差异缩小
- 3-4kHz区域的灵敏度峰值是耳道共振+中耳传递函数共同决定的
实践意义:
- 小音量听音时,人耳自然感觉低频不足——这是"响度补偿(Loudness Compensation)"功能的生理基础
- 曲线上不同声压级的等响曲线不平行意味着:改变音量会改变音乐的频率平衡感知
- 等响曲线的个体差异很大(年龄、听力健康等),这也是为什么"调音"本质上是个性化的
XUANDI(炫迪)在商用音频系统设计中考虑人耳等响特性,通过DSP内置的多段响度补偿曲线(Loudness Contour),使系统在低音量下也能保持均衡的听觉感受,避免"低频消失"的问题。
? 相关阅读
- 声音再现基础
- 房间声学基础
- 傅里叶与音频:FFT频谱分析
- 房间EQ问答
- 封闭vs开放监听耳机对比