立体声的盲区:只有 X,没有 Y


你戴上耳机,打开一首混音良好的立体声录音。鼓在正中间,吉他在左侧,键盘在右侧,贝斯在中间稍偏左——这个画面非常清晰。但一个问题:


所有声音都在一个平面上。


没有纵深,没有前后层次,没有"这辆车从远处开过来"的体验。立体声的左右定位靠声像电位器(Pan Pot)的左右声道电平差来完成,这本质上是一个一维(X 轴)的信息。


声音从前方来和从后方来,在传统立体声中是无法区分的——因为左右声道的信息完全相同(当声像居中时)。


这正是挂谷(Kakeya)猜想在音频中的投射:一个维度的观测数据,不足以唯一确定另一个维度的解。 给定相同的左右电平数据,你无法判断声音来自 +Y(前方)还是 -Y(后方)。


人耳是如何感知纵深的?


在人头的物理结构中,声音传到鼓膜的过程不是简单的"响不响"——它经历了:


  • 头部衍射 — 声音绕过头部到达对侧耳朵时,相位和幅度会发生改变
  • 耳廓反射 — 不同方向来的声音在耳廓中反射路径不同,产生方向特定的梳状滤波
  • 到达时间差 — 左右耳收到同一声音的时间差随角度变化

科学家们用人工头(如 KEMAR 假人)在消声室中放置数百个不同方向的扬声器,每个方向播放一个短脉冲,用耳道内的麦克风记录下——这个记录就是空间脉冲响应


M/S + 空间卷积:我们怎么做的


DpdoEngine 原有的空间处理采用 M/S 编码 + 双方向卷积的方案:


  1. M/S 分解 — 将 L/R 立体声拆成 M(Mid = L+R)/ S(Side = L−R)
  2. M 通道 → 用正前方脉冲响应卷积 → 中间声定位在前方
  3. S 通道 → 用正后方脉冲响应卷积 → 两侧声定位在后方环绕
  4. 合成 — 重新合并为 L/R

这样做已经能产生不错的方向感,但有一个根本局限:纵深(Y 轴)是固定的二分映射,要么前方,要么后方,中间没有连续过渡。


DpdoDepth:多角度数据插值


要打破这个二分限制,需要更多角度的测量数据,然后在角度之间做连续插值。


核心思路


利用公开的 KEMAR 测量数据集或真人实测数据,一次性加载 13 个水平方向的空间脉冲响应(0°~180° 每 15° 一个):


0° 15° 30° 45° 60° 75° 90° 105° 120° 135° 150° 165° 180°


然后引入一个纵深参数 D ∈ [−1, +1]:


D 值含义中间声感觉从哪来两侧声感觉从哪来
+1正前方180°
+0.5前偏散45°135°
0耳平90°90°
−0.5后偏散135°45°
−1正后方180°

每个通道对应一个目标角度,在两个最近的加载角度之间做插值卷积:两个独立的卷积引擎分别跑这个信号,输出按插值权重混合。


为什么是 13 个方向?


15° 步长是精度与计算量的实用折中。人耳对水平方向的分辨率大约为 1°(前方)到 10°(侧面),所以 15° 步长覆盖了绝大部分的可感知变化。计算量仅从 2 次卷积增加到 4 次卷积,对现代 CPU 来说几乎可以忽略。


当提供了完整的外部测量数据文件时,角度数量固定为 13 个。如果使用内嵌数据(仅 0°/180°),则继续使用原有的二分逻辑,depth 仅控制前后 swap。


纵深如何映射到角度?


深度参数 D 通过一个简单的线性映射转化为角度:


angleM = (1 − D) × 90°
angleS = 180° − angleM

验证:

  • D=+1 → angleM=0°, angleS=180°(中间声在前,两侧声在后 → 声场宽阔但主体在前)
  • D=0 → angleM=90°, angleS=90°(中间声和两侧声都从侧面来 → 声场扁平,无前后层次)
  • D=−1 → angleM=180°, angleS=0°(中间声在后,两侧声在前 → 整体声场后移)

与挂谷猜想的关系


挂谷猜想的一个直观理解是:在一维线上观测到的数据,无法唯一确定二维空间的位置。这在音频中的体现正是:只靠 L/R 电平无法判断前后。


DpdoDepth 给出的不是"解出"这个问题——而是绕过了它。它不靠算出一个数学解,而是直接拿真实人头的物理测量结果作为模板,通过卷积把"这个声音听起来像从某个方向传到鼓膜"的听感嵌入信号中。


挂谷猜想说:一维信息不够唯一解二维。DpdoDepth 说:那我就不靠算的,直接用物理测量值喂给你听。


后续方向


DpdoDepth 当前的实现聚焦于水平面的前后纵深感知。正在考虑的扩展方向:


  • 多仰角插值 — 增加上下维度,实现三维空间定位
  • 个性化档案 — 支持不同人的个性化空间感知数据
  • 动态纵深 — 按频段或时间实时调整 depth,创造声源在空间中的运动轨迹
  • 到达时间差强化 — 叠加精细的左右耳到达时间差,强化方向定位的精确度

结语


DpdoDepth 的价值在于:


  1. 将 M/S 编码 + 空间卷积的成熟框架与多角度测量数据插值相结合
  2. 提供了一个 连续的纵深参数(而不仅是前后二分),让听者可以自由调整声音的空间位置
  3. 与 DpdoEngine 的现有母带工具链(降噪、均衡、限幅、DSEE)无缝集成

如果你对 DpdoDepth 的技术实现感兴趣,或者想在你的 SACD 母带中尝试空间感优化,联系我们