響度正規化與降噪

觀眾可以忍受畫面糊,但忍受不了聲音忽大忽小、或是要一直調音量。 這篇整理兩件影片後製最常做、也最常做錯的音訊處理:響度正規化降噪


一、響度正規化:治「整體太小聲」和「忽大忽小」

LUFS 是什麼

傳統音量表量的是訊號峰值(Peak),但人耳不是這樣聽的。一段全程 -6dB 的持續人聲,跟一段只有幾個瞬間衝到 -6dB 的敲擊聲,峰值一樣,聽起來的大小聲卻差很多。

LUFS(Loudness Units Full Scale)是模擬人耳感知、對整段節目做統計的響度單位。這也是為什麼各家平台都用 LUFS 當標準。

各平台的慣用目標

用途目標響度
Podcast、人聲為主的內容-16 LUFS
YouTube約 -14 LUFS(平台自己會再拉一次)
電視廣播-23 LUFS

平台會自己調整

YouTube、Spotify 這類平台會把過大的音量壓下來(但通常不會把太小聲的拉上去)。所以「上傳前先做到位」的意義,主要是避免你的影片比別人小聲。

正規化實際做了三件事

  1. 量測整段素材的實際響度
  2. 整體增益到目標值
  3. 動態調整:小聲的段落多拉一點、大聲的段落少拉一點

同時還會設一個真峰值上限(一般用 -1.5 dBTP),保證拉大聲的過程不會爆音。

所以它一次治兩個病:整體偏小聲、以及講話忽大忽小。

用 ffmpeg 做

ffmpeg -i input.mp4 -af loudnorm=I=-16:TP=-1.5:LRA=11 -ar 48000 output.mp4
  • I=-16:目標響度
  • TP=-1.5:真峰值上限
  • LRA=11:容許的響度變化範圍

一定要補 -ar 48000

loudnorm 濾鏡內部會把取樣率升到 192kHz 處理。如果不補 -ar 壓回去,輸出檔就會是 192kHz,檔案變大、部分播放器與平台也不見得吃。

想先看看素材原本多大聲,可以只量不改:

ffmpeg -i input.mp4 -af loudnorm=print_format=summary -f null -

看輸出裡的 Input Integrated 就是這段素材目前的整體響度。

什麼時候該開、什麼時候不要開

  • 人聲錄音(會議、講課、Podcast、口播):幾乎可以無腦開
  • 音樂、或刻意做出動態的內容:不要開。你精心安排的「安靜 → 爆發」會被壓平

它不是修音工具

把小聲的地方拉大時,底噪也會跟著變大——這是物理,不是參數沒調好。錄音現場的底噪,後製救不回來。


二、降噪:為什麼處理完人聲會變單薄

傳統降噪的原理:頻譜減法

  1. 從沒有人聲的片段取一份噪音指紋(冷氣聲、電流聲長什麼樣)
  2. 在整段音訊裡,逐個頻段把這份指紋「減掉」

聽起來很合理,問題出在人聲跟噪音在頻譜上本來就重疊。

人聲變單薄是原理性的取捨,不是實作缺陷

  • 氣音子音本質就是寬頻噪音。ㄙ、ㄈ、ㄏ 這些音在頻譜上跟電流聲幾乎長一樣 —— 減噪音的時候會被一起削掉,結果就是口齒變模糊
  • 高頻泛音能量弱、又跟噪音重疊,被削掉後聲音就變薄、變乾
  • 減過頭會出現「音樂噪音」(Musical Noise):那種水底冒泡、金屬感的怪聲

現代的 AI 降噪(RNNoise、Krisp、各家會議軟體內建)走的是另一條路:學會「分辨人聲」,而不是「減去噪音」。保留度好很多,但天花板還是在。

哪些噪音好處理、哪些幾乎無解

噪音類型傳統降噪效果
穩定持續的(冷氣、風扇、電流聲)好處理
忽有忽無的(鍵盤聲、翻紙聲、突發雜音)幾乎無解

指紋法的前提是「噪音長期穩定」,突發噪音根本抓不到指紋。

ffmpeg 的兩個選項

  • afftdn —— 頻譜法,開箱即用
  • arnndn —— RNNoise,效果較好,但需要另外下載 .rnnn 模型檔

三、兩個一定要記住的順序

先降噪、再響度正規化

反過來做,等於先把噪音放大,再叫降噪去處理一個更大聲的噪音。

會議軟體的錄影,不要再降一次噪

Jitsi、Zoom、Google Meet 這類軟體在錄製時多半已經降過噪了。你再降一次是純粹的傷害——人聲已經被削過一輪,第二輪只會更薄。

拿到會議錄影,先聽一段再決定要不要降噪;很多時候只需要做響度正規化就夠了。


相關