響度正規化與降噪
觀眾可以忍受畫面糊,但忍受不了聲音忽大忽小、或是要一直調音量。 這篇整理兩件影片後製最常做、也最常做錯的音訊處理:響度正規化與降噪。
一、響度正規化:治「整體太小聲」和「忽大忽小」
LUFS 是什麼
傳統音量表量的是訊號峰值(Peak),但人耳不是這樣聽的。一段全程 -6dB 的持續人聲,跟一段只有幾個瞬間衝到 -6dB 的敲擊聲,峰值一樣,聽起來的大小聲卻差很多。
LUFS(Loudness Units Full Scale)是模擬人耳感知、對整段節目做統計的響度單位。這也是為什麼各家平台都用 LUFS 當標準。
各平台的慣用目標
| 用途 | 目標響度 |
|---|---|
| Podcast、人聲為主的內容 | -16 LUFS |
| YouTube | 約 -14 LUFS(平台自己會再拉一次) |
| 電視廣播 | -23 LUFS |
平台會自己調整
YouTube、Spotify 這類平台會把過大的音量壓下來(但通常不會把太小聲的拉上去)。所以「上傳前先做到位」的意義,主要是避免你的影片比別人小聲。
正規化實際做了三件事
- 量測整段素材的實際響度
- 整體增益到目標值
- 動態調整:小聲的段落多拉一點、大聲的段落少拉一點
同時還會設一個真峰值上限(一般用 -1.5 dBTP),保證拉大聲的過程不會爆音。
所以它一次治兩個病:整體偏小聲、以及講話忽大忽小。
用 ffmpeg 做
ffmpeg -i input.mp4 -af loudnorm=I=-16:TP=-1.5:LRA=11 -ar 48000 output.mp4I=-16:目標響度TP=-1.5:真峰值上限LRA=11:容許的響度變化範圍
一定要補
-ar 48000
loudnorm濾鏡內部會把取樣率升到 192kHz 處理。如果不補-ar壓回去,輸出檔就會是 192kHz,檔案變大、部分播放器與平台也不見得吃。
想先看看素材原本多大聲,可以只量不改:
ffmpeg -i input.mp4 -af loudnorm=print_format=summary -f null -看輸出裡的 Input Integrated 就是這段素材目前的整體響度。
什麼時候該開、什麼時候不要開
- ✅ 人聲錄音(會議、講課、Podcast、口播):幾乎可以無腦開
- ❌ 音樂、或刻意做出動態的內容:不要開。你精心安排的「安靜 → 爆發」會被壓平
它不是修音工具
把小聲的地方拉大時,底噪也會跟著變大——這是物理,不是參數沒調好。錄音現場的底噪,後製救不回來。
二、降噪:為什麼處理完人聲會變單薄
傳統降噪的原理:頻譜減法
- 從沒有人聲的片段取一份噪音指紋(冷氣聲、電流聲長什麼樣)
- 在整段音訊裡,逐個頻段把這份指紋「減掉」
聽起來很合理,問題出在人聲跟噪音在頻譜上本來就重疊。
人聲變單薄是原理性的取捨,不是實作缺陷
- 氣音子音本質就是寬頻噪音。ㄙ、ㄈ、ㄏ 這些音在頻譜上跟電流聲幾乎長一樣 —— 減噪音的時候會被一起削掉,結果就是口齒變模糊
- 高頻泛音能量弱、又跟噪音重疊,被削掉後聲音就變薄、變乾
- 減過頭會出現「音樂噪音」(Musical Noise):那種水底冒泡、金屬感的怪聲
現代的 AI 降噪(RNNoise、Krisp、各家會議軟體內建)走的是另一條路:學會「分辨人聲」,而不是「減去噪音」。保留度好很多,但天花板還是在。
哪些噪音好處理、哪些幾乎無解
| 噪音類型 | 傳統降噪效果 |
|---|---|
| 穩定持續的(冷氣、風扇、電流聲) | 好處理 |
| 忽有忽無的(鍵盤聲、翻紙聲、突發雜音) | 幾乎無解 |
指紋法的前提是「噪音長期穩定」,突發噪音根本抓不到指紋。
ffmpeg 的兩個選項
afftdn—— 頻譜法,開箱即用arnndn—— RNNoise,效果較好,但需要另外下載.rnnn模型檔
三、兩個一定要記住的順序
先降噪、再響度正規化
反過來做,等於先把噪音放大,再叫降噪去處理一個更大聲的噪音。
會議軟體的錄影,不要再降一次噪
Jitsi、Zoom、Google Meet 這類軟體在錄製時多半已經降過噪了。你再降一次是純粹的傷害——人聲已經被削過一輪,第二輪只會更薄。
拿到會議錄影,先聽一段再決定要不要降噪;很多時候只需要做響度正規化就夠了。
相關
- 字幕清理與台灣字幕慣例
- 自媒體器材 —— 收音器材選得好,後製要救的東西就少