MusicGenerate

Pomiar separacji wokalu z kanału środkowego

Ile z wycentrowanego sygnału faktycznie znika, a co zostaje.

Opublikowano

W skrócie

Ograniczone pasmem wyciszanie mid/side usunęło wycentrowany ton testowy o 29,5 dB — około 97% jego amplitudy — podczas gdy mocno wypanowany ton w tym samym pliku stracił tylko 0,5 dB. Ta różnica to cała podstawa usuwania wokalu w stylu karaoke i da się ją zmierzyć — to nie kwestia opinii.

Metoda

  1. 01

    Zsyntezuj 3-sekundowy, 44,1 kHz, stereo WAV z dwoma tonami: 440 Hz o równej amplitudzie w obu kanałach (zastępnik wycentrowanego lead wokalu) oraz 2 kHz tylko w lewym kanale (zastępnik mocno wypanowanego instrumentu).

  2. 02

    Przetwórz plik silnikiem separacji serwisu w trybie instrumental — dekompozycja mid/side z wyciszeniem środka tylko między 180 Hz a 9 kHz, kaskadowe zwrotnice 24 dB/okt.

  3. 03

    Zdekoduj wyeksportowany WAV z powrotem do AudioBuffer i zmierz energię przy 440 Hz i 2 kHz za pomocą filtra Goertzela na pierwszych 2 sekundach.

  4. 04

    Porównaj każdy z tym samym pomiarem wykonanym na nieprzetworzonym źródle.

Wyniki

PomiarWartośćUwaga
Wycentrowany ton 440 Hz−29,5 dBusunięte w ok. 97%
Skrajnie zapanorowany ton 2 kHz−0,5 dBpraktycznie nienaruszony
Czas trwania wyjścia3,00 sbez zmian
Kanały wyjściowe2stereo zachowane
Czas przetwarzania< 1 sw przeglądarce, bez uploadu

Wnioski

Kasowanie jest niemal całkowite, ale tylko dla idealnie wycentrowanej zawartości

Ton o identycznej amplitudzie i fazie w obu kanałach to przypadek idealny i traci 29,5 dB. Prawdziwe wokale nigdy nie są aż tak wycentrowane — drobne różnice w pogłosie, podwojeniu i poszerzaniu stereo zostawiają resztki. Ten pomiar opisuje więc sufit tej techniki, a nie to, co da Ci komercyjne nagranie.

To ograniczenie pasma sprawia, że wynik jest użyteczny

Naiwne kasowanie L−R usuwa wszystko wycentrowane w całym paśmie, łącznie ze stopą i basem. Ograniczenie kasowania do 180 Hz–9 kHz zostawia te zakresy nietknięte, dlatego przetworzony plik wciąż brzmi jak muzyka, a nie jak chudy mono-artefakt. Spadek o 0,5 dB na bocznie zapanorowanym tonie potwierdza, że nietknięte pasma przechodzą praktycznie bez zmian.

Szerokość stereo przewiduje wynik przed przetwarzaniem

Ponieważ technika opiera się wyłącznie na różnicy między kanałami, stosunek energii side do mid w pliku przewiduje, czy w ogóle zadziała. Plik mono nie ma różnicy do wykorzystania i zwróci prawie ciszę, dlatego narzędzie najpierw to mierzy i odmawia działania zamiast produkować bezużyteczny plik.

Ograniczenia

  • Syntetyczne tony to najlepszy przypadek; komercyjne masteringi są węższe i mocniej przetworzone
  • Ogony pogłosu i delaya na wokalu nie są wycentrowane i przetrwają kasowanie
  • Podwójne albo skrajnie zapanorowane chórki z definicji przetrwają
  • Pomiary na jednym silniku przeglądarki; inne implementacje filtrów Web Audio mogą się nieco różnić

Pomiar separacji wokalu z kanału środkowego

Ile z wycentrowanego sygnału faktycznie znika, a co zostaje.