MusicGenerate

การวัดการแยกเสียงร้องช่องกลาง

สัญญาณกึ่งกลางหายไปเท่าไรจริงๆ และอะไรที่ยังอยู่.

เผยแพร่

สรุปสั้นๆ

การยกเลิกแบบ mid/side ที่จำกัดย่านความถี่ลดโทนทดสอบที่แพนกลางลงได้ 29.5 dB — ราว 97% ของแอมพลิจูด — ขณะที่โทนที่แพนสุดในไฟล์เดียวกันหายไปแค่ 0.5 dB. ช่องว่างนั้นคือพื้นฐานทั้งหมดของการลบเสียงร้องแบบคาราโอเกะ และเป็นสิ่งที่วัดได้ ไม่ใช่ความคิดเห็น.

วิธีการ

  1. 01

    สังเคราะห์ไฟล์ WAV สเตอริโอ 3 วินาที 44.1 kHz ที่มีสองโทน: 440 Hz ที่แอมพลิจูดเท่ากันทั้งสองแชนเนล (แทนเสียงร้องนำที่อยู่กึ่งกลาง) และ 2 kHz ในแชนเนลซ้ายเท่านั้น (แทนเครื่องดนตรีที่แพนสุด).

  2. 02

    ประมวลผลไฟล์ด้วยเอนจินแยกเสียงของไซต์ในโหมดอินสทรูเมนทัล — แยกแบบ mid/side โดยยกเลิกสัญญาณกึ่งกลางเฉพาะช่วง 180 Hz ถึง 9 kHz โดยใช้ครอสโอเวอร์ซ้อนกัน 24 dB/อ็อกเทฟ.

  3. 03

    ถอดรหัสไฟล์ WAV ที่ส่งออกกลับเป็น AudioBuffer แล้ววัดพลังงานที่ 440 Hz และ 2 kHz ด้วยตัวกรอง Goertzel บนช่วง 2 วินาทีแรก

  4. 04

    เปรียบเทียบแต่ละค่ากับการวัดแบบเดียวกันบนไฟล์ต้นฉบับที่ไม่ผ่านการประมวลผล

ผลลัพธ์

การวัดผลค่าหมายเหตุ
โทน 440 Hz กึ่งกลาง−29.5 dBลบออกประมาณ 97%
โทน 2 kHz ที่แพนสุดข้าง−0.5 dBแทบไม่เปลี่ยน
ความยาวผลลัพธ์3.00 วินาทีไม่เปลี่ยน
แชนเนลผลลัพธ์2คงสเตริโอไว้
เวลาในการประมวลผล< 1 วินาทีทำในเบราว์เซอร์ ไม่ต้องอัปโหลด

ข้อค้นพบ

การหักล้างเกือบหมดจด แต่เฉพาะคอนเทนต์ที่กึ่งกลางสมบูรณ์เท่านั้น

โทนที่มีแอมพลิจูดและเฟสเหมือนกันทั้งสองแชนเนลคือเคสในอุดมคติ และมันลดได้ 29.5 dB โวคัลจริงไม่กึ่งกลางขนาดนั้น — ความต่างเล็กๆ จากรีเวิร์บ การดับเบิล และการขยายสเตริโอจะเหลือเศษอยู่ ดังนั้นค่าที่วัดจึงบอกเพดานของเทคนิค มากกว่าสิ่งที่แทร็กเชิงพาณิชย์จะให้ได้

การจำกัดย่านความถี่คือสิ่งที่ทำให้ผลลัพธ์ยังใช้งานได้

การหักล้าง L−R แบบซื่อๆ จะลบทุกอย่างที่กึ่งกลางในทุกความถี่ รวมถึงกลองคิกและเบส การจำกัดการหักล้างไว้ที่ 180 Hz–9 kHz ทำให้ย่านเหล่านั้นยังอยู่ นั่นจึงเป็นเหตุผลที่ไฟล์ที่ประมวลผลแล้วยังฟังเป็นเพลง ไม่ใช่อาร์ติแฟกต์โมโนบางๆ การลดลง 0.5 dB บนโทนที่แพนข้างยืนยันว่าย่านที่ไม่ถูกแตะผ่านไปได้แทบไม่เปลี่ยน

ความกว้างสเตริโอทำนายผลลัพธ์ได้ก่อนประมวลผล

เพราะเทคนิคนี้พึ่งพาความต่างระหว่างแชนเนลล้วนๆ อัตราส่วนพลังงานระหว่างไซด์ต่อมิดของไฟล์จึงทำนายได้ว่าจะใช้ได้ไหม ไฟล์โมโนไม่มีความต่างให้ใช้ ผลคือเงียบแทบสนิท นี่จึงเป็นเหตุผลที่เครื่องมือนี้วัดค่านี้ก่อนแล้วปฏิเสธการทำงาน แทนที่จะสร้างไฟล์ไร้ประโยชน์

ข้อจำกัด

  • โทนสังเคราะห์คือเคสที่ดีที่สุด; มาสเตอร์เชิงพาณิชย์แคบกว่าและผ่านการประมวลผลมากกว่า
  • หางรีเวิร์บและดีเลย์บนโวคัลไม่กึ่งกลางและรอดจากการหักล้าง
  • แบ็กกิ้งโวคัลที่ดับเบิลหรือแพนสุดข้างถูกออกแบบมาให้รอด
  • วัดบนเอนจินเบราว์เซอร์ตัวเดียว; การอิมพลีเมนต์ตัวกรอง Web Audio อื่นอาจต่างกันเล็กน้อย

การวัดการแยกเสียงร้องช่องกลาง

สัญญาณกึ่งกลางหายไปเท่าไรจริงๆ และอะไรที่ยังอยู่.