تمثيلات التعلّم
قبل أن تتعلّم شبكةٌ الصوت، يجب أن نقدّمه لها بتمثيلٍ مناسب. لماذا تأكل تقريباً كل نماذج الصوت "mel spectrogram" لا الموجة الخام ولا الطيف العادي؟ الجواب — مجدداً — في الأذن.
تريد تدريب شبكة تميّز الكلمات. خياراتك للدخل: (أ) الموجة الخام (16000 رقم للثانية)، (ب) الطيف الخطّي من FFT (513 تردد لكل إطار)، (ج) شيء آخر.
المشكلة مع (أ): الموجة فيها معلومة كثيرة غير مفيدة (الطور، التفاصيل الدقيقة)، والشبكة تضيّع طاقتها. المشكلة مع (ب): الطيف الخطّي يعطي نفس الدقّة لـ 100Hz و 100Hz آخر عند 8kHz — لكن أذنك (والمعنى اللغوي) لا تكترث للفروق الدقيقة في الترددات العالية. كيف تبني تمثيلاً يطابق ما تهتمّ به الأذن: دقّة عالية في الجهير، خشنة في الحاد، ومقياس جهارة لوغاريتمي؟
سلّم mel — حلّ اللغز
من العقدة ٠٥: الأذن تحلّل في نطاقات حرجة (ضيّقة في الجهير، عريضة في الحاد). سلّم mel يحاكي ذلك: تحويل لا خطّي للتردد يجعل المسافات الإدراكية متساوية. نطبّق بنك فلاتر مثلّثة متباعدة على سلّم mel على الطيف، فنجمع الطاقة في ~40–80 نطاق إدراكي بدل مئات الترددات الخطّية.
الخطّ الكامل: من الموجة إلى الميزة
log لأن إدراك الجهارة لوغاريتمي (ديسيبل) — نظيرٌ مباشر لـgamma في مسار الصور (الإدراك غير الخطّي). وDCT على الطيف اللوغاريتمي ينتج MFCC: يفصل "الغلاف الطيفي" (هويّة الصوت/الحرف) عن "التفاصيل الدقيقة"، ويزيل الارتباط بين النطاقات (decorrelation) — نفس وظيفة DCT في ضغط الصور! الأدوات تتكرّر عبر الوسائط حرفياً.
mel-spectrogram صورة (محور زمن × محور mel، قيمة = طاقة). وهذا يفتح الباب: كل أدوات رؤية الحاسوب (CNN، Vision Transformers) تنطبق على الصوت مباشرةً. تصنيف الأصوات، الكلام، الموسيقى — كثيرٌ منها "تصنيف صور" على spectrograms. مسار الصور يصبح أداةً لمسار الصوت.
- ابنِ بنك فلاتر mel: حوّل حدود الترددات إلى mel
m=2595·log10(1+f/700)، وزّع النقاط بالتساوي على mel، عُد للتردد، وابنِ مثلّثات. - طبّق على طيف القدرة (من STFT العقدة ٠٢) → mel energies →
log→ ارسم mel-spectrogram كصورة. - طبّق DCT (أعِد استخدام كودك من مسار الصور!) واحتفظ بأول 13 → MFCC.
- اختبار: استخرج MFCC لكلمتين مختلفتين منطوقتين، وكلمة واحدة مرّتين. احسب المسافة بينها — يجب أن تكون النسختان أقرب. صنّفتَ صوتاً بميزات يدوية، تماماً كما تفعل النماذج قبل التعلّم العميق.
التمثيل الجيّد للتعلّم يطابق الأذن: سلّم mel (نطاقات حرجة) + log (جهارة) → mel-spectrogram = صورة. و DCT يعطي MFCC. الأدوات نفسها من ضغط الصور تظهر هنا. الآن الصوت "صورة جاهزة لشبكة". لكن ما الذي تتعلّمه الشبكة فعلاً؟ وكيف تولّد صوتاً أو تضغطه أفضل من كل ما بنينا؟