حدود كثافة الطيف الطاقي (PSD)
كلٌّ من الدورية وطريقة ويلش ينتجان تقديرًا واحدًا لـ PSD — دالةً في التردد وحده. يفترضان أن الإشارة ثابتة (Stationary): أي أن خصائصها الإحصائية لا تتغيّر بمرور الوقت. لكن كثيرًا من الإشارات الحقيقية تنقض هذا الافتراض كليًا. الكلام يتنقّل بين صمت وأصوات صائتة وصامتة في أجزاء من الثانية. صدى خفاش يجتاح من ٨٠ كيلوهرتز إلى ٢٠ كيلوهرتز في أقل من ثانية. إشارة زلزالية هادئة حتى تصل الموجة الأولى (P-wave) فتمتلئ بالطاقة.
لهذه الإشارات غير الثابتة، نحتاج إلى تمثيل يرصد كيف يتغيّر محتوى الطيف بمرور الوقت — توزيعًا مشتركًا في الزمن والتردد. الطيف الزمني-الترددي (Spectrogram) هو أكثر هذه التمثيلات انتشارًا واستخدامًا.
تحويل فورييه قصير الأمد (STFT)
يُحسَب الطيف من تحويل فورييه قصير الأمد (STFT). الفكرة بسيطة: بدلًا من حساب DFT واحد على الإشارة كاملها، نُزيح نافذة تحليل قصيرة على طول الإشارة ونحسب DFT عند كل موضع. كل DFT منقوع بالنافذة يعطي المحتوى الترددي المحلي قرب تلك النقطة الزمنية.
الطيف الزمني-الترددي هو ببساطة مربع سعة STFT — توزيع الطاقة في مستوى الزمن-التردد:
مقايضة دقة الزمن والتردد
أكثر خصائص الطيف جوهريةً هي مقايضة دقة الزمن مقابل التردد. هذه نتيجة حتمية لطريقة عمل النوافذ في تحويل فورييه، وهي المقابل الرقمي لمبدأ عدم اليقين لهايزنبرغ في ميكانيكا الكم.
طول نافذة التحليل M يحدد كلا الدقتين في آنٍ واحد:
- دقة زمنية عالية — يحدّد الأحداث بدقة في الزمن
- دقة ترددية ضعيفة — Δf = f_s/M كبير
- ذروات ترددية عريضة وضبابية
- مناسب للإشارات العابرة: نقرات، بدايات، ضربات
- نموذجي: M = ١٢٨–٥١٢ عيّنة
- دقة زمنية ضعيفة — تُموّه الأحداث في الزمن
- دقة ترددية عالية — Δf = f_s/M صغير
- ذروات ترددية حادة وضيقة
- مناسب للتوافقيات: أصوات موسيقية، نغمات
- نموذجي: M = ٢٠٤٨–٨١٩٢ عيّنة
جداء دقة الزمن (Δt) ودقة التردد (Δf) محدود من الأسفل بثابت يعتمد على شكل النافذة. النافذة الغاوسية تبلغ الحد الأدنى النظري (حد غابور). لا توجد نافذة تمنحك دقةً عالية في البُعدين معًا — يمكنك نقل المقايضة بتغيير النافذة، لكن لا مفر منها.
Δt · Δf ≥ 1/(4π) — حد غابور لأي تحليل زمني-ترددي خطيمعاملات STFT في التطبيق العملي
يتحكم في الطيف أربعة معاملات. كل منها يؤثر في دقة الزمن والتردد، والتكلفة الحسابية، والمظهر البصري للنتيجة:
| المعامل | أثره على دقة الزمن | أثره على دقة التردد | القيمة الشائعة |
|---|---|---|---|
| طول النافذة M | ↑M → أضعف (إطارات أطول) | ↑M → أدق (Δf = f_s/M) | ٥١٢–٤٠٩٦ عيّنة |
| حجم القفز R | ↓R → أدق (تداخل أكبر) | لا أثر | M/4 أو M/2 |
| نوع النافذة | يؤثر في التسرّب الجانبي | فص رئيسي أعرض = دقة ترددية أضعف | Hann (الأكثر شيوعًا) |
| حجم FFT: N ≥ M | لا أثر | ↑N → شبكة ترددية أدق (حشو بأصفار) | أقرب قوة لـ 2 أكبر من M |
لاحظ أن حجم القفز R وحجم FFT لا يغيّران الدقة الجوهرية — بل يغيّران كثافة أخذ العيّنات في مستوى الزمن-التردد. قفزة أصغر تعطي إطارات زمنية أكثر (مُستكثَفة، لا دقة حقيقية أعلى). الحشو بأصفار (N > M) يعطي شبكة ترددية أدق لكن لا يكشف تفاصيل ترددية لم تكن موجودة في النافذة ذات M عيّنة.
قراءة الطيف الزمني-الترددي
يُعرض الطيف كصورة ملونة ثنائية الأبعاد. التقليد: الزمن يتزايد من اليسار إلى اليمين، التردد يتزايد من الأسفل إلى الأعلى، واللون يُرمّز الطاقة — عادةً باستخدام خريطة ألوان متجانسة إدراكيًا (viridis، inferno) أو درجات رمادية. يُرسَم دائمًا تقريبًا بالديسيبل: 10 log₁₀(|X(m,ω)|²).
أبرز السمات التي يمكن رصدها في الطيف:
| السمة | كيف تبدو | مثال على الإشارة |
|---|---|---|
| خط أفقي | جيبي ثابت التردد | نغمة نقية، شوكة رنانة |
| خط مائل (chirp) | تردد يجتاح خطيًا بمرور الوقت | مسح ترددي FM، صدى خفاش |
| حزمة توافقيات | خطوط أفقية متوازية عند f₀, 2f₀, 3f₀, … | الكلام المنطوق، الآلات الموسيقية |
| شريط رأسي | طاقة عريضة النطاق مركّزة في الزمن | نقرة، ضربة طبل، نبضة |
| سحابة منتشرة | طاقة تشبه الضوضاء منتشرة في الزمن والتردد | ضوضاء بيضاء، احتكاك في الكلام (/s/، /sh/) |
| مسارات الفورمانت | نطاقات لامعة تتغيّر ببطء | رنينات الأصوات الصائتة في الكلام |
الطيف في الكلام والصوتيات
طُوِّر الطيف تاريخيًا لتحليل الكلام وما زال الأداة الرئيسية في هذا المجال. يحلّ الطيف الضيّق النطاق (نافذة طويلة، ~٢٠–٣٠ ملي ثانية) التوافقيات الفردية للتردد الأساسي ويتتبّع رنينات الفورمانت — ذروات الطيف العريضة التي تحدّد هوية الصوائت. أما الطيف واسع النطاق (نافذة قصيرة، ~٣–٥ ملي ثانية) فيحلّ التفاصيل الزمنية كدورات السواكن والنبضات الحنجرية الفردية، لكنه يُموّه التوافقيات في نطاقات عريضة.
في تعلّم الآلة الصوتي (التعرف على الكلام، تصنيف الأنماط الموسيقية، وسم الصوت)، نادرًا ما تُستخدَم الأطياف الخام مباشرةً. بدلًا من ذلك، يُحوَّل محور التردد إلى المقياس الميلي (Mel Scale) — مقياس إدراكي يحاكي طريقة إدراك الجهاز السمعي البشري للطبقة الصوتية (لوغاريتمي تقريبًا عند الترددات العالية). ثم تُضغَط سعة الطيف الميلي بأخذ اللوغاريتم، مُنتِجةً مميزات مدمجة ذات معنى إدراكي. هذا هو المُدخَل لمعظم الشبكات العصبية الصوتية الحديثة (CNN، Transformer، Whisper، إلخ).
Mel Spectrogram = STFT magnitude → mel filterbank → ضغط لوغاريتميتطبيقات الطيف خارج مجال الكلام
قدرة الطيف على الكشف عن كيفية تطوّر محتوى الطيف عبر الزمن تجعله مفيدًا في مجالات هندسية متعددة:
| المجال | التطبيق | ما يمكن رصده |
|---|---|---|
| الرادار | تحليل بصمة ميكرو-دوبلر | تضمينات ترددية من شفرات دوّارة وأشخاص يمشون |
| السونار | تصنيف الأهداف تحت الماء | توافقيات المراوح، أنماط التكهّف |
| الاهتزازات | كشف أعطال المحامل | سمات نبضية عند ترددات العطل، والنطاقات الجانبية |
| الطب الحيوي | كشف نوبات EEG | زيادة مفاجئة في الطاقة العريضة النطاق، تذبذبات إيقاعية |
| الاتصالات | تحديد الإشارات / SIGINT | نوع التضمين، عرض النطاق، توقيت النبضات |
| علم الزلازل | تحليل الزلازل | أوقات وصول P-wave و S-wave، محتوى تردد الصدع |
حدود الطيف الزمني-الترددي
للطيف قيدان جوهريان يتخطّيان مقايضة الدقة. أولًا: يُهدر معلومات الطور — لا يحتوي |X(m,ω)|² على طور، لذا لا يمكن إعادة بناء الإشارة الأصلية من الطيف وحده (وإن كان التقريب ممكنًا عبر خوارزميات تكرارية كـ Griffin-Lim). ثانيًا: يُظهر الطيف حدودًا متقاطعة للإشارات متعددة المركّبات — أنماط تداخل بين مركّبات الإشارة تظهر كسمات وهمية في مستوى الزمن-التردد. يوفر توزيع وينر-فيل تركيزًا مثاليًا في الزمن-التردد، لكنه يعاني أكثر من هذه الحدود المتقاطعة.
للصوتيات بمعدّل أخذ عيّنات ٤٤.١ كيلوهرتز، نافذة ٢٠ ملي ثانية (٨٨٢ عيّنة، تُقرَّب عادةً إلى ١٠٢٤) تعطي دقة توافقية جيدة للأصوات الموسيقية. للكلام بمعدّل ١٦ كيلوهرتز، نافذة ٢٥ ملي ثانية (٤٠٠ عيّنة، تُقرَّب إلى ٥١٢) هي المعيار في التعرف على الكلام. لمراقبة الاهتزازات بمعدّل ١٠ كيلوهرتز، اختر نافذةً تعطي Δf كافيًا لفصل تردد العطل عن التوافقيات المجاورة. تحقّق دائمًا بالفحص البصري للطيف.
قاعدة عملية: طول النافذة ≈ ٢٠–٤٠ ملي ثانية لإشارات الكلام والصوتيات- الطيف الزمني-الترددي = |STFT|² — خريطة طاقة ثنائية الأبعاد في الزمن والتردد، مناسبة للإشارات غير الثابتة.
- STFT: تزحيح نافذة تحليل منقوع بها على الإشارة وحساب DFT عند كل موضع بحجم قفز R.
- المقايضة الجوهرية: نافذة قصيرة ← دقة زمنية عالية، دقة ترددية ضعيفة؛ نافذة طويلة ← العكس. لا يمكن تحسين الاثنين في آنٍ واحد (مبدأ عدم اليقين).
- حجم القفز والحشو بأصفار يؤثران في كثافة الشبكة لا في الدقة الحقيقية.
- يُعرض الطيف بالديسيبل على صورة ملونة: الزمن (أفقي)، التردد (رأسي)، الطاقة (لون).
- الطيف الميلي = STFT → مرشحات Mel → ضغط لوغاريتمي — المميزة القياسية لأنظمة تعلّم الآلة الصوتية.
- يُهدر الطور في الطيف — إعادة البناء تتطلب خوارزميات تكرارية لتقدير الطور.