نموذجان، إشارة واحدة
تُبنى معالجة الإشارات الرقمية الكلاسيكية على الرياضيات: تحليل فورييه، ونظرية المرشحات، ونظرية التقدير، ونظرية المعلومات. كل خوارزمية مشتقة من مبادئ أولى، وسلوكها قابل للتنبؤ الكامل والفهم التحليلي. أما التعلم الآلي فيُبنى على البيانات: يتعلم النموذج تمثيلات داخلية بتحسين دالة خسارة على مجموعة تدريب ضخمة، دون ضمان أن الأوزان المكتسبة تقابل أي كمية قابلة للتفسير البشري. تعايش هذان النموذجان جنباً إلى جنب لعقود، لكن السنوات العشر الماضية شهدت تقاربهما.
تظهر الشبكات العصبية الآن في كل طبقة من طبقات مكدس معالجة الإشارات الحديث — تخفيف الضوضاء في الميكروفونات، وتصنيف مخططات التضمين، والكشف عن الشذوذات في إشارات الاهتزاز، وموازنة القنوات اللاسلكية. يستعرض هذا الدرس أين يُعزز التعلم الآلي معالجة الإشارات الرقمية، وأين تتفوق معالجة الإشارات الكلاسيكية، والبنية الهجينة الناشئة التي تجمع ضمانات نظرية معالجة الإشارات مع القدرة التمثيلية للشبكات العصبية.
تتبادل معالجة الإشارات الكلاسيكية افتراضات النموذج مقابل قابلية التفسير: إذا افترضت أن الإشارة محدودة النطاق أو ثابتة أو تتبع توزيعاً معروفاً، يمكنك اشتقاق المعالج الأمثل تحليلياً. يتبادل التعلم الآلي الافتراضات مقابل المرونة: بالتعلم من البيانات، يتكيف النموذج مع الإشارات التي تكون إحصاءاتها غير معروفة أو غير ثابتة — على حساب قابلية التفسير والحاجة إلى بيانات تدريب مصنفة.
إزالة ضوضاء الإشارة بالشبكات العصبية
مرشح وينر هو الحل الكلاسيكي لإزالة ضوضاء الإشارة: لإشارة ملوثة بضوضاء مضافة، صمم مرشحاً في نطاق التردد يقلل متوسط الخطأ التربيعي بين الإشارة النظيفة والمقدّرة. مرشح وينر أمثل عندما تكون كثافات طيف الطاقة للإشارة والضوضاء معروفة. حين لا تكون كذلك — أو حين تكون الضوضاء غير ثابتة أو غير غاوسية — يتدهور أداء مرشح وينر.
يمكن للشبكات العصبية العميقة المتعلمة من البيانات أن تتغلب على هذا القيد. البنية الأكثر نجاحاً لإزالة ضوضاء الإشارات أحادية البعد هي شبكة التلافيف السببية المتمددة (مرتبطة بـ WaveNet). بدلاً من التعلم في نطاق التردد، تعالج هذه الشبكات الشكل الموجي الخام في المجال الزمني من خلال تلافيفات أحادية البعد ذات عوامل تمديد تتزايد أسياً (1، 2، 4، 8، ..، 512)، مما يلتقط البنية عبر مقاييس زمنية متعددة في آنٍ واحد. يتنامى الحقل الاستقبالي أسياً مع العمق بينما يتنامى عدد المعاملات خطياً فقط.
وفي الممارسة، تتفوق شبكات إزالة الضوضاء العميقة على ترشيح وينر الكلاسيكي حين تكون الضوضاء غير ثابتة (مثل ضجيج الأحاديث في خلفية مسجّل صوت)، أو حين تكون بنية الإشارة معقدة يصعب نمذجتها تحليلياً (مثل الموسيقى أو الكلام متعدد الأصوات). والمقابل: يحتاج النموذج إلى آلاف الأمثلة التدريبية المزدوجة (مشوَّشة/نظيفة) وإلى عشرات الملايين من عمليات الضرب والتجميع لكل ثانية صوت — حسابات أكثر بكثير بما لا يقاس مما يحتاجه مرشح وينر.
التصنيف التلقائي للتضمين
التصنيف التلقائي للتضمين (AMC) هو مشكلة تحديد مخطط تضمين الإشارة المستقبَلة — التمييز بين AM وFM، أو BPSK وQPSK و16-QAM — دون معرفة مسبقة بما أُرسل. تستخرج خوارزميات AMC الكلاسيكية ميزات مصنوعة يدوياً من الإشارة (إحصاءات السعة الآنية والطور والتردد؛ التراكمات ذات الرتبة الأعلى) وتُغذيها في اختبار نسبة الاحتمال أو شجرة قرار. تتطلب هذه المستخرجات خبرة مجالية ويجب إعادة تصميمها لكل نوع تضمين جديد.
يمكن للشبكات العصبية التلافيفية (CNNs) المطبقة مباشرة على الشكل الموجي الأساسي المركب أن تتعلم استخراج ميزات مميزة للتضمين تلقائياً. أثبتت مجموعة بيانات RadioML أن شبكة CNN ضحلة نسبياً — أربع طبقات تلافيفية تعمل على أزواج عينات المربع والتعامد (IQ) — تحقق دقة منافسة للهندسة المتخصصة في الميزات عبر أكثر من 20 فئة تضمين ونطاق واسع من قيم نسبة إشارة إلى ضوضاء. وعند SNR عالية (أكبر من 10 dB)، تتجاوز النماذج العميقة دقة أي مجموعة ميزات مصنوعة يدوياً معروفة.
والفكرة الجوهرية أن عينات IQ الخام تحمل أصلاً كل المعلومات اللازمة لتصنيف التضمين — المعلومات نفسها التي تستخرجها الطرق الكلاسيكية بكدّ على هيئة ميزات مصنوعة يدوياً. وشبكة CNN، إن أُعطيت بيانات كافية، تتعلم تمثيلاً داخلياً أغنى بالضرورة من أي مجموعة ميزات ثابتة. الثمن هو الغموض: يصعب تفسير لماذا صنّفت الشبكة مقطعاً بعينه على أنه QPSK لا 8-PSK، وهذا يهم في بيئات الطيف المنظَّمة حيث يجب أن يكون قرار المصنّف قابلاً للتدقيق.
موازنة القناة بالتعلم الآلي
في الدرس السابق، اختُزلت موازنة قناة OFDM إلى قسمة مركبة واحدة لكل تردد فرعي — بسيطة للغاية لأن OFDM يحوّل القناة انتقائية التردد إلى قنوات فرعية مستوية متوازية. في الأنظمة أحادية الحامل أو غير OFDM، تبدو القناة ما زالت مرشح FIR، وتتطلب الموازنة عكسها، عادةً بمساوٍ بردود الفعل في القرار (DFE) أو مرشح MMSE-LE. حين تكون القناة مجهولة أو متغيرة بسرعة، يجب تقدير المرشح وتحديثه باستمرار.
يمكن للشبكات العصبية المتكررة (RNNs)، وبشكل أحدث نماذج التسلسل المستندة إلى المحول، أن تتعلم موازنة القنوات مباشرةً من البيانات المستقبَلة، دون تقدير صريح للقناة أو تصميم مرشح. يُدرَّب النموذج على أزواج من (الإشارة المستقبَلة، البتات المرسلة) ويتعلم تعييناً شاملاً يجري عكس القناة ضمنياً. هذا النهج جذاب بشكل خاص في القنوات ذات الذاكرة (مثل قنوات الصوت تحت الماء ذات فارق التأخير البالغ مئات المللي ثانية) حيث يتطلب المساوي الكلاسيكي الأمثل مرشحاً طويلاً جداً.
تُظهر نتائج القياس المرجعي على نماذج القنوات المعيارية (ITU للمركبات، والقناة الصوتية تحت الماء، والقناة الساتلية) أن المساويات العصبية تُطابق أداء MMSE أو تتجاوزه قليلاً في سيناريوهات الحركة العالية، حيث تتغير القناة أسرع مما يستطيع التقدير المعتمد على الطيّار تتبعه. لكن المساويات العصبية تفشل فشلاً كارثياً على القنوات الخارجة عن توزيع التدريب — أي نوع قناة لم ترَه أثناء التدريب — بينما يتدهور مساوي MMSE الكلاسيكي تدهوراً لطيفاً متدرجاً. هذه الهشاشة قيد جوهري على الطرق المدفوعة بالبيانات في التطبيقات الحرجة للسلامة.
بنى عصبية مدركة للإشارات الرقمية
الاتجاه البحثي الأكثر إنتاجية مؤخراً ليس استبدال معالجة الإشارات الرقمية بالتعلم الآلي بل تضمين بُنى معالجة الإشارات داخل البنى العصبية. بتقييد البنية لتتوافق مع الحدوس الإشارية المعروفة، يكتسب النموذج تحيزاً استقرائياً يقلل متطلبات البيانات ويحسن التعميم. يُسمى هذا النهج الهجين التعلم العميق القائم على النماذج أو فرد الخوارزمية.
يحوّل فرد الخوارزمية خوارزمية كلاسيكية تكرارية (مثل خوارزمية ISTA لاسترداد الإشارات المتفرقة أو مفكك التوربو) إلى شبكة عصبية ذات عمق منتهٍ، حيث تقابل كل طبقة تكراراً واحداً. تُستبدل المعاملات الخوارزمية الثابتة (معدلات الخطوة، العتبات، معاملات التخميد) بمعاملات مكتسبة محسَّنة شاملاً عبر البيانات التدريبية. الشبكة الناتجة قابلة للتفسير (كل طبقة لها معنى واضح في معالجة الإشارات)، وكفؤة في البيانات (ترث بنية الخوارزمية)، وقابلة للتدريب (تتدفق التدرجات عبر التكرارات المفردة عبر الانتشار العكسي).
تكرر خوارزمية ISTA لاسترداد الإشارات المتفرقة: x ← Sλ(Wx + b · y)، حيث Sλ دالة عتبة ناعمة، وW مصفوفة مشتقة من مصفوفة الاستشعار، وb عدد قياسي لحجم الخطوة. تستبدل LISTA W وb بمعاملات مكتسبة وتفرد K تكراراً في شبكة ذات K طبقة. تحقق شبكة LISTA بعشر طبقات نفس دقة إعادة البناء التي تحققها 1000 تكرار من ISTA الكلاسيكية — تسريع 100×— لأن المعاملات المكتسبة تستغل إحصاءات بيانات التدريب التي تتجاهلها ISTA الكلاسيكية.
ومن أمثلة البنى المدركة لمعالجة الإشارات أيضاً: بنوك المرشحات المتعلَّمة (استبدل نوافذ STFT الثابتة بنوى تلافيفية أحادية البعد تُهيَّأ بمرشحات تحليل ثم تُصقل شاملاً لمهمة لاحقة)؛ ومستقبلات OFDM المفرودة عميقاً (استبدل تقدير القناة المعتمد على الطيّار وموازنة ZF بشبكة تنقيح تكراري متعلَّمة)؛ ومُشكِّلات الحزمة العصبية (استبدل مرشح MVDR المكاني بشبكة عصبية مركبة القيم تتعلم مانيفولد مصفوف الهوائيات من تسجيلات ميكروفونات التدريب).
للميزة التي تستبدلها بنوك المرشحات المتعلَّمة اسمٌ يستحق المعرفة، لأنها هيمنت على التعرف على الكلام لعقود: معاملات الكبستروم على تردد مِل (MFCCs). واجهةُ MFCC خط أنابيب ثابت من معالجة الإشارات — خذ طيف المقدار قصير الزمن، وحوّله إلى مقياس مِل الإدراكي، وخذ لوغاريتم طاقة كل حزمة مِل (وكلا الخطوتين مُقدَّمتان في الوحدة 9، الدرس 3) — يختمها تحويل أخير: تحويل الجيب تمام المتقطع (DCT) يُطبَّق على طاقات مِل اللوغاريتمية. ويؤدي الـ DCT مهمتين معاً. فهو يفكّ ارتباط حزم مِل، فيكفي مصنِّفٌ بنموذج تباين قطري، وهو يضغط معظم الطاقة في نحو اثني عشر معاملاً أولاً — إذ تحتفظ واجهةُ كلامٍ نموذجية بنحو 13 معاملاً وتُهمل الباقي، فينتج متجه ميزات صغير ومتين. وبنوك المرشحات المتعلَّمة أعلاه هي فعلياً خط الأنابيب نفسه بعد استبدال مرشحات مِل والـ DCT بتلافيفات قابلة للتدريب: يكتشف النموذج واجهته الأمامية بنفسه بدل أن يرث واجهة مِل–DCT.
أين تتفوق معالجة الإشارات الكلاسيكية
على الرغم من النتائج المثيرة للإعجاب، تمتلك معالجة الإشارات القائمة على التعلم الآلي نقاط فشل واضحة لا تمتلكها معالجة الإشارات الكلاسيكية. فهم هذه الحدود ضروري لأي مهندس يقرر أي نهج يستخدم.
| المعيار | معالجة الإشارات الكلاسيكية | التعلم الآلي / معالجة الإشارات العصبية |
|---|---|---|
| قابلية التفسير | تحليلية كاملة؛ السلوك مشتق من النظرية | صندوق أسود؛ التمثيلات الداخلية مبهمة |
| التعميم | يتدهور بشكل تدريجي في ظروف جديدة | قد يفشل كارثياً خارج نطاق التوزيع |
| متطلبات البيانات | لا شيء (قائم على النموذج) | آلاف إلى ملايين الأمثلة المصنفة |
| الحوسبة | منخفضة (خاصة المستندة إلى FFT) | عالية (قد يتطلب الاستدلال GPU/NPU) |
| زمن الاستجابة | متوقع وحتمي | متغير؛ الزمن الحقيقي الصارم صعب |
| الاعتماد | حدود قابلة للتحقق على الأداء | ضمانات إحصائية فقط |
| الإشارات غير الثابتة | يتطلب تكيّف النموذج | يتعلم الأنماط غير الثابتة |
| نوع ضوضاء مجهول | يتدهور الأداء إذا كان النموذج خاطئاً | يتعلم من الأمثلة بغض النظر عن النوع |
تظل معالجة الإشارات الكلاسيكية مهيمنة في الأنظمة الحيوية للسلامة والمستندة إلى المعايير. لا يمكن لمحطة قاعدة 5G استخدام مساوٍ عصبي يُوصَف سلوكه وصفاً احتمالياً فقط — يفرض معيار 3GPP حسابات ميزانية ارتباط محددة تتطلب حدوداً تحليلية للأداء. وتُهيمن بنوك المرشحات القائمة على FFT، ومفككات فيتربي، ومرشحات كالمان على الطيران والفضاء والأجهزة الطبية والاتصالات المطابقة للمعايير، والسبب أنها قابلة للاعتماد والتصديق.
يتفوق التعلم الآلي في التطبيقات التي تتوفر فيها بيانات مصنفة وفيرة ولا تُشترط فيها قابلية التفسير: تحسين الصوت للمستهلكين (إلغاء الضوضاء في سمّاعات الأذن)، والصيانة التنبؤية (كشف الشذوذ في إشارات الاهتزاز)، والراديو المعرفي (استشعار الطيف في بيئات مجهولة). ويتجه الاتجاه نحو البنى الهجينة التي تطبق التعلم الآلي على المشاكل الفرعية التي يصعب نمذجة إحصاءات الإشارة فيها تحليلياً، مع الإبقاء على معالجة الإشارات الكلاسيكية للمراحل القابلة للتحليل في سلسلة المعالجة.
DSP-101: منظور ختامي
يُغلق هذا الدرس الأخير من DSP-101 القوس الممتد من نظرية أخذ العينات لنايكويست-شانون في الوحدة الأولى إلى تقاطع التعلم الآلي ومعالجة الإشارات في الوحدة الثانية عشرة. غطت الرحلة أخذ العينات والتكميم وتحويل DFT وتصميم مرشحات FIR وIIR والتحليل الطيفي وأنظمة المعدل المتعدد وتطبيقات معالجة الإشارات الرقمية الواقعية في الأنظمة المضمنة والصوت والاتصالات وصولاً إلى التعلم الآلي.
الخيط الموحِّد طوال الرحلة هو المنظور في نطاق التردد: يمكن فهم كل عملية في معالجة الإشارات الرقمية تقريباً — التصفية والارتباط والاستيفاء وتضمين OFDM وتصفية وينر وحتى الحقل الاستقبالي لشبكة التلافيف المتمددة — باعتبارها معالجة للمحتوى الطيفي للإشارة. المهندس القادر على قراءة الطيف وفهم معنى استجابة ترددية للمرشح والتفكير في النطاق الترددي والضوضاء والتشويه يمتلك عدسة تنطبق بالتساوي على راديو الثلاثينيات ومعالجات الإشارات العصبية لعام 2030.
- تُعدّ معالجة الإشارات الكلاسيكية مثلى حين تكون إحصاءات الإشارة والضوضاء معروفة؛ يتفوق التعلم الآلي حين تكون تلك الإحصاءات مجهولة أو غير ثابتة أو معقدة للنمذجة التحليلية.
- تعالج شبكات التلافيف المتمددة الأحادية البعد الشكل الموجي الخام في المجال الزمني، مع نمو أسي للحقل الاستقبالي مع العمق ونمو خطي لعدد المعاملات.
- يتفوق التصنيف التلقائي للتضمين بالشبكات التلافيفية على الميزات الإحصائية المصنوعة يدوياً عند نسب إشارة إلى ضوضاء مرتفعة، على حساب قابلية التفسير.
- تتجاوز برامج الموازنة العصبية أداء MMSE في قنوات عالية التنقل — لكنها تفشل كارثياً على أنواع قنوات خارج نطاق التدريب؛ يتدهور MMSE الكلاسيكي بشكل تدريجي.
- يحوّل فرد الخوارزمية (مثل LISTA) الخوارزميات التكرارية لمعالجة الإشارات إلى شبكات عصبية ذات عمق منتهٍ ومعاملات مكتسبة، بما يجمع قابلية التفسير والتحسين القائم على البيانات.
- تظل معالجة الإشارات الكلاسيكية إلزامية في الأنظمة الحيوية للسلامة المعتمدة ومنخفضة زمن الاستجابة؛ يُنتج التعلم الآلي أفضل النتائج حيث البيانات وفيرة وقابلية التفسير ليست اشتراطاً تنظيمياً.