مشهد الحدود الأمامية
لم يعد التعلم الآلي تخصصًا ثابتًا — إنه مجال متطور تتحول افتراضاته الجوهرية كل بضع سنوات. لا تشبه نماذج 2024 تلك التي كانت عليه في 2018، وعلى الأرجح ستختلف نماذج 2030 بالقدر ذاته. تُحدّد ستة اتجاهات أنشط حدود البحث الراهنة: النماذج متعددة الوسائط، والنماذج الأساسية، ووكلاء الذكاء الاصطناعي، والحوسبة العصبية، والتعلم الآلي الكمي، والتعلم الآلي على الحافة. فهم هذه الاتجاهات ضروري ليس فقط لمواكبة التطورات، بل لبناء حدوس حول مآلات المجال وأسبابها.
هذه المجالات ليست مستقلة عن بعضها — إنها تتقاطع. يمكن لنموذج أساسي أن يُشغّل وكيل ذكاء اصطناعي؛ وقد تُشغّل شريحة تعلم آلي على الحافة يومًا ما نموذجًا متعدد الوسائط مضغوطًا؛ وقد تُسرّع الحوسبة الكمية في نهاية المطاف خطوة التحسين التي تقوم عليها كل هذه الأنظمة. الموضوع الجامع هو توسيع القدرات: كل اتجاه يوسّع إما ما يمكن للنماذج إدراكه، أو ما يمكنها فعله، أو أين يمكنها العمل، أو مدى كفاءتها في الحساب.
تمتد هذه الاتجاهات على طيف واسع من النضج. النماذج متعددة الوسائط والنماذج الأساسية مُنشرة في الإنتاج اليوم. يتحول وكلاء الذكاء الاصطناعي بسرعة من البحث إلى الانتشار. التعلم الآلي على الحافة ينمو بسرعة في الأنظمة المدمجة. تبقى الحوسبة العصبية والتعلم الآلي الكمي إلى حد بعيد حدودًا بحثية قبل تجارية، رغم إمكاناتهما الحقيقية على المدى البعيد.
النماذج متعددة الوسائط
تعمل نماذج التعلم الآلي التقليدية على وسيط واحد — صور أو نصوص أو صوت — مع بنيات متخصصة منفصلة لكل وسيط. تعالج النماذج متعددة الوسائط البيانات وتولّدها عبر وسائط متعددة في آنٍ واحد، مما يتيح فهمًا أغنى للعالم. النموذج الذي يمكنه رؤية صورة وقراءة تعليقها والاستماع إلى الصوت المصاحب لها يفهم سياقًا أوسع بكثير من أي نظام أحادي الوسيط.
البنيات والأنظمة الرئيسية
التحدي التقني الرئيسي في النماذج متعددة الوسائط هو توافق الوسائط — ضمان أن تُعيَّن تمثيلات من أنواع مدخلات مختلفة (ميزات الصور، وتضمينات الرموز، والطيف الصوتي) في فضاء دلالي مشترك ذي علاقات ذات معنى. التدريب التبايني المسبق (كما في CLIP)، والانتباه المتقاطع بين مشفّرات خاصة بكل وسيط، والتقسيم إلى رموز الموحّد (معاملة رقع الصور كرموز) هي المناهج الرئيسية.
تُظهر النماذج متعددة الوسائط قدرات لا يمكن لأي نموذج أحادي الوسيط إنجازها: قراءة النصوص المضمّنة في الصور (OCR)، وفهم الرسوم البيانية والمخططات، ووصف الصور بالتفصيل، والإجابة عن أسئلة تتعلق بإطارات الفيديو، وتوليد الصور من أوصاف تركيبية معقدة. هذه القدرات ليست مبرمجة صراحةً — بل تنبثق من الحجم والتدريب المسبق متعدد الوسائط.
النماذج الأساسية وأثرها
يُشير مصطلح النموذج الأساسي (Bommasani وآخرون، 2021) إلى النماذج الكبيرة المُدرَّبة على بيانات واسعة النطاق والتي يمكن تكييفها مع مهام مصب متعددة. GPT-4 وGemini وClaude وLLaMA وBERT كلها نماذج أساسية. ما يجعلها أساسية ليس حجمها بحد ذاته، بل عموميتها: يمكن تكييف نموذج مُدرَّب مسبقًا واحد، عبر الضبط الدقيق أو الحث، لمهام متنوعة كتشخيص الأمراض وتحليل الوثائق القانونية وتوليد الأكواد.
القدرات الناشئة
من أبرز خصائص النماذج الأساسية الظهور: قدرات نوعية تظهر فجأة عند أحجام معينة وتغيب في النماذج الأصغر. التعلم السياقي من أمثلة قليلة (القدرة على حل المهام من بضعة أمثلة في الحث دون تحديثات تدرجية)، والاستدلال بسلسلة الأفكار، والحساب متعدد الخطوات، كلها سلوكيات ناشئة لوحظت في نماذج لغوية كبيرة تتجاوز ~100 مليار معامل — سلوكيات لم يُحسَّن لها بصراحة أثناء التدريب.
| الخاصية | الوصف | الدلالة |
|---|---|---|
| الحجم | 100 مليار إلى تريليون+ معامل مُدرَّب على تريليونات الرموز | قدرات ناشئة غير متاحة في النماذج الأصغر |
| قابلية النقل | تدريب مرة واحدة، تكييف متعدد عبر الضبط الدقيق أو الحث | يُوزّع تكلفة التدريب على آلاف المهام المصب |
| التعلم من أمثلة قليلة | مهام جديدة تُحل من أمثلة في السياق دون تحديث تدرجي | انتشار سريع في مجالات جديدة دون إعادة تدريب |
| خطر التجانس | أنظمة عديدة مبنية على نموذج أساسي واحد | الأخطاء والتحيزات والإخفاقات تنتشر لجميع أنظمة المصب |
| مركزية البيانات | التدريب على بيانات بحجم الإنترنت يتطلب بنية تحتية ضخمة | الوصول والتطوير مركّزان في المؤسسات الكبيرة |
قوانين التحجيم العصبي
تصف قوانين التحجيم (Kaplan وآخرون، 2020؛ Hoffmann وآخرون، 2022 — "Chinchilla") علاقات قانون القوة القابلة للتنبؤ بين حجم النموذج وحجم مجموعة البيانات وميزانية الحوسبة والخسارة. أظهرت نتيجة Chinchilla أن معظم النماذج الكبيرة كانت مُدرَّبة تدريبًا ناقصًا: مع ميزانية حوسبة ثابتة، الأمثل هو تدريب نموذج أصغر على بيانات أكثر بدلًا من نموذج أكبر على رموز أقل. أدى ذلك إلى نماذج كـMistral-7B تحقق أداء GPT-3 بجزء من المعاملات.
وكلاء الذكاء الاصطناعي واستخدام الأدوات
النموذج الأساسي الذي لا يولّد سوى النص أداة قوية لكنها سلبية. تمتد وكلاء الذكاء الاصطناعي لتُمكّن النماذج اللغوية من اتخاذ إجراءات في العالم: تصفح الويب، وكتابة الأكواد وتنفيذها، واستدعاء واجهات برمجة التطبيقات، والاستعلام عن قواعد البيانات، وتسلسل خطوات الاستدلال لإنجاز أهداف متعددة الخطوات. يُحوّل نموذج الوكيل النماذج اللغوية من كائنات تُجيب على الأسئلة إلى حلاّل مشكلات فاعلة.
أنماط الوكلاء الأساسية
التحدي المحوري في وكلاء الذكاء الاصطناعي هو الموثوقية. استدعاء نموذج واحد بموثوقية 90% يتحول إلى نظام يفشل 65% من الوقت بعد 10 استدعاءات متتالية للأدوات (0.9¹⁰ ≈ 0.35). تستلزم متانة الوكيل اكتشاف الأخطاء ومنطق إعادة المحاولة واستراتيجيات الاحتياط وتحليلًا دقيقًا للمهام لتقليل الإجراءات غير القابلة للعكس. يُطوّر المجال بنشاط معايير تقييم (WebArena، SWE-bench، GAIA) لقياس أداء الوكلاء في العالم الحقيقي.
الحوسبة العصبية
تعمل عمليات التعلم العميق التقليدية على بنيات فون نيومان (معالجات CPU وGPU) التي تفصل الذاكرة عن الحوسبة، مما يُنشئ اختناقًا في عرض نطاق الذاكرة لضربات المصفوفات الكبيرة. تستلهم الحوسبة العصبية من الأنظمة العصبية البيولوجية لبناء أجهزة تتعايش فيها الحوسبة والذاكرة — الخلايا العصبية في الرقائق العصبية تخزن وتحسب في مكانها، مما يُلغي اختناق الذاكرة-الحوسبة.
الشبكات العصبية الشرارية
الشبكات العصبية الشرارية (SNNs) هي النموذج الحسابي الرئيسي للأجهزة العصبية. على عكس الخلايا العصبية الاصطناعية التي تُخرج تنشيطات مستمرة، تُطلق الخلايا العصبية الشرارية أحداثًا ثنائية منفصلة (شرارات) في أوقات محددة. يُشفَّر المعلومات في توقيت الشرارات ومعدلها لا في تنشيطات ذات قيم حقيقية. SNNs مدفوعة بالأحداث بطبيعتها: تستهلك الخلية العصبية الطاقة فقط حين تُطلق شرارة، خلافًا لضربات المصفوفات الكثيفة التي تستهلك الطاقة حتى حين تكون المدخلات صفرًا.
التحدي الرئيسي في الحوسبة العصبية هو مشكلة التدريب: الانتشار الخلفي لا ينطبق مباشرةً على SNNs لأن دالة الشرارة غير قابلة للاشتقاق. تُقرّب أساليب التدرج البديل دالة الشرارة بدالة سلسة أثناء الانتشار الخلفي. بدلًا من ذلك يمكن إنشاء SNNs بتحويل ANNs المُدرَّبة مسبقًا (تحويل ANN إلى SNN). تُقايض النماذج الناتجة عادةً بعض الدقة مقابل توفير هائل في الطاقة — مما يجعل الأنظمة العصبية أكثر جاذبية لتطبيقات الحافة التي تعمل دائمًا وتعتمد على البطاريات.
التعلم الآلي الكمي
يستكشف التعلم الآلي الكمي (QML) كيف يمكن لأجهزة الحوسبة الكمية تسريع أو تعزيز خوارزميات التعلم الآلي نوعيًا. تُمثّل أجهزة الحوسبة الكمية المعلومات بالكيوبت، التي على خلاف البتات الكلاسيكية يمكنها الوجود في تراكبات من 0 و1 في آنٍ واحد. يُتيح هذا التراكب، مقرونًا بالتشابك والتداخل، للخوارزميات الكمية استكشاف فضاءات حلول ضخمة أسيًا بطرق لا تستطيع أجهزة الكمبيوتر الكلاسيكية تكرارها بكفاءة.
الدوائر الكمية التباينية
أكثر مناهج QML عملية على المدى القريب هو الدوائر الكمية التباينية (VQCs)، وتُسمى أيضًا الشبكات العصبية الكمية. تُطبّق VQC تسلسلًا معيَّرًا من البوابات الكمية على الكيوبتات ثم تقيس المخرجات. تُحسَّن المعاملات كلاسيكيًا باستخدام حلقة هجينة كمية-كلاسيكية — تحسب الدائرة الكمية التمرير الأمامي، وتُقدَّر التدرجات عبر قاعدة إزاحة المعاملات أو الفروقات المنتهية، ثم تُحدّث المحسّنات الكلاسيكية المعاملات. تم توضيح VQCs للتصنيف والانحدار والمهام التوليدية على أجهزة كمية صغيرة.
| منهج QML | الميزة الكمية المدّعاة | الحالة الراهنة |
|---|---|---|
| آلة المتجهات الداعمة الكمية (QSVM) | تسريع أسي لتقييم النواة في فضاء ميزات عالي الأبعاد | نظرية؛ نتائج إزالة الكم تُقلّص الميزة للبيانات الكلاسيكية |
| PCA الكمي (qPCA) | تسريع أسي في تحليل القيم الذاتية لمصفوفات الكثافة | يتطلب ذاكرة RAM الكمية (QRAM) البعيدة عن التطبيق العملي |
| QNN التباينية | قد تتعلم دوالًا صعبة على الشبكات الكلاسيكية للبيانات ذات الطابع الكمي | تم إثباتها على مجموعات بيانات صغيرة؛ مشكلة النجد العقيم تُقيّد التدريب |
| آلة بولتزمان الكمية | أخذ عينات من توزيعات معقدة بكفاءة أكبر باستخدام التلدين الكمي | يُستخدَم D-Wave annealer؛ مقيّد بالرسوم البيانية منخفضة الترابط |
كثير من التسريعات الكمية المدّعاة في التعلم الآلي تم "إزالة كمها" — وُجد لاحقًا أن الخوارزميات الكلاسيكية (أخذ العينات، الجبر الخطي العشوائي) تحقق تعقيدًا مقاربيًا مماثلًا. تبقى الحجة للميزة الكمية الحقيقية في التعلم الآلي أقوى للمسائل التي تكون فيها بيانات الإدخال بطبيعتها كمية (كيمياء كمية، محاكاة كمية) لا البيانات الكلاسيكية المُشفَّرة في حالات كمية.
التعلم الآلي على الحافة وTinyML
يفرض نشر التعلم الآلي على الحافة — في المتحكمات الدقيقة والهواتف الذكية وأجهزة استشعار إنترنت الأشياء والأنظمة المدمجة — قيودًا صارمة: ميلي واط من الطاقة، وكيلوبايت من ذاكرة الوصول العشوائي، وميغابايت من مساحة التخزين، وميلي ثانية من زمن الاستجابة. TinyML هو تخصص جعل الشبكات العصبية تعمل ضمن هذه القيود دون اتصال بالسحابة. هذا ضروري لتطبيقات كالكشف الدائم عن الكلمات المفتاحية، ومراقبة الصحة على الجهاز، والكاميرات الذكية، والمركبات ذاتية القيادة حيث تُدخل رحلات ذهاب وإياب للسحابة زمن استجابة غير مقبول أو خطر يمس الخصوصية.
تقنيات ضغط النماذج
التحدي الرئيسي في TinyML هو أن أدق النماذج هي الأكبر، بينما تتطلب قيود الحافة نماذج صغيرة. يُؤتمت البحث عن البنيات العصبية (NAS) تصميم البنيات التي تضرب حدودًا بارتو محددة للدقة مقابل حجم النموذج أو زمن الاستجابة — يبحث عبر مليارات التكوينات الممكنة للشبكة ليجد تلك التي تناسب ميزانيات الأجهزة المحددة. يدمج NAS المدرك للأجهزة (مثل MCUNet وOnce-for-All) جداول زمن استجابة الأجهزة مباشرةً في هدف البحث.
التقاطع: المستقبل الموحّد
أبرز ما في هذه الاتجاهات الناشئة هو تقاطعها. توفر النماذج الأساسية العمود الفقري الاستدلالي لوكلاء الذكاء الاصطناعي؛ وتوسّع المشفّرات متعددة الوسائط ما يمكن للوكلاء إدراكه؛ ويُوصل التعلم الآلي على الحافة الوكلاء إلى البيئات المقيّدة الموارد؛ وقد يُشغّل الأجهزة العصبية يومًا ما وكلاء الحافة بكفاءة طاقة على المستوى البيولوجي. الحوسبة الكمية، رغم أنها أكثر تأملًا، قد تُسرّع في نهاية المطاف التحسين أو أخذ العينات أو خطوات الاستنتاج الجوهرية لجميع هذه الأنظمة.
تخيّل مركبة ذاتية القيادة في المستقبل القريب: نموذج أساسي متعدد الوسائط مضغوط (رؤية + LIDAR + خريطة) يعمل على رقاقة استنتاج مُستلهَمة من الحوسبة العصبية على الحافة، مع طبقة تخطيط وكيلة تستدعي واجهات برمجية للملاحة والمرور، كل ذلك يُحدَّث عبر التعلم الاتحادي دون نقل بيانات الاستشعار الخام. كل اتجاه ناشئ تم وصفه في هذا الدرس يؤدي دورًا في ذلك النظام.
التحديات القائمة
- التكلفة الطاقوية للتحجيم — يستهلك تدريب نموذج أساسي كبير طاقة تعادل مئات الرحلات عبر المحيط الأطلسي؛ يتطلب التعلم الآلي المستدام كفاءة خوارزمية وبنية تحتية للطاقة المتجددة
- قابلية التفسير على نطاق واسع — مع نمو النماذج يصعب فهم ما تعلمته؛ بحث قابلية التفسير الآلي يتقدم لكنه لا يزال بعيدًا عن الشمولية للنماذج الحدودية
- السلامة في الأنظمة الوكيلة — الوكلاء الذين يتخذون إجراءات في العالم الحقيقي يُنشئون أنماط فشل جديدة: حقن الحث، وإساءة استخدام الأدوات، والأخطاء المتسلسلة في الوكلاء متعددي الخطوات
- معدلات أخطاء الكم — ~0.1–1% لكل بوابة حاليًا؛ الحوسبة الكمية المتحملة للأخطاء تتطلب ~1000 كيوبت فيزيائي لكل كيوبت منطقي
- التدريب على الجهاز — الاستنتاج على الحافة محلول؛ الضبط الدقيق على الجهاز والتعلم المستمر ضمن ميزانيات الكيلوبايت من الذاكرة لا يزالان تحديات بحثية نشطة
تُوافق النماذج متعددة الوسائط بين الرؤية واللغة والصوت في تمثيلات مشتركة (التدريب التبايني CLIP؛ الانتشار للتوليد). تُظهر النماذج الأساسية قدرات ناشئة على نطاق واسع، يحكمها قانون تحجيم أسي — تُثبت نتيجة Chinchilla أن التدريب الأمثل حوسبيًا يستخدم معاملات أقل على بيانات أكثر. تُمتدّ وكلاء الذكاء الاصطناعي النماذج اللغوية لاتخاذ إجراءات عبر استدعاء الأدوات وRAG والتخطيط متعدد الخطوات (ReAct). تستخدم الرقائق العصبية الخلايا العصبية الشرارية للحوسبة المدفوعة بالأحداث المتناسبة مع الطاقة. يستخدم التعلم الآلي الكمي الدوائر التباينية في حلقات هجينة كمية-كلاسيكية، مع أوضح ميزة للبيانات ذات الطابع الكمي. يُنشر التعلم الآلي على الحافة نماذج مضغوطة (التكميم، والتقليم، والتقطير، وNAS) للمتحكمات الدقيقة والهواتف. تتقاطع الاتجاهات الست نحو أنظمة تعلم آلي قادرة وفعّالة ومستقلة تعمل عبر طيف الحوسبة الكامل.