ثورة الذكاء الاصطناعي
من الأنظمة القائمة على القواعد إلى آلات تكتب الشعر — كيف وصلنا إلى هنا؟
ما هو الذكاء الاصطناعي؟
الذكاء الاصطناعي هو علم جعل الآلات تقوم بأشياء تتطلب ذكاءً لو قام بها الإنسان — التعلم والتفكير وحل المشكلات والإبداع.
ببساطة: كتاب طبخ في مقابل طبّاخ تعلّم بالتذوّق. النظام القائم على القواعد يتبع الوصفة حرفياً وينهار لحظة نقصان مكوّن واحد؛ أمّا الثلاثة الأخرى فقد تعلّمت من التجربة، كلٌّ منها من تجربة أوسع من سابقتها.
تقنيًّا: الذكاء الاصطناعي الرمزي (القائم على القواعد) وتعلّم الآلة مقاربتان تحت مظلّة واحدة. والتعلّم العميق مجموعة جزئية من تعلّم الآلة — شبكات ذات طبقات كثيرة — والذكاء الاصطناعي التوليدي استخدامٌ للتعلّم العميق يمثّل التوزيع الاحتمالي تمثيلاً يكفي لأخذ عيّنات جديدة منه.
البدايات المبكرة للذكاء الاصطناعي
حلم الآلات المفكرة أقدم مما قد تتوقع.
ببساطة: يمرّ على هذا الخطّ الزمني قرابة خمسين سنة ولا شيء فيه قادر على إجراء محادثة. ظلّ المجال يعلن أنه أوشك على الوصول، وظلّ مخطئاً — مرّتين بقدرٍ كافٍ لتوقّف التمويل.
تقنيًّا: القوس من 1950 إلى 1997 هو الذكاء الاصطناعي الرمزي: قواعد مكتوبة يدوياً وبحث. اقترح Turing سنة 1950 معيار لعبة المحاكاة؛ وكان ELIZA سنة 1966 استبدالاً للأنماط بلا أي تمثيل للمعنى؛ وكان Deep Blue سنة 1997 بحث alpha–beta فوق دالّة تقييم مضبوطة يدوياً. كلّ انتصار جاء من البحث والقواعد، ولهذا لم يُعمَّم أيٌّ منها.
من شتاء الذكاء الاصطناعي إلى ربيعه
لعقود، كانت الشبكات العصبية طريقًا مسدودًا. ثلاثة اختراقات غيّرت كل شيء.
ببساطة: كانت الوصفة مكتوبة منذ سنوات؛ والذي وصل أخيراً هو المكوّنات والفرن. صورٌ أكثر ممّا يستطيع أحد النظر إليه، ورقاقة صُنعت لألعاب الفيديو فإذا بها مثالية للمهمّة.
تقنيًّا: الانتشار العكسي يعود إلى ثمانينيات القرن الماضي؛ والذي تغيّر بحلول 2012 هو المقياس والتهيئة — مجاميع بيانات موسومة بحجم الويب مثل ImageNet، وإنتاجية معالجات الرسوميات في ضرب المصفوفات الكثيفة، ثم ReLU وdropout اللذان خفّفا تلاشي التدرّجات وفرط المطابقة في الأكداس العميقة. وقد جمع AlexNet (Krizhevsky وزملاؤه، 2012) الثلاثة معاً.
تعلم الآلة
البرمجة التقليدية: البشر يكتبون القواعد. تعلم الآلة يعكس ذلك — البيانات تُعلّم القواعد.
y = mx + b الذي يناسب بياناتك بشكل أفضل عن طريق تقليل الخطأ بين التنبؤات والقيم الفعلية. كل خطوة “تدريب” تُعدّل m (الميل) وb (نقطة التقاطع) للاقتراب أكثر.
ببساطة: أنت لا تعلّمه الحساب. تعرض عليه 2→4 و5→10 و8→16 فيستنتج “ضاعِفه” بنفسه — تماماً كما التقطتَ أنت النمط قبل أن يخبرك أحد بالقاعدة.
تقنيًّا: انحدار خطّي بالمربّعات الصغرى: تلائم الأداة ميلاً m وتقاطعاً b بتصغير مربّع الخطأ بين قيمة y المتوقَّعة والملاحَظة. و“القاعدة” المتعلَّمة هي هذان الرقمان — لا جدول بحث مخزَّن للأمثلة التي أدخلتَها.
التعلم بإشراف مقابل بدون إشراف
النهجان الرئيسيان لتعلم الآلة. انقر على اللوحات لإضافة نقاط ورؤية الفرق.
ببساطة: طريقتان لفرز كومة غسيل. إمّا أن يكون أحدهم قد أخبرك سلفاً إلى أي كومة ينتمي كلّ جورب، وإمّا أن تلاحظ ببساطة أن بعضها صوفي وبعضها ليس كذلك، فتصنع أكوامك بنفسك.
تقنيًّا: التعلّم بإشراف يلائم حدّ قرار على أزواج (x, y) حيث y وسمٌ مُعطى. أمّا التعلّم بلا إشراف فلا y فيه، وإنما يقسّم فضاء المُدخلات وفق دالّة تشابه — وk-means يصغّر التباين داخل العنقود. والعناقيد التي يجدها بلا أسماء، لأن أحداً لم يمنحها أسماء.
الشبكات العصبية
مستوحاة من الدماغ — طبقات من “الخلايا العصبية” متصلة بـروابط موزونة.
تتعلم الشبكة بضبط ملايين الأوزان لتقليل أخطاء التنبؤ.
ببساطة: تخيّل لوحة توصيل هائلة، لكلّ سلك فيها مقبض صوت خاصّ به. والتعلّم هو إدارة ملايين تلك المقابض جزءاً يسيراً في كلّ مرّة حتى يخرج الشيء الصحيح من الطرف الآخر.
تقنيًّا: كلّ طبقة تحسب مجموعاً موزوناً لمُدخلاتها زائد انحياز، ثم تطبّق دالّة لاخطّية. والتدريب هبوطٌ تدرّجي على دالّة خسارة: يوفّر الانتشار العكسي مشتقّة الخطأ بالنسبة إلى كلّ وزن على حدة، ثم يخطو كلّ وزن خطوة صغيرة عكس تدرّجه.
البيرسبترون (1958)
انقر على المدخلات للتبديل، عدّل الأوزان — شاهد تدفق الحساب.
ببساطة: حارس باب بقاعدة واحدة: اجمع مقدار أهمّية كلّ شيء عندك، فإن تجاوز المجموع العتبة فأْذَن بالدخول. غيّر مقدار الأهمّية تتغيّر قائمة الداخلين.
تقنيًّا: يحسب البيرسبترون (Rosenblatt، 1958) دالّة درجية للمقدار w·x + b — أي وحدة عتبة خطّية واحدة. وضبط الأوزان والانحياز يحرّك مستوياً فائقاً واحداً ويُديره، ولهذا بالضبط يستطيع تحقيق AND وOR ولا يستطيع XOR أبداً: فXOR غير قابلة للفصل خطّياً.
التعلم العميق
رتّب طبقات عديدة والشبكات العميقة تتعلم تمثيلات أكثر تجريدًا. كل طبقة تبني على سابقتها.
ببساطة: لا أحد يعلّم طفلاً أن العين خطّان منحنيان ونقطة. يرى وجوهاً كافية فتتجمّع الأجزاء من تلقاء نفسها — الحوافّ أوّلاً، ثم الأشكال، ثم الوجوه كاملة.
تقنيًّا: العمق يشتري التركيب. الطبقة k تبني سماتها من سمات الطبقة k−1، فتنمو القدرة التعبيرية بالعمق لا بالعرض؛ والشبكة الضحلة تحتاج إلى وحدات أكثر أُسّياً للتعبير عن الدوالّ نفسها. أمّا تدرّج الحوافّ ← الأجزاء ← الأجسام في الجدول فقد لوحظ تجريبياً في شبكات التفافية مدرَّبة.
أكثر من مجرّد إكمال تلقائي
هاتفك يخمّن الكلمة التالية. أمّا نموذج اللغة الكبير فيُكمل الفكرة بأكملها.
ببساطة: هاتفك يُكمل الكلمة. والنموذج يُكمل الفكرة — ثم الفقرة التي بعدها، وهو لا يزال في الموضوع نفسه.
تقنيًّا: الإكمال التلقائي في الهاتف عادةً نموذج n-gram قصير الرتبة أو نموذج خفيف فوق إحصاءات كلمات محلّية. أمّا LLM فيشترط كلّ رمز على كامل السياق السابق ويُعيد إدخال مخرجاته إلى نفسه، فيُصان الاتّساق عبر مئات الرموز لا عبر رمز واحد.
آلية الانتباه
عند معالجة كلمة ما، النموذج “ينتبه” للكلمات الأخرى ذات الصلة — وهذه هي الوصفة، ثم الشيء نفسه.
ببساطة: “جلس القطّ على الحصيرة لأنه كان متعباً.” الحصيرة لا تتعب. حسمتَ هذا من غير أن تنتبه إلى أنك حسمتَه — رجعتَ إلى كلمة واحدة بعينها وتجاهلتَ البقية. أمّا النموذج فعليه أن يكسبه، وأعلاه تستطيع أن تشاهد اللحظة التي يكسبه فيها.
تقنيًّا: لكلّ موضع يحسب النموذج درجة صلة مقابل كلّ موضع آخر، ثم يعيّر تلك الدرجات إلى توزيع مجموعه 1، ثم يأخذ المجموع الموزون لتمثيلات المواضع الأخرى. ومن هذه الأوزان تنبثق الإحالة المرجعية، لا من مرحلة حلٍّ منفصلة: استعلام “لأنه” يسجّل أعلى درجة مقابل “القطّ”. ولأن كلّ زوج يُقيَّم مباشرةً فإن المسافة بين أي رمزين خطوة واحدة مهما تباعدا.
لماذا تفوز المحوّلات
الشبكات التكرارية تقرأ كلمة واحدة في كل مرة. المحوّلات ترى كل الكلمات دفعة واحدة.
ببساطة: ستّة أشخاص يمرّرون رسالة في صفّ واحداً بعد آخر، مقابل ستّة يقرؤون الصفحة نفسها دفعةً واحدة. المجموعة الثانية تفرغ في الزمن الذي تستغرقه الأولى في تمريرة واحدة.
تقنيًّا: الحالة الخفيّة في الشبكة العَودية عند الخطوة t تعتمد على الخطوة t−1، فلا يمكن توازي التدريب على امتداد المتتالية. أمّا الانتباه الذاتي فلا عَودية فيه: تُحسب كلّ المواضع في ضرب مصفوفات واحد، مقايضةً لـO(n) خطوة تسلسلية بـO(n²) مقارنة زوجية ينفّذها معالج الرسوميات في آنٍ واحد (Vaswani وزملاؤه، 2017).
ثلاث عائلات من المحوّلات
المحوّل نفسه، موصولٌ بثلاث طرق لثلاث مهام مختلفة — كاتب، وقارئ، ومترجم. بدّل بينها لترى الكتل التي تستخدمها كل عائلة. وقد كان محوّل 2017 الأصلي هو الشكل الكامل — ست طبقات ترميز وست طبقات فكّ ترميز (Vaswani وآخرون، §3.1)؛ والعائلات ذات الكومة الواحدة جاءت بعده.
ببساطة: المحرّك نفسه في ثلاثة هياكل مختلفة. واحد مبنيّ للمضيّ إلى الأمام (الكتابة)، وواحد لاستيعاب الصفحة كلّها دفعةً واحدة (القراءة)، وواحد يستقبل من طرف ويُنتج من الطرف الآخر (الترجمة).
تقنيًّا: بنية المفكِّك وحده (GPT) تكدّس انتباهاً ذاتياً مُقنَّعاً وتُدرَّب على توقّع الرمز التالي. وبنية المرمِّز وحده (BERT) تستعمل انتباهاً ذاتياً غير مُقنَّع وتُدرَّب على ملء المواضع المُقنَّعة. أمّا بنية المرمِّز–المفكِّك (T5) فتُبقي الكُدسين معاً وتضيف الانتباه المتقاطع، فتُسقط متتالية دخل على متتالية خرج تُولَّد على حدة.
من GPT إلى Claude
المحوّل أشعل سباقًا أعاد تشكيل صناعة التكنولوجيا في 7 سنوات فقط.
ما حجم النماذج اليوم؟
عالمان مختلفان، وواحد منهما فقط يَنشر أرقامه.
ببساطة: الفكرة نفسها، تكبر كلّ سنة، حتى توقّفت عند نقطةٍ ما عن كونها عرضاً بحثياً وصارت شيئاً يستعمله مئة مليون إنسان قبل أن يفرغ أحد من الجدال حوله.
تقنيًّا: القوس مقياسٌ زائد واجهة. أظهر GPT-1 سنة 2018 أن التدريب التوليدي المسبق قابل للنقل؛ وأظهر GPT-3 سنة 2020 انبثاق التعلّم بأمثلة قليلة داخل السياق عند نحو 175 مليار وسيط؛ وأضاف ChatGPT سنة 2022 الضبط بالتعليمات وواجهة محادثة — وهو تغيير في المنتج لا في البنية. حسّاس للزمن: صفّا 2023 و2025 يصفان مشهداً يتحرّك أسرع من أي شريحة.
اختبار المعرفة
سبعة أسئلة على هذه الوحدة. أجب لترى السبب — يظهر الشرح سواء أصبتَ أم أخطأت.