ثورة الذكاء الاصطناعي

من الأنظمة القائمة على القواعد إلى آلات تكتب الشعر — كيف وصلنا إلى هنا؟

ما هو الذكاء الاصطناعي؟

الذكاء الاصطناعي هو علم جعل الآلات تقوم بأشياء تتطلب ذكاءً لو قام بها الإنسان — التعلم والتفكير وحل المشكلات والإبداع.

📏
القائم على القواعد (الذكاء الاصطناعي الكلاسيكي)
قواعد صريحة "إذا/إذن" يكتبها المبرمجون. قوية لكنها هشة.
📊
تعلم الآلة
أنظمة تتعلم الأنماط من البيانات دون برمجتها صراحةً.
🧠
التعلم العميق
شبكات عصبية ذات طبقات عديدة تتعلم تمثيلات مجردة.
✨
الذكاء الاصطناعي التوليدي
نماذج تُنشئ محتوى جديدًا — نصوصًا وصورًا وأكوادًا وموسيقى.
بلغة مبسّطة

ببساطة: كتاب طبخ في مقابل طبّاخ تعلّم بالتذوّق. النظام القائم على القواعد يتبع الوصفة حرفياً وينهار لحظة نقصان مكوّن واحد؛ أمّا الثلاثة الأخرى فقد تعلّمت من التجربة، كلٌّ منها من تجربة أوسع من سابقتها.

تقنيًّا: الذكاء الاصطناعي الرمزي (القائم على القواعد) وتعلّم الآلة مقاربتان تحت مظلّة واحدة. والتعلّم العميق مجموعة جزئية من تعلّم الآلة — شبكات ذات طبقات كثيرة — والذكاء الاصطناعي التوليدي استخدامٌ للتعلّم العميق يمثّل التوزيع الاحتمالي تمثيلاً يكفي لأخذ عيّنات جديدة منه.

البدايات المبكرة للذكاء الاصطناعي

حلم الآلات المفكرة أقدم مما قد تتوقع.

📜
1950
آلان تورنج — “هل تستطيع الآلات التفكير؟”
اقترح اختبار تورنج في ورقته البحثية “الحوسبة والذكاء”
اقرأ الورقة البحثية
🏛️
1956
مؤتمر دارتموث
صُكّ مصطلح “الذكاء الاصطناعي”. وُلد المجال رسميًا.
اعرف المزيد
💬
1966
روبوت الدردشة ELIZA
بنى MIT روبوت دردشة يحاكي معالجًا نفسيًا — مقنعًا بشكل مفاجئ لعصره.
اعرف المزيد
❄️
1974–93
شتاء الذكاء الاصطناعي
وعود مبالغ فيها وتنفيذ ناقص. جفّ التمويل مرتين مع انهيار دورات الضجيج.
اعرف المزيد
♟️
1997
ديب بلو يهزم كاسباروف
حاسوب الشطرنج من IBM يهزم بطل العالم في مباراة تاريخية.
اعرف المزيد
بلغة مبسّطة

ببساطة: يمرّ على هذا الخطّ الزمني قرابة خمسين سنة ولا شيء فيه قادر على إجراء محادثة. ظلّ المجال يعلن أنه أوشك على الوصول، وظلّ مخطئاً — مرّتين بقدرٍ كافٍ لتوقّف التمويل.

تقنيًّا: القوس من 1950 إلى 1997 هو الذكاء الاصطناعي الرمزي: قواعد مكتوبة يدوياً وبحث. اقترح Turing سنة 1950 معيار لعبة المحاكاة؛ وكان ELIZA سنة 1966 استبدالاً للأنماط بلا أي تمثيل للمعنى؛ وكان Deep Blue سنة 1997 بحث alpha–beta فوق دالّة تقييم مضبوطة يدوياً. كلّ انتصار جاء من البحث والقواعد، ولهذا لم يُعمَّم أيٌّ منها.

من شتاء الذكاء الاصطناعي إلى ربيعه

لعقود، كانت الشبكات العصبية طريقًا مسدودًا. ثلاثة اختراقات غيّرت كل شيء.

📊
انفجار البيانات
نحو 1000 ضعف من البيانات في عقد
الإنترنت والهواتف الذكية والمستشعرات أنشأت محيطات من بيانات التدريب التي تحتاجها الخوارزميات الجائعة.
⚡
ثورة معالجات الرسوميات
أسرع بمراتب من حيث الحجم
بطاقات الرسوميات المصممة للألعاب اتضح أنها مثالية للعمليات الحسابية المتوازية — جوهر الشبكات العصبية.
🧮
خوارزميات أفضل
ReLU و Dropout وإصلاحات الانتشار العكسي
تحسينات بسيطة لكنها حاسمة سمحت للشبكات بالتعمق دون تلاشي التدرجات.
🏆
2012 — الاختراق
AlexNet يسحق ImageNet
شبكة CNN عميقة تفوقت على المنافسة بأكثر من 10 نقاط مئوية. بدأ ربيع الذكاء الاصطناعي الثالث.
اقرأ عن AlexNet
بلغة مبسّطة

ببساطة: كانت الوصفة مكتوبة منذ سنوات؛ والذي وصل أخيراً هو المكوّنات والفرن. صورٌ أكثر ممّا يستطيع أحد النظر إليه، ورقاقة صُنعت لألعاب الفيديو فإذا بها مثالية للمهمّة.

تقنيًّا: الانتشار العكسي يعود إلى ثمانينيات القرن الماضي؛ والذي تغيّر بحلول 2012 هو المقياس والتهيئة — مجاميع بيانات موسومة بحجم الويب مثل ImageNet، وإنتاجية معالجات الرسوميات في ضرب المصفوفات الكثيفة، ثم ReLU وdropout اللذان خفّفا تلاشي التدرّجات وفرط المطابقة في الأكداس العميقة. وقد جمع AlexNet (‏Krizhevsky وزملاؤه، 2012) الثلاثة معاً.

تعلم الآلة

البرمجة التقليدية: البشر يكتبون القواعد. تعلم الآلة يعكس ذلك — البيانات تُعلّم القواعد.

🧪
ساحة تعلم الآلة
أدخل أمثلة، درّب نموذجًا، اختبر التنبؤات
1
بيانات التدريب
الإدخال (x)الإخراج (y)
→
2
التدريب
في انتظار بيانات التدريب...
3
التنبؤ
f( ) = —
جرّب النمط: 2→4، 5→10، 8→16. هل يستطيع النموذج اكتشاف y = 2x؟
ما وراء الكواليس: يستخدم النموذج الانحدار الخطي — يجد الخط y = mx + b الذي يناسب بياناتك بشكل أفضل عن طريق تقليل الخطأ بين التنبؤات والقيم الفعلية. كل خطوة “تدريب” تُعدّل m (الميل) وb (نقطة التقاطع) للاقتراب أكثر.
بلغة مبسّطة

ببساطة: أنت لا تعلّمه الحساب. تعرض عليه 2→4 و5→10 و8→16 فيستنتج “ضاعِفه” بنفسه — تماماً كما التقطتَ أنت النمط قبل أن يخبرك أحد بالقاعدة.

تقنيًّا: انحدار خطّي بالمربّعات الصغرى: تلائم الأداة ميلاً m وتقاطعاً b بتصغير مربّع الخطأ بين قيمة y المتوقَّعة والملاحَظة. و“القاعدة” المتعلَّمة هي هذان الرقمان — لا جدول بحث مخزَّن للأمثلة التي أدخلتَها.

التعلم بإشراف مقابل بدون إشراف

النهجان الرئيسيان لتعلم الآلة. انقر على اللوحات لإضافة نقاط ورؤية الفرق.

بإشراف
أنت تُسمّي البيانات — النموذج يتعلم الحدود
بدون إشراف
بدون تسميات — النموذج يكتشف التجمعات بنفسه
بلغة مبسّطة

ببساطة: طريقتان لفرز كومة غسيل. إمّا أن يكون أحدهم قد أخبرك سلفاً إلى أي كومة ينتمي كلّ جورب، وإمّا أن تلاحظ ببساطة أن بعضها صوفي وبعضها ليس كذلك، فتصنع أكوامك بنفسك.

تقنيًّا: التعلّم بإشراف يلائم حدّ قرار على أزواج (x, y) حيث y وسمٌ مُعطى. أمّا التعلّم بلا إشراف فلا y فيه، وإنما يقسّم فضاء المُدخلات وفق دالّة تشابه — وk-means يصغّر التباين داخل العنقود. والعناقيد التي يجدها بلا أسماء، لأن أحداً لم يمنحها أسماء.

الشبكات العصبية

مستوحاة من الدماغ — طبقات من “الخلايا العصبية” متصلة بـروابط موزونة.

الإدخال المخفية الإخراج x₁ x₂ x₃ y₁ y₂

تتعلم الشبكة بضبط ملايين الأوزان لتقليل أخطاء التنبؤ.

بلغة مبسّطة

ببساطة: تخيّل لوحة توصيل هائلة، لكلّ سلك فيها مقبض صوت خاصّ به. والتعلّم هو إدارة ملايين تلك المقابض جزءاً يسيراً في كلّ مرّة حتى يخرج الشيء الصحيح من الطرف الآخر.

تقنيًّا: كلّ طبقة تحسب مجموعاً موزوناً لمُدخلاتها زائد انحياز، ثم تطبّق دالّة لاخطّية. والتدريب هبوطٌ تدرّجي على دالّة خسارة: يوفّر الانتشار العكسي مشتقّة الخطأ بالنسبة إلى كلّ وزن على حدة، ثم يخطو كلّ وزن خطوة صغيرة عكس تدرّجه.

البيرسبترون (1958)

انقر على المدخلات للتبديل، عدّل الأوزان — شاهد تدفق الحساب.

1.0 + − 1.0 + − 0 x₁ 0 x₂ -1.5 bias + − Σ = 0.0 step(x) 0 الناتج
0×1.0 + 0×1.0 + (-1.5) = -1.5 → 0
انقر على الدوائر لتبديل المدخلات • استخدم +/− لتعديل الأوزان
بلغة مبسّطة

ببساطة: حارس باب بقاعدة واحدة: اجمع مقدار أهمّية كلّ شيء عندك، فإن تجاوز المجموع العتبة فأْذَن بالدخول. غيّر مقدار الأهمّية تتغيّر قائمة الداخلين.

تقنيًّا: يحسب البيرسبترون (‏Rosenblatt، 1958) دالّة درجية للمقدار w·x + b — أي وحدة عتبة خطّية واحدة. وضبط الأوزان والانحياز يحرّك مستوياً فائقاً واحداً ويُديره، ولهذا بالضبط يستطيع تحقيق AND وOR ولا يستطيع XOR أبداً: فXOR غير قابلة للفصل خطّياً.

التعلم العميق

رتّب طبقات عديدة والشبكات العميقة تتعلم تمثيلات أكثر تجريدًا. كل طبقة تبني على سابقتها.

الطبقة
ترى
مثال (الوجوه)
1
بكسلات خام
حواف، تدرجات
2
تركيبات حواف
أشكال، منحنيات
3
أجزاء الكائن
عيون، أنوف
4
كائنات كاملة
وجوه، هوية
GPT-4
~1.8 تريليون معامل لـGPT-4 — تقدير خارجي؛ لم تنشره OpenAI قطّ
+120
طبقة عمق — مُتناقَل
13T
رمز تدريب — مُتناقَل
لماذا العمق مهم: الشبكة السطحية لا تتعلم إلا أنماطًا بسيطة. تكديس الطبقات يتيح للنموذج تركيب الميزات — من بكسلات إلى حواف إلى أشكال إلى مفاهيم. هذه التركيبية هي ما يجعل التعلم العميق قويًا بما يكفي للغة والرؤية وتوليد الأكواد.
بلغة مبسّطة

ببساطة: لا أحد يعلّم طفلاً أن العين خطّان منحنيان ونقطة. يرى وجوهاً كافية فتتجمّع الأجزاء من تلقاء نفسها — الحوافّ أوّلاً، ثم الأشكال، ثم الوجوه كاملة.

تقنيًّا: العمق يشتري التركيب. الطبقة k تبني سماتها من سمات الطبقة k−1، فتنمو القدرة التعبيرية بالعمق لا بالعرض؛ والشبكة الضحلة تحتاج إلى وحدات أكثر أُسّياً للتعبير عن الدوالّ نفسها. أمّا تدرّج الحوافّ ← الأجزاء ← الأجسام في الجدول فقد لوحظ تجريبياً في شبكات التفافية مدرَّبة.

أكثر من مجرّد إكمال تلقائي

هاتفك يخمّن الكلمة التالية. أمّا نموذج اللغة الكبير فيُكمل الفكرة بأكملها.

الإكمال التلقائي مقابل نموذج اللغة الكبير
📱 الإكمال التلقائي في الهاتف
اختر عبارة من الأعلى.
يتنبّأ بكلمة واحدة مرجّحة اعتماداً على إحصاءات الكلمات المحلية.
✨ نموذج اللغة الكبير
اختر عبارة من الأعلى.
يواصل فكرة متماسكة عبر كثير من الرموز.
بلغة مبسّطة

ببساطة: هاتفك يُكمل الكلمة. والنموذج يُكمل الفكرة — ثم الفقرة التي بعدها، وهو لا يزال في الموضوع نفسه.

تقنيًّا: الإكمال التلقائي في الهاتف عادةً نموذج n-gram قصير الرتبة أو نموذج خفيف فوق إحصاءات كلمات محلّية. أمّا LLM فيشترط كلّ رمز على كامل السياق السابق ويُعيد إدخال مخرجاته إلى نفسه، فيُصان الاتّساق عبر مئات الرموز لا عبر رمز واحد.

آلية الانتباه

عند معالجة كلمة ما، النموذج “ينتبه” للكلمات الأخرى ذات الصلة — وهذه هي الوصفة، ثم الشيء نفسه.

🎯
١. قيّم كل كلمة
وهو يقرأ كلمةً واحدة، يمنح كل كلمة أخرى في الجملة درجةً تقول: ما مدى صلتها بهذه الكلمة؟
📊
٢. حوّل الدرجات إلى حصص
تُضغط الدرجات إلى نسب مجموعها ١٠٠٪ — وهذه هي أوزان الانتباه.
🪨
٣. امزج المعاني
يصبح تمثيل الكلمة خليطاً من الكلمات التي منحها أكبر وزن.
لأن كل كلمة تُقيَّم مقابل كل كلمة أخرى، يستطيع الضمير أن يمتدّ إلى اسمه مهما بَعُد عنه. جرّبها أدناه: مرّر المؤشر على “لأنه” وشاهد الخطوات الثلاث أعلاه تعمل على جملةٍ واحدة. أمّا الصيغة الرياضية التي تنتج هذه الأوزان فموعدها الوحدة الثانية.
كشّاف الانتباه — على من يعود الضمير في “لأنه”؟
مرّر المؤشر أو انقر على “لأنه” لترى الكلمات التي تنتبه إليها.
الانتباه الذاتي يحسم مرجع الضمير في “لأنه” بمنح الوزن الأكبر لكلمة “القطّ”، لا “الحصيرة” — مع أن الحصيرة أقرب، وكلمة “الدافئة” تجعل القراءة الأخرى مغرية. والعربية تمنحك دليلاً إضافياً: متعباً مذكّر والحصيرة مؤنّثة، فالمطابقة وحدها تحسم الإحالة. وما تراه هنا مُشفِّر ثنائي الاتجاه يحقّ له النظر في الجهتين، ولهذا يسحب الضمير وزناً من “متعباً” و“اللعب” وهما تأتيان بعده. أمّا المُفكِّك من طراز GPT فهو سببي — لا يرى إلا ما سبق. وهذه الأوزان توضيحية ومؤلَّفة يدوياً، غير مأخوذة من نموذج مدرَّب — لكن الظاهرة نفسها حقيقية ومنشورة: يعرضها Vaswani وآخرون (2017) في الشكل 4، حيث يُربط الضمير “its” بكلمة “Law” عند الطبقة الخامسة من ست.
بلغة مبسّطة

ببساطة: “جلس القطّ على الحصيرة لأنه كان متعباً.” الحصيرة لا تتعب. حسمتَ هذا من غير أن تنتبه إلى أنك حسمتَه — رجعتَ إلى كلمة واحدة بعينها وتجاهلتَ البقية. أمّا النموذج فعليه أن يكسبه، وأعلاه تستطيع أن تشاهد اللحظة التي يكسبه فيها.

تقنيًّا: لكلّ موضع يحسب النموذج درجة صلة مقابل كلّ موضع آخر، ثم يعيّر تلك الدرجات إلى توزيع مجموعه 1، ثم يأخذ المجموع الموزون لتمثيلات المواضع الأخرى. ومن هذه الأوزان تنبثق الإحالة المرجعية، لا من مرحلة حلٍّ منفصلة: استعلام “لأنه” يسجّل أعلى درجة مقابل “القطّ”. ولأن كلّ زوج يُقيَّم مباشرةً فإن المسافة بين أي رمزين خطوة واحدة مهما تباعدا.

لماذا تفوز المحوّلات

الشبكات التكرارية تقرأ كلمة واحدة في كل مرة. المحوّلات ترى كل الكلمات دفعة واحدة.

► RNN — تسلسلي
—
The
←
cat
←
sat
←
on
←
the
←
mat
✓
★ Transformer — متوازي
—
The
cat
sat
on
the
mat
✓
اضغط سباق! لرؤية الفرق
عنق زجاجة RNN
كل كلمة يجب أن تنتظر الكلمة السابقة. الكلمة 6 لا يمكنها البدء حتى تنتهي الكلمات 1–5.
ميزة المحوّل
كل الكلمات تُعالج في وقت واحد باستخدام الانتباه الذاتي. لا انتظار، لا عنق زجاجة.
لمزيد من المشاهدة: 3Blue1Brown — مقدّمة بصرية عن المحوّلات (فيديو خارجي)
بلغة مبسّطة

ببساطة: ستّة أشخاص يمرّرون رسالة في صفّ واحداً بعد آخر، مقابل ستّة يقرؤون الصفحة نفسها دفعةً واحدة. المجموعة الثانية تفرغ في الزمن الذي تستغرقه الأولى في تمريرة واحدة.

تقنيًّا: الحالة الخفيّة في الشبكة العَودية عند الخطوة t تعتمد على الخطوة t−1، فلا يمكن توازي التدريب على امتداد المتتالية. أمّا الانتباه الذاتي فلا عَودية فيه: تُحسب كلّ المواضع في ضرب مصفوفات واحد، مقايضةً لـO(n) خطوة تسلسلية بـO(n²) مقارنة زوجية ينفّذها معالج الرسوميات في آنٍ واحد (‏Vaswani وزملاؤه، 2017).

ثلاث عائلات من المحوّلات

المحوّل نفسه، موصولٌ بثلاث طرق لثلاث مهام مختلفة — كاتب، وقارئ، ومترجم. بدّل بينها لترى الكتل التي تستخدمها كل عائلة. وقد كان محوّل 2017 الأصلي هو الشكل الكامل — ست طبقات ترميز وست طبقات فكّ ترميز (Vaswani وآخرون، §3.1)؛ والعائلات ذات الكومة الواحدة جاءت بعده.

المدخلات رموز المُشفِّر ثنائي الاتجاه مكدّس × N المُفكِّك سببي (مُقنّع) مكدّس × N المخرجات الرمز التالي
بلغة مبسّطة

ببساطة: المحرّك نفسه في ثلاثة هياكل مختلفة. واحد مبنيّ للمضيّ إلى الأمام (الكتابة)، وواحد لاستيعاب الصفحة كلّها دفعةً واحدة (القراءة)، وواحد يستقبل من طرف ويُنتج من الطرف الآخر (الترجمة).

تقنيًّا: بنية المفكِّك وحده (GPT) تكدّس انتباهاً ذاتياً مُقنَّعاً وتُدرَّب على توقّع الرمز التالي. وبنية المرمِّز وحده (BERT) تستعمل انتباهاً ذاتياً غير مُقنَّع وتُدرَّب على ملء المواضع المُقنَّعة. أمّا بنية المرمِّز–المفكِّك (T5) فتُبقي الكُدسين معاً وتضيف الانتباه المتقاطع، فتُسقط متتالية دخل على متتالية خرج تُولَّد على حدة.

من GPT إلى Claude

المحوّل أشعل سباقًا أعاد تشكيل صناعة التكنولوجيا في 7 سنوات فقط.

📄
2017
«Attention Is All You Need»
يتخلّى Vaswani وآخرون عن التكرار تماماً — ست طبقات ترميز وست طبقات فكّ ترميز، وثمانية رؤوس انتباه — وكل نموذج تحت هذا السطر مبنيّ عليها.
arXiv:1706.03762
🔬
2018
GPT-1 — 117 مليون معامل
أثبتت OpenAI أن المحوّلات يمكنها توليد نص متماسك وسياقي من التدريب المسبق وحده.
اقرأ الورقة
🚀
2020
GPT-3 — 175 مليار معامل
ظهر التعلم بأمثلة قليلة: أعطِ أمثلة في الموجّه، والنموذج يعمّم. تحول نموذجي.
اقرأ الورقة
💥
نوفمبر 2022
ChatGPT ينتشر عالميًا
100 مليون مستخدم في شهرين — أسرع منتج استهلاكي نموًا في التاريخ.
OpenAI
⚔️
2023
Claude و Gemini و Llama
Anthropic وGoogle وMeta تدخل السباق. نماذج حدودية مفتوحة ومغلقة المصدر تتنافس.
🤖
2025
الذكاء الاصطناعي الوكيل
نماذج تتصرف بشكل مستقل — تكتب الأكواد وتجري الاختبارات وتنشر في بيئة الإنتاج.

ما حجم النماذج اليوم؟

عالمان مختلفان، وواحد منهما فقط يَنشر أرقامه.

الفئة
الحجم
أين تعمل، ومن يُصدرها
صغيرة جداً / طرفية
1B–4B
على الجهاز نفسه — هاتف أو حاسوب محمول، بلا شبكة. إصدارات صغيرة من Gemma وPhi وLlama.
صغيرة / متوسطة
7B–70B
أفراس العمل: قويّة بما يكفي لعملٍ حقيقي، ورخيصة بما يكفي لتشغيلها بنفسك. معظم إصدارات Llama وQwen وMistral.
مفتوحة رائدة
120B–685B
أوزان مفتوحة بحجم الخوادم تقترب من استدلال النماذج المغلقة. إصدارات Qwen وDeepSeek؛ أوزانٌ تستطيع تنزيلها.
مغلقة على الحدّ الأمامي
~1T–2T+ (تقديراً)
عبر الواجهة البرمجية فقط. فـOpenAI وGoogle وAnthropic لا تنشر عدد الوسائط — وكل رقم هنا تقديرٌ خارجي.
خليط الخبراء (MoE)، ولماذا الرقم الكبير مُضلِّل. النموذج الرائد ليس عادةً شبكةً كثيفةً واحدة، بل شبكاتٌ فرعية كثيرة — خبراء — ومعها موجِّهٌ صغير يختار اثنين منهم لكل رمز. فنموذجٌ يُعلَن بـ685 مليار وسيط قد لا يُشغّل منها إلا نحو 37 ملياراً لأي رمزٍ بعينه. ولهذا يستطيع نموذجٌ مفتوح رائد أن ينافس نموذجاً مغلقاً دون كلفة التشغيل التي يوحي بها العنوان: مجموع الوسائط حجمٌ، والوسائط النشطة هي الفاتورة. فاسأل دائماً أيّهما المذكور.
بلغة مبسّطة

ببساطة: الفكرة نفسها، تكبر كلّ سنة، حتى توقّفت عند نقطةٍ ما عن كونها عرضاً بحثياً وصارت شيئاً يستعمله مئة مليون إنسان قبل أن يفرغ أحد من الجدال حوله.

تقنيًّا: القوس مقياسٌ زائد واجهة. أظهر GPT-1 سنة 2018 أن التدريب التوليدي المسبق قابل للنقل؛ وأظهر GPT-3 سنة 2020 انبثاق التعلّم بأمثلة قليلة داخل السياق عند نحو 175 مليار وسيط؛ وأضاف ChatGPT سنة 2022 الضبط بالتعليمات وواجهة محادثة — وهو تغيير في المنتج لا في البنية. حسّاس للزمن: صفّا 2023 و2025 يصفان مشهداً يتحرّك أسرع من أي شريحة.

اختبار المعرفة

سبعة أسئلة على هذه الوحدة. أجب لترى السبب — يظهر الشرح سواء أصبتَ أم أخطأت.

السؤال 1 من 0
النتيجة 0/0

النقاط الرئيسية

📜
الذكاء الاصطناعي ليس جديدًا
بدأ الحلم عام 1950 — الحوسبة الرخيصة والبيانات الضخمة جعلته عمليًا.
🔄
تعلم الآلة يعكس البرمجة
بيانات + إجابات = قواعد. دع الآلة تكتشف الأنماط.
🏷️
نوعان من التعلم
بإشراف (مسمّى) مقابل بدون إشراف (اكتشاف الأنماط).
⚡
المحوّلات فازت
الانتباه + التوازي في القراءة = جميع نماذج اللغة الحديثة تقريباً. أمّا الكتابة فتبقى رمزاً واحداً في كل مرة.
تعلم الآلةالشبكات العصبيةالتعلم بإشرافالمحوّلاتالانتباهالتعلم العميق