أساسيات نماذج اللغة الكبيرة

كيف تعمل نماذج اللغة الكبيرة فعلياً — من النص الخام إلى الاستجابات الذكية.

كيف تعمل نماذج اللغة الكبيرة

في جوهرها، تقوم نماذج اللغة الكبيرة بشيء واحد: التنبؤ بالرمز التالي. بالنظر إلى سلسلة من الكلمات، ما الذي يأتي بعد ذلك؟

🔮
التنبؤ بالرمز التالي
العملية الأساسية: بالنظر إلى السياق، التنبؤ بالاستمرار الأكثر احتمالاً.
📚
بيانات التدريب
تريليونات من الكلمات من الكتب والمواقع والبرمجة والمحادثات.
⚙️
المعاملات
مليارات من الأوزان المتعلَّمة التي تُشفّر المعرفة وأنماط اللغة.
✨
القدرات الناشئة
الاستدلال والإبداع والفهم التي تنشأ من الحجم وحده.
بلغة مبسّطة

ببساطة: إنها خاصية الإكمال التلقائي في لوحة مفاتيح هاتفك، مكبّرة إلى حدٍّ لا يكاد يُعرَف. النموذج لا يقرّر ما ستقوله الجملة قبل أن يبدأها — بل يلتزم بكلمة واحدة، ثم ينظر إلى كل ما سبق بما فيه تلك الكلمة، ثم يلتزم بالكلمة التالية.

تقنيًّا: محوّل انحداري ذاتي بمُفكِّك تشفير فقط. كل تمريرة أمامية تُخرج توزيعاً احتمالياً على المفردات مشروطاً بالتسلسل السابق كاملاً؛ ثم يُضاف الرمز المختار إلى المُدخَل وتتكرّر التمريرة. لا شيء في البنية يخطّط مسبقاً، ولا تُحمَل حالة بين التمريرات سوى النص نفسه.

لماذا لم يكفِ عدُّ الكلمات

قبل الشبكات العصبية بوقت طويل، كانت نماذج اللغة تكتفي بـعدّ تسلسلات الكلمات. نموذج N-gram يتنبّأ بالكلمة التالية اعتماداً على الكلمات N−1 السابقة فقط. اسحب N من 1 إلى 5 وراقب المنحنيين يتصارعان: النص يتحسّن باستمرار، بينما الجدول الذي يلزمك تخزينه ينفجر باستمرار.

🔢
مشكلة العدّ في نماذج N-gram
تنبّأ من الكلمات السابقة بالعدّ — ثم شاهد التركيبات تنفجر
1 هذيان 2 مُبعثَر 3 متقطّع 4 مقروء 5 طبيعي
عدد التسلسلات الممكنة بمفردات من 50,000 كلمة = 50,000N
لهذا احتجنا إلى التضمينات والمحوّلات. فبدلاً من حفظ عدّادات لكل تسلسل، تتعلّم النماذج المعنى (التضمينات) وأيّ الكلمات السابقة تهمّ (الانتباه) — فتعمّم على جمل لم ترها من قبل قط. وكلاهما يأتي لاحقاً في هذه الوحدة: التضمينات في الدرس الثالث، والانتباه في الدرس الرابع؛ وكل ما بينهما يتناول كيف يدخل النص إلى النموذج من الأصل. النِسب أعلاه نِسب عدّاد ثلاثيات، مأخوذة من العدّ المباشر للتسلسلات — والشريحة التالية تعرض نِسب نموذج لغة عصبي للأمر نفسه، ولهذا يختلف الجدولان.
بلغة مبسّطة

ببساطة: تخيّل أن تحفظ كل تركيبة ممكنة من مكعّبات الليغو — مستحيل! فطرق تركيب الكلمات معاً أكثر من أن تُحصى.

تقنيًّا: الانفجار التوافقي: حجم المفردات مرفوعاً لأس طول التسلسل يجعل العدّ الشامل غير قابل للتنفيذ مع بيانات نادرة.

التنبؤ بالرمز التالي

شاهد كيف ينتج نموذج اللغة الكبير النص — رمزاً واحداً في كل مرة، كل اختيار مبني على الاحتمالات. وهذه نِسب نموذج لغة عصبي للأمر الذي تناوله عدّاد الثلاثيات قبل قليل؛ الأرقام مختلفة لأن الآلية مختلفة — لا شيء هنا مَعدود من جدول.

🎯
متنبئ الرموز
انقر على “توليد” لاختيار الرمز التالي بناءً على الاحتمالات
جلس القطّ على
النسب توضيحية ومؤلَّفة يدوياً لبيان شكل توزيع الرمز التالي — وهي غير مأخوذة من نموذج مدرَّب. أمّا أخذ العيّنة نفسه فحقيقي: كل ضغطة تسحب من هذه الاحتمالات بالضبط، ولهذا يعطي التكرار كلمات مختلفة.
بلغة مبسّطة

ببساطة: إنها قرعة لم تُوزَّع تذاكرها بالتساوي. الكلمة الحصيرة تحوز معظمها، لكن السطح تحوز القليل — فالضغط على «توليد» مرتين للأمر نفسه قد يعطيك كلمتين مختلفتين، وليست إحداهما خطأً.

تقنيًّا: هذه الأداة تأخذ عيّنة من التوزيع بدل أن تأخذ الأعلى احتمالاً، ولهذا لا يكون الخرج حتمياً. فك التشفير الجشع كان سيُعيد المرشّح الأول في كل مرة؛ وأخذ العيّنة هو ما يجعل الاستدعاءات المتكرّرة للأمر نفسه تتباعد.

احتمال لكل كلمة

المتنبئ في الشريحة السابقة يعطيك رمزاً واحداً مأخوذاً بالعيّنة. تراجَع خطوة وانظر إلى ورقة الاقتراع كاملة التي أُخذت منها تلك العيّنة: النموذج يمنح درجة لـكل كلمة في مفرداته — ما بين خمسين ومئة ألف كلمة تقريباً — ويجب أن يكون مجموع هذه الدرجات 100%.

📊
ورقة الاقتراع كاملة، لا الفائز وحده
ستة مرشحين لفراغ واحد — بينهم اثنان ما كان أحد ليختارهما
أحبّ أن آكل ؟؟؟
مُدخَل واحد، وفراغ واحد، ودرجة لكل كلمة يمكن أن تملأه.
النِّسب توضيحية، كُتبت يدوياً لإظهار شكل توزيع الكلمة التالية — وهي ليست مقروءة من نموذج مُدرَّب، وهو العُرف نفسه الذي تتبعه هذه الوحدة في أرقام الثلاثيات مقابل الشبكة العصبية. المهم هو العمودان الأخيران: حجارة وسُحُباً موسومان بأنهما غير معقولين ومرسومان بلون رمادي وحدّ متقطّع، ومع ذلك يحمل كل منهما رقماً. لا شيء يساوي صفراً أبداً. هذا هو معنى «توزيع احتمالي على المفردات»، وهو سبب أن رفع درجة الحرارة قد يسمح لأحدهما بالمرور في النهاية.
بلغة مبسّطة

ببساطة: كل كلمة يعرفها النموذج تنال درجة في كل دور، بما فيها الكلمات السخيفة. لا شيء يُشطَب من القائمة أبداً؛ فكلمة حجارة تُمنح رقماً صغيراً جداً، لا أن تُترك بلا رقم.

تقنيًّا: دالة softmax على لوغيتات المفردات تُعيد احتمالاً موجباً تماماً لكل مدخلة، فلا يكون أي رمز صفراً بالضبط. وهذه الخاصية هي ما يجعل الذيل قابلاً للبلوغ: ارفع درجة الحرارة أو وسّع النواة بما يكفي فقد يُسحَب رمز غير معقول. والنِّسب المعروضة توضيحية، كُتبت يدوياً لإظهار شكل مثل هذا التوزيع.

قوة الحجم

المزيد من المعاملات + المزيد من البيانات = قدرات ناشئة لا تمتلكها النماذج الأصغر ببساطة.

175B
معاملات GPT-3
~300B
رموز تدريب GPT-3
10K+
وحدات GPU للتدريب — رقم متداول واسعاً، لم تؤكّده OpenAI
قوانين التوسع: يتحسن الأداء بشكل متوقع مع زيادة حجم النموذج والبيانات والحوسبة. لهذا السبب يستمر السباق نحو نماذج أكبر — وأذكى. رقمَا GPT-3 كلاهما من Brown et al.، 2020؛ أمّا نماذج الطليعة بعد ذلك فتُدرَّب على رموز أكثر بكثير — انظر الشريحة التالية.
بلغة مبسّطة

ببساطة: لم يجلس أحد ليضيف خاصية اسمها «الاستدلال». بل بنوا الشيء نفسه بحجم أكبر بكثير، وأطعموه نصاً أكثر بكثير، فبدأت تظهر قدرات لم تكن لدى النسخ الأصغر.

تقنيًّا: قوانين التوسّع تصف انخفاض الخسارة انخفاضاً متوقَّعاً مع نمو المعاملات والبيانات والحوسبة معاً — متوقَّعاً بدرجة تكفي للتخطيط لعملية تدريب على أساسها. ورقما GPT-3 أعلاه من Brown et al.، 2020؛ أما نماذج الطليعة بعدها فتُدرَّب على رموز أكثر بكثير، فاقرأ الاتجاه لا الأرقام.

كيف يُبنى النموذج: ثلاث مراحل

المساعد المكتمل لا يُدرَّب مرة واحدة. إنه يمرّ عبر ثلاث تمريرات منفصلة، لكلٍّ منها معلّم مختلف وسعر مختلف تماماً. انقر مرحلةً لترى الصورة الكاملة.

🏗️
اقرأ، ثم تدرّب، ثم تلقَّ الملاحظات
التدريب المسبق · الضبط الدقيق المُشرَف · المواءمة
المرحلة 1
قراءة المكتبة
التدريب المسبق · ذاتي الإشراف
خمّن الكلمة التالية في نص حقيقي، مراراً وتكراراً، حتى ترسخ القواعد والحقائق. لا أحد يوسم شيئاً — فالنص هو مفتاح إجابته بنفسه.
البيانات10 تريليون رمز+
التكلفة100 مليون دولار+
الزمن3–6 أشهر
المرحلة 2
تعلّم المهمة
الضبط الدقيق · SFT
أرِه أمثلة معالَجة لإجابة جيدة عن طلب، كي يكفّ عن مجرد مواصلة النص ويبدأ في الردّ عليك.
البيانات100 ألف مثال+
التكلفة10 آلاف–مليون دولار
الزمنأيام
المرحلة 3
تلقّي الملاحظات
المواءمة · RLHF
يقارن الناس بين إجابتين ويختارون الأفضل. يتعلّم النموذج أن يصوّب نحو نوع الإجابة التي فضّلها الناس فعلاً.
البيانات500 ألف مقارنة+
التكلفةمستمرة
الزمنلا تنتهي أبداً
المرحلة 1 وحدها تحتاج حاسوباً خارقاً. أما المرحلتان 2 و3 فرخيصتان نسبياً — ولهذا يمكن بناء كثير من المساعدين المختلفين فوق حفنة من النماذج الأساسية. الأرقام تقديرات عامة برتبة المقدار للنماذج المتقدّمة وتتقادم بسرعة.
بلغة مبسّطة

ببساطة: المراحل الثلاث تجيب عن ثلاثة أسئلة مختلفة. كيف تبدو اللغة؟ وكيف تبدو الإجابة الجيدة؟ وحين تكون إجابتان جيدتين معاً، أيّهما يفضّلها الناس فعلاً؟

تقنيًّا: ثلاثة أهداف تدريب مختلفة، لا ثلاث جرعات من هدف واحد: هدف ذاتي الإشراف للتنبؤ بالرمز التالي على نص خام، ثم محاكاة مُشرَف عليها لأزواج من الأمثلة المعالَجة، ثم تحسين تفضيلي مقابل نموذج مكافأة مُتعلَّم من مقارنات بشرية. والأرقام تقديرات عامة برتبة المقدار وتتقادم بسرعة.

ما هي الرموز؟

لا تقرأ نماذج اللغة الكبيرة الأحرف أو الكلمات — بل تقرأ الرموز. الرمز هو جزء من النص، غالباً كلمة أو جزء من كلمة.

“Tokenization”
→
“Token”
“ization”
لماذا ليس الأحرف؟ الأحرف المنفردة تحمل معنى قليلاً جداً. لماذا ليس الكلمات؟ عدد كبير جداً من الكلمات الفريدة، والصرف يتغير بشكل كبير. الرموز هي الوحدة المثالية — أجزاء ذات معنى تحافظ على حجم المفردات قابلاً للإدارة.
بلغة مبسّطة

ببساطة: النموذج يقرأ في قطع بحجم المقاطع الصوتية تقريباً. وما إن ينتهي التقطيع حتى تختفي حروفك — إذ تُستبدَل كل قطعة برقم، والأرقام هي كل ما يراه النموذج.

تقنيًّا: كل رمز عدد صحيح يُستخدم فهرساً في مفردات ثابتة، لجلب صفٍّ من مصفوفة التضمين. أما تسلسل الأحرف نفسه فلا يصل إلى الشبكة قط، ولهذا تكون المهام على مستوى الحرف عسيرة على نموذج فصيح فيما عدا ذلك.

خمّن قبل أن تنظر

حدسك يقول “عُدّ الكلمات”. والمُرمِّز يخالفك. خمّن أولاً، ثم انظر القطع الفعلية — الفجوة بين الاثنين هي الدرس كله.

🎲
لعبة تخمين الرموز
أربع سلاسل إنجليزية عن قصد، إجابات جاهزة من مفردات كلمات فرعية حقيقية
كم رمزاً في هذه السلسلة؟
النتيجة 0 / 0
الكلمات الشائعة قطعة واحدة؛ والكلمات غير المألوفة تُقطَّع. ولهذا قد تكلّف كلمة واحدة طويلة مخترَعة أكثر من جملة قصيرة كاملة. الخوارزمية: ترميز أزواج البايت — الشريحة بعد التالية.
ولماذا السلاسل بالإنجليزية؟ لأن الأعداد أعلاه مقيسة على مُرمِّز إنجليزي فعلي. ولو وضعنا مكانها سلاسل عربية لوجب حساب انكسارات BPE عربية حقيقية — والتخمين في الأداة التي درسُها بالضبط أن “حدسك في عدّ الرموز خاطئ” أسوأ مكان يمكن أن تُخمّن فيه. والأهم أن القاعدة تسري عليك أنت مضاعفةً: النص العربي يكلّف عادةً ضعفين إلى أربعة أضعاف ما يكلّفه المعنى نفسه بالإنجليزية — وهو ما تقوله بطاقة “تعدد اللغات” بعد قليل. فاقرأ الأرقام هنا حدّاً أدنى، لا سعراً لنصّك.
بلغة مبسّطة

ببساطة: حدسك يعدّ الكلمات لأن الكلمات هي ما تقرؤه أنت. أما المُرمِّز فيعدّ شيئاً آخر، والفرق ليس عشوائياً — فالكلمة التي رآها مليون مرة تكلّف قطعة واحدة، والكلمة التي بالكاد رآها تكلّف أربعاً.

تقنيًّا: عدد الرموز يتبع تكرار الكلمة في المدوّنة، لا عدد الكلمات ولا عدد الأحرف. فالسلاسل المتكرّرة تبقى مدخلات مفردات واحدة، والنادرة تُفكَّك إلى وحدات كلمات فرعية. ولهذا يكون عدد الرموز هو الوحدة الصادقة الوحيدة لحساب التكلفة وميزانية السياق.

ساحة الترميز

اكتب أي نص لترى كيف يتم تقسيمه إلى رموز. كل لون يمثل رمزاً مختلفاً.

🧩
ساحة الترميز
هذا تقريب استدلالي لا مفردات BPE حقيقية: يقسّم على السوابق واللواحق الشائعة بدل الدمجات المتعلَّمة، فقد يخالفه مُرمِّز إنتاجي أحياناً. والعلامة · في البداية تدلّ على المسافة التابعة للرمز، والرقم تحت كل قطعة معرّف توضيحي لا معرّف مفردات حقيقي.
الرموز: 0 الأحرف: 0 النسبة: 0 حرف/رمز
جرّب:
بلغة مبسّطة

ببساطة: ألصق نصاً نثرياً فتصطفّ القطع مع الكلمات تقريباً. وألصق شيفرة برمجية فتتشظّى — إذ تكلّف الأقواس والمسافات البادئة والشرطات السفلية كلٌّ منها قطعة مستقلة، ولهذا تكلّف الكمية نفسها من الشيفرة أكثر من الكمية نفسها من الإنجليزية.

تقنيًّا: نسبة الأحرف إلى الرمز خاصية للعبء المُعالَج لا ثابت: النثر الإنجليزي يدور حول 4، أما الشيفرة واللغات كثيرة التصريف أو غير اللاتينية فأقل بكثير. ولاحظ أن هذه الأداة نفسها تقريب استدلالي يقسّم على اللواصق الشائعة، لا مفردات BPE متعلَّمة، فقد يخالفها مُرمِّز إنتاجي أحياناً.

ترميز أزواج البايت (BPE)

خوارزمية الترميز الأكثر شيوعاً. تبدأ بالأحرف وتدمج الأزواج الأكثر تكراراً بشكل تكراري.

الخطوة 1
البدء بالأحرف
“lower” → [l, o, w, e, r] — كل حرف هو رمز خاص به
الخطوة 2
عدّ الأزواج
إيجاد الزوج المتجاور الأكثر تكراراً في جميع نصوص التدريب (مثلاً “e”+“r” يظهر 10,000 مرة)
الخطوة 3
الدمج والتكرار
استبدال “e”+“r” بـ “er” في كل مكان. التكرار لأكثر من 50 ألف عملية دمج.
النتيجة
مفردات من الكلمات الفرعية
“lower” → [“low”, “er”] — الكلمات الشائعة تبقى كاملة، والنادرة تُقسّم.
بلغة مبسّطة

ببساطة: لم يكتب أحد قائمة القطع يدوياً. بل استُخرجت بقراءة جبل من النصوص ولصق الزوج المتجاور الأكثر ظهوراً مراراً وتكراراً — فالقطع الموجودة ليست إلا ما ظلّ النص يكرّره.

تقنيًّا: BPE إجراء دمج جشع من الأسفل إلى الأعلى. ابدأ بمفردات على مستوى الأحرف، وعُدّ أزواج الرموز المتجاورة في المدوّنة، وادمج الأكثر تكراراً، وكرّر ذلك عدداً محدَّداً من الدمجات. وقائمة الدمج المرتَّبة هي المُرمِّز، وتُجمَّد قبل التدريب — فلا يستطيع النموذج تغيير طريقة تقطيعه لاحقاً.

لماذا الترميز مهم

💰
التكلفة
تسعير واجهات البرمجة يكون لكل رمز. المزيد من الرموز = تكلفة أعلى لنفس النص.
🌍
تعدد اللغات
العربية والصينية واليابانية قد تستخدم 2–4 أضعاف الرموز مقارنة بالإنجليزية لنفس المعنى.
📏
نافذة السياق
النماذج لها حد أقصى للرموز. الترميز يحدد مقدار ما يمكن إدخاله.
⚠️
الحالات الحدية
الأرقام والبرمجة ويونيكود قد تُرمّز بشكل غير متوقع — مما يؤثر على سلوك النموذج.
بلغة مبسّطة

ببساطة: الترميز ليس تفصيلاً تقنياً تتركه للسبّاكة. فهو يحدّد فاتورتك، ومقدار ما يتّسع له مستندك، وما إذا كانت الجملة العربية ستكلّفك ضعفي ما تكلّفه الجملة نفسها بالإنجليزية أو ثلاثة أضعافه.

تقنيًّا: المُرمِّز مُدرَّب على الإنجليزية في معظمه، فالكتابات الأقل تمثيلاً في تلك المدوّنة تتشظّى إلى رموز أكثر لكل قدر من المعنى. وهذه الغرامة تتراكم: الفوترة لكل رمز، ونافذة السياق مُقوَّمة بالرموز، وزمن الاستجابة يتناسب مع طول التسلسل — اختلال واحد يُحاسَب عليه ثلاث مرات.

الكلمات كأرقام

كل رمز يصبح متجهاً عالي الأبعاد. الكلمات المتشابهة تتجمع معاً. اسحب الفضاء لتدويره، أو ركّز عليه واستعمل مفاتيح الأسهم.

الحيوانات الملكية المشاعر التقنية الطعام
X
Y
Z
كلب
قطة
أسد
نمر
ذئب
جرو
مَلِك
ملكة
أمير
أميرة
عرش
تاج
حاسوب
محمول
هاتف
لوحي
شِفرة
تفاح
موز
برتقال
بيتزا
عنب
سعيد
حزين
غاضب
فرح
جرّب:

اكتب كلمة أو انقر مثالاً لترى أين تحطّ في الفضاء الدلالي…

المواضع هنا موضوعة يدوياً للتعليم، وليست إسقاطاً لأي نموذج مدرَّب، واختبار الكلمة قاعدة صغيرة على الجذور والكلمات المفتاحية فوق قائمة من 22 كلمة — لا بحث حقيقي عن أقرب الجيران.
قراءات ومقاطع إضافية لهذه الوحدة كلّها مجموعة في الشريحة الأولى.
📐
تشابه جيب التمام
قياس مدى تقارب متجهي كلمتين بالزاوية بينهما.
🎯
التجميع الدلالي
الكلمات ذات المعاني المتشابهة تتجمع طبيعياً في فضاء المتجهات.
بلغة مبسّطة

ببساطة: امنح كل كلمة موضعاً على خريطة، وضع الكلمات التي تُستعمل في مواقف متشابهة قرب بعضها. لم يرسم أحد هذه الخريطة — بل نتجت عن كون مَلِك ومَلِكة تردان باستمرار في النوع نفسه من الجمل.

تقنيًّا: كل مدخلة في المفردات تُقابَل بمتجه كثيف، مُتعلَّم بالنزول الاشتقاقي على هدف التدريب لا مُسنَد يدوياً. والتقارب يُقاس بتشابه جيب التمام، وما يُشفَّر فيه هو التشابه التوزيعي — تشابه سياقات الاستعمال — وليس هذا هو تشابه المعنى نفسه. والفضاء أعلاه نموذج تعليمي ثلاثي الأبعاد لفضاء بمئات أو آلاف الأبعاد.

حساب الكلمات

تُشفّر التضمينات العلاقات كاتجاهات. يمكنك إجراء عمليات حسابية على المعنى — اختر تناظراً وشاهد المتجهات تصطفّ.

🔄
القياسات
باريس:فرنسا :: طوكيو:؟ الحساب المتجهي يعطيك “اليابان”.
📊
الأبعاد العالية
التضمينات الحقيقية تستخدم 768–4096 بُعداً لالتقاط المعنى الدقيق.
بلغة مبسّطة

ببساطة: على هذه الخريطة يحمل الاتجاه معنىً أيضاً، لا الموضع وحده. فالخطوة التي تنقلك من رجل إلى امرأة هي تقريباً الخطوة نفسها، في الاتجاه نفسه، التي تنقلك من مَلِك إلى مَلِكة.

تقنيًّا: بعض العلاقات الدلالية والنحوية تظهر متجهات إزاحة شبه متوازية، فيمكن طرح التناظر بوصفه جمعاً متجهياً وحلّه بالبحث عن أقرب جار. وهو تقريبي لا مضبوط: فالحساب يهبط قرب الهدف، وتُستبعَد حدود الاستعلام عادةً من البحث، والانتظام يصحّ في بعض أنواع العلاقات أكثر بكثير من غيرها.

داخل نموذج اللغة الكبير

يتدفق النص عبر سلسلة من التحويلات. انقر على كل مرحلة لمعرفة المزيد.

📝 المُرمِّز
→
📊 التضمين
→
⚡ المحوّل ×N
→
🎯 المخرج
كتلة المحوّل هي حيث يجري العمل — وهو تسلسل عمليات محدّد، لا سحر. كل كتلة لها جزأين: الانتباه الذاتي (فهم السياق) والشبكة الأمامية (معالجة المعلومات). نماذج اللغة الحديثة تُكدّس 32–120 من هذه الكتل.
بلغة مبسّطة

ببساطة: يدخل النص من الأمام ويخرج تخمين الكلمة التالية من الخلف، عبر أربع محطات بترتيب ثابت. والمحطة الموسومة بـ×N هي المحطة نفسها مكرّرة — لا محطة مختلفة في كل مرة.

تقنيًّا: مُرمِّز ← جلب التضمين ← كومة من كتل محوّل متطابقة ← إسقاط خرج إلى لوغيتات المفردات. وكل كتلة مطابقة بنيوياً لكل كتلة أخرى — انتباه ذاتي يليه شبكة أمامية، مع وصلات متبقية وتسوية — غير أن لكلٍّ منها أوزانها المتعلَّمة الخاصة.

ما مدى عمق الكومة؟

الرمز «×N» في المخطط أعلاه يحمل معنى كبيرًا. اسحب العمق وأرسل رمزًا عبر الكومة.

🏗️
نصٌّ يدخل، ورمزٌ تالٍ يخرج
راقب رمزًا واحدًا وهو يهبط عبر الكومة
6
أعداد الكتل هنا من رتبة الأعداد الحقيقية — النماذج المفتوحة الصغيرة تعمل بنحو 12–32 كتلة، والكبيرة بأكثر من 100. وكل كتلة تؤدّي الأمرين نفسيهما؛ فالعمق لا يُدخل شيئًا جديدًا.
بلغة مبسّطة

ببساطة: العمق ليس أنواعاً إضافية من التفكير؛ بل هو العملية نفسها تُطبَّق ثانيةً على خرجها هي. فكل تمريرة تصقل تمثيلاً مبنياً جزئياً من قبل، كما تصقل التحريرات المتتابعة مسوّدةً.

تقنيًّا: كل كتلة تقرأ من التيار المتبقي وتكتب فيه، فتتراكم التمثيلات بدل أن تُستبدَل. والعمق يكلّف حوسبةً وزمن استجابة تكلفةً خطية، ولهذا يُوازَن العمق مقابل العرض وطول السياق بدل تعظيمه ببساطة. وأعداد الكتل هنا من رتبة الأعداد الحقيقية، لا مواصفة منتج بعينه.

Q و K و V — ثلاثة أدوار

كيف يعرف النموذج أن “it” تشير إلى “cat”؟ الانتباه يسمح لكل كلمة بالنظر إلى كل كلمة أخرى.

انتباه الضرب النقطي المُقيّس
كل كلمة تلعب ثلاثة أدوار في الوقت نفسه، والصيغة أدناه ليست إلا هذه الأدوار الثلاثة مجتمعة:
Q — الاستعلام: السؤال الذي تطرحه هذه الكلمة. “أنا ضمير؛ فمن اسمي؟”
K — المفتاح: ما تعلنه الكلمة أنها قادرة على الإجابة عنه. “أنا اسم حيوان مفرد.”
V — القيمة: المحتوى الذي تسلّمه الكلمة متى اختِيرت.
اقرأها من اليسار إلى اليمين: اضرب كل استعلام في كل مفتاح (QKT) لتقييم مدى إجابة كل كلمة عن كل سؤال؛ ثم اقسم على √dk لتبقى هذه الدرجات في نطاق عملي كلما طالت المتجهات؛ وتُلطّفها softmax إلى نِسب مجموعها ١٠٠٪؛ ثم امزج القيم بهذه النِسب بالضبط. وهذا المزيج هو المعنى الجديد للكلمة، معنىً واعياً بسياقه.
بلغة مبسّطة

ببساطة: تخيّل غرفة يرفع فيها كل شخص بطاقةً تقول عمّا يستطيع الإجابة، ويرفع كلٌّ من الباقين سؤالاً. تقرأ كل البطاقات، وتقرّر مَن يستحق الإصغاء، وتأخذ قدراً من كلٍّ منهم — أكثر من النافعين.

تقنيًّا: Q و K و V ثلاثة إسقاطات خطية متعلَّمة منفصلة للمتجه المُدخَل نفسه. والتوافق هو الجداء النقطي للاستعلامات في المفاتيح، مقسوماً على √dk لإبقاء الدرجات قبل softmax في نطاق تبقى فيه الاشتقاقات صالحة؛ ثم تسوّيها softmax إلى أوزان، ويكون الخرج ذلك المجموع الموزون لمتجهات القيم.

الانتباه خطوة بخطوة

الصيغة كاملةً دفعةً واحدة كثيرة. وهذه هي الأمور الأربعة التي تقوم بها فعلًا، واحدًا تلو الآخر.

🔍
إلى ماذا تنظر هذه الكلمة؟
اختر استعلامًا ثم تنقّل: المفاتيح ← الدرجات ← softmax ← المجموع الموزون
متجه الخرج للكلمة «it»
الأوزان توضيحية، كُتبت يدويًا لإظهار شكل العملية الحسابية — وهي ليست مقروءة من نموذج مدرَّب. أمّا الخطوات الأربع وترتيبها فهي بالضبط خطوات الانتباه بالجداء النقطي المُقيَّس (Vaswani et al.، Attention Is All You Need، 2017).
بلغة مبسّطة

ببساطة: مكتوبةً كصيغة واحدة تبدو قفزةً واحدة. وهي في الحقيقة أربع حركات صغيرة: اسأل، وقيّم الجميع، وحوّل الدرجات إلى حصص مجموعها كلّ واحد، ثم امزج.

تقنيًّا: الخطوات الأربع وترتيبها هي بالضبط خطوات الانتباه بالجداء النقطي المُقيَّس (Vaswani et al.، 2017، والاستشهاد كاملاً في الشرح أعلاه)، والثالثة وحدها غير خطية — فـ softmax هي ما يحوّل درجات حقيقية اعتباطية إلى مجموعة أوزان مُسوّاة قابلة للمقارنة. والأوزان في الأداة توضيحية كُتبت يدوياً، وليست مقروءة من نموذج مدرَّب.

خريطة الانتباه الحرارية

كل صف كلمة تطرح سؤالها؛ وكل خلية تُظهر كم من الجواب جاء من الكلمة في ذلك العمود. والرؤوس المختلفة تتعلّم أعمالًا مختلفة.

🔍
خريطة الانتباه الحرارية
مرر الماوس على الخلايا لرؤية أي الكلمات تنتبه لبعضها

تعمّق أكثرعرض تفاعلي: النموذج كاملاً من البداية إلى النهاية — المُرمِّز → الاستعلام/المفتاح/القيمة → 12 رأساً → الشبكة الأمامية → الاحتمالات. من إنتاج الذكاء الاصطناعي، مبني على الشكل 1 من ورقة Cho وآخرين، «Transformer Explainer» (CHI '26). ↗

بلغة مبسّطة

ببساطة: النموذج لا يفعل هذا مرة واحدة. بل يفعله عدة مرات جنباً إلى جنب بأولويات مختلفة — تمريرة تتعقّب مرجع الضمير، وأخرى تراقب الكلمة المجاورة مباشرةً — ثم يجمع ما وجدته كلّها.

تقنيًّا: الانتباه متعدّد الرؤوس يُجري عدة عمليات انتباه بالتوازي على إسقاطات أقل بُعداً ثم يسلسل النتائج. وتخصّص الرؤوس كالمرجعية أو التبعية النحوية نزعة مرصودة في دراسات السَّبر، لا شيء محدَّد في البنية ولا مُدرَّب عليه؛ والتسميات على الأزرار أعلاه توضيح لتلك النتيجة.

لماذا الانتباه يفوز

استبدلت المحوّلات شبكات RNN و LSTM لأن الانتباه يمكنه معالجة جميع الرموز بالتوازي.

الميزة
RNN
LSTM
المحوّل
التوازي
❌ تسلسلي
❌ تسلسلي
✅ متوازي بالكامل
تُمرّر RNN حالةً مخفية من كل خطوة إلى التي تليها، فلا تبدأ الخطوة t قبل الخطوة t−1. وترث LSTM القيد نفسه: بوّاباتها تشتري ذاكرة، لا توازياً. عنق الزجاجةتسلسل من 1000 رمز يكلّف RNN أو LSTM 1000 خطوة تسلسلية. أما الانتباه الذاتي فيتيح لكل رمز أن ينتبه لكل رمز آخر دفعةً واحدة، فتكفي المحوّل خطوة واحدة لِـقراءة التسلسل. أما الكتابة فقصة أخرى: التوليد يبقى انحداريّاً ذاتيّاً، رمزاً واحداً في كل مرة (Vaswani وآخرون، 2017، §3)، ولهذا تتدفّق الإجابة الطويلة تدريجياً بدل أن تظهر كاملةً.
المدى البعيد
❌ ينسى
⚠️ أفضل
✅ سياق كامل
على الحالة المخفية في RNN أن تحشر كل السياق السابق في متجه واحد ثابت الحجم، فيبهت بالمسافة. وجاءت بوابات LSTM — النسيان والإدخال والإخراج — لتتعلّم ما يُحتفظ به. أما الانتباه فيُلغي خطوة الضغط: يبقى كل رمز في المتناول مباشرةً. المدى المفيدتحتفظ RNN العادية بنحو 50 رمزاً — فبحلول الرمز 500 يكون الرمز الأول قد ضاع في الغالب. وتمدّ LSTM ذلك إلى نحو 200–500 رمز. وليس أيٌّ منهما نافذة سياق بالمعنى الحديث.
سرعة التدريب
بطيء
بطيء
~سُبع تكلفة التدريب
التسريع هو التوازي مقبوضاً: إذ يتفرّغ بُعد التسلسل فتعمل وحدة GPU على كل المواضع في آنٍ واحد. ويضع Vaswani وآخرون كلفة تدريب النموذج الأساسي عند نحو سُبع كلفة أفضل نظام سابق، إذ بلغ 27.3 BLEU في 12 ساعة على 8 وحدات GPU — ويصرّحون بأن عمود الكلفة تقديري لا مقياس زمني (2017، الجدول 2 و§6.1). ورافقته فكرتان أخريان من 2017 — الانتباه متعدد الرؤوس (الشريحة السابقة) والترميز الموضعي الذي يحقن ترتيب الكلمات بلا تكرار.
الحقبة
2013–2017
2014–2017
2017 — اليوم
تصدّرت RNN معالجة اللغة الطبيعية من 2013؛ واستأثرت LSTM بالترجمة الآلية والتعرف على الكلام وتوليد النصوص من 2014 — وقد اشتغلت Google Translate عليها حتى انتقلت إلى المحوّلات. وكل نموذج لغة كبير واسع الاستخدام اليوم (GPT وClaude وGemini وLlama) محوّل.
“الانتباه هو كل ما تحتاجه” (2017) — الورقة البحثية التي بدأت كل شيء. أظهر باحثو Google أن الانتباه وحده، بدون التكرار، يمكنه تحقيق نتائج متقدمة في مهام الترجمة.
بلغة مبسّطة

ببساطة: التصاميم الأقدم تقرأ الجملة كما تستمع إلى رسالة صوتية — بالترتيب حصراً، كلمةً كلمة، دون تخطٍّ. أما الانتباه فيقرؤها كما تقرأ صفحة: كل شيء حاضر دفعةً واحدة، وبإمكان الكلمة الثالثة أن تنظر مباشرةً إلى الكلمة الثلاثمئة.

تقنيًّا: النماذج المتكرّرة تفرض تبعية تسلسلية: لا يمكن حساب الخطوة t قبل الخطوة t−1، فلا يقبل بُعد التسلسل التوازي أثناء التدريب، ويطول المسار بين الرموز المتباعدة بطول المسافة بينها. أما الانتباه الذاتي فيجعل طول ذلك المسار ثابتاً وبُعد التسلسل متوازياً بالكامل. والثمن كلفة تربيعية في طول التسلسل — وهي المقايضة التي تشتري هذا التسريع.

الهلوسة — عندما يختلق الذكاء الاصطناعي الأشياء

يمكن لنماذج اللغة الكبيرة توليد نص يبدو واثقاً وسلساً لكنه خاطئ تماماً. هذا يسمى الهلوسة.

🎭
اختلاق واثق
اختراع حقائق أو اقتباسات أو أحداث لم تحدث قط — وهو أشيع الأنواع الثلاثة. فحيث ضعفت إشارة التدريب يملأ النموذج الفراغ بنمط معقول بدلاً من أن يقول “لا أعرف”.
مثال حقيقياسأل عن “معاهدة لشبونة 1987” فقد تحصل على ملخّص سَلِس لاتفاقية تاريخية. لا وجود لتلك المعاهدة: فمعاهدة لشبونة وُقّعت في 2007.
🔀
خلط المصادر
خلط تفاصيل من مصادر أو سياقات مختلفة، فتخرج إجابة هجينة تمزج مواد لا رابط بينها. وأشدّ ما يضرّ في البحث والعمل الأكاديمي حيث الإسناد هو المقصد نفسه.
مثال“ماذا قال آينشتاين عن الحوسبة الكمومية؟” — فتُعاد ملاحظاته الحقيقية عن ميكانيكا الكم في صورة تعليق على الحوسبة الكمومية الحديثة التي لم يناقشها قط.
💥
أخطاء منطقية
سلاسل استدلال تبدو صحيحة لكنها تحتوي عيوباً خفية — غالباً في الحساب أو الاستنتاج متعدد الخطوات. وهي أصعب الأنواع اكتشافاً: كل خطوة على حدة تُقرَأ صحيحة، والسلسلة وحدها هي التي تفشل.
مثال“كل الورود زهور؛ وبعض الزهور تذبل بسرعة؛ إذن كل الورود تذبل بسرعة.” هذه مغالطة الحد الأوسط غير الموزَّع، تُقال بالنبرة الواثقة نفسها التي تُقال بها حجّة سليمة.
لماذا يحدث هذا؟ تتنبأ نماذج اللغة بالنص المعقول، وليس النص الصحيح. ليس لديها مدقق حقائق داخلي — فهي تُحسّن ما يبدو صحيحاً بناءً على أنماط بيانات التدريب.
بلغة مبسّطة

ببساطة: ليس ثمة لحظة يتحقّق فيها النموذج من صدق ما هو مُقبل على قوله. فالفصاحة والصواب متطابقان من الداخل — ولهذا يُقرَأ استشهاد مختلَق بالسلاسة نفسها التي يُقرَأ بها استشهاد حقيقي.

تقنيًّا: هدف التدريب يكافئ الاستمرارات المرجّحة، ولا توجد إشارة صدق منفصلة يُحسَّن مقابلها. ولا شيء في التمريرة الأمامية يستشير قاعدة معرفة أو مُدقّقاً، فالثقة في نص الخرج خاصية لتوزيع الرموز، لا دليلاً عن العالم.

لماذا تبدأ المحادثات الطويلة في الانحراف

بعد حدٍّ معيّن، نصٌّ أكثر في النافذة يفعل عكس المساعدة: تتشوّش التفاصيل المبكرة، ويملأ النموذج التشوّش باختراعات معقولة. اسحب المنزلقة.

🧠
كم من المحادثة لا يزال يحتفظ به؟
توضيحي — ردود جاهزة عند كل مستوى امتلاء، لا نموذج حيّ
في النافذة: 0K / 100 ألف رمز
استرجاع مثالي
فارغة 100K
واضحضبابيمُختلَق
سابقاً: اسمي سارة وأنا مهندسة مدنية.
سابقاً: أعمل على توسعة مترو القاهرة.
سابقاً: موعدي النهائي في مارس.
لاحقاً، تسأل: “ذكّرني بما أخبرتك به”
هذه هلوسة، لا نسيان. نادراً ما يجيب النموذج بـ “فقدت ذلك”. إنه يجيب بشيء يناسب شكل السؤال — وهو أصعب بكثير في اكتشافه.
أبقِ النافذة مرتّبة لا ممتلئة. لصق كل ما لديك ليس مجانياً: فهو يخفّف الجزء الذي كان مهماً. وضع فشل ذو صلة: “الضياع في المنتصف” — الوحدة 5.
بلغة مبسّطة

ببساطة: الخطر ليس في ضياع التفصيل. بل في أن الفراغ يُملأ. فتحصل على إجابة واثقة محدّدة معقولة بالشكل الذي طلبته — ولا شيء يشير إلى الجزء المختلَق.

تقنيًّا: ينتشر الانتباه على تسلسل أطول، ويتدهور استرجاع أي حقيقة مبكّرة بعينها كلما امتلأت النافذة. ومع ذلك يظلّ النموذج يُخرج إكمالاً عالي الاحتمال، فيظهر الفشل استبدالاً لا امتناعاً. هذه هلوسة لا نسيان — أما أثر الموضع المتصل «الضياع في المنتصف» فتتناوله الوحدة 5.

مكافحة الهلوسة

عدة استراتيجيات يمكنها تقليل (لكن ليس إزالة) الهلوسة.

الاستراتيجية 1
التأسيس
تقديم مستندات مصدرية في الأمر حتى يجيب النموذج من السياق المعطى لا من بيانات تدريبه. بسيط وفعّال ولا يحتاج بنية تحتية — لكن عليك أن تملك المستندات الصحيحة سلفاً، ونافذة السياق تحدّ ما تستطيع لصقه. كيف يعمل“بناءً على المستند التالي، أجب عن السؤال: [المستند] — السؤال: ما كانت الإيرادات في الربع الثالث؟” فلا يبقى للنموذج ما يجيب منه سواه.
الاستراتيجية 2
RAG (التوليد المعزز بالاسترجاع)
البحث تلقائياً في قاعدة معرفية وحقن المستندات ذات الصلة في الأمر — أي تأسيس دون أن تجلب أنت شيئاً. وهو المعيار الصناعي لتقليل الهلوسة في الإنتاج: استرجاع محرّك بحث مركّب على توليد نموذج لغة. خط الأنابيبيسأل المستخدم “ما سياسة الاسترداد لدينا؟”، ثمّ يبحث النظام في مستندات الشركة بتشابه التضمينات، ثمّ تُحقن أعلى 3 نتائج في الأمر، ثمّ يجيب النموذج منها.
الاستراتيجية 3
الذكاء الاصطناعي الدستوري و RLHF
تدريب النماذج على الرفض عند عدم اليقين بدلاً من اختلاق الأشياء. يدرّب الذكاء الاصطناعي الدستوري (Anthropic) النموذج على مجموعة مبادئ مكتوبة، منها الصدق بشأن عدم اليقين؛ ويستخدم RLHF التغذية الراجعة البشرية لمكافأة الإجابات الدقيقة. وكلاهما يعمل أثناء التدريب لا عند الاستدلال — فيشكّلان السلوك على حدود ما يعرفه النموذج. مبدأ، بتقريبإن لم تكن متأكداً من شيء فقل ذلك. لا تختلق معلومات. “لا أعرف” أفضل من إجابة خاطئة واثقة.
الاستراتيجية 4
الاستشهادات والتحقق
طلب من النموذج الاستشهاد بالمصادر، ثم التحقق منها. استخدم الأدوات — البحث في الويب واستعلامات قواعد البيانات — للتحقق من الحقائق. وأقوى ما يكون مع الأنظمة الوكيلية التي تُجري الفحص على مخرجاتها قبل أن تراها أنت. سير العملالإجابة مع استشهادات، ثمّ استخدام أداة بحث للتأكد من وجود كل استشهاد، ثمّ مقابلة ما يقوله المصدر فعلاً بالادعاء، ثمّ الإبلاغ عن كل ما لا يصحّ.
بلغة مبسّطة

ببساطة: لا تستطيع أن تجعله يكفّ عن الاختلاق، فغيّر إذاً ما يختلق منه. ضع المستند الحقيقي أمامه فتصير الإجابة المعقولة والإجابة الصحيحة إجابةً واحدة.

تقنيًّا: هذه الاستراتيجيات تهاجم المشكلة في طبقات مختلفة — المُدخَل (التأسيس والاسترجاع)، والتدريب (المواءمة على الرفض عند عدم اليقين)، والمخرَج (الاستشهاد مع تحقّق خارجي). ولا واحدة منها تُزيل الهلوسة؛ بل تضيّق كلٌّ منها المجال الذي يكون فيه الاختلاق أرجح الاستمرارات. والتحقّق وحده هو ما يلتقط الفشل بعد وقوعه.

درجة الحرارة — التحكم بالإبداع

تتحكم درجة الحرارة بمدى “إبداع” النموذج. اسحب المنزلق لترى كيف تتغير الاحتمالات.

متوازن
0.7
nice
cold
hot
wild
banana
quantum
☀️
مثال على المخرجات — «ما هي عاصمة فرنسا؟»
Softmax مع درجة الحرارة
قاعدة عملية: للبرمجة والمهام الواقعية استخدم T=0. وللكتابة الإبداعية جرّب T=0.8–1.0.
بلغة مبسّطة

ببساطة: مقبض واحد، وهو لا يضيف أفكاراً ولا يحذفها — بل يقرّر إلى أي مدى يقبل النموذج المراهنة على المرشّح الضعيف. أدِره إلى الأسفل يفز المرشّح الأوفر حظاً في كل مرة؛ وأدِره إلى الأعلى تبدأ الاحتمالات البعيدة في الظهور.

تقنيًّا: درجة الحرارة تقسم اللوغيتات قبل softmax. فدون 1 تُحدّد التوزيع نحو المنوال؛ وفوق 1 تُسطّحه، فترفع الكتلة على الذيل الذي أرتك إياه هذه الوحدة قبل شريحتين. إنها تعيد تشكيل التوزيع القائم ولا تُدخل قط مرشّحاً لم يكن مُقيَّماً أصلاً. والمخرجات المعروضة لكل نطاق هنا أمثلة جاهزة، لا توليد حيّ.

استراتيجيات أخذ العينات

درجة الحرارة ليست المقبض الوحيد. إليك الطرق الرئيسية للتحكم بمخرجات نماذج اللغة.

الاستراتيجية
كيف تعمل
حالة الاستخدام
الجشع
دائماً اختر الرمز الأعلى
أسئلة واقعية، برمجة
Top-k
أخذ عينات من أعلى k رمز
إبداع متوازن
Top-p (النواة)
أخذ عينات من أصغر مجموعة مجموعها p
إبداع ديناميكي
درجة الحرارة
إعادة تشكيل التوزيع الكامل
تحكم دقيق
في الممارسة: معظم واجهات البرمجة تجمع هذه الطرق. Claude يستخدم درجة الحرارة + top-p معاً.
بلغة مبسّطة

ببساطة: سؤالان مختلفان يسهل الخلط بينهما. درجة الحرارة تسأل: كم ينبغي أن تكون الحظوظ متفاوتة؟ أما Top-k و Top-p فتسألان: كم مرشّحاً يُسمح له أصلاً بدخول ورقة الاقتراع قبل السحب؟

تقنيًّا: درجة الحرارة تعيد تحجيم التوزيع؛ أما Top-k و Top-p فتبتُرانه. فـ Top-k تُبقي عدداً ثابتاً من المرشّحين، و Top-p تُبقي أصغر مجموعة يبلغ احتمالها التراكمي p — فتكيّف Top-p حدّ القطع بحسب مقدار ثقة النموذج عند تلك الخطوة، بينما لا تفعل Top-k ذلك. وهي تتركّب معاً، ولهذا تُتيح معظم واجهات البرمجة أكثر من واحدة في آن.

اختبار المعرفة

ثمانية أسئلة على هذه الوحدة. أجب لترى السبب — يظهر الشرح سواء أصبتَ أم أخطأت.

السؤال 1 من 0
النتيجة 0/0

النقاط الرئيسية

🔮
التنبؤ بالرمز التالي
تتنبأ نماذج اللغة بما يأتي بعد ذلك. الذكاء ينشأ من الحجم.
✂️
رموز، ليست كلمات
يُقسّم النص إلى رموز فرعية عبر BPE. هذا يؤثر على التكلفة والقدرة.
📊
التضمينات تلتقط المعنى
الكلمات تصبح متجهات حيث المسافة = التشابه الدلالي.
⚡
الانتباه هو كل شيء
تستخدم المحوّلات الانتباه لفهم السياق بالتوازي.
🎭
الهلوسة حقيقية
تبدو نماذج اللغة واثقة حتى عندما تكون خاطئة. تحقق دائماً من الادعاءات المهمة.
🌡️
درجة الحرارة = مقياس الإبداع
منخفضة = دقيقة وحتمية. عالية = إبداعية ومتنوعة.
الترميزBPEالتضميناتالانتباهالمحوّلالهلوسةدرجة الحرارةأخذ العينات