من إنتاج الذكاء الاصطناعيمبني على ورقة منشورةأرقام توضيحية
هذا الرسم التفاعلي من إنتاج Claude (شركة Anthropic) اعتماداً على الورقة
المذكورة أدناه، ضمن مواد مساق Wireless 101. وهو يحاكي التصميم البصري
للشكل 1 من:
Aeree Cho, Grace C. Kim, Alexander Karpekov, Seongmin Lee, Alec Helbling, Benjamin Hoover,
Zijie J. Wang, Minsuk Kahng, Duen Horng Chau.
Transformer Explainer: Learning LLM Transformers with Interactive Visual Explanation and
Experimentation. CHI '26. DOI
10.1145/3772318.3791725.
CC BY 4.0.
هذه الصفحة لا تشغّل نموذجاً. الأداة الأصلية تشغّل GPT‑2 حقيقياً في المتصفّح؛ أمّا
هذه فصفحة HTML ساكنة بلا أي استدلال، فكل رقم فيها من ثلاثة أنواع، وكل نوع موسوم في موضعه:
مستخرَج من أشكال الورقة نفسها، أو حقيقة معماريّة منشورة عن
GPT‑2 Small، أو توضيحي. حسابات درجة الحرارة و top‑k و top‑p و
softmax حقيقية؛ أمّا قيم الانتباه فليست قياسات.
وسلوك الرؤوس يحاكي أنماطاً رصدتها دراسات التقصّي، وهي موسومة ● موثّق أو ○ نمط محتمل.
المحوّل من البداية إلى النهاية — رسم سانكي
مبني على الشكل 1 من ورقة Transformer Explainer (Cho وآخرون، CHI '26).
عرض تفاعلي للمقرر — مرتبط من شرائح الوحدة 2 بكلتا اللغتين.
مرّر المؤشّر على أي رمز لتتبّع مساره؛ اضغط ⚲ لتوسيع أي مرحلة في موضعها؛
وتنقّل بين الكتل والرؤوس. الدرجات الخام (logits) مستخرَجة من الشكل 4B في الورقة،
والاحتمالات تُحسَب حياً — وكل لوحة تبيّن أي أرقامها حقيقي وأيها توضيحي.
الكتلة 1 من 12الرأس 1 من 12
المُرمِّز — لماذا الرموز ليست كلمات
يدمج ترميز أزواج البايتات (BPE) أكثر أزواج المحارف تكراراً حتى يبلغ مفردات بحجم ثابت.
فتبقى الكلمات الشائعة كاملة، وتُقطَّع الأندر منها إلى أجزاء مألوفة.
أمران يخطئ فيهما الناس.1.المستخدمين كلمة واحدة لكنها رمزان —
المستخدم + ين. فالنموذج لا يرى
الكلمة قطّ؛ يرى الأجزاء، وعليه أن يعيد تركيب المعنى. وهذا ما يخدمه رأس
«إكمال الكلمة المقسومة».
2. علامة ␣ تدلّ على مسافة سابقة تنتمي إلى الرمز الذي
بعدها. ولهذا لا تحمل ين مسافة سابقة: فهي إكمال لما قبلها لا كلمة جديدة. والعربية تُقطّع أكثر من الإنجليزية في هذه المُرمّزات، لأن مفرداتها بُنيت على نصوص إنجليزية في الأساس.
الأرقام: التقسيم المعروض سلوك حقيقي لـ BPE في GPT‑2، والمعرّفات
المعرّفات كلّها توضيحية هنا، ولذلك تحمل الصفوف كلّها علامة * — فالورقة تنشر معرّفات إنجليزية فقط، ولا يوجد في هذا المستودع مُرمّز نستخرج به معرّفات العربية.
التضمين — معرّف الرمز، ثم متجهان يُجمعان
يصبح كل رمز معرّفاً رقمياً، ويجلب المعرّف متجهاً مُتعلَّماً، ثم يُضاف إليه متجه موضعي،
والمجموع هو ما يدخل الكتلة الأولى.
الأرقام:المعرّفات كلّها توضيحية هنا، وكذلك صفّ تضمين الرمز — فالورقة تنشر معرّفات إنجليزية فقط.
والعدد 768 هو عرض GPT‑2 Small المنشور.
وصفّ الموضع محسوب بالمعادلة الحقيقية —
PE(pos,2i) = sin(pos / 100002i/d) (Vaswani وآخرون 2017،
§3.5) — ولهذا يتذبذب طرفه الأيسر سريعاً ويكاد طرفه الأيمن يستوي.
تحفّظ يجدر معرفته: GPT‑2 في الواقع يتعلّم تضميناته الموضعية ولا يستخدم
هذا الجيب الثابت؛ والجيب مرسوم هنا لأنه النسخة التي يمكن حسابها بصدق في هذه الصفحة.
والرمادي مقصود — §6.1 ص.7، «للتأكيد على أنها التمثيلات الأولية قبل أي تحويل».
الانتباه الذاتي في ثلاث خطوات
تعرض الورقة هذه الخطوات جنباً إلى جنب لا بالتتابع، حتى تُقارَن النتائج الوسيطة
بدل أن تُحفَظ (§6.2 ص.7).
الأرقام: الجداءات القياسية الخام توضيحية، لكن هيئتها ليست اعتباطية.
خمسة رؤوس منها تحاكي أصنافاً مسمّاة وموثّقة — الرمز السابق، والواسع/التمتيني،
والنحوي بالتبعية، والرمز النادر (Clark وآخرون 2019 What Does BERT Look At?؛
Voita وآخرون 2019 Analyzing Multi-Head Self-Attention؛ وOlsson وآخرون 2022 لحالة
المُفكِّك) ومصرف الانتباه (Xiao وآخرون 2023، وليس Clark).
وثلاثة — الذات/الهوية، والتلاشي بالقرب، وإكمال الكلمة المقسومة —
أنماط محتملة لا أصناف مسمّاة، واللوحة توسم أيها أيّ بـ ● و ○.
تحفّظ عبر المعمار: Clark مُرمِّز ثنائي الاتجاه وVoita مُرمِّز ترجمة آلية، فتطبيق
نتائجهما على رؤوس GPT‑2 المُفكِّكة استقراء لا نقل.
والنسبة هنا ليست النسبة الحقيقية: رُسمت ثمانية رؤوس مسمّاة، رأس لكل سلوك، لتتمكّن من
رؤية الفهرس كلّه؛ أمّا في نموذج حقيقي فالرؤوس القابلة للتفسير بوضوح هي الأقلية
— ومعظمها يشبه الرؤوس 9–12 (وجد Voita وآخرون أن معظم الرؤوس قابل للتشذيب،
وكذلك Michel وآخرون 2019).
العمق: يبلغ الوضوح ذروته مبكراً في الرؤوس الموضعية ووسط الكومة في النحوية، ثم
يتلاشى عند الكتلة 12 — تنقّل بين الكتل وراقب القراءة.
والنطاقات المطبوعة فوق كل لوحة محسوبة من المصفوفة المعروضة لا منسوخة من الورقة:
فنطاقها «−3.0…3.0» للّوحة 2 لا يمكن أن ينتج عن
«−25.3…7.4» للّوحة 1، لأن القسمة على √64 تحدّ اللوحة 2 قرب
+0.9. وكل ما بعد اللوحة 1 حساب حقيقي: ÷√64، والقناع السببي، وsoftmax.
واقرأ اللوحة الوسطى: يصير المثلّث الأعلى −∞ لأن
الرمز لا يستطيع الانتباه إلى رمز لم يأتِ بعد — وهو مرسوم لا محذوف. واللوحة 3 هي
softmax وحدها؛ فالإسقاط العشوائي زمن تدريب وكان سيُفسد كون مجموع الصفوف 1، فلم
يُطبَّق هنا.
وغير معروض بقصد:رؤوس الاستدلال بالقياس — أفضل الأصناف توثيقاً في
النماذج المُفكِّكة (Olsson وآخرون 2022: إذا رأى «… A B … A»
تنبّأ بـ B). فهي تحتاج زوجاً مكرّراً في السياق، وهذا النص من ستة رموز لا يحتوي أيّ
تكرار، فيصير مثل هذا الرأس هنا غير مميَّز عن الرأس الواسع. ورسمه يعني اختلاق نمط لا
يستطيع النص إنتاجه.
من متجه واحد إلى تخمين مرتَّب
من اليسار إلى اليمين، بالترتيب الذي تُنفَّذ به العمليات فعلاً
(§6.2 ص.8): الدرجات الخام → القسمة على درجة الحرارة → الترشيح → softmax.
تحفّظ واحد على هذا الترتيب: يعمل top-k على الرتبة، فيمكنه أن يُطبَّق على
الدرجات الخام مباشرة — أمّا top-p فيحتاج احتمالات مُسوَّاة ليجمعها تراكمياً،
فيُحسَب بعد softmax ثم تُعاد تسوية الناجين. لذا فأعمدة الجدول أدناه مرتَّبة ترتيباً تعليمياً،
لا ترتيب تنفيذ صارم، في هذه الخطوة الواحدة.
الأرقام: الدرجات الخام الخمس الأساسية مستخرَجة من الشكل 4B في الورقة
نفسها (فهي تطبع −136.68 / 0.8 = −170.85 وتكتب
الـ softmax بتمامه)، وعند T = 0.8 تعيد إنتاج النِسب
المنشورة فيها بفارق لا يتجاوز 0.07 نقطة. وأيّ درجة خام في صفّ آخر توضيحية.
أمّا درجة الحرارة والترشيح وإعادة التسوية أعلاه فـمضبوطة تماماً — حساب، لا
توضيح.
ما يخرج فعلاً
زرّا التنقّل يتحرّكان على محورين مختلفين
الكتل — العمق. متتابعة. كل كتلة تتغذّى على مخرَج ما قبلها،
ولذلك الترتيب مهم: بادِل كتلتين فيتعطّل النموذج.
الرؤوس — العرض. متوازية، داخل كتلة واحدة. الرؤوس الاثنا عشر
تقرأ المدخل نفسه في اللحظة نفسها، ولذلك الترتيب بلا معنى: بادِل رأسين فلا يتغيّر
شيء سوى الأسماء.
ما تفعله كل مرحلة
لماذا هذه الألوان بالتحديد. تقول الورقة (§6.1 ص.7) إن تضمينات الرموز رماديّة
«للتأكيد على أنها التمثيلات الأولية قبل أي تحويل»، ثم
«الاستعلام أزرق والمفتاح أحمر، وتظهر درجات الانتباه الناتجة بالبنفسجي،
بما يعكس بصرياً اجتماع الاثنين». وهذا البنفسجي يؤدّي عملاً تعليمياً لا يؤدّيه النص:
يُظهر أن الدرجة حاصل شيئين. أمّا الشبكة الأمامية فتبقى بلون واحد لأنها توسّع
التمثيل ولا تمنحه دوراً جديداً.
ولمّا كانت لوحة المساق (كهرماني وحبري) لا تحتوي أزرق ولا أحمر ولا أخضر، أُعيد اشتقاق الألوان
الأربعة هنا وقياسها على الخلفية الكريميّة وعلى السطح الداكن — والثمانية كلها تتجاوز
4.5:1 كنص وكنص على تعبئة. وتنعكس تدريجات شبكة الدرجات بين الوضعين، لأن البنفسجي الفاتح
نسبته 8.77:1 على السطح الداكن و 1.74:1 على الكريمي.
عن الدمج في الشرائح. هذه الصفحة مرتبطة من الوحدة الثانية كعرض مستقل، ولم تُدمَج
داخل شريحة. فدمجها في m2-l1-slides.html يعني صندوقاً بارتفاع 590 بكسل تقريباً،
ولذلك سيتحوّل العرض الكامل إمّا إلى شريط يُسحَب أفقياً أو إلى ثلاث مراحل مرتبطة على الشرائح
القائمة أصلاً. وهذا القرار مؤجَّل بقصد — انظر
ref/papers/transformer-explainer.md §9.3 R1/R5/R6.