١٠ أوراق بحثية يجب أن يعرفها كل مهندس ذكاء اصطناعي

البحث التأسيسي الذي شكّل الذكاء الاصطناعي الحديث — من المحولات إلى التوليد المعزز بالاسترجاع.

Attention Is All You Need (2017)

فاسواني وآخرون — الورقة التي أطلقت آلاف النماذج.

اقرأ الورقة‏ورقة فاسواني وآخرون (2017): Attention Is All You Need — على arXiv برقم 1706.03762 ↗

📐
الانتباه الذاتي
كل رمز يلتفت إلى كل رمز آخر بالتوازي.
⚡
المعالجة المتوازية
على عكس RNNs، تُعالج جميع المواضع في آنٍ واحد.
🔑
الابتكار الرئيسي
Q·KT / √dk — انتباه حاصل الضرب النقطي المُقيّس.
🏗️
البنية المعمارية
مُشفّر-مُفكّك مع انتباه متعدد الرؤوس وطبقات تغذية أمامية.
بلغة مبسّطة

ببساطة: في وليمة صاخبة لا تسمع كل الأصوات بالقدر نفسه — بل تُصغي إلى الشخصين اللذين يمسّ كلامهما ما أنت على وشك قوله. كل كلمة في الجملة تفعل ذلك، مع كل كلمة أخرى، في اللحظة نفسها.

تقنيًّا: يقيس انتباه حاصل الضرب النقطي المُقيّس كل استعلام مقابل كل مفتاح، ثم يحوّل الدرجات بدالة softmax إلى أوزان، ويعيد المجموع الموزون للقيم. عمليةٌ تشمل كل الأزواج بلا تكرار زمني، ولهذا يُحسم التسلسل كله في خطوة متوازية واحدة بدل خطوة زمنية تلو الأخرى (Vaswani et al.، 2017).

GPT — المحولات التوليدية المُدرّبة مسبقاً (2018–2024)

بنية المُفكّك فقط التي تطورت لتغيير العالم.

اقرأ الأوراق‏GPT-1: Improving Language Understanding by Generative Pre-Training (2018) — ملف PDF من OpenAI ↗‏GPT-3: Language Models are Few-Shot Learners (2020) — على arXiv برقم 2005.14165 ↗‏التقرير التقني لنموذج GPT-4 (2023) — على arXiv برقم 2303.08774 ↗

2018
GPT-1
مُفكّك فقط، تدريب مسبق غير خاضع للإشراف + ضبط دقيق خاضع للإشراف.
2019
GPT-2
«خطير جداً للإصدار» — 1.5 مليار معامل، نقل المهام بدون أمثلة.
2020
GPT-3
175 مليار معامل، التعلم داخل السياق، التوجيه بعدد قليل من الأمثلة.
2023
GPT-4
متعدد الوسائط، استدلال موسع، استخدام الأدوات.
بلغة مبسّطة

ببساطة: لم يُعِد أحد تصميم المحرّك بين 2018 و2023. أبقوا المحرّك نفسه وبنوه أكبر وبوقود أكثر — وبعد حجم معيّن بدأ يؤدّي حِيَلًا لم يعلّمه إياها أحد، مثل اتّباع تعليمة لم يرَ عنها إلا وصفًا.

تقنيًّا: تُثبّت سلسلة GPT هدف التنبؤ بالرمز التالي ببنية المُفكّك وحده عبر أربعة أجيال، وتوسّع المعاملات والبيانات والحوسبة. وورقة GPT-3 (2020) هي التي سمّت العائد: التعلّم داخل السياق، حيث تحلّ أمثلة قليلة في الأمر محلّ تحديثات التدرّج — وهي قدرة لم يُحسّنها هدف التدريب أصلًا.

BERT — الفهم ثنائي الاتجاه (2018)

مهمة BERT أن يفهم النص، لا أن يكمله. دُرِّب بتمرين «أكمل الفراغ» متطوّر: أخفِ بعض الكلمات، ثم خمّنها. The [MASK] sat on the [MASK] — ولكي يجيب cat وmat عليه أن يقرأ الجملة كاملة، بما فيها الجزء الذي يأتي بعد الفراغ. وهذا هو الفرق عن GPT، الذي لا يرى أبدًا إلا ما سبق الكلمة.

اقرأ الورقة‏ورقة دِفلِن وآخرون (2018): BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding — على arXiv برقم 1810.04805 ↗

🔄
يقرأ في الاتجاهين
كل كلمة تُفهم من الكلمات التي قبلها ومن الكلمات التي بعدها، في الوقت نفسه.
🎭
خمّن الكلمة المخفيّة masked LM
أخفِ نحو كلمة من كل سبع، ثم اطلب من النموذج أن يعيدها. رخيص التهيئة على أي نص لديك، ولا يحتاج بشرًا يصنّف شيئًا.
📝
هل تنتمي هاتان الجملتان معًا؟ next-sentence prediction
تمرين ثانٍ: اعرض عليه جملتين واسأله إن كانت الثانية تلي الأولى فعلًا. أعمال لاحقة شكّكت في أن هذا التمرين يستحق تكلفته.
🏆
لماذا لا يزال مهمًّا
البحث والتصنيف والترتيب لا تزال تستند إلى هذه العائلة. وRoBERTa وALBERT وDistilBERT كلها تنويعات عليها.
بلغة مبسّطة

ببساطة: الكاتب الذي يؤلّف جملة لا يملك إلا الكلمات التي على الصفحة أصلًا. أما المدقّق الذي يقرأ الصفحة تامّة فيملك جانبَي أي فراغ — ولهذا يلتقط التدقيق ما لا تلتقطه الكتابة. GPT يكتب، وBERT يدقّق.

تقنيًّا: BERT محوّل من مُشفّر فقط بلا قناع سببي، فكل موضع يلتفت إلى التسلسل كاملًا في الاتجاهين. وهذا يجعل التوليد الانحداري الذاتي مستحيلًا ويجعل جودة التمثيل ممتازة، ولهذا تعيش هذه العائلة في التصنيف والترتيب والاسترجاع لا في المحادثة.

LoRA — التكيّف منخفض الرتبة (2021)

تعليم نموذج كبير مهمّة جديدة كان يعني إعادة كتابة الكتاب كلّه. أما LoRA فهو ورقة لاصقة تُثبَّت على الصفحة: الكتاب يبقى كما هو تمامًا، والورقة تحمل التصحيح. وفي نموذج بسبعة مليارات معامل تكون الورقة نحو 0.1% من حجم الكتاب — وهذا ما يحوّل الضبط الدقيق من عمل مركز بيانات إلى شيء تشغّله على جهاز واحد.

اقرأ الورقة‏ورقة هو وآخرون (2021): LoRA: Low-Rank Adaptation of Large Language Models — على arXiv برقم 2106.09685 ↗

🧮
أعِد كتابة الكتاب، أو ثبّت ورقة
راقب ما يتوقّف عن كونه قابلًا للتدريب — ثمّ أحصِ ما بقي
قابل للتدريب مجمّد الشبكة = مصفوفة أوزان واحدة W  ·  الشريطان = A (d×r) و B (r×d)
r = 8
7,000,000,000
معامل قابل للتدريب
كل وزن في المصفوفة يُحدَّث. هذا ما كان يعنيه الضبط الدقيق قبل 2021.
مقياس لوغاريتمي — كل خطوة متساوية تعني تغيّرًا بمقدار عشرة أضعاف، فتبقى حصّة بهذا الصغر مرئية.
أرقام توضيحية لنموذج بسبعة مليارات معامل، مبنيّة على الأرقام الواردة في تعميقات هذه الشريحة نفسها. يدرّب LoRA عددًا مقداره 2×d×r من المعاملات لكل مصفوفة مكيَّفة، فيكون العدد خطّيًا في r — وهذا الجزء دقيق تمامًا (Hu et al.، LoRA: Low-Rank Adaptation of Large Language Models، 2021). وسماكة الشريطين ليست بمقياس رسم: فعند r=8 تكون الحصّة الحقيقية أقلّ من 0.1% ولن تظهر أصلًا. العدّاد هو الرقم الحقيقي.
📉
كم هي صغيرة تلك الورقة
يُدرَّب جزء من واحد بالمئة من معاملات النموذج. أقلّ بمراتب من الضبط الدقيق الكامل، فيتّسع في ذاكرة أصغر بكثير.
🔀
كتاب واحد، أوراق كثيرة
احتفظ بورقة لكل مهمة، وبدّلها دخولًا وخروجًا. نسخة واحدة من النموذج على القرص تخدم كل الأعمال.
بلغة مبسّطة

ببساطة: تثبيت الورقة رخيص. أما سبب نجاحها فمنفصل وأقلّ وضوحًا: التصحيح الذي تحتاجه مهمّة جديدة بسيط عادةً — دفعة في اتجاهات قليلة متّسقة، لا إعادة كتابة لكل صفحة. والورقة القصيرة تسع تصحيحًا بسيطًا، ولم تكن لتسع تصحيحًا معقّدًا.

تقنيًّا: يجمّد LoRA المصفوفة W ويتعلّم ΔW = A·B حيث A بأبعاد d×r وB بأبعاد r×d، فتكون رتبة ΔW محصورة عند r على الأكثر. والرهان أن تحديث الأوزان الذي يريده الضبط الدقيق منخفض الرتبة في جوهره. وعدد المعاملات المدرَّبة لكل مصفوفة مكيَّفة هو 2·d·r، أي خطّي في r — وعند الاستدلال يندمج B·A في W فلا يتغيّر زمن الاستجابة (Hu et al.، 2021).

PEFT — الضبط الدقيق الفعّال للمعاملات

عائلة من التقنيات تجعل تكيّف النماذج الكبيرة عملياً.

اقرأ الأوراق‏طبقات المحوّل — هولسبي وآخرون (2019): Parameter-Efficient Transfer Learning for NLP — على arXiv برقم 1902.00751 ↗‏ضبط البادئة — لي وليانغ (2021): Prefix-Tuning: Optimizing Continuous Prompts for Generation — على arXiv برقم 2101.00190 ↗

🔧
LoRA
مصفوفات أوزان منخفضة الرتبة
📌
ضبط البادئة
بادئات أوامر قابلة للتعلم
🎯
طبقات المحوّل
وحدات اختناق صغيرة
❄️
قاعدة مُجمّدة
النموذج الأصلي يبقى دون تغيير
🔄
تبديل المهام
تبديل سريع للأوزان الخاصة بالمهام
📊
النتيجة
جودة ضبط دقيق كاملة بجزء من التكلفة
بلغة مبسّطة

ببساطة: ثمّة أكثر من موضع لتثبيت الورقة. يمكنك الكتابة في الهامش بجوار النص (وحدة صغيرة تُدرَج بين الطبقات)، أو تدبيس مذكّرة تمهيدية في المقدّمة فيُقرأ كل ما بعدها قراءةً مختلفة (تمهيد متعلَّم). وLoRA خيار من هذه الخيارات، لا العائلة كلها.

تقنيًّا: PEFT مظلّة تجمع الطرق التي تكيّف عمودًا فقريًّا مجمّدًا بتدريب مجموعة صغيرة من المعاملات الجديدة. المحوّلات (adapters) تُدرِج وحدات MLP اختناقية داخل كل كتلة؛ وضبط البادئة يُلحِق متجهات مفاتيح/قيم متعلَّمة بكل طبقة انتباه؛ وLoRA يعيد صياغة تحديث الأوزان نفسه. وتختلف في موضع المعاملات القابلة للتدريب وفي إضافتها كلفةَ استدلال — فالمحوّلات والبادئات تضيفها، وLoRA المدموج لا يضيفها.

ViT — محول الرؤية (2020)

اقرأ الصورة كما تقرأ صفحة. قطّع الصورة إلى شبكة من مربّعات صغيرة، ثم رتّب المربّعات على ترتيب القراءة، وسلّمها إلى محوّل كأن كل مربّع كلمة. صورة 224×224 مقطّعة إلى مربّعات 16×16 تصبح جملة من 196 «كلمة» — ومن هناك تكون الآلة هي نفسها الآلة التي تقرأ النص.

اقرأ الورقة‏ورقة دوسوفيتسكي وآخرون (2020): An Image Is Worth 16×16 Words: Transformers for Image Recognition at Scale — على arXiv برقم 2010.11929 ↗

🖼️
مربّعات بدلًا من كلمات patch embedding
قطّع الصورة إلى مربّعات 16×16، وسطّح كل واحد، وأدخل التسلسل. علامات الموضع تخبر النموذج أين كان كل مربّع.
🔄
لا شيء فيه خاصّ بالرؤية
نفس مُشفّر المحوّل المستخدَم للنص، بلا تعديل. ولا التفافات في أي مكان — وهذا كان الجزء المفاجئ.
📊
يحتاج صورًا كثيرة JFT-300M
على مجموعة بيانات صغيرة يخسر أمام CNN، لأن CNN مبنيّ وهو يعرف مسبقًا أن القطة قطة أينما وقعت في الإطار. أما مع مجموعة ضخمة فيتعلّم ViT ذلك بنفسه ويتقدّم.
🌊
بنية واحدة لكل شيء
حين تعمل الصور والنص على التصميم نفسه، يستطيع نموذج واحد أن يأخذ الاثنين. هذه هي الخطوة التي جعلت نماذج اليوم متعددة الوسائط ممكنة.
بلغة مبسّطة

ببساطة: الطفل الذي نشأ على حفنة صور يعرف مع ذلك أن القطة قطة وإن كانت مقلوبة أو في ركن الإطار — هذا الافتراض يأتي مركّبًا فيه. أما ViT فلا يولد به. أرِه صورًا قليلة يتعثّر، وأرِه صورًا هائلة العدد يستنبط القاعدة بنفسه ثم يطبّقها أفضل من النسخة المركّبة.

تقنيًّا: تُرسِّخ CNN تكافؤ الإزاحة والمحلّية كأولويات معمارية مضمّنة. وViT يزيلها: تُضمَّن الرقع، ويُتعلَّم الموضع، والانتباه شامل من الطبقة الأولى. ومع بيانات أقلّ يكلّفه غياب هذه الأولوية دقّةً أمام CNN؛ أما بعد تدريب مسبق على مجموعة ضخمة فيتقدّم عليها، وهذه هي نتيجة التوسّع التي تعرضها الورقة (Dosovitskiy et al.، 2020).

VAE و GANs — رواد التوليد

طريقتان لجعل آلة تُنتج وجهًا لم يوجد قط. الرسّام يتعلّم شكل «الوجه» كفضاء سلس، فتستطيع أن تنزلق من وجه إلى آخر، وكل نقطة في الطريق هي أيضًا وجه. أما المزوّر فلا يتعلّم ذلك الفضاء أبدًا — إنه فقط يصير بارعًا جدًّا في خدع مفتّش. نتائج أحدّ، لكن لا يوجد «بَين» تنزلق فيه.

اقرأ الأوراق‏VAE — كينغما وويلينغ (2013): Auto-Encoding Variational Bayes — على arXiv برقم 1312.6114 ↗‏GANs — غودفيلو وآخرون (2014): Generative Adversarial Networks — على arXiv برقم 1406.2661 ↗

 
VAE (2013) — الرسّام
GANs (2014) — المزوّر
كيف يتعلّم
اضغط الدخل إلى أرقام قليلة، ثم أعد بناءه منها latent distribution
شبكتان تتنافسان — واحدة تصنع المزيّف وأخرى تحاول كشفه adversarial training
ما تحصل عليه
فضاء سلس تتحرّك فيه — امزج وجهين، وامشِ بين الأنماط
عيّنات مفردة تبدو واقعية بشكل صادم
نقطة الضعف
المخرجات تخرج ناعمة قليلًا، وهو أثر جانبي لتحسين إعادة البناء الأمين
التدريب غير مستقرّ، وقد ينهار إلى إنتاج نفس المخرجات القليلة
غوص أعمق
نماذج الانتشار — في الشريحة التالية — تجاوزت كليهما في النهاية، وفعلت ذلك باستعارة شيء من كلٍّ منهما: الفضاء السلس القابل للتنقّل الذي بناه الرسّام، مع مخرجات حادّة بما يكفي لإرضاء مفتّش المزوّر.
بلغة مبسّطة

ببساطة: الرسّام يُقيَّم بمدى مطابقة رسمه للأصل، فإذا لم يتيقّن تحوّط — والخطّ المتحوّط خطٌّ ناعم. أما المزوّر فلا يُقيَّم إلا بخداع المفتّش، والتحوّط لا يكسبه شيئًا. فنقطة ضعف كلٍّ منهما هي الثمن المباشر لما يُقيَّم عليه.

تقنيًّا: يعظّم VAE احتمالية إعادة البناء مضافًا إليها حدّ KL الذي يشدّ التوزيع اللاحق الكامن نحو توزيع سابق؛ وخسارة إعادة البناء على مستوى البكسل هي ما يمحو التفاصيل عالية التردد بالمتوسّط، وحدّ KL هو ما يشتري الفضاء الكامن المتّصل الذي تستطيع الاستيفاء عبره. أما GAN فيحسّن هدف حدّ أدنى-أقصى مقابل مُميِّز، بلا أي حدّ لإعادة البناء — ومن هنا الحدّة، ومن هنا أيضًا انهيار الأنماط وعدم استقرار التدريب كنمطَي فشل قائمَين.

نماذج الانتشار (2020–2022)

إزالة الضباب. إضافة الضباب إلى صورة مجانية — لا تحتاج مهارة ولا تدريبًا لتُسيء صورة. فالنموذج لا يُعلَّم الرسم أبدًا. يُعلَّم شيئًا واحدًا: أن يزيل خطوة واحدة من الضباب. كرّر ذلك بضع عشرات المرات، بادئًا من ضباب خالص لا شيء غيره، فتخرج صورة. اسحب المنزلق لتُدخل الضباب خطوة خطوة، ثم اقرأ الشريط في الاتجاه المعاكس لترى ما يفعله النموذج فعلًا.

اقرأ الأوراق‏ورقة هو وآخرون (2020): Denoising Diffusion Probabilistic Models — على arXiv برقم 2006.11239 ↗‏الانتشار الكامن — رومباخ وآخرون (2022): High-Resolution Image Synthesis with Latent Diffusion Models — على arXiv برقم 2112.10752 ↗

🌫️
أضِف الضباب، ثم أزِلْه
ست خطوات من الصورة إلى الضوضاء الخالصة — وبالعكس
الخطوة 0
ست خطوات هنا للوضوح؛ أما الصيغة الأصلية فاستخدمت في حدود 1,000 خطوة (Ho et al.، Denoising Diffusion Probabilistic Models، 2020)؛ وأدوات المعاينة اللاحقة خفّضت التوليد إلى نحو 20–50 خطوة.
🎨
اعمل على الصغير، ثم كبّر latent diffusion
خمسون مرورًا على صورة بدقّة كاملة كلفة مُهلِكة. صغّرها أولًا، وأنجز كل العمل على النسخة الصغيرة، ووسّعها في النهاية — وهذه هي الخطوة التي وضعت توليد الصور على أجهزة عادية.
🏆
ما الذي أطلقته
كل أداة تحويل نص إلى صورة سمعت عنها تعمل بهذه الفكرة. وتوجيهها بأمر نصّي مسألة أن تخبر مُزيل الضباب ما الذي يُفترض أنه يكشفه.
بلغة مبسّطة

ببساطة: إزالة الضباب دفعةً واحدة بطولية عملُ فنّان. أما إزالته شعرةً شعرة، مرّة بعد مرّة، فعملُ فنّي — وفنّيٌّ تستطيع تدريبه فعلًا، لأنك تصنع مادة تدريب لا حدّ لها مجانًا بمجرّد تضبيب صور تملكها أصلًا.

تقنيًّا: العملية الأمامية جدول تضبيب غاوسي ثابت بلا معاملات متعلَّمة، فتُولَّد أزواج التدريب بلا كلفة وتُعايَن أي خطوة زمنية مباشرة. والشبكة لا تتعلّم إلا التنبؤ بالضوضاء المضافة عند خطوة معيّنة؛ وأخذ العيّنات يطرح ذلك التنبؤ تكراريًّا. أما الانتشار الكامن فيشغّل الحلقة في فضاء مُشفّر تلقائي مضغوط بدل فضاء البكسل، وهذا هو التغيير الذي أنزل الكلفة إلى أجهزة المستهلك (Ho et al.، 2020؛ Rombach et al.، 2022).

RAG — التوليد المعزز بالاسترجاع (2020)

لويس وآخرون — تأصيل نماذج اللغة في معرفة حقيقية قابلة للاسترجاع.

اقرأ الورقة‏ورقة لويس وآخرون (2020): Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks — على arXiv برقم 2005.11401 ↗

المشكلة
حدود المعرفة والهلوسة
لنماذج اللغة حدود معرفية وتهلوس حقائق لا تعرفها.
الحل
استرجع ثم ولّد
استرجع المستندات ذات الصلة، احقنها في السياق، ثم ولّد.
البنية المعمارية
خط أنابيب RAG
استعلام ← تضمين ← بحث متجهي ← أفضل K قطعة ← نموذج اللغة + السياق ← الإجابة.
الأثر
ذكاء اصطناعي للشركات
قواعد المعرفة، روبوتات الدردشة المُؤصّلة في بيانات حقيقية، بحث الشركات.
بلغة مبسّطة

ببساطة: الامتحان المفتوح الكتاب يتفوّق على المغلق، وليس لأن الطالب صار أذكى، بل لأنه صار يستطيع أن يذكر الصفحة. أما في الامتحان المغلق فالطالب الواثق الذي نسي المعلومة سيخترع ببساطة معلومةً تبدو صحيحة — وبالثقة نفسها تمامًا.

تقنيًّا: يفصل RAG المعرفة عن المعاملات: يجلب المسترجِع مقاطع وقت الاستعلام ويشترط المولّد عليها، فتحديث المدوّنة يحدّث الإجابات بلا إعادة تدريب. وهو يضيّق مساحة الهلوسة ولا يغلقها — فالنموذج قد يسيء قراءة مقطع مسترجَع أو يعمّم منه أو يتجاهله، والاسترجاع الخاطئ إجابةٌ خاطئة بمرجع مرفق (Lewis et al.، 2020).

اختبار المعرفة

ثمانية أسئلة على هذه الوحدة. أجب لترى السبب — يظهر الشرح سواء أصبتَ أم أخطأت.

السؤال 1 من 0
النتيجة 0/0

الصورة الكاملة

أنت الآن تعرف الأوراق العشر التي تُعرّف الذكاء الاصطناعي الحديث. من آليات الانتباه إلى التوليد المعزز بالاسترجاع — هذا هو الأساس الذي يحتاجه كل مهندس ذكاء اصطناعي.

TransformersGPTBERTLoRAPEFTViTVAEGANsDiffusionRAG

كل ورقة هنا تتحدّث عن شكل نموذج. أمّا تركيب استدعاءات نماذج كثيرة في نظام عامل فهو طبقة منفصلة لها قواعدها الخاصّة — وليست لها بعد ورقة فارقة تخصّها.

التالي: الوحدة 8 — مستقبل الذكاء الاصطناعي التوليدي. رأيت من أين جاءت هذه الأنظمة؛ والوحدة الأخيرة تسأل إلى أين تتجه، وما يعنيه ذلك لك.