١٠ أوراق بحثية يجب أن يعرفها كل مهندس ذكاء اصطناعي
البحث التأسيسي الذي شكّل الذكاء الاصطناعي الحديث — من المحولات إلى التوليد المعزز بالاسترجاع.
Attention Is All You Need (2017)
فاسواني وآخرون — الورقة التي أطلقت آلاف النماذج.
اقرأ الورقةورقة فاسواني وآخرون (2017): Attention Is All You Need — على arXiv برقم 1706.03762 ↗
ببساطة: في وليمة صاخبة لا تسمع كل الأصوات بالقدر نفسه — بل تُصغي إلى الشخصين اللذين يمسّ كلامهما ما أنت على وشك قوله. كل كلمة في الجملة تفعل ذلك، مع كل كلمة أخرى، في اللحظة نفسها.
تقنيًّا: يقيس انتباه حاصل الضرب النقطي المُقيّس كل استعلام مقابل كل مفتاح، ثم يحوّل الدرجات بدالة softmax إلى أوزان، ويعيد المجموع الموزون للقيم. عمليةٌ تشمل كل الأزواج بلا تكرار زمني، ولهذا يُحسم التسلسل كله في خطوة متوازية واحدة بدل خطوة زمنية تلو الأخرى (Vaswani et al.، 2017).
GPT — المحولات التوليدية المُدرّبة مسبقاً (2018–2024)
بنية المُفكّك فقط التي تطورت لتغيير العالم.
اقرأ الأوراقGPT-1: Improving Language Understanding by Generative Pre-Training (2018) — ملف PDF من OpenAI ↗GPT-3: Language Models are Few-Shot Learners (2020) — على arXiv برقم 2005.14165 ↗التقرير التقني لنموذج GPT-4 (2023) — على arXiv برقم 2303.08774 ↗
ببساطة: لم يُعِد أحد تصميم المحرّك بين 2018 و2023. أبقوا المحرّك نفسه وبنوه أكبر وبوقود أكثر — وبعد حجم معيّن بدأ يؤدّي حِيَلًا لم يعلّمه إياها أحد، مثل اتّباع تعليمة لم يرَ عنها إلا وصفًا.
تقنيًّا: تُثبّت سلسلة GPT هدف التنبؤ بالرمز التالي ببنية المُفكّك وحده عبر أربعة أجيال، وتوسّع المعاملات والبيانات والحوسبة. وورقة GPT-3 (2020) هي التي سمّت العائد: التعلّم داخل السياق، حيث تحلّ أمثلة قليلة في الأمر محلّ تحديثات التدرّج — وهي قدرة لم يُحسّنها هدف التدريب أصلًا.
BERT — الفهم ثنائي الاتجاه (2018)
مهمة BERT أن يفهم النص، لا أن يكمله. دُرِّب بتمرين «أكمل الفراغ» متطوّر: أخفِ بعض الكلمات، ثم خمّنها. The [MASK] sat on the [MASK] — ولكي يجيب cat وmat عليه أن يقرأ الجملة كاملة، بما فيها الجزء الذي يأتي بعد الفراغ. وهذا هو الفرق عن GPT، الذي لا يرى أبدًا إلا ما سبق الكلمة.
ببساطة: الكاتب الذي يؤلّف جملة لا يملك إلا الكلمات التي على الصفحة أصلًا. أما المدقّق الذي يقرأ الصفحة تامّة فيملك جانبَي أي فراغ — ولهذا يلتقط التدقيق ما لا تلتقطه الكتابة. GPT يكتب، وBERT يدقّق.
تقنيًّا: BERT محوّل من مُشفّر فقط بلا قناع سببي، فكل موضع يلتفت إلى التسلسل كاملًا في الاتجاهين. وهذا يجعل التوليد الانحداري الذاتي مستحيلًا ويجعل جودة التمثيل ممتازة، ولهذا تعيش هذه العائلة في التصنيف والترتيب والاسترجاع لا في المحادثة.
LoRA — التكيّف منخفض الرتبة (2021)
تعليم نموذج كبير مهمّة جديدة كان يعني إعادة كتابة الكتاب كلّه. أما LoRA فهو ورقة لاصقة تُثبَّت على الصفحة: الكتاب يبقى كما هو تمامًا، والورقة تحمل التصحيح. وفي نموذج بسبعة مليارات معامل تكون الورقة نحو 0.1% من حجم الكتاب — وهذا ما يحوّل الضبط الدقيق من عمل مركز بيانات إلى شيء تشغّله على جهاز واحد.
ببساطة: تثبيت الورقة رخيص. أما سبب نجاحها فمنفصل وأقلّ وضوحًا: التصحيح الذي تحتاجه مهمّة جديدة بسيط عادةً — دفعة في اتجاهات قليلة متّسقة، لا إعادة كتابة لكل صفحة. والورقة القصيرة تسع تصحيحًا بسيطًا، ولم تكن لتسع تصحيحًا معقّدًا.
تقنيًّا: يجمّد LoRA المصفوفة W ويتعلّم ΔW = A·B حيث A بأبعاد d×r وB بأبعاد r×d، فتكون رتبة ΔW محصورة عند r على الأكثر. والرهان أن تحديث الأوزان الذي يريده الضبط الدقيق منخفض الرتبة في جوهره. وعدد المعاملات المدرَّبة لكل مصفوفة مكيَّفة هو 2·d·r، أي خطّي في r — وعند الاستدلال يندمج B·A في W فلا يتغيّر زمن الاستجابة (Hu et al.، 2021).
PEFT — الضبط الدقيق الفعّال للمعاملات
عائلة من التقنيات تجعل تكيّف النماذج الكبيرة عملياً.
اقرأ الأوراقطبقات المحوّل — هولسبي وآخرون (2019): Parameter-Efficient Transfer Learning for NLP — على arXiv برقم 1902.00751 ↗ضبط البادئة — لي وليانغ (2021): Prefix-Tuning: Optimizing Continuous Prompts for Generation — على arXiv برقم 2101.00190 ↗
ببساطة: ثمّة أكثر من موضع لتثبيت الورقة. يمكنك الكتابة في الهامش بجوار النص (وحدة صغيرة تُدرَج بين الطبقات)، أو تدبيس مذكّرة تمهيدية في المقدّمة فيُقرأ كل ما بعدها قراءةً مختلفة (تمهيد متعلَّم). وLoRA خيار من هذه الخيارات، لا العائلة كلها.
تقنيًّا: PEFT مظلّة تجمع الطرق التي تكيّف عمودًا فقريًّا مجمّدًا بتدريب مجموعة صغيرة من المعاملات الجديدة. المحوّلات (adapters) تُدرِج وحدات MLP اختناقية داخل كل كتلة؛ وضبط البادئة يُلحِق متجهات مفاتيح/قيم متعلَّمة بكل طبقة انتباه؛ وLoRA يعيد صياغة تحديث الأوزان نفسه. وتختلف في موضع المعاملات القابلة للتدريب وفي إضافتها كلفةَ استدلال — فالمحوّلات والبادئات تضيفها، وLoRA المدموج لا يضيفها.
ViT — محول الرؤية (2020)
اقرأ الصورة كما تقرأ صفحة. قطّع الصورة إلى شبكة من مربّعات صغيرة، ثم رتّب المربّعات على ترتيب القراءة، وسلّمها إلى محوّل كأن كل مربّع كلمة. صورة 224×224 مقطّعة إلى مربّعات 16×16 تصبح جملة من 196 «كلمة» — ومن هناك تكون الآلة هي نفسها الآلة التي تقرأ النص.
ببساطة: الطفل الذي نشأ على حفنة صور يعرف مع ذلك أن القطة قطة وإن كانت مقلوبة أو في ركن الإطار — هذا الافتراض يأتي مركّبًا فيه. أما ViT فلا يولد به. أرِه صورًا قليلة يتعثّر، وأرِه صورًا هائلة العدد يستنبط القاعدة بنفسه ثم يطبّقها أفضل من النسخة المركّبة.
تقنيًّا: تُرسِّخ CNN تكافؤ الإزاحة والمحلّية كأولويات معمارية مضمّنة. وViT يزيلها: تُضمَّن الرقع، ويُتعلَّم الموضع، والانتباه شامل من الطبقة الأولى. ومع بيانات أقلّ يكلّفه غياب هذه الأولوية دقّةً أمام CNN؛ أما بعد تدريب مسبق على مجموعة ضخمة فيتقدّم عليها، وهذه هي نتيجة التوسّع التي تعرضها الورقة (Dosovitskiy et al.، 2020).
VAE و GANs — رواد التوليد
طريقتان لجعل آلة تُنتج وجهًا لم يوجد قط. الرسّام يتعلّم شكل «الوجه» كفضاء سلس، فتستطيع أن تنزلق من وجه إلى آخر، وكل نقطة في الطريق هي أيضًا وجه. أما المزوّر فلا يتعلّم ذلك الفضاء أبدًا — إنه فقط يصير بارعًا جدًّا في خدع مفتّش. نتائج أحدّ، لكن لا يوجد «بَين» تنزلق فيه.
اقرأ الأوراقVAE — كينغما وويلينغ (2013): Auto-Encoding Variational Bayes — على arXiv برقم 1312.6114 ↗GANs — غودفيلو وآخرون (2014): Generative Adversarial Networks — على arXiv برقم 1406.2661 ↗
ببساطة: الرسّام يُقيَّم بمدى مطابقة رسمه للأصل، فإذا لم يتيقّن تحوّط — والخطّ المتحوّط خطٌّ ناعم. أما المزوّر فلا يُقيَّم إلا بخداع المفتّش، والتحوّط لا يكسبه شيئًا. فنقطة ضعف كلٍّ منهما هي الثمن المباشر لما يُقيَّم عليه.
تقنيًّا: يعظّم VAE احتمالية إعادة البناء مضافًا إليها حدّ KL الذي يشدّ التوزيع اللاحق الكامن نحو توزيع سابق؛ وخسارة إعادة البناء على مستوى البكسل هي ما يمحو التفاصيل عالية التردد بالمتوسّط، وحدّ KL هو ما يشتري الفضاء الكامن المتّصل الذي تستطيع الاستيفاء عبره. أما GAN فيحسّن هدف حدّ أدنى-أقصى مقابل مُميِّز، بلا أي حدّ لإعادة البناء — ومن هنا الحدّة، ومن هنا أيضًا انهيار الأنماط وعدم استقرار التدريب كنمطَي فشل قائمَين.
نماذج الانتشار (2020–2022)
إزالة الضباب. إضافة الضباب إلى صورة مجانية — لا تحتاج مهارة ولا تدريبًا لتُسيء صورة. فالنموذج لا يُعلَّم الرسم أبدًا. يُعلَّم شيئًا واحدًا: أن يزيل خطوة واحدة من الضباب. كرّر ذلك بضع عشرات المرات، بادئًا من ضباب خالص لا شيء غيره، فتخرج صورة. اسحب المنزلق لتُدخل الضباب خطوة خطوة، ثم اقرأ الشريط في الاتجاه المعاكس لترى ما يفعله النموذج فعلًا.
اقرأ الأوراقورقة هو وآخرون (2020): Denoising Diffusion Probabilistic Models — على arXiv برقم 2006.11239 ↗الانتشار الكامن — رومباخ وآخرون (2022): High-Resolution Image Synthesis with Latent Diffusion Models — على arXiv برقم 2112.10752 ↗
ببساطة: إزالة الضباب دفعةً واحدة بطولية عملُ فنّان. أما إزالته شعرةً شعرة، مرّة بعد مرّة، فعملُ فنّي — وفنّيٌّ تستطيع تدريبه فعلًا، لأنك تصنع مادة تدريب لا حدّ لها مجانًا بمجرّد تضبيب صور تملكها أصلًا.
تقنيًّا: العملية الأمامية جدول تضبيب غاوسي ثابت بلا معاملات متعلَّمة، فتُولَّد أزواج التدريب بلا كلفة وتُعايَن أي خطوة زمنية مباشرة. والشبكة لا تتعلّم إلا التنبؤ بالضوضاء المضافة عند خطوة معيّنة؛ وأخذ العيّنات يطرح ذلك التنبؤ تكراريًّا. أما الانتشار الكامن فيشغّل الحلقة في فضاء مُشفّر تلقائي مضغوط بدل فضاء البكسل، وهذا هو التغيير الذي أنزل الكلفة إلى أجهزة المستهلك (Ho et al.، 2020؛ Rombach et al.، 2022).
RAG — التوليد المعزز بالاسترجاع (2020)
لويس وآخرون — تأصيل نماذج اللغة في معرفة حقيقية قابلة للاسترجاع.
ببساطة: الامتحان المفتوح الكتاب يتفوّق على المغلق، وليس لأن الطالب صار أذكى، بل لأنه صار يستطيع أن يذكر الصفحة. أما في الامتحان المغلق فالطالب الواثق الذي نسي المعلومة سيخترع ببساطة معلومةً تبدو صحيحة — وبالثقة نفسها تمامًا.
تقنيًّا: يفصل RAG المعرفة عن المعاملات: يجلب المسترجِع مقاطع وقت الاستعلام ويشترط المولّد عليها، فتحديث المدوّنة يحدّث الإجابات بلا إعادة تدريب. وهو يضيّق مساحة الهلوسة ولا يغلقها — فالنموذج قد يسيء قراءة مقطع مسترجَع أو يعمّم منه أو يتجاهله، والاسترجاع الخاطئ إجابةٌ خاطئة بمرجع مرفق (Lewis et al.، 2020).
اختبار المعرفة
ثمانية أسئلة على هذه الوحدة. أجب لترى السبب — يظهر الشرح سواء أصبتَ أم أخطأت.
الصورة الكاملة
أنت الآن تعرف الأوراق العشر التي تُعرّف الذكاء الاصطناعي الحديث. من آليات الانتباه إلى التوليد المعزز بالاسترجاع — هذا هو الأساس الذي يحتاجه كل مهندس ذكاء اصطناعي.
كل ورقة هنا تتحدّث عن شكل نموذج. أمّا تركيب استدعاءات نماذج كثيرة في نظام عامل فهو طبقة منفصلة لها قواعدها الخاصّة — وليست لها بعد ورقة فارقة تخصّها.
التالي: الوحدة 8 — مستقبل الذكاء الاصطناعي التوليدي. رأيت من أين جاءت هذه الأنظمة؛ والوحدة الأخيرة تسأل إلى أين تتجه، وما يعنيه ذلك لك.