السياق والاسترجاع

إدارة أثمن مورد في الذكاء الاصطناعي — ما يمكن للنموذج رؤيته، وكيفية الاستفادة القصوى من كل رمز.

السياق — المورد النادر

نافذة السياق هي كل ما يمكن للنموذج رؤيته في وقت واحد. المدخلات + المخرجات مجتمعة. إنها محدودة ومكلفة والعائق الأول.

📐
مُصوِّر نافذة السياق
شاهد كيف تملأ المهام المختلفة النافذة
النظام
السياق/المستندات
المستخدم
المخرجات
متاح
المحادثة البسيطة تستخدم فقط ~15% من النافذة. معظم السياق متاح لنمو المحادثة.
بلغة مبسّطة

ببساطة: إنه مكتب لا خزانة ملفات. لا يُعمَل إلا على ما هو مبسوط على المكتب الآن — والصفحة المنجَزة عليها أن تتّسع على المكتب نفسه، إلى جانب المادة التي كُتبت منها.

تقنيًّا: نافذة السياق حدٌّ صارم لعدد الرموز يشمل الأمر والإكمال معًا، ويُعاد تزويده كاملًا مع كل طلب. والنموذج عديم الحالة بين الاستدعاءات، فلا وجود عنده لشيء خارج تلك النافذة؛ وكل ما تظنّه ذاكرة هو نصّ أعاده أحدهم إليها.

ما الذي يملؤها فعلاً

حقيبة واحدة، بمقاس ثابت واحد — ومتى امتلأت فلا سبيل لإضافة شيء إلا بإخراج شيء. وعند الحزم لرحلة، ليست الجوارب هي المشكلة — بل الأحذية. الأمر نفسه هنا: التعليمات وتعريفات الأدوات صغيرة، والملفات والشفرة هي ما يملأ الحقيبة. بدّل حالة كل عنصر لحزمه أو إخراجه.

🎒
احزم حقيبة السياق
أربعة أشياء تدخل كل طلب — أحدها ضخم
الحقيبة فارغة
لم يُحزَم شيء بعد.
النسب توضيحية لا مقيسة — والمغزى هو الحساب. فالنافذة ميزانية ثابتة واحدة يتقاسمها أمر النظام، وتعريفات الأدوات، والمستندات المُسترجَعة، وسجل المحادثة، والإجابة نفسها. احزم الأربعة هنا فتبلغ 80% قبل أن يكتب النموذج كلمة واحدة. ولهذا يتفوّق استرجاع المقطع ذي الصلة على لصق الملف كله.
بلغة مبسّطة

ببساطة: الحزم ليس مسألة ما تريد اصطحابه، بل ما ترضى بتركه. فلحظة امتلاء الحقيبة يصير كل شيء جديد تضيفه قرارًا بإخراج شيء آخر — والحقيبة تمتلئ قبل ما توقّعت بكثير.

تقنيًّا: النافذة ميزانية واحدة مشتركة بين أمر النظام ومخطّطات الأدوات والمقاطع المسترجَعة وتاريخ المحادثة والإكمال. وتعريفات الأدوات خاصّةً ضريبة ثابتة على كل طلب تُدفَع سواء استُدعيت أداة أم لا، والاحتياطي المتروك للمخرجات هو القيد الذي يُنسى: تجاوزه يقتطع الإجابة لا المُدخل.

ما الذي ينساه النموذج

فكّر في تصفّح بريد إلكتروني طويل: تتذكّر السطر الأول والطلب الأخير، وتتشوّش الفقرات بينهما. السياق الطويل يتصرّف بالطريقة نفسها — فالحقيقة المدفونة في وسط المستند هي الأرجح أن تُغفَل.انحياز الأسبقية والحداثة

🫥
الضياع في المنتصف
راقب النموذج يقرأ مقطعاً طويلاً، ثم افحص ما احتفظ به
جاهز — المقطع كامل في السياق
—
استرجاع البداية
—
استرجاع المنتصف
—
استرجاع النهاية
هذا هو تأثير “الضياع في المنتصف”، الذي سمّاه وقاسه Liu et al.، Lost in the Middle: How Language Models Use Long Contexts (2023). خلاصتهم: دقّة الاسترجاع أعلى ما تكون حين تقع الحقيقة المطلوبة في بداية السياق تماماً أو نهايته تماماً، وتنخفض حين تقع في المنتصف. والنسب أعلاه توضيحية لهذا الشكل حرف U، لا أرقام من الورقة. القاعدة العملية: ضع التعليمة والحقيقة الحرجة عند الحواف.
بلغة مبسّطة

ببساطة: الخطر ليس في نسيان المنتصف، بل في أن لا شيء يخبرك بأنه نُسي. تحصل على إجابة واثقة تبدو كاملة، مبنيّة على الثلثين اللذين استعملهما النموذج فعلًا من المستند.

تقنيًّا: دقّة الاسترجاع عبر السياقات الطويلة ترسم منحنى على شكل U مقابل موضع المعلومة المطلوبة، أقواه عند الطرفين وأضعفه في المنتصف (Liu et al.، 2023). وهو أثر موضعي لا أثر سعة: فالمعلومة داخل النافذة ومع ذلك يقلّ الالتفات إليها، فتوسيع النافذة لا يعالجه. أما ترتيب المُدخل فيعالجه.

استراتيجيات إدارة السياق

كل رمز مهم. إليك كيفية استخدامها بحكمة.

🗜️
اضغط، لا تفرغ
لخّص المستندات الطويلة بدلاً من لصق كل شيء. ركّز على ما هو ذو صلة.
🎯
استرجع، لا تُضمّن
استخدم RAG لسحب الأجزاء ذات الصلة فقط بدلاً من قاعدة المعرفة بأكملها.
🔧
الأدوات بدل السياق
دع الوكيل يقرأ الملفات عند الطلب بدلاً من تحميل كل شيء مسبقاً في السياق.
✂️
تقليم المحادثة
المحادثات الطويلة تراكم الضوضاء. لخّص وأعد البدء للمهام المعقدة.
بلغة مبسّطة

ببساطة: الاستراتيجيات الأربع غريزة واحدة: احمل الصفحة لا المكتبة. فالباحث الذي يحمل كل كتاب قد يحتاجه لا يستطيع رفع أيّ منها — والمهارة في معرفة الصفحة التي يدور عليها السؤال.

تقنيًّا: الفرق بين الأربع في توقيت الاختزال. الضغط يختزل عند الكتابة، فهو فاقد لكنه رخيص. والاسترجاع يؤجّل الانتقاء إلى وقت الاستعلام، فلا يكون أفضل من المسترجِع. وإتاحة الأدوات تؤجّله إلى حكم النموذج نفسه داخل الحلقة. أما التقليم فيختزل بعد وقوع الأمر ويُسقِط حالة المحادثة، فما لم يُلخَّص ضاع.

اختر نموذجك

العائلة نفسها بثلاثة أحجام — والفرق الذي يهمّ ليس نتيجة اختبار قياسي، بل أيّ عمل تُسلّمه لكل واحد منها. انقر بطاقةً.

🧠
Opus
المتخصّص
⚡
Sonnet
الشامل
🚀
Haiku
العدّاء
Opus — المتخصّص الذي تحجزه للمهمة الصعبة.الفئة الأكثر قدرة
أبطأ وأغلى، ويستحقّ ذلك بالضبط حين يكون التفكير هو العمل لا الكتابة.

جرّب: اقرأ ثلاثة تقارير متعارضة وقُل لي أين تختلف فعلاً.
أسماء الفئات والسرعة النسبية مستقرّة؛ أمّا إصدارات النماذج بعينها وأسعارها وسرعاتها فتتغيّر كثيراً، فتعامل مع أي رقم تقرأه في مكان آخر كرقم مؤرَّخ. المهمّ أن تتذكّر شكل الاختيار — رخيص وسريع، أو متوازن، أو بطيء وعميق — وهو شكل يسري على تشكيلة كل مزوّد لا على هذه وحدها.
بلغة مبسّطة

ببساطة: لا تحجز الجرّاح الاستشاري لنزع شظيّة، ولا ترسل عدّاء السرعة ليجري الماراثون. واختيار أكبر نموذج لكل شيء ليس احتياطًا بل دفع أجر اختصاصي مقابل عمل شظيّة — مع انتظار أطول.

تقنيًّا: تفاضل الطبقات بين القدرة وزمن الاستجابة والكلفة لكل رمز، والمحاور الثلاثة تتحرك معًا. والمعيار الصحيح صعوبة وحدة عمل واحدة لا الحجم الإجمالي: فألف تصنيف تافه مكانها أسرع طبقة، وحكم واحد ملتبس فعلًا مكانه أقدر طبقة. وأسماء الإصدارات والأسعار والسرعات هي الجزء المتقلّب، أما شكل المفاضلة فلا.

متى تستخدم ماذا

رتّب حسب صعوبة وحدة العمل الواحدة، لا حسب كَمّها.

المهمة
أفضل نموذج
السبب
تصنيف 5,000 تقييم إلى راضٍ / غير راضٍ
Haiku
حكم واحد ضئيل، مكرّر آلاف المرات — فتفوز السرعة والتكلفة
تلخيص اجتماع طويل
Haiku
المادة موجودة أصلاً؛ لا شيء يحتاج استنباطاً
صياغة ردّ، أو إصلاح معادلة في جدول بيانات
Sonnet
تفكير حقيقي مطلوب، لكن ليس تفكيراً عميقاً — الخيار اليومي الافتراضي
إصلاح خطأ في شفرة لم تكتبها أنت
Sonnet
استدلال جيد وسرعة إنجاز
التوفيق بين ثلاثة تقارير متعارضة
Opus
الإجابة ليست في أي مصدر منها؛ لا بدّ من استنباطها
تصميم نظام، أو إعادة هيكلة قاعدة شفرة كبيرة
Opus
قرارات دقيقة متشابكة وأخطاؤها مكلفة
قاعدة عامة: ابدأ بـ Sonnet لمعظم المهام. ارتقِ إلى Opus للاستدلال المعقد. استخدم Haiku للعمليات البسيطة ذات الحجم الكبير.

خط أنابيب RAG

انقر على كل خطوة لترى كيف يحوّل RAG استعلام المستخدم إلى إجابة مؤسسة.

01
💬
الاستعلام
←
02
🔢
التضمين
←
03
🔎
البحث
←
04
📎
التعزيز
←
05
✨
التوليد
الاستعلام: يسأل المستخدم سؤالاً: "How do I set up authentication in Next.js 15?" هذا الاستعلام بلغة طبيعية هو نقطة البداية في خط الأنابيب.
بلغة مبسّطة

ببساطة: اسأل أمين مكتبة سؤالًا فلن يسرد لك جوابًا من ذاكرته. بل يستنتج ما تريده فعلًا، ويمشي إلى الرفّ الصحيح، ويعود بثلاث صفحات، ثم يجيب — والصفحات مفتوحة أمامه.

تقنيًّا: خمس مراحل، والتي تحسم الجودة هي البحث لا التوليد. يُضمَّن الاستعلام في فضاء المتجهات نفسه الذي فُهرست فيه القطع، وتُسترجَع أقرب الجيران، وتُلحَق أفضل k منها بالأمر. ولا يستطيع المولّد أن يكون أصحّ ممّا سلّمه إليه البحث — فإخفاقات الاسترجاع تظهر إجاباتٍ خاطئة فصيحة حسنة الصياغة.

كم يتقارب معنيان؟

الخطوة 3 من البحث تطرح سؤالاً يمكن أن تضع له رقماً: كم يتقارب هذان المعنيان؟ كل كلمة تصبح نقطةً في فضاء، والقرب يُقاس بالزاوية بينهما — لا بالأحرف التي يتشاركانها.تشابه جيب التمام

📐
قارن كلمتين
انقر زوجاً لتسجيل نتيجته
لا مقارنات بعد
اختر زوجاً أعلاه لرؤية نتيجته.
النتائج قيم توضيحية اختيرت لإظهار شكل النتيجة، لا قياسات من نموذج تضمين بعينه. لاحظ king / queen: متضادّان في وجه، ومع ذلك متقاربان إجمالاً، لأنهما يتشاركان كل شيء تقريباً عدا ذلك. وcar / happiness قرب الصفر — معنيان لا صلة بينهما يقفان على زاوية قائمة.
بلغة مبسّطة

ببساطة: يمكن لشخصين أن يشيرا في الاتجاه نفسه تقريبًا من طرفَي حقل متقابلين. فالمقارَن هو الاتجاه الذي يواجهانه لا موضع وقوفهما — ولهذا تتساوى مذكّرة قصيرة وتقرير طويل في كونهما عن الشيء نفسه.

تقنيًّا: تشابه جيب التمام هو حاصل الضرب النقطي للمتجهين مقسومًا على مقداريهما، فيقيس الزاوية ويُسقط الطول. والطول في التضمين يتبع التكرار وحجم المستند أكثر مما يتبع المعنى، فتطبيعه إسقاطًا هو المقصود لا تبسيط. فالاتجاه المطابق يساوي 1، وغير المرتبط قرب 0، والمعاكس −1 — وإن كان −1 الحقيقي نادرًا عمليًّا.

مطابقة الكلمات مقابل مطابقة المعنى

البحث القديم يبحث عن الكلمات التي كتبتها. والبحث الدلالي يبحث عمّا قصدته. شغّل الاثنين على مكتبة المستندات الثلاثة نفسها وراقب أين يتعثّر الأول. وتحفّظٌ واحد بالإنصاف: العمود المقابل أدناه هو المطابقة الحرفية الساذجة — فالبحث بالكلمة المفتاحية الحقيقي يجرّد الكلمات إلى جذورها، فيطابق “أخبز” بـ “خَبز” ويصير هذا الفشل بعينه أخفّ. لكن الشكل يبقى قائماً متى لم يتشارك الاستعلام أي مفردة مع المستند بالمرّة، ولهذا تُبقي الشريحة التالية على البحث بالكلمة المفتاحية بدل أن تستبدله.

🔎
بحثان، مكتبة واحدة
المكتبة: “أفضل وصفة كيكة الشوكولاتة” · “دليل خَبز الكوكيز” · “نصائح البراوني المنزلي”
اختر استعلاماً
مطابقة حرفية ساذجة بلا تجريد للجذور
في انتظار استعلام.
البحث الدلالي المعنى
في انتظار استعلام.
نسب المطابقة توضيحية، والعمود المقابل هو النسخة الساذجة عن قصد: يقارن الصور السطحية وحدها. أمّا مُقيِّم كلمات مفتاحية إنتاجي مثل BM25 فيجرّد مصطلحاته إلى جذورها، فتتطابق “أخبز” و“خَبز” ولا يحدث هذا الإخفاق بعينه. أمّا ما ينجو من تجريد الجذور فهو الحالة الأصعب — استعلامٌ لا تتقاطع مفرداته مع مفردات المستند أصلاً (“شيء حلو” مقابل “البراوني”)، وهذه فجوة لا تجسرها مطابقة الكلمات بأي قدر. وهي الفجوة التي تسدّها التضمينات، وهي سبب أن يكون الجواب: شغّل الاثنين.
بلغة مبسّطة

ببساطة: اطلب من أمين مكتبة «ذلك الكتاب ذا الغلاف الأزرق عن الحرب» فيجده. واطلب ذلك من حاسوب يبحث عن كلمة «أزرق» حرفيًّا فيناولك كتابًا عن الدهان. لكن اطلب من أيّهما رقم قطعة، فالمطابِق الحرفي يفوز بلا منازع.

تقنيًّا: الاسترجاع المعجمي يسجّل على تداخل المصطلحات ولا يعبر فجوة المفردات؛ والاسترجاع الكثيف يسجّل على قرب التضمين ويعبرها بسهولة، لكنه يطمس السلاسل النادرة المضبوطة — المعرّفات ورموز الأخطاء وأرقام القطع — لأنها تحمل إشارة دلالية ضئيلة. والاثنان يخفقان في حالات منفصلة، ولهذا بالضبط يشغّل البحث الهجين كليهما ويدمج الترتيبين بدل أن يختار.

لماذا RAG أفضل من الضبط الدقيق

الجانب
الضبط الدقيق
RAG
حداثة البيانات
مجمدة عند التدريب
محدثة دائماً
التكلفة
إعادة التدريب مكلفة
فقط حدّث الفهرس
التتبع
صندوق أسود
استشهاد بمصادر دقيقة
وقت الإعداد
ساعات إلى أيام
دقائق مع التضمينات
الهلوسة
لا تزال شائعة
مؤسسة على المصادر
عملياً: RAG هو الخيار الافتراضي لمعظم تطبيقات الذكاء الاصطناعي في الإنتاج. الضبط الدقيق محجوز لتغيير سلوك النموذج (النبرة، التنسيق)، وليس إضافة المعرفة.
بلغة مبسّطة

ببساطة: تعليم أحدهم معلومةً وتعليمه أسلوبًا درسان مختلفان. فإن كانت مشكلتك «لا يعرف سياسة الإرجاع عندنا» فناوله السياسة. وإن كانت «لا يبدو مثلنا» فلن يصلح ذلك أي قدر من مناولته المستندات.

تقنيًّا: الضبط الدقيق يحدّث الأوزان وهو الأداة الصحيحة لتحويل الأسلوب والالتزام بالصيغة وتأطير المهمة. أما RAG فيترك الأوزان كما هي ويحقن المعرفة عند الاستدلال، فتصير المدوّنة قابلة للتحديث والتدقيق والاستشهاد. والحقائق المخبوزة في الأوزان لا تُراجَع دون إعادة تدريب، ولا تُنسَب، ولا تُسحَب — وهذه الخصائص الثلاث تحسم الاختيار أكثر مما تحسمه الدقّة.

داخل “ابحث في قاعدة بيانات المتجهات”

ابدأ بمشكلة تلمسها بيدك. يكتب مستخدم ERR_4032 في بحث الدعم لديك. اطلب معنى هذه السلسلة فتعود إليك مستندات عن الأخطاء. أمّا إن عددتَ الحروف فتحصل على المستند الوحيد الذي يسمّي ERR_4032 فعلاً. لا يكفي أيٌّ منهما وحده، ولا يستطيع أيٌّ منهما أن يقارن استعلامك بعشرة ملايين مستند واحداً واحداً. ثلاث وظائف تحلّ ذلك.
🎯
قريب بما يكفي، فوراً ANN
أنت لا تريد المقهى الأقرب بالإثبات — تريد مقهى جيداً في عشر ثوان. والمقايضة هنا هي نفسها: تنازل عن المستند الأقرب وحده فيصلك مستند قريب جداً أسرع بآلاف المرات.
🕸️
خريطة فيها طرق سريعة وشوارع فرعية HNSW
أنت لا تقود إلى شارع في مدينة أخرى شارعاً شارعاً: الطريق السريع عبر البلاد، ثم الطرق الرئيسية، ثم الشوارع المحلية حتى الباب. وهذا الفهرس مبنيّ بالطريقة نفسها، وتستخدمه معظم قواعد بيانات المتجهات.
🔤
بحثٌ في الصفحة يعرف أن “في” لا تُحتسب BM25
يعدّ كم مرّة تظهر كلماتك، لكنه يخصم الكلمات التي تظهر في كل مستند، ويكفّ عن مكافأة الطول. وهذا هو الذي يجد ERR_4032. شغّله جنباً إلى جنب مع بحث المتجهات فيكون لديك البحث الهجين.
كل بطاقة تفتح البحث العلمي الذي وراءها. وANN هو أقرب جار تقريبي — صنف من الطرق لا خوارزمية واحدة.

أنماط البحث الوكيلي

الوكلاء لا يبحثون مرة واحدة فقط — بل يحسّنون استراتيجية البحث بشكل تكراري بناءً على النتائج.

المستوى 1
البحث البسيط
استعلام واحد، إرجاع أفضل K نتيجة. بسيط لكنه غالباً يفقد التفاصيل الدقيقة.
المستوى 2
إعادة كتابة الاستعلام
الذكاء الاصطناعي يعيد كتابة الاستعلام لمطابقة أفضل للتضمينات قبل البحث.
المستوى 3
الاستعلام المتعدد
توليد وجهات نظر متعددة لنفس السؤال، البحث في كل منها، دمج النتائج.
المستوى 4
البحث الوكيلي
الوكيل يبحث، يقيّم النتائج، يحسّن الاستعلام، يبحث مرة أخرى — في حلقة حتى يرضى.
بلغة مبسّطة

ببساطة: المستويات الأربعة أربعة أجوبة عن سؤال واحد: مَن يحقّ له أن يقرّر أن البحث لم يكن جيّدًا؟ في المستوى الأول لا أحد — تأخذ ما تُعطى. وفي الرابع يقرأ الوكيل النتائج بنفسه ويحكم بضعفها فيعيد الكرّة.

تقنيًّا: المستويات 1–3 كلها مرور واحد: قد يُعاد صوغ الاستعلام أو يُوزَّع، لكن عدد جولات الاسترجاع محدَّد قبل التنفيذ. أما المستوى 4 فيضع الاسترجاع داخل حلقة تحكّم، فيصير عدد الجولات تابعًا للبيانات. وهذا ما يشتري الاستدعاء على الاستعلامات ناقصة التحديد، وما يجعل زمن الاستجابة والكلفة غير متوقّعَين — ولهذا يحتاج الباحث الوكيلي سقفًا للخطوات بما لا تحتاجه الثلاثة الأخرى.

اتّباع الأدلّة

المحقّق لا يحلّ القضية بسؤال واحد. يسأل، وينظر إلى ما عاد، ويدع ذلك يشكّل السؤال التالي. والوكيل يبحث بالطريقة نفسها — فكّر، نفّذ، انظر إلى النتيجة، فكّر ثانيةً.ReAct

🕵️
راقب وكيلاً يصقل بحثه
سؤال غامض واحد، ثلاث عمليات بحث، إجابة واحدة صالحة للاستخدام
اختر سؤالاً
اختر سؤالاً لمراقبة الحلقة تعمل.
نمط الاستدلال←الفعل←الملاحظة سمّاه ReAct فريقُ Yao et al.، ReAct: Synergizing Reasoning and Acting in Language Models (2022). لاحظ ما لا ينتجه البحث الأول: إجابة. إنه ينتج سؤالاً أفضل. وهذا هو الفرق كله عن الاسترجاع أحادي اللقطة.
بلغة مبسّطة

ببساطة: سؤال المحقّق الأول نادرًا ما يكون المفيد — بل هو الذي يدلّه على ما يسأل عنه تاليًا. وإذا تخطّيت خطوة النظر فيما عاد إليك فأنت لا تحقّق، بل تخمّن بصوت عالٍ على التوالي.

تقنيًّا: يشابك ReAct آثار الاستدلال مع استدعاءات الأدوات بحيث تكون كل ملاحظة في السياق قبل اختيار الفعل التالي (Yao et al.، 2022). وخطوة الملاحظة هي ما يميّزه عن سلسلة الأفكار: فالاستدلال وحده لا يستطيع إلا التوسّع فيما يعتقده النموذج أصلًا، أما الملاحظة فتستطيع مناقضته. وهذا أيضًا نمط الفشل — فإن لم تكن الملاحظات تناقض شيئًا أبدًا، فالحلقة لا تفعل إلا تأكيد نفسها.

استراتيجيات التقطيع

كيفية تقسيم المستندات تحدد جودة الاسترجاع. اضبط حجم القطعة أدناه.

✂️
مستكشف حجم القطعة
شاهد كيف تؤثر الأحجام المختلفة على تقسيم المستند
متوسط
3 قطع — توازن بين السياق والدقة.
بلغة مبسّطة

ببساطة: قطّع وصفة طبخ إلى أسطر مفردة فتصلك «اخبزها 40 دقيقة» دون أن تقول ما الذي تخبزه. وأبقِها صفحة واحدة فيجرّ كل بحث عن أي شيء فيها الصفحة كلها. والقطع يجب أن يقع حيث يتغيّر المعنى أصلًا.

تقنيًّا: حجم القطعة يضبط مفاضلة الدقّة والسياق عند طرفَي خط الأنابيب: فالقطعة هي الوحدة المُضمَّنة، فالكبيرة تُوسِّط عدّة مواضيع في متجه واحد فتسترجع بغموض، والصغيرة تسترجع بحدّة لكنها قد تصل بلا الجمل المحيطة اللازمة لاستعمالها. والتداخل بين القطع المتجاورة يستعيد بعض سياق الحدود بكلفة فهرس أكبر، والقطع على البنية — العناوين والفقرات — يتفوّق عادةً على القطع بعدد ثابت.

إدارة المهام طويلة المدى

المهام المعقدة يمكن أن تمتد لـمئات استدعاءات الأدوات. كيف يبقى الوكلاء على المسار.

📋
خطط أولاً
قسّم المهمة إلى خطوات قبل التنفيذ. الوكلاء يستخدمون خططاً داخلية لتتبع التقدم.
🗜️
ضغط السياق
عندما يمتلئ السياق، يتم تلخيص الرسائل القديمة لإفساح المجال لمعلومات جديدة.
🧠
الذاكرة المستمرة
احفظ الحقائق المهمة في ملفات لتستمر عبر إعادة تعيين نافذة السياق.
🤝
الوكلاء الفرعيون
فوّض المهام الفرعية لوكلاء جدد بنوافذ سياق خاصة بهم.
بلغة مبسّطة

ببساطة: في عمل يمتدّ أيامًا لا تعتمد على التذكّر، بل تمسك دفترًا. الخطة على الورق، والنتائج على الورق، وحين يمتلئ رأسك تسلّم القطعة التالية لمن رأسه صافٍ.

تقنيًّا: الأربعة كلها استجابات لقيد واحد: النافذة ثابتة والمهمة ليست كذلك. فالخطة المكتوبة تُخرِج حالةً كانت ستبقى مقيمة. والضغط يبادل الأمانة بالمساحة وهو غير قابل للعكس، فما يُسقطه ضائع. والملفات تنقل الحالة خارج النافذة تمامًا وهي الوحيدة من الأربع التي تنجو من إعادة التصفير. أما الوكلاء الفرعيون فيقسّمون الميزانية بدل مطّها — لكلٍّ نافذة نظيفة، ولا يعود إلا الملخّص.

شكلان للمهمة

أمين المكتبة والمحقّق كلاهما بارع في عمله. لن ترسل المحقّق ليجلب كتاباً، ولا أمين المكتبة ليحلّ القضية. RAG أمين مكتبة؛ والوكيل محقّق.

 
RAG
الوكيلي
الشكل
استرجِع، ثم أجب — مرةً واحدة
حلقة: خطّط، نفّذ، تحقّق، كرّر
يناسب حين
الإجابة موجودة أصلاً في مستندات بحوزتك
المهمة تحتاج فعلاً أو تكراراً أو استدلالاً يتجاوز البحث
المهمة النموذجية
سؤال وجواب على متن معروف؛ البحث في السياسات والمستندات؛ الاستشهاد
التصحيح والإصلاح؛ بحث متعدد المصادر؛ أي شيء بخطوات
الخطوات لكل طلب
واحدة
غير محدودة — النموذج يقرّر متى يتوقف
التكلفة وزمن الاستجابة
منخفضان ومتوقّعان
أعلى ومتغيّران
وضع الفشل
يسترجع المقطع الخطأ ويجيب بثقة
يدور في حلقة، أو يتوه، أو يتصرّف بناءً على استنتاج خاطئ
ليس أحدهما أو الآخر على مستوى النظام. عادةً يمتلك الوكيل RAG كإحدى أدواته — فيسترجع حين يكون الاسترجاع ما تحتاجه الخطوة الحالية، ثم يمضي ليفعل شيئاً بالنتيجة. فالسؤال الحقيقي ليس أبداً “RAG أم وكلاء؟” بل “هل تنتهي هذه المهمة باسترجاع واحد، أم تحتاج حلقة؟” إن أجاب عنها استرجاع واحد، فلا تدفع ثمن حلقة.
بلغة مبسّطة

ببساطة: كلاهما قد يخطئ، ويخطئان على نحوين مختلفين. أمين المكتبة يأتيك بالكتاب الخطأ ويحدّثك عنه بثقة تامّة. والمحقّق يتبع خيطًا فاسدًا ساعةً كاملة ثم يحاسبك على الساعة.

تقنيًّا: للشكلَين منحنيا كلفة مختلفان وبصمتا فشل مختلفتان. فالاسترجاع أحادي المرور محدود زمن الاستجابة وله نقطة فشل واحدة عند المسترجِع، فالاسترجاع السيئ يعطي إجابة خاطئة واحدة واثقة. أما الحلقة الوكيلية فعدد خطواتها غير محدود، فتتراكم أخطاؤها عبر الخطوات وكلفتها متغيّرة بالبناء. وهذا اللاتناظر، لا القدرة، هو سبب حاجة الحلقة إلى سقف خطوات وشرط توقّف صريح.

أيهما أستخدم؟

سؤال واحد يحسمها: هل يمكن الإجابة عن هذا بإيجاد المقطع الصحيح، أم يجب أن يحدث شيء؟ صنّف كل مهمة، ثم تحقّق من نفسك.

🧭
صنّف المهمة
اختر RAG أو الوكيلي لكل واحدة — التغذية الراجعة فورية
0 من 5 مصنَّفة
لمزيد من المشاهدة: RAG مقابل الذكاء الاصطناعي الوكيلي — فيديو تفسيري خارجي ↗ — رؤية خارجية للتمييز نفسه؛ غير مطلوبة لهذه الوحدة.

اختبار المعرفة

ثمانية أسئلة على هذه الوحدة. أجب لترى السبب — يظهر الشرح سواء أصبتَ أم أخطأت.

السؤال 1 من 0
النتيجة 0/0

النقاط الرئيسية

📐
السياق محدود
كل رمز يكلّف مالاً وانتباهاً. والملفات والكود تستهلك معظم الميزانية — فكن استراتيجياً فيما يدخل.
🫥
احترس من المنتصف
النماذج تتذكّر بداية السياق الطويل ونهايته أفضل ما تتذكّر. ضَع التعليمة والحقيقة الحرجة على الحافّتين.
🧠
النموذج المناسب للمهمة المناسبة
Opus للاستدلال العميق، Sonnet للعمل اليومي، Haiku للسرعة.
🔎
RAG ضروري
هو المعيار للذكاء الاصطناعي في الإنتاج. وتحت الغطاء: فهارس ANN (وHNSW عادةً) مع بحث BM25 الهجين، ثم إعادة الترتيب.
✂️
قطّع بحكمة
حجم القطعة يحدّد جودة الاسترجاع. صغير جداً يفقد السياق، وكبير جداً يضيف ضوضاء.
🧭
طابِق شكل المهمة
استرجاع واحد يجيب عنها → RAG. تحتاج فعلاً أو تكراراً أو تصحيحاً ذاتياً ← وكيلي. والوكلاء يستخدمون RAG كأداة، فليست المسألة إمّا/أو.
نافذة السياقالضياع في المنتصفOpusSonnetHaikuRAGالتضميناتتشابه جيب التمامANNHNSWBM25البحث الهجينالتقطيعReActالوكلاء الفرعيون