الترميز والتوليد
يقرأ النموذج اللغويّ الكبير (LLM) ويكتب باستخدام الرموز — وهي أجزاء صغيرة من النص — وينتجها رمزاً واحداً في كل مرة. معرفة هذا وحده تفسّر قدراً مفاجئاً من سلوك النموذج وتكلفته.
النص يصير رموزاً
قبل أن يرى النموذج نصّك، يُقسَّم إلى رموز. يشرح مقرّر GenAI-101 آليات ذلك — وهنا يهمّنا ما يكلّفه.
- يُقسَّم نصّك إلى رموز قبل أن يقرأه النموذج
- الرمز تقريباً جزء من كلمة — غالباً جزء من كلمة لا كلمة كاملة
- نصوص مختلفة تكلّف أعداد رموز مختلفة رغم تساوي عدد الحروف
- النص غير الإنجليزيّ غالباً يكلّف رموزاً أكثر من الفكرة نفسها بالإنجليزية
التوليد تسلسليّ
يتوقّع النموذج الرمز التالي بناءً على كل ما كُتب حتى الآن، ثم يُلحقه، ثم يعيد الكرّة. هذه الحقيقة وحدها تفسّر أمرين ستلمسهما بصفتك مهندساً.
لماذا هذا مهمّ
الرموز هي الوحدة التي تُحاسَب وتُقاس بها زمنياً، فتتحوّل إلى قيد تصميميّ.
- كلٌّ من التكلفة وزمن الاستجابة يتناسب مع عدد الرموز
- تدفع مقابل رموز الإدخال زائد رموز الإخراج — فالمُوجَّه ليس مجانياً
- تقليم المُوجَّهات يوفّر مالاً حقيقياً في أي شيء يعمل بتكرار
معقول لا صحيح
لأن النموذج يختار الرمز التالي الأكثر معقوليّة — لا الصحيح — فقد يكون مخطئاً بثقة. لا تعالج ذلك بمزيد من الثقة؛ بل تصمّم تحقّقاً حول المخرجات.
طبّقها
كيف تطبّق: الصق مُوجَّهاً في أي عارض ترميز وانظر كم رمزاً يبلغ. ثم اختصره — احذف الكلمات الحشوية والتكرار — وراقب العدد يهبط.
- متتبّع مهامّ الذكاء الاصطناعي الأسبوعيّة — مُوجَّه تحليل الرسالة يعمل مع كل رسالة، فعدد رموزه تكلفة متكرّرة. أبقِه رشيقاً.
- موقع علامتك الشخصيّة — التوليد هنا تكلفة لمرة واحدة، فعدد الرموز أقل أهمية من ضبط المحتوى.
ما الذي تعلّمته
تعمل النماذج اللغوية الكبيرة بالرموز وتُولّد رمزاً واحداً في كل مرة. هذا يحكم التكلفة وزمن الاستجابة والانحراف — ولأن المخرجات معقولة لا صحيحة بالضرورة، تبني تحقّقاً حولها.