أساسيات نماذج اللغة الكبيرة
كيف تعمل نماذج اللغة الكبيرة فعلياً — من النص الخام إلى الاستجابات الذكية.
كيف تعمل نماذج اللغة الكبيرة
في جوهرها، تقوم نماذج اللغة الكبيرة بشيء واحد: التنبؤ بالرمز التالي. بالنظر إلى سلسلة من الكلمات، ما الذي يأتي بعد ذلك؟
ببساطة: إنها خاصية الإكمال التلقائي في لوحة مفاتيح هاتفك، مكبّرة إلى حدٍّ لا يكاد يُعرَف. النموذج لا يقرّر ما ستقوله الجملة قبل أن يبدأها — بل يلتزم بكلمة واحدة، ثم ينظر إلى كل ما سبق بما فيه تلك الكلمة، ثم يلتزم بالكلمة التالية.
تقنيًّا: محوّل انحداري ذاتي بمُفكِّك تشفير فقط. كل تمريرة أمامية تُخرج توزيعاً احتمالياً على المفردات مشروطاً بالتسلسل السابق كاملاً؛ ثم يُضاف الرمز المختار إلى المُدخَل وتتكرّر التمريرة. لا شيء في البنية يخطّط مسبقاً، ولا تُحمَل حالة بين التمريرات سوى النص نفسه.
لماذا لم يكفِ عدُّ الكلمات
قبل الشبكات العصبية بوقت طويل، كانت نماذج اللغة تكتفي بـعدّ تسلسلات الكلمات. نموذج N-gram يتنبّأ بالكلمة التالية اعتماداً على الكلمات N−1 السابقة فقط. اسحب N من 1 إلى 5 وراقب المنحنيين يتصارعان: النص يتحسّن باستمرار، بينما الجدول الذي يلزمك تخزينه ينفجر باستمرار.
ببساطة: تخيّل أن تحفظ كل تركيبة ممكنة من مكعّبات الليغو — مستحيل! فطرق تركيب الكلمات معاً أكثر من أن تُحصى.
تقنيًّا: الانفجار التوافقي: حجم المفردات مرفوعاً لأس طول التسلسل يجعل العدّ الشامل غير قابل للتنفيذ مع بيانات نادرة.
التنبؤ بالرمز التالي
شاهد كيف ينتج نموذج اللغة الكبير النص — رمزاً واحداً في كل مرة، كل اختيار مبني على الاحتمالات. وهذه نِسب نموذج لغة عصبي للأمر الذي تناوله عدّاد الثلاثيات قبل قليل؛ الأرقام مختلفة لأن الآلية مختلفة — لا شيء هنا مَعدود من جدول.
ببساطة: إنها قرعة لم تُوزَّع تذاكرها بالتساوي. الكلمة الحصيرة تحوز معظمها، لكن السطح تحوز القليل — فالضغط على «توليد» مرتين للأمر نفسه قد يعطيك كلمتين مختلفتين، وليست إحداهما خطأً.
تقنيًّا: هذه الأداة تأخذ عيّنة من التوزيع بدل أن تأخذ الأعلى احتمالاً، ولهذا لا يكون الخرج حتمياً. فك التشفير الجشع كان سيُعيد المرشّح الأول في كل مرة؛ وأخذ العيّنة هو ما يجعل الاستدعاءات المتكرّرة للأمر نفسه تتباعد.
احتمال لكل كلمة
المتنبئ في الشريحة السابقة يعطيك رمزاً واحداً مأخوذاً بالعيّنة. تراجَع خطوة وانظر إلى ورقة الاقتراع كاملة التي أُخذت منها تلك العيّنة: النموذج يمنح درجة لـكل كلمة في مفرداته — ما بين خمسين ومئة ألف كلمة تقريباً — ويجب أن يكون مجموع هذه الدرجات 100%.
ببساطة: كل كلمة يعرفها النموذج تنال درجة في كل دور، بما فيها الكلمات السخيفة. لا شيء يُشطَب من القائمة أبداً؛ فكلمة حجارة تُمنح رقماً صغيراً جداً، لا أن تُترك بلا رقم.
تقنيًّا: دالة softmax على لوغيتات المفردات تُعيد احتمالاً موجباً تماماً لكل مدخلة، فلا يكون أي رمز صفراً بالضبط. وهذه الخاصية هي ما يجعل الذيل قابلاً للبلوغ: ارفع درجة الحرارة أو وسّع النواة بما يكفي فقد يُسحَب رمز غير معقول. والنِّسب المعروضة توضيحية، كُتبت يدوياً لإظهار شكل مثل هذا التوزيع.
قوة الحجم
المزيد من المعاملات + المزيد من البيانات = قدرات ناشئة لا تمتلكها النماذج الأصغر ببساطة.
ببساطة: لم يجلس أحد ليضيف خاصية اسمها «الاستدلال». بل بنوا الشيء نفسه بحجم أكبر بكثير، وأطعموه نصاً أكثر بكثير، فبدأت تظهر قدرات لم تكن لدى النسخ الأصغر.
تقنيًّا: قوانين التوسّع تصف انخفاض الخسارة انخفاضاً متوقَّعاً مع نمو المعاملات والبيانات والحوسبة معاً — متوقَّعاً بدرجة تكفي للتخطيط لعملية تدريب على أساسها. ورقما GPT-3 أعلاه من Brown et al.، 2020؛ أما نماذج الطليعة بعدها فتُدرَّب على رموز أكثر بكثير، فاقرأ الاتجاه لا الأرقام.
كيف يُبنى النموذج: ثلاث مراحل
المساعد المكتمل لا يُدرَّب مرة واحدة. إنه يمرّ عبر ثلاث تمريرات منفصلة، لكلٍّ منها معلّم مختلف وسعر مختلف تماماً. انقر مرحلةً لترى الصورة الكاملة.
ببساطة: المراحل الثلاث تجيب عن ثلاثة أسئلة مختلفة. كيف تبدو اللغة؟ وكيف تبدو الإجابة الجيدة؟ وحين تكون إجابتان جيدتين معاً، أيّهما يفضّلها الناس فعلاً؟
تقنيًّا: ثلاثة أهداف تدريب مختلفة، لا ثلاث جرعات من هدف واحد: هدف ذاتي الإشراف للتنبؤ بالرمز التالي على نص خام، ثم محاكاة مُشرَف عليها لأزواج من الأمثلة المعالَجة، ثم تحسين تفضيلي مقابل نموذج مكافأة مُتعلَّم من مقارنات بشرية. والأرقام تقديرات عامة برتبة المقدار وتتقادم بسرعة.
ما هي الرموز؟
لا تقرأ نماذج اللغة الكبيرة الأحرف أو الكلمات — بل تقرأ الرموز. الرمز هو جزء من النص، غالباً كلمة أو جزء من كلمة.
ببساطة: النموذج يقرأ في قطع بحجم المقاطع الصوتية تقريباً. وما إن ينتهي التقطيع حتى تختفي حروفك — إذ تُستبدَل كل قطعة برقم، والأرقام هي كل ما يراه النموذج.
تقنيًّا: كل رمز عدد صحيح يُستخدم فهرساً في مفردات ثابتة، لجلب صفٍّ من مصفوفة التضمين. أما تسلسل الأحرف نفسه فلا يصل إلى الشبكة قط، ولهذا تكون المهام على مستوى الحرف عسيرة على نموذج فصيح فيما عدا ذلك.
خمّن قبل أن تنظر
حدسك يقول “عُدّ الكلمات”. والمُرمِّز يخالفك. خمّن أولاً، ثم انظر القطع الفعلية — الفجوة بين الاثنين هي الدرس كله.
ولماذا السلاسل بالإنجليزية؟ لأن الأعداد أعلاه مقيسة على مُرمِّز إنجليزي فعلي. ولو وضعنا مكانها سلاسل عربية لوجب حساب انكسارات BPE عربية حقيقية — والتخمين في الأداة التي درسُها بالضبط أن “حدسك في عدّ الرموز خاطئ” أسوأ مكان يمكن أن تُخمّن فيه. والأهم أن القاعدة تسري عليك أنت مضاعفةً: النص العربي يكلّف عادةً ضعفين إلى أربعة أضعاف ما يكلّفه المعنى نفسه بالإنجليزية — وهو ما تقوله بطاقة “تعدد اللغات” بعد قليل. فاقرأ الأرقام هنا حدّاً أدنى، لا سعراً لنصّك.
ببساطة: حدسك يعدّ الكلمات لأن الكلمات هي ما تقرؤه أنت. أما المُرمِّز فيعدّ شيئاً آخر، والفرق ليس عشوائياً — فالكلمة التي رآها مليون مرة تكلّف قطعة واحدة، والكلمة التي بالكاد رآها تكلّف أربعاً.
تقنيًّا: عدد الرموز يتبع تكرار الكلمة في المدوّنة، لا عدد الكلمات ولا عدد الأحرف. فالسلاسل المتكرّرة تبقى مدخلات مفردات واحدة، والنادرة تُفكَّك إلى وحدات كلمات فرعية. ولهذا يكون عدد الرموز هو الوحدة الصادقة الوحيدة لحساب التكلفة وميزانية السياق.
ساحة الترميز
اكتب أي نص لترى كيف يتم تقسيمه إلى رموز. كل لون يمثل رمزاً مختلفاً.
ببساطة: ألصق نصاً نثرياً فتصطفّ القطع مع الكلمات تقريباً. وألصق شيفرة برمجية فتتشظّى — إذ تكلّف الأقواس والمسافات البادئة والشرطات السفلية كلٌّ منها قطعة مستقلة، ولهذا تكلّف الكمية نفسها من الشيفرة أكثر من الكمية نفسها من الإنجليزية.
تقنيًّا: نسبة الأحرف إلى الرمز خاصية للعبء المُعالَج لا ثابت: النثر الإنجليزي يدور حول 4، أما الشيفرة واللغات كثيرة التصريف أو غير اللاتينية فأقل بكثير. ولاحظ أن هذه الأداة نفسها تقريب استدلالي يقسّم على اللواصق الشائعة، لا مفردات BPE متعلَّمة، فقد يخالفها مُرمِّز إنتاجي أحياناً.
ترميز أزواج البايت (BPE)
خوارزمية الترميز الأكثر شيوعاً. تبدأ بالأحرف وتدمج الأزواج الأكثر تكراراً بشكل تكراري.
ببساطة: لم يكتب أحد قائمة القطع يدوياً. بل استُخرجت بقراءة جبل من النصوص ولصق الزوج المتجاور الأكثر ظهوراً مراراً وتكراراً — فالقطع الموجودة ليست إلا ما ظلّ النص يكرّره.
تقنيًّا: BPE إجراء دمج جشع من الأسفل إلى الأعلى. ابدأ بمفردات على مستوى الأحرف، وعُدّ أزواج الرموز المتجاورة في المدوّنة، وادمج الأكثر تكراراً، وكرّر ذلك عدداً محدَّداً من الدمجات. وقائمة الدمج المرتَّبة هي المُرمِّز، وتُجمَّد قبل التدريب — فلا يستطيع النموذج تغيير طريقة تقطيعه لاحقاً.
لماذا الترميز مهم
ببساطة: الترميز ليس تفصيلاً تقنياً تتركه للسبّاكة. فهو يحدّد فاتورتك، ومقدار ما يتّسع له مستندك، وما إذا كانت الجملة العربية ستكلّفك ضعفي ما تكلّفه الجملة نفسها بالإنجليزية أو ثلاثة أضعافه.
تقنيًّا: المُرمِّز مُدرَّب على الإنجليزية في معظمه، فالكتابات الأقل تمثيلاً في تلك المدوّنة تتشظّى إلى رموز أكثر لكل قدر من المعنى. وهذه الغرامة تتراكم: الفوترة لكل رمز، ونافذة السياق مُقوَّمة بالرموز، وزمن الاستجابة يتناسب مع طول التسلسل — اختلال واحد يُحاسَب عليه ثلاث مرات.
الكلمات كأرقام
كل رمز يصبح متجهاً عالي الأبعاد. الكلمات المتشابهة تتجمع معاً. اسحب الفضاء لتدويره، أو ركّز عليه واستعمل مفاتيح الأسهم.
اكتب كلمة أو انقر مثالاً لترى أين تحطّ في الفضاء الدلالي…
قراءات ومقاطع إضافية لهذه الوحدة كلّها مجموعة في الشريحة الأولى.
ببساطة: امنح كل كلمة موضعاً على خريطة، وضع الكلمات التي تُستعمل في مواقف متشابهة قرب بعضها. لم يرسم أحد هذه الخريطة — بل نتجت عن كون مَلِك ومَلِكة تردان باستمرار في النوع نفسه من الجمل.
تقنيًّا: كل مدخلة في المفردات تُقابَل بمتجه كثيف، مُتعلَّم بالنزول الاشتقاقي على هدف التدريب لا مُسنَد يدوياً. والتقارب يُقاس بتشابه جيب التمام، وما يُشفَّر فيه هو التشابه التوزيعي — تشابه سياقات الاستعمال — وليس هذا هو تشابه المعنى نفسه. والفضاء أعلاه نموذج تعليمي ثلاثي الأبعاد لفضاء بمئات أو آلاف الأبعاد.
حساب الكلمات
تُشفّر التضمينات العلاقات كاتجاهات. يمكنك إجراء عمليات حسابية على المعنى — اختر تناظراً وشاهد المتجهات تصطفّ.
ببساطة: على هذه الخريطة يحمل الاتجاه معنىً أيضاً، لا الموضع وحده. فالخطوة التي تنقلك من رجل إلى امرأة هي تقريباً الخطوة نفسها، في الاتجاه نفسه، التي تنقلك من مَلِك إلى مَلِكة.
تقنيًّا: بعض العلاقات الدلالية والنحوية تظهر متجهات إزاحة شبه متوازية، فيمكن طرح التناظر بوصفه جمعاً متجهياً وحلّه بالبحث عن أقرب جار. وهو تقريبي لا مضبوط: فالحساب يهبط قرب الهدف، وتُستبعَد حدود الاستعلام عادةً من البحث، والانتظام يصحّ في بعض أنواع العلاقات أكثر بكثير من غيرها.
داخل نموذج اللغة الكبير
يتدفق النص عبر سلسلة من التحويلات. انقر على كل مرحلة لمعرفة المزيد.
ببساطة: يدخل النص من الأمام ويخرج تخمين الكلمة التالية من الخلف، عبر أربع محطات بترتيب ثابت. والمحطة الموسومة بـ×N هي المحطة نفسها مكرّرة — لا محطة مختلفة في كل مرة.
تقنيًّا: مُرمِّز ← جلب التضمين ← كومة من كتل محوّل متطابقة ← إسقاط خرج إلى لوغيتات المفردات. وكل كتلة مطابقة بنيوياً لكل كتلة أخرى — انتباه ذاتي يليه شبكة أمامية، مع وصلات متبقية وتسوية — غير أن لكلٍّ منها أوزانها المتعلَّمة الخاصة.
ما مدى عمق الكومة؟
الرمز «×N» في المخطط أعلاه يحمل معنى كبيرًا. اسحب العمق وأرسل رمزًا عبر الكومة.
ببساطة: العمق ليس أنواعاً إضافية من التفكير؛ بل هو العملية نفسها تُطبَّق ثانيةً على خرجها هي. فكل تمريرة تصقل تمثيلاً مبنياً جزئياً من قبل، كما تصقل التحريرات المتتابعة مسوّدةً.
تقنيًّا: كل كتلة تقرأ من التيار المتبقي وتكتب فيه، فتتراكم التمثيلات بدل أن تُستبدَل. والعمق يكلّف حوسبةً وزمن استجابة تكلفةً خطية، ولهذا يُوازَن العمق مقابل العرض وطول السياق بدل تعظيمه ببساطة. وأعداد الكتل هنا من رتبة الأعداد الحقيقية، لا مواصفة منتج بعينه.
Q و K و V — ثلاثة أدوار
كيف يعرف النموذج أن “it” تشير إلى “cat”؟ الانتباه يسمح لكل كلمة بالنظر إلى كل كلمة أخرى.
ببساطة: تخيّل غرفة يرفع فيها كل شخص بطاقةً تقول عمّا يستطيع الإجابة، ويرفع كلٌّ من الباقين سؤالاً. تقرأ كل البطاقات، وتقرّر مَن يستحق الإصغاء، وتأخذ قدراً من كلٍّ منهم — أكثر من النافعين.
تقنيًّا: Q و K و V ثلاثة إسقاطات خطية متعلَّمة منفصلة للمتجه المُدخَل نفسه. والتوافق هو الجداء النقطي للاستعلامات في المفاتيح، مقسوماً على √dk لإبقاء الدرجات قبل softmax في نطاق تبقى فيه الاشتقاقات صالحة؛ ثم تسوّيها softmax إلى أوزان، ويكون الخرج ذلك المجموع الموزون لمتجهات القيم.
الانتباه خطوة بخطوة
الصيغة كاملةً دفعةً واحدة كثيرة. وهذه هي الأمور الأربعة التي تقوم بها فعلًا، واحدًا تلو الآخر.
ببساطة: مكتوبةً كصيغة واحدة تبدو قفزةً واحدة. وهي في الحقيقة أربع حركات صغيرة: اسأل، وقيّم الجميع، وحوّل الدرجات إلى حصص مجموعها كلّ واحد، ثم امزج.
تقنيًّا: الخطوات الأربع وترتيبها هي بالضبط خطوات الانتباه بالجداء النقطي المُقيَّس (Vaswani et al.، 2017، والاستشهاد كاملاً في الشرح أعلاه)، والثالثة وحدها غير خطية — فـ softmax هي ما يحوّل درجات حقيقية اعتباطية إلى مجموعة أوزان مُسوّاة قابلة للمقارنة. والأوزان في الأداة توضيحية كُتبت يدوياً، وليست مقروءة من نموذج مدرَّب.
خريطة الانتباه الحرارية
كل صف كلمة تطرح سؤالها؛ وكل خلية تُظهر كم من الجواب جاء من الكلمة في ذلك العمود. والرؤوس المختلفة تتعلّم أعمالًا مختلفة.
ببساطة: النموذج لا يفعل هذا مرة واحدة. بل يفعله عدة مرات جنباً إلى جنب بأولويات مختلفة — تمريرة تتعقّب مرجع الضمير، وأخرى تراقب الكلمة المجاورة مباشرةً — ثم يجمع ما وجدته كلّها.
تقنيًّا: الانتباه متعدّد الرؤوس يُجري عدة عمليات انتباه بالتوازي على إسقاطات أقل بُعداً ثم يسلسل النتائج. وتخصّص الرؤوس كالمرجعية أو التبعية النحوية نزعة مرصودة في دراسات السَّبر، لا شيء محدَّد في البنية ولا مُدرَّب عليه؛ والتسميات على الأزرار أعلاه توضيح لتلك النتيجة.
لماذا الانتباه يفوز
استبدلت المحوّلات شبكات RNN و LSTM لأن الانتباه يمكنه معالجة جميع الرموز بالتوازي.
ببساطة: التصاميم الأقدم تقرأ الجملة كما تستمع إلى رسالة صوتية — بالترتيب حصراً، كلمةً كلمة، دون تخطٍّ. أما الانتباه فيقرؤها كما تقرأ صفحة: كل شيء حاضر دفعةً واحدة، وبإمكان الكلمة الثالثة أن تنظر مباشرةً إلى الكلمة الثلاثمئة.
تقنيًّا: النماذج المتكرّرة تفرض تبعية تسلسلية: لا يمكن حساب الخطوة t قبل الخطوة t−1، فلا يقبل بُعد التسلسل التوازي أثناء التدريب، ويطول المسار بين الرموز المتباعدة بطول المسافة بينها. أما الانتباه الذاتي فيجعل طول ذلك المسار ثابتاً وبُعد التسلسل متوازياً بالكامل. والثمن كلفة تربيعية في طول التسلسل — وهي المقايضة التي تشتري هذا التسريع.
الهلوسة — عندما يختلق الذكاء الاصطناعي الأشياء
يمكن لنماذج اللغة الكبيرة توليد نص يبدو واثقاً وسلساً لكنه خاطئ تماماً. هذا يسمى الهلوسة.
ببساطة: ليس ثمة لحظة يتحقّق فيها النموذج من صدق ما هو مُقبل على قوله. فالفصاحة والصواب متطابقان من الداخل — ولهذا يُقرَأ استشهاد مختلَق بالسلاسة نفسها التي يُقرَأ بها استشهاد حقيقي.
تقنيًّا: هدف التدريب يكافئ الاستمرارات المرجّحة، ولا توجد إشارة صدق منفصلة يُحسَّن مقابلها. ولا شيء في التمريرة الأمامية يستشير قاعدة معرفة أو مُدقّقاً، فالثقة في نص الخرج خاصية لتوزيع الرموز، لا دليلاً عن العالم.
لماذا تبدأ المحادثات الطويلة في الانحراف
بعد حدٍّ معيّن، نصٌّ أكثر في النافذة يفعل عكس المساعدة: تتشوّش التفاصيل المبكرة، ويملأ النموذج التشوّش باختراعات معقولة. اسحب المنزلقة.
ببساطة: الخطر ليس في ضياع التفصيل. بل في أن الفراغ يُملأ. فتحصل على إجابة واثقة محدّدة معقولة بالشكل الذي طلبته — ولا شيء يشير إلى الجزء المختلَق.
تقنيًّا: ينتشر الانتباه على تسلسل أطول، ويتدهور استرجاع أي حقيقة مبكّرة بعينها كلما امتلأت النافذة. ومع ذلك يظلّ النموذج يُخرج إكمالاً عالي الاحتمال، فيظهر الفشل استبدالاً لا امتناعاً. هذه هلوسة لا نسيان — أما أثر الموضع المتصل «الضياع في المنتصف» فتتناوله الوحدة 5.
مكافحة الهلوسة
عدة استراتيجيات يمكنها تقليل (لكن ليس إزالة) الهلوسة.
ببساطة: لا تستطيع أن تجعله يكفّ عن الاختلاق، فغيّر إذاً ما يختلق منه. ضع المستند الحقيقي أمامه فتصير الإجابة المعقولة والإجابة الصحيحة إجابةً واحدة.
تقنيًّا: هذه الاستراتيجيات تهاجم المشكلة في طبقات مختلفة — المُدخَل (التأسيس والاسترجاع)، والتدريب (المواءمة على الرفض عند عدم اليقين)، والمخرَج (الاستشهاد مع تحقّق خارجي). ولا واحدة منها تُزيل الهلوسة؛ بل تضيّق كلٌّ منها المجال الذي يكون فيه الاختلاق أرجح الاستمرارات. والتحقّق وحده هو ما يلتقط الفشل بعد وقوعه.
درجة الحرارة — التحكم بالإبداع
تتحكم درجة الحرارة بمدى “إبداع” النموذج. اسحب المنزلق لترى كيف تتغير الاحتمالات.
ببساطة: مقبض واحد، وهو لا يضيف أفكاراً ولا يحذفها — بل يقرّر إلى أي مدى يقبل النموذج المراهنة على المرشّح الضعيف. أدِره إلى الأسفل يفز المرشّح الأوفر حظاً في كل مرة؛ وأدِره إلى الأعلى تبدأ الاحتمالات البعيدة في الظهور.
تقنيًّا: درجة الحرارة تقسم اللوغيتات قبل softmax. فدون 1 تُحدّد التوزيع نحو المنوال؛ وفوق 1 تُسطّحه، فترفع الكتلة على الذيل الذي أرتك إياه هذه الوحدة قبل شريحتين. إنها تعيد تشكيل التوزيع القائم ولا تُدخل قط مرشّحاً لم يكن مُقيَّماً أصلاً. والمخرجات المعروضة لكل نطاق هنا أمثلة جاهزة، لا توليد حيّ.
استراتيجيات أخذ العينات
درجة الحرارة ليست المقبض الوحيد. إليك الطرق الرئيسية للتحكم بمخرجات نماذج اللغة.
ببساطة: سؤالان مختلفان يسهل الخلط بينهما. درجة الحرارة تسأل: كم ينبغي أن تكون الحظوظ متفاوتة؟ أما Top-k و Top-p فتسألان: كم مرشّحاً يُسمح له أصلاً بدخول ورقة الاقتراع قبل السحب؟
تقنيًّا: درجة الحرارة تعيد تحجيم التوزيع؛ أما Top-k و Top-p فتبتُرانه. فـ Top-k تُبقي عدداً ثابتاً من المرشّحين، و Top-p تُبقي أصغر مجموعة يبلغ احتمالها التراكمي p — فتكيّف Top-p حدّ القطع بحسب مقدار ثقة النموذج عند تلك الخطوة، بينما لا تفعل Top-k ذلك. وهي تتركّب معاً، ولهذا تُتيح معظم واجهات البرمجة أكثر من واحدة في آن.
اختبار المعرفة
ثمانية أسئلة على هذه الوحدة. أجب لترى السبب — يظهر الشرح سواء أصبتَ أم أخطأت.