لماذا التقييمات هي المهارة الأساسية
يرى أندرو نج أن السمة الوحيدة التي تفصل أفضل مَن يبنون أنظمة الذكاء الاصطناعي عن غيرهم هي حلقة التقييمات المنضبطة — أن تقيس فعلاً ما إذا كان النظام يعمل، ثم تستخدم ما تتعلّمه لتحسينه. هذه الوحدة تدور حول بناء تلك العادة.
لماذا هي صعبة، ولماذا تهمّ
مخرجات الذكاء الاصطناعي غير متوقّعة — قد تعطيك المُطالبة نفسها إجابة جيدة اليوم وسيئة غداً. لذا فإنّ «بدت جيدة حين جرّبتها» ليست دليلاً.
- لأنّ السلوك يتغيّر (الوحدة 1)، فإنّ تجربة ناجحة واحدة لا تُثبت شيئاً.
- لا يمكنك تحسين ما لا تقيسه — التخمينات تنقل المشكلة من مكان إلى آخر فحسب.
- التقييمات تحوّل الانطباع إلى قياس: درجة قابلة للتكرار يمكنك الوثوق بها.
حلقة التقييم
الحلقة هي ما يحوّل العبث العشوائي إلى تقدّم منهجي — كل دورة تخبرك بالضبط بما ينبغي إصلاحه تالياً.
ما الذي يجعل التقييمات شائكة
لا توجد وصفة واحدة يمكنك نسخها. وهذا بالضبط ما يجعلها مهارة لا مجرد خانة تُعلَّم عليها.
- المقاربة الصحيحة تختلف باختلاف المشروع — روبوت المحادثة ومُستخرِج البيانات يحتاجان مقاييس مختلفة.
- بل تختلف حتى باختلاف المرحلة — الفحص المبدئي السريع يختلف عن مجموعة اختبارات ناضجة.
- اختيار ما تقيسه حُكمٌ شخصي، ويتحسّن مع الممارسة.
الاختبار أولاً، وقد نضج
لقد صادفت تفكير «الاختبار أولاً» في الوحدة 4. التقييمات هي نسخته الناضجة: في الشِّفرة العادية يكون الاختبار نجاحاً أو فشلاً، أمّا مخرجات الذكاء الاصطناعي فمسألة درجات، فتقيس الجودة — إلى أيّ مدى، وكم مرة — لا مجرد ما إذا كان قد اشتغل.
طبّقها
كيف تنفّذها: اختَر الشيء الوحيد الذي يجب أن تُتقنه أداتك، ثم دوّن كيف ستقيسه على 10 أمثلة حقيقية. هذا هو أول تقييم لك.
- متتبّع مهام الذكاء الاصطناعي الأسبوعي — قِس «هل تحوّلت الرسالة إلى المهمة الصحيحة؟» عبر مجموعة من الرسائل الحقيقية.
- موقع علامتك الشخصية — قِس «هل يعود كل ادّعاء مُولَّد إلى مصدر؟» عبر كل قسم.
ما الذي تعلّمته
حلقة التقييمات المنضبطة — قِس، جِد أكبر إخفاق، أصلِح، ثم قِس مجدداً — هي العادة التي تفصل أفضل مَن يبنون أنظمة الذكاء الاصطناعي أكثر من غيرها. لا يوجد تقييم واحد يناسب الجميع، لذا فهي مهارة تستحق الممارسة على مشاريعك الختامية.