تخطَّ إلى المحتوى

التعلم من التغذية الراجعة البشرية

RLHF

متوسط تقنيات

يُسمّى أيضًا: التعلم المعزّز من التغذية الراجعة البشرية، التعلم بالملاحظات البشرية

بجملة واحدة

طريقة لتدريب أنظمة الذكاء الاصطناعي تعتمد على بشر يقيّمون إجابات النموذج، فيتعلّم النموذج تفضيل الإجابات التي أعجبتهم وتجنّب ما رفضوه.

التعلم من التغذية الراجعة البشرية هو الخطوة التي تحوّل النموذج اللغوي من آلة تكمل النصوص إلى مساعد مفيد ومهذّب. النموذج اللغوي الكبير (برنامج ضخم تدرّب على كميات هائلة من النصوص) يتعلّم في البداية التنبؤ بالكلمة التالية فقط. لكنه لا يعرف الفرق بين إجابة مفيدة وإجابة مسيئة أو خاطئة. هنا يأتي دور البشر.

تعمل هذه الطريقة على 3 مراحل مبسّطة:

  • جمع الأمثلة: يكتب مدرّبون بشريون إجابات نموذجية على أسئلة متنوعة، ليتعلّم النموذج شكل الإجابة الجيدة.
  • التقييم والترتيب: يولّد النموذج عدة إجابات للسؤال نفسه، ويرتّبها البشر من الأفضل إلى الأسوأ. من هذه الترتيبات يُبنى نموذج مكافأة (برنامج صغير يتوقع أي إجابة سيفضّلها الإنسان).
  • التحسين المستمر: يتدرّب النموذج الأساسي على توليد إجابات تحصل على درجات أعلى من نموذج المكافأة، فيصبح مع الوقت أكثر فائدة وأمانًا.

أنت تلمس نتيجة هذه العملية كل يوم دون أن تنتبه. حين يرفض ChatGPT مساعدتك في شيء ضار، أو حين يجيب Claude بأسلوب منظم ومهذب، فهذا أثر مباشر لهذا التدريب. وحين تضغط زر الإعجاب أو عدم الإعجاب على إجابة، فأنت تشارك عمليًا في تغذية راجعة قد تُستخدم لتحسين النموذج لاحقًا.

استخدام صحيح

صاحب متجر إلكتروني سعودي يسأل ChatGPT عن صياغة رد على عميل غاضب، فيحصل على رد مهذب ومتعاطف بدل نص جاف أو هجومي.

لماذا: أسلوب الرد المهذب ليس صدفة. المقيّمون البشريون فضّلوا خلال التدريب الإجابات المتعاطفة، فتعلّم النموذج تبنّي هذه النبرة.

طالب طب يطلب من Claude شرح دواء معين، فيقدّم النموذج الشرح مع تنبيه واضح بضرورة مراجعة طبيب مختص قبل أي قرار علاجي.

لماذا: إضافة التحذيرات في المواضيع الطبية سلوك تعلّمه النموذج من تقييمات بشرية كافأت الإجابات الحذرة والمسؤولة.

خطأ شائع

موظف يعتقد أن النموذج المدرّب بهذه الطريقة يقول الحقيقة دائمًا، فينشر معلومات من ChatGPT في تقرير رسمي دون تدقيق.

الصواب: هذا خطأ. التدريب بالتغذية الراجعة يجعل الإجابات أكثر إقناعًا وتهذيبًا، لكنه لا يمنع الهلوزة (اختلاق معلومات خاطئة بثقة). الصواب هو التحقق من كل معلومة مهمة من مصدر موثوق.

صانع محتوى يظن أن النموذج يتعلّم منه فورًا، فيصحّح للنموذج معلومة ويتوقع أن يتذكرها لكل المستخدمين غدًا.

الصواب: التغذية الراجعة لا تعدّل النموذج لحظيًا. التقييمات تُجمع من ملايين المستخدمين ثم تدخل في دورات تدريب لاحقة تستغرق شهورًا. تصحيحك يفيد المحادثة الحالية فقط.

كيف تميّزه بسرعة

الخلط الأكثر شيوعًا هو الظن بأن هذه الطريقة تجعل النموذج أذكى أو أكثر معرفة. الحقيقة أنها لا تضيف معلومات جديدة، بل تعدّل السلوك والأسلوب فقط: تجعل الإجابات أكثر فائدة وأمانًا وتهذيبًا. المعرفة نفسها يكتسبها النموذج من بيانات التدريب في مرحلة سابقة. لتجنّب الالتباس، تذكّر المعادلة: بيانات التدريب تبني المعرفة، والتغذية الراجعة البشرية تهذّب السلوك.

لماذا يهمّك؟

هذا المصطلح يفسّر لك لماذا يرفض المساعد الذكي بعض الطلبات ويقبل غيرها، ولماذا تختلف شخصية ChatGPT عن Claude رغم تشابه التقنية. فهمه يجعلك تدرك أن سلوك النموذج انعكاس لتفضيلات المقيّمين البشريين، وليس حيادًا مطلقًا. كما يذكّرك بأن ضغطة الإعجاب التي تمنحها للإجابات جزء فعلي من تطوير هذه الأنظمة.

أدوات تستخدم هذا المفهوم

مصطلحات ذات صلة

النشرة اليومية

كل ما يهمّك في الذكاء الاصطناعي، في 60 ثانية يوميًا

نرصد المئات من المصادر ونرسل لك الخلاصة فقط. بلا حشو، وبلا رسائل مزعجة.