بيانات التدريب
Training Data
يُسمّى أيضًا: بيانات التدريب، مجموعة التدريب، داتا التدريب
الأمثلة الضخمة من نصوص وصور وأصوات التي يتعلّم منها نظام الذكاء الاصطناعي قبل أن يصبح قادرًا على الإجابة أو التوليد.
بيانات التدريب هي المادة الخام التي يتعلّم منها أي نظام ذكاء اصطناعي. تخيّل طالبًا يذاكر آلاف الكتب قبل الامتحان: الكتب هنا هي بيانات التدريب، والامتحان هو أسئلتك اليومية للنظام. كلما كانت الكتب أكثر تنوعًا وأدق محتوى، كانت إجابات الطالب أفضل.
تختلف طبيعة هذه البيانات حسب نوع النظام:
- النماذج اللغوية مثل ChatGPT وClaude تتدرّب على نصوص هائلة من مواقع وكتب ومقالات.
- مولّدات الصور مثل Midjourney تتدرّب على ملايين الصور المصحوبة بأوصاف نصية.
- أنظمة الصوت مثل ElevenLabs تتدرّب على تسجيلات صوتية بشرية.
أثناء التدريب، يمرّر النظام هذه الأمثلة عبر شبكة عصبية (نموذج حسابي مستوحى من طريقة عمل الدماغ) فتتعدّل قيمه الداخلية المسماة المعامِلات تدريجيًا، حتى يلتقط الأنماط: كيف تُبنى الجملة العربية، كيف يبدو وجه الإنسان، كيف تُنطق الكلمات. النظام لا يحفظ البيانات حفظًا حرفيًا، بل يستخلص منها قواعد وأنماطًا عامة.
هذا المصطلح يظهر في حياتك أكثر مما تظن. حين يجيب ChatGPT إجابة قديمة عن سعر أو حدث، فالسبب أن بيانات تدريبه توقفت عند تاريخ معيّن. وحين يخطئ نموذج في لهجتك المحلية، فالسبب غالبًا قلة النصوص العربية في بياناته مقارنة بالإنجليزية.
✓ استخدام صحيح
عيادة أسنان في الرياض تريد نظامًا يتعرّف على التسوّس في صور الأشعة، فتجمع 10 آلاف صورة أشعة سابقة صنّفها أطباء حقيقيون، وتستخدمها لتدريب النموذج.
لماذا: هذا هو الاستخدام الصحيح للمصطلح: أمثلة مصنّفة بعناية يتعلّم منها النظام قبل أن يعمل على حالات جديدة لم يرها من قبل.
متجر إلكتروني مصري يدرّب نموذجًا للرد على استفسارات العملاء باستخدام أرشيف 50 ألف محادثة حقيقية بين خدمة العملاء والزبائن.
لماذا: المحادثات القديمة هنا بيانات تدريب حقيقية: تعلّم النموذج أسلوب العملاء المصريين وأسئلتهم الشائعة، فيردّ بلغة يفهمونها.
✕ خطأ شائع
موظف يقول: "سأكتب برومبت طويلًا ومفصّلًا لـ ChatGPT، وهكذا أكون قد درّبته على شركتنا".
الصواب: هذا خلط شائع. البرومبت (التعليمات التي تكتبها للنموذج) لا يغيّر بيانات التدريب ولا يعلّم النموذج شيئًا دائمًا. النموذج ينسى كل شيء بعد انتهاء المحادثة. التدريب الحقيقي عملية منفصلة تجريها الشركات المطوّرة على خوادمها.
طالب يظن أن ChatGPT "يبحث في بيانات تدريبه" كما يبحث غوغل في الإنترنت، فيسأله عن نتيجة مباراة جرت أمس.
الصواب: بيانات التدريب ليست قاعدة بيانات يُبحث فيها لحظيًا، بل مادة تعلّم انتهت في تاريخ محدد. ما بعد ذلك التاريخ لا يعرفه النموذج، إلا إذا استخدم أداة بحث خارجية مثل ما تفعله Perplexity.
كيف تميّزه بسرعة
أكثر التباس شيوعًا هو الخلط بين ثلاثة أشياء: بيانات التدريب، والبرومبت، ونافذة السياق. بيانات التدريب هي ما تعلّمه النموذج مرة واحدة قبل إطلاقه، ولا تتغير بمحادثاتك معه. أما البرومبت والملفات التي ترفعها فتعيش داخل نافذة السياق (الذاكرة المؤقتة للمحادثة) وتُنسى بانتهائها. إذا أردت تعليم النموذج معرفة دائمة جديدة، فذلك يتطلب الضبط الدقيق أو التوليد المعزّز بالاسترجاع، وهما تقنيتان مختلفتان تمامًا عن مجرد الكتابة له.
لماذا يهمّك؟
فهم بيانات التدريب يفسّر لك معظم سلوك أدوات الذكاء الاصطناعي: لماذا تجيب إجابات قديمة، ولماذا تكون أضعف بالعربية منها بالإنجليزية، ولماذا تهلوس أحيانًا. هذا الفهم يجعلك تعرف متى تثق بإجابة النموذج ومتى تتحقق منها بنفسك. كما يهمّ أي صاحب مشروع يفكر في بناء حل ذكاء اصطناعي، لأن جودة البيانات تحدد جودة النتيجة قبل أي شيء آخر.
أدوات تستخدم هذا المفهوم
مصطلحات ذات صلة
كل ما يهمّك في الذكاء الاصطناعي، في 60 ثانية يوميًا
نرصد المئات من المصادر ونرسل لك الخلاصة فقط. بلا حشو، وبلا رسائل مزعجة.