تخطَّ إلى المحتوى

النموذج متعدد الوسائط

Multimodal Model

مبتدئ نماذج

يُسمّى أيضًا: النموذج متعدد الأنماط، الذكاء الاصطناعي متعدد الوسائط

بجملة واحدة

نموذج ذكاء اصطناعي يفهم ويتعامل مع أكثر من نوع واحد من المحتوى، مثل النص والصورة والصوت معًا.

النموذج متعدد الوسائط هو نظام ذكاء اصطناعي يستقبل ويعالج أنواعًا مختلفة من البيانات في آن واحد: نصوص، صور، مقاطع صوتية، وأحيانًا فيديو. الفرق بينه وبين النموذج اللغوي الكبير التقليدي بسيط: النموذج اللغوي يفهم النص فقط، أما النموذج متعدد الوسائط فيمكنك أن ترسل له صورة فاتورة ويقرأها، أو تسجيلًا صوتيًا ويلخّصه، أو رسمًا بيانيًا ويشرحه لك.

كيف يعمل؟ النموذج يحوّل كل نوع من المحتوى إلى تمثيل رقمي موحّد يسمى التضمينات (أرقام تصف معنى المحتوى). بهذه الطريقة تصبح صورة قطة وكلمة "قطة" متقاربتين في "لغة" النموذج الداخلية، فيستطيع الربط بينهما. معظم هذه النماذج مبنية على معمارية المحوّل (البنية التقنية التي تقف خلف نماذج الذكاء الاصطناعي التوليدي الحديثة)، ودُرّبت على كميات هائلة من بيانات التدريب التي تجمع نصوصًا وصورًا مترابطة.

أين تظهر في حياتك اليومية؟ أمثلة كثيرة:

  • ترفع صورة وصفة دواء بخط اليد إلى ChatGPT فيقرأها ويشرح لك الجرعات.
  • تصوّر لوحة سيارة معطّلة على الطريق وتسأل النموذج عن سبب العطل المحتمل.
  • تصف مشهدًا بالكلمات فيولّد لك النموذج صورة كاملة، كما يفعل Midjourney.
  • ترسل لقطة شاشة لجدول بيانات معقّد وتطلب تحويله إلى ملخص نصي.

باختصار: كلما رأيت تطبيق ذكاء اصطناعي يقبل صورة أو صوتًا وليس نصًا فقط، فأنت أمام نموذج متعدد الوسائط.

استخدام صحيح

صاحبة متجر إلكتروني في جدة تصوّر منتجاتها بهاتفها، ثم ترفع الصور إلى Claude وتطلب منه كتابة وصف تسويقي لكل منتج بالعربية.

لماذا: هذا استخدام صحيح لأن النموذج يعالج مدخلًا بصريًا (الصورة) ويخرج نصًا، أي يجمع بين وسيطين مختلفين في مهمة واحدة.

طالب طب يصوّر شريحة تشريحية من كتابه الورقي ويسأل ChatGPT: ما اسم هذا الجزء وما وظيفته؟ فيحلل النموذج الصورة ويجيب.

لماذا: النموذج هنا فهم محتوى الصورة نفسها، لا مجرد نص مكتوب عليها، وهذه هي القدرة الجوهرية للنماذج متعددة الوسائط.

خطأ شائع

موظف يقول: "أرسلت للنموذج رابط فيديو على يوتيوب ولخّصه لي، إذن هو شاهد الفيديو بالكامل".

الصواب: خطأ شائع. كثير من الأدوات تقرأ النص المصاحب للفيديو أو التفريغ الكتابي فقط، ولا تحلل الصورة والصوت فعليًا. تحقق دائمًا مما يعالجه النموذج حقًا قبل الاعتماد على ملخصه.

صانع محتوى يعتقد أن أي تطبيق يحوّل النص إلى صوت هو نموذج متعدد الوسائط، فيصف أداة قراءة نصوص بسيطة بأنها "ذكاء اصطناعي متعدد الوسائط".

الصواب: تحويل النص إلى صوت وحده لا يكفي. النموذج متعدد الوسائط يفهم المحتوى ويربط بين الوسائط المختلفة، لا مجرد أن يحوّل صيغة إلى أخرى تحويلًا آليًا. أدوات مثل ElevenLabs تنتج صوتًا عالي الجودة، لكن وصف "متعدد الوسائط" ينطبق على النماذج التي تفهم وتستدل عبر أنواع المحتوى المختلفة.

كيف تميّزه بسرعة

الالتباس الأكثر شيوعًا هو الخلط بين النموذج متعدد الوسائط والتطبيق الذي يجمع عدة أدوات منفصلة. بعض التطبيقات تستخدم نموذجًا للنص وآخر للصور وثالثًا للصوت، ثم تربطها ببعضها، وهذا ليس نموذجًا متعدد الوسائط حقيقيًا. النموذج الحقيقي يفهم كل الوسائط داخل نظام واحد موحّد، ولذلك يستطيع الربط بينها بعمق، مثل شرح النكتة في صورة ساخرة. للتمييز، اسأل: هل النموذج نفسه يفهم الصورة، أم أن أداة خارجية تحوّلها إلى نص أولًا؟

لماذا يهمّك؟

هذه النماذج غيّرت طريقة تعاملك مع الذكاء الاصطناعي: لم تعد مضطرًا لكتابة كل شيء، بل تصوّر وترفع وتسأل. للموظف وصاحب المشروع الصغير، هذا يعني أتمتة مهام كانت تتطلب إدخالًا يدويًا مرهقًا، مثل قراءة الفواتير أو تحليل صور المنتجات. وفهم المصطلح يساعدك على اختيار الأداة المناسبة لعملك بدل دفع اشتراكات لأدوات لا تحتاجها.

أدوات تستخدم هذا المفهوم

مصطلحات ذات صلة

النشرة اليومية

كل ما يهمّك في الذكاء الاصطناعي، في 60 ثانية يوميًا

نرصد المئات من المصادر ونرسل لك الخلاصة فقط. بلا حشو، وبلا رسائل مزعجة.