تخطَّ إلى المحتوى

DeepSeek V4 Flash: أرقام أقوى وتعادل مع GPT-5.6 Terra

الشركة الصينية نشرت نتائج نسخة محدّثة من نموذجها، تتقدّم بفارق كبير في مهام الأدوات وتتأخّر بفارق أكبر في مهام أخرى.

فريق الراصد، نقلًا عن Reddit r/LocalLLaMA 7 دقيقة قراءة 2 مشاهدة
الخلاصة

نشرت DeepSeek أرقام نسخة محدّثة من نموذج V4 Flash تُظهر تحسنًا كبيرًا في اختبارات تشغيل الأوامر واستخدام الأدوات، مع تقدّم على GPT-5.6 Terra في اختبارين وتأخّر واضح في اختبارين آخرين. الأرقام تقيس القدرة فقط، ولم تنشر الشركة في هذا التحديث بيانات عن السرعة أو التكلفة أو حجم النموذج.

أبرز النقاط

  • Terminal Bench ارتفع من 56.9 إلى 82.7، لكن الاختبار نفسه تغيّر من نسخة 2.0 إلى 2.1 فالمقارنة ليست متكافئة تمامًا
  • Toolathlon ارتفع من 51.8 إلى 70.3، وهي زيادة 18.5 نقطة في مهام استخدام الأدوات
  • أمام GPT-5.6 Terra: تقدّم لـ Flash في Terminal Bench وToolathlon، وتأخّر في DeepSWE وAgents' Last Exam
  • سبعة اختبارات ظهرت لأول مرة بلا أرقام سابقة، فلا يمكن معرفة اتجاه التحسن فيها
  • لا شيء في الأرقام المنشورة يقيس أداء النموذج بالعربية

ما الذي تغيّر بين نسختين من النموذج نفسه

حدّثت DeepSeek صفحة تحديثات واجهتها البرمجية بأرقام نسخة جديدة من نموذج V4 Flash، مؤرّخة بـ 2026-07-31، مقابل نسخة المعاينة السابقة.

الفارق الأبرز في اختبارين:

  • Terminal Bench، وهو اختبار يقيس قدرة النموذج على تنفيذ مهام حقيقية عبر سطر الأوامر: من 56.9 إلى 82.7.
  • Toolathlon، وهو اختبار لاستخدام الأدوات الخارجية وربطها لإنجاز مهمة: من 51.8 إلى 70.3.

الاثنان يقيسان ما يُعرف بسلوك الوكيل الذكي، أي النموذج الذي ينفّذ خطوات متتابعة بنفسه بدلًا من إنتاج نص واحد ويتوقف.

قفزة 25 نقطة تحتاج نجمة صغيرة

الزيادة في Terminal Bench تبدو هائلة على الورق: 25.8 نقطة بين نسختين. لكن الاختبار نفسه انتقل من الإصدار 2.0 إلى 2.1 بين القياسين.

هذا يعني أن الرقمين لم يُقاسا على المسطرة ذاتها، وأشار إلى ذلك من جمع الأرقام صراحةً. التحسن موجود على الأرجح، لكن حجمه الحقيقي أقل وضوحًا مما يوحي الجدول.

القاعدة العملية: أي مقارنة بين نسختين من اختبار مختلفتين تُقرأ باعتبارها مؤشرًا لا دليلًا قاطعًا.

سبعة اختبارات بلا نقطة مقارنة

ظهرت في الجدول سبعة اختبارات لأول مرة، بلا أرقام سابقة تُقارن بها:

  • NL2Repo: 54.2، وCybergym: 76.7، وDeepSWE: 54.4
  • Agent Last Exam: 25.2، وAutomation Bench: 25.1
  • DSBench-FullStack: 68.7، وDSBench-Hard: 59.6

وجود الرقم لا يخبرنا إن كان النموذج يتقدّم أو يتراجع في هذه المهام. وانخفاض نتيجتي Agent Last Exam وAutomation Bench إلى حدود 25 نقطة يشير إلى أن المهام الطويلة والمعقدة ما تزال منطقة ضعف.

أمام GPT-5.6 Terra: كل طرف يفوز في نصف الملعب

وضع مستخدمو مجتمع LocalLLaMA على Reddit أرقام DeepSeek إلى جانب أرقام GPT-5.6 Terra من OpenAI، فظهرت صورة متعادلة:

  • Terminal Bench: 82.7 لـ Flash مقابل 78.4 لـ Terra، بفارق 4.3 نقطة.
  • Toolathlon: 70.3 مقابل 53.1، بفارق كبير لصالح Flash يبلغ 17.2 نقطة.
  • DeepSWE: 69.6 لـ Terra مقابل 54.4 لـ Flash، بفارق 15.2 نقطة.
  • Agents' Last Exam: 50.4 لـ Terra مقابل 25.2 لـ Flash، أي ضعف النتيجة تقريبًا.

لا فائز واضح. النموذج الصيني أقوى في تشغيل الأوامر وتنسيق الأدوات، والنموذج الأمريكي أقوى في هندسة البرمجيات ومهام الوكلاء الطويلة.

كلمة Flash في الاسم لا تخبرنا شيئًا عن السرعة

الزاوية التي يبحث عنها كثيرون هي الكفاءة: هل النموذج أسرع؟ أخفّ؟ أرخص؟ الأرقام المنشورة لا تجيب على أي من هذه الأسئلة.

كل ما في الجدول اختبارات قدرة. لا زمن استجابة، ولا تكلفة التوكن، ولا عدد المعامِلات، ولا متطلبات تشغيل. التسمية تشير عادةً إلى نسخة أخفّ وأسرع، لكن التسمية ليست قياسًا.

حتى تنشر DeepSeek أرقام السعر والسرعة، أي حديث عن كفاءة أعلى يبقى استنتاجًا من الاسم لا من البيانات.

لماذا يهمّك

إن كنت تستخدم النموذج للدردشة وكتابة النصوص، فهذه الأرقام لا تعنيك كثيرًا. لا شيء فيها يقيس جودة الكتابة أو الترجمة أو التلخيص.

إن كنت مطوّرًا أو تبني أدوات تعمل تلقائيًا، فالأمر مختلف. اختبارات مثل Toolathlon تقيس بالضبط ما تحتاجه: نموذج ينادي أدوات، يقرأ نتائجها، ويصحّح مساره.

المعنى الأوسع: الفارق بين أفضل نموذج مغلق وأقرب منافس صيني لم يبقَ فجوة عامة، بل تحوّل إلى فروق متبادلة تعتمد على نوع المهمة.

بالنسبة للمنطقة العربية

أول ما يجب قوله بصراحة: لا شيء في هذه الأرقام يقيس أداء النموذج بالعربية. كل الاختبارات المذكورة تتعلق بالبرمجة وسطر الأوامر واستخدام الأدوات، وهي مهام لغتها الإنجليزية والكود.

الخبر الجيد أن هذا النوع من المهام أقل حساسية للغة. المطوّر في عمّان أو الدار البيضاء يكتب أوامره بالإنجليزية أصلًا، فالتحسن في Terminal Bench ينفعه مباشرة بغضّ النظر عن دعم العربية.

أما إن كان استخدامك يشمل نصوصًا عربية، فالطريق الوحيد أمامك هو الاختبار بنفسك. جرّب مهامك الفعلية: مراسلات، لهجات، أسماء أعلام، التشكيل الآلي. لوحة الأرقام هذه لن تجيبك.

ما يستحق الانتباه من زاوية عملية:

  • سمعة DeepSeek السابقة قامت على إصدار أوزان نماذجها للعموم، لكن هذا التحديث لا يوضّح إن كانت أوزان V4 Flash متاحة للتنزيل والتشغيل المحلي.
  • الفرق التقنية في الشركات الخاضعة لقواعد حماية بيانات محلية تسأل عادةً عن مكان معالجة البيانات. النموذج المفتوح يحلّ هذه المسألة، والنموذج عبر واجهة برمجية لا يحلّها.
  • لم تُعلن أرقام تسعير في هذا التحديث، فأي مقارنة تكلفة مع البدائل الغربية سابقة لأوانها.

الخطوة العملية اليوم: اختر مهمة واحدة صغيرة تنفّذها فعلًا في عملك، وشغّلها على النموذجين، واحكم بنتيجتك أنت.

ما لم تنشره الشركة

الفجوات في هذا الإعلان واضحة، ومن الإنصاف ذكرها:

  • لا بيانات عن حجم النموذج ولا عن بنيته.
  • لا أرقام سرعة ولا تسعير.
  • لا اختبارات لغوية متعددة، ولا شيء عن الهلوسة أو دقة المعلومات.
  • لا تفاصيل عن بيانات التدريب ولا عن حدود الاستخدام.

الأرقام صادرة عن الشركة نفسها على صفحة تحديثاتها، ولم تُراجعها جهة مستقلة بعد. هذا ينطبق على معظم إعلانات النماذج، من الشرق والغرب معًا.

الخلاصة

النسخة المحدّثة من DeepSeek V4 Flash تتقدّم بوضوح في مهام تشغيل الأوامر واستخدام الأدوات، وتتفوّق على GPT-5.6 Terra في اختبارين وتتأخّر عنه في اختبارين.

هذا يجعله مرشحًا جديًا للمطوّر الذي يبني أدوات تلقائية ويفضّل بديلًا غير غربي. لكن حتى تُنشر أرقام السعر والسرعة وتُختبر العربية عمليًا، تبقى الصورة نصف مكتملة.

أسئلة شائعة

ما هو DeepSeek V4 Flash؟

نموذج لغوي من شركة DeepSeek الصينية، نشرت الشركة على صفحة تحديثات واجهتها البرمجية أرقام نسخة محدّثة منه مؤرّخة 2026-07-31. الأرقام تركّز على مهام برمجية ومهام وكلاء، مثل تنفيذ أوامر في الطرفية واستخدام أدوات خارجية. لم يوضّح التحديث حجم النموذج ولا سعره ولا إن كانت أوزانه متاحة للتنزيل.

هل DeepSeek V4 Flash أفضل من GPT-5.6؟

لا إجابة واحدة. في Terminal Bench سجّل Flash 82.7 مقابل 78.4 لـ GPT-5.6 Terra، وفي Toolathlon 70.3 مقابل 53.1. لكن في DeepSWE سجّل Terra 69.6 مقابل 54.4، وفي Agents' Last Exam 50.4 مقابل 25.2. أي أن كل نموذج يتقدّم في نوع مختلف من المهام، والاختيار يعتمد على ما تريد إنجازه.

هل النموذج يدعم اللغة العربية؟

الأرقام المنشورة لا تجيب على هذا السؤال. كل الاختبارات المذكورة تقيس البرمجة وسطر الأوامر واستخدام الأدوات، ولا يوجد بينها اختبار لغوي. الطريقة الوحيدة للمعرفة هي التجربة المباشرة على نصوصك ومهامك العربية الفعلية، لأن أداء النماذج بالعربية يختلف كثيرًا عن أدائها بالإنجليزية ولا يمكن استنتاجه من نتائج برمجية.

ماذا يعني اختبار Toolathlon تحديدًا؟

اختبار يقيس قدرة النموذج على استخدام أدوات خارجية لإنجاز مهمة: ينادي الأداة، يقرأ ما ترجعه، ثم يقرر خطوته التالية. هذا جوهر ما يُسمى الوكيل الذكي. الارتفاع من 51.8 إلى 70.3 يعني عمليًا أن النموذج أصبح أقدر على إكمال سلاسل الخطوات دون أن يتوه في منتصفها.

هل الأرقام موثوقة؟

هي أرقام نشرتها DeepSeek عن نموذجها، ولم تراجعها جهة مستقلة بعد. إضافةً إلى ذلك، اختبار Terminal Bench تغيّر من النسخة 2.0 إلى 2.1 بين القياسين، فالمقارنة بين 56.9 و82.7 ليست على المسطرة نفسها. تعامل مع النتائج كمؤشر على الاتجاه العام لا كقياس نهائي دقيق.

هل يمكنني تشغيل النموذج على جهازي؟

لم يوضّح تحديث DeepSeek إن كانت أوزان V4 Flash متاحة للتنزيل. الشركة أصدرت سابقًا نماذج بأوزان مفتوحة، لكن هذا لا يضمن الأمر هنا. كما أنها لم تنشر عدد المعامِلات ولا متطلبات التشغيل، وهما ما تحتاجه لتقدير إن كان جهازك يكفي أصلًا.

هل النموذج أسرع وأقل استهلاكًا للموارد فعلًا؟

لا بيانات تدعم ذلك في هذا التحديث. الجدول المنشور يقيس القدرة فقط: نسب نجاح في اختبارات محددة. لا يوجد فيه زمن استجابة، ولا تكلفة توكن، ولا حجم نموذج. تسمية Flash تُستخدم عادةً للنسخ الأخفّ والأسرع، لكن الاسم ليس قياسًا يمكن الاعتماد عليه.

المصادر

  • فريق الراصد إعداد وتحرير بالعربية
  • Reddit r/LocalLLaMA المصدر الأصلي

مراجع إضافية

أعدّ فريق الراصد هذا التقرير بالعربية اعتمادًا على ما نشرته Reddit r/LocalLLaMA، مع تحقّق مستقل وإضافة السياق العربي. الرابط الأصلي مذكور أعلاه.

النقاش (0)

اكتب تعليقك الآن، سنطلب منك إنشاء حساب عند النشر فقط.

لا توجد تعليقات بعد. كن أول من يشارك برأيه.

النشرة اليومية

كل ما يهمّك في الذكاء الاصطناعي، في 60 ثانية يوميًا

نرصد المئات من المصادر ونرسل لك الخلاصة فقط. بلا حشو، وبلا رسائل مزعجة.

اقرأ أيضًا

OpenAI تخفّض أسعار GPT-5.6 حتى 80%

أعلنت OpenAI خفض أسعار التوكن في نموذجها GPT-5.6 بنسبة تصل إلى 80%، وقال رئيسها التنفيذي سام ألتمان إن الشركة تريد تقديم الأفضل. الخفض يعني أن التطبيق...

فريق الراصد · · 8 دقيقة قراءة