DeepSeek V4 Flash: أرقام أقوى وتعادل مع GPT-5.6 Terra
الشركة الصينية نشرت نتائج نسخة محدّثة من نموذجها، تتقدّم بفارق كبير في مهام الأدوات وتتأخّر بفارق أكبر في مهام أخرى.
نشرت DeepSeek أرقام نسخة محدّثة من نموذج V4 Flash تُظهر تحسنًا كبيرًا في اختبارات تشغيل الأوامر واستخدام الأدوات، مع تقدّم على GPT-5.6 Terra في اختبارين وتأخّر واضح في اختبارين آخرين. الأرقام تقيس القدرة فقط، ولم تنشر الشركة في هذا التحديث بيانات عن السرعة أو التكلفة أو حجم النموذج.
أبرز النقاط
- Terminal Bench ارتفع من 56.9 إلى 82.7، لكن الاختبار نفسه تغيّر من نسخة 2.0 إلى 2.1 فالمقارنة ليست متكافئة تمامًا
- Toolathlon ارتفع من 51.8 إلى 70.3، وهي زيادة 18.5 نقطة في مهام استخدام الأدوات
- أمام GPT-5.6 Terra: تقدّم لـ Flash في Terminal Bench وToolathlon، وتأخّر في DeepSWE وAgents' Last Exam
- سبعة اختبارات ظهرت لأول مرة بلا أرقام سابقة، فلا يمكن معرفة اتجاه التحسن فيها
- لا شيء في الأرقام المنشورة يقيس أداء النموذج بالعربية
ما الذي تغيّر بين نسختين من النموذج نفسه
حدّثت DeepSeek صفحة تحديثات واجهتها البرمجية بأرقام نسخة جديدة من نموذج V4 Flash، مؤرّخة بـ 2026-07-31، مقابل نسخة المعاينة السابقة.
الفارق الأبرز في اختبارين:
- Terminal Bench، وهو اختبار يقيس قدرة النموذج على تنفيذ مهام حقيقية عبر سطر الأوامر: من 56.9 إلى 82.7.
- Toolathlon، وهو اختبار لاستخدام الأدوات الخارجية وربطها لإنجاز مهمة: من 51.8 إلى 70.3.
الاثنان يقيسان ما يُعرف بسلوك الوكيل الذكي، أي النموذج الذي ينفّذ خطوات متتابعة بنفسه بدلًا من إنتاج نص واحد ويتوقف.
قفزة 25 نقطة تحتاج نجمة صغيرة
الزيادة في Terminal Bench تبدو هائلة على الورق: 25.8 نقطة بين نسختين. لكن الاختبار نفسه انتقل من الإصدار 2.0 إلى 2.1 بين القياسين.
هذا يعني أن الرقمين لم يُقاسا على المسطرة ذاتها، وأشار إلى ذلك من جمع الأرقام صراحةً. التحسن موجود على الأرجح، لكن حجمه الحقيقي أقل وضوحًا مما يوحي الجدول.
القاعدة العملية: أي مقارنة بين نسختين من اختبار مختلفتين تُقرأ باعتبارها مؤشرًا لا دليلًا قاطعًا.
سبعة اختبارات بلا نقطة مقارنة
ظهرت في الجدول سبعة اختبارات لأول مرة، بلا أرقام سابقة تُقارن بها:
- NL2Repo: 54.2، وCybergym: 76.7، وDeepSWE: 54.4
- Agent Last Exam: 25.2، وAutomation Bench: 25.1
- DSBench-FullStack: 68.7، وDSBench-Hard: 59.6
وجود الرقم لا يخبرنا إن كان النموذج يتقدّم أو يتراجع في هذه المهام. وانخفاض نتيجتي Agent Last Exam وAutomation Bench إلى حدود 25 نقطة يشير إلى أن المهام الطويلة والمعقدة ما تزال منطقة ضعف.
أمام GPT-5.6 Terra: كل طرف يفوز في نصف الملعب
وضع مستخدمو مجتمع LocalLLaMA على Reddit أرقام DeepSeek إلى جانب أرقام GPT-5.6 Terra من OpenAI، فظهرت صورة متعادلة:
- Terminal Bench: 82.7 لـ Flash مقابل 78.4 لـ Terra، بفارق 4.3 نقطة.
- Toolathlon: 70.3 مقابل 53.1، بفارق كبير لصالح Flash يبلغ 17.2 نقطة.
- DeepSWE: 69.6 لـ Terra مقابل 54.4 لـ Flash، بفارق 15.2 نقطة.
- Agents' Last Exam: 50.4 لـ Terra مقابل 25.2 لـ Flash، أي ضعف النتيجة تقريبًا.
لا فائز واضح. النموذج الصيني أقوى في تشغيل الأوامر وتنسيق الأدوات، والنموذج الأمريكي أقوى في هندسة البرمجيات ومهام الوكلاء الطويلة.
كلمة Flash في الاسم لا تخبرنا شيئًا عن السرعة
الزاوية التي يبحث عنها كثيرون هي الكفاءة: هل النموذج أسرع؟ أخفّ؟ أرخص؟ الأرقام المنشورة لا تجيب على أي من هذه الأسئلة.
كل ما في الجدول اختبارات قدرة. لا زمن استجابة، ولا تكلفة التوكن، ولا عدد المعامِلات، ولا متطلبات تشغيل. التسمية تشير عادةً إلى نسخة أخفّ وأسرع، لكن التسمية ليست قياسًا.
حتى تنشر DeepSeek أرقام السعر والسرعة، أي حديث عن كفاءة أعلى يبقى استنتاجًا من الاسم لا من البيانات.
لماذا يهمّك
إن كنت تستخدم النموذج للدردشة وكتابة النصوص، فهذه الأرقام لا تعنيك كثيرًا. لا شيء فيها يقيس جودة الكتابة أو الترجمة أو التلخيص.
إن كنت مطوّرًا أو تبني أدوات تعمل تلقائيًا، فالأمر مختلف. اختبارات مثل Toolathlon تقيس بالضبط ما تحتاجه: نموذج ينادي أدوات، يقرأ نتائجها، ويصحّح مساره.
المعنى الأوسع: الفارق بين أفضل نموذج مغلق وأقرب منافس صيني لم يبقَ فجوة عامة، بل تحوّل إلى فروق متبادلة تعتمد على نوع المهمة.
بالنسبة للمنطقة العربية
أول ما يجب قوله بصراحة: لا شيء في هذه الأرقام يقيس أداء النموذج بالعربية. كل الاختبارات المذكورة تتعلق بالبرمجة وسطر الأوامر واستخدام الأدوات، وهي مهام لغتها الإنجليزية والكود.
الخبر الجيد أن هذا النوع من المهام أقل حساسية للغة. المطوّر في عمّان أو الدار البيضاء يكتب أوامره بالإنجليزية أصلًا، فالتحسن في Terminal Bench ينفعه مباشرة بغضّ النظر عن دعم العربية.
أما إن كان استخدامك يشمل نصوصًا عربية، فالطريق الوحيد أمامك هو الاختبار بنفسك. جرّب مهامك الفعلية: مراسلات، لهجات، أسماء أعلام، التشكيل الآلي. لوحة الأرقام هذه لن تجيبك.
ما يستحق الانتباه من زاوية عملية:
- سمعة DeepSeek السابقة قامت على إصدار أوزان نماذجها للعموم، لكن هذا التحديث لا يوضّح إن كانت أوزان V4 Flash متاحة للتنزيل والتشغيل المحلي.
- الفرق التقنية في الشركات الخاضعة لقواعد حماية بيانات محلية تسأل عادةً عن مكان معالجة البيانات. النموذج المفتوح يحلّ هذه المسألة، والنموذج عبر واجهة برمجية لا يحلّها.
- لم تُعلن أرقام تسعير في هذا التحديث، فأي مقارنة تكلفة مع البدائل الغربية سابقة لأوانها.
الخطوة العملية اليوم: اختر مهمة واحدة صغيرة تنفّذها فعلًا في عملك، وشغّلها على النموذجين، واحكم بنتيجتك أنت.
ما لم تنشره الشركة
الفجوات في هذا الإعلان واضحة، ومن الإنصاف ذكرها:
- لا بيانات عن حجم النموذج ولا عن بنيته.
- لا أرقام سرعة ولا تسعير.
- لا اختبارات لغوية متعددة، ولا شيء عن الهلوسة أو دقة المعلومات.
- لا تفاصيل عن بيانات التدريب ولا عن حدود الاستخدام.
الأرقام صادرة عن الشركة نفسها على صفحة تحديثاتها، ولم تُراجعها جهة مستقلة بعد. هذا ينطبق على معظم إعلانات النماذج، من الشرق والغرب معًا.
الخلاصة
النسخة المحدّثة من DeepSeek V4 Flash تتقدّم بوضوح في مهام تشغيل الأوامر واستخدام الأدوات، وتتفوّق على GPT-5.6 Terra في اختبارين وتتأخّر عنه في اختبارين.
هذا يجعله مرشحًا جديًا للمطوّر الذي يبني أدوات تلقائية ويفضّل بديلًا غير غربي. لكن حتى تُنشر أرقام السعر والسرعة وتُختبر العربية عمليًا، تبقى الصورة نصف مكتملة.
أسئلة شائعة
ما هو DeepSeek V4 Flash؟
هل DeepSeek V4 Flash أفضل من GPT-5.6؟
هل النموذج يدعم اللغة العربية؟
ماذا يعني اختبار Toolathlon تحديدًا؟
هل الأرقام موثوقة؟
هل يمكنني تشغيل النموذج على جهازي؟
هل النموذج أسرع وأقل استهلاكًا للموارد فعلًا؟
المصادر
- فريق الراصد إعداد وتحرير بالعربية
- Reddit r/LocalLLaMA المصدر الأصلي
مراجع إضافية
أعدّ فريق الراصد هذا التقرير بالعربية اعتمادًا على ما نشرته Reddit r/LocalLLaMA، مع تحقّق مستقل وإضافة السياق العربي. الرابط الأصلي مذكور أعلاه.
النقاش (0)
لا توجد تعليقات بعد. كن أول من يشارك برأيه.
كل ما يهمّك في الذكاء الاصطناعي، في 60 ثانية يوميًا
نرصد المئات من المصادر ونرسل لك الخلاصة فقط. بلا حشو، وبلا رسائل مزعجة.