الترميز العربي
Arabic Tokenization
يُسمّى أيضًا: تقطيع النص العربي، التجزئة الرمزية للعربية، توكنة العربية
عملية تقسيم النص العربي إلى وحدات صغيرة تفهمها نماذج الذكاء الاصطناعي وتحسب على أساسها التكلفة والسرعة.
الترميز العربي هو الطريقة التي تُقطَّع بها الجمل العربية إلى وحدات صغيرة تسمى "توكنات" (أجزاء من الكلمات يتعامل معها النموذج اللغوي بدلًا من الكلمات الكاملة). النموذج مثل ChatGPT لا يقرأ كلمة "المكتبة" ككلمة واحدة، بل قد يقسمها إلى "ال" و"مكتب" و"ة". هذا التقسيم يحدد كم يفهم النموذج من نصك، وكم يكلّفك استخدامه.
المشكلة أن العربية لغة معقدة الصرف. الكلمة الواحدة قد تحمل حرف جر وأداة تعريف وضميرًا متصلًا، مثل "وبمكتبتهم" التي تعادل خمس كلمات إنجليزية. معظم أنظمة الترميز صُممت أصلًا للإنجليزية، لذلك تقطّع العربية تقطيعًا سيئًا وتنتج عدد توكنات أكبر. النتائج العملية لذلك:
- تكلفة أعلى: النص العربي نفسه قد يستهلك ضعف توكنات نظيره الإنجليزي أو أكثر، والشركات تحاسب بعدد التوكنات.
- مساحة أقل: نافذة السياق (الحد الأقصى من النص الذي يستوعبه النموذج دفعة واحدة) تمتلئ أسرع بالعربية.
- فهم أضعف أحيانًا: التقطيع غير الدقيق قد يفصل الكلمة عن معناها، فيخطئ النموذج في التشكيل أو الإعراب أو اللهجات.
تظهر هذه المسألة في حياتك كلما استخدمت روبوت محادثة بالعربية، أو دفعت مقابل واجهة برمجة تطبيقات، أو لاحظت أن النموذج "ينسى" بداية محادثة عربية طويلة أسرع من الإنجليزية. النماذج الأحدث، مثل إصدارات ChatGPT وClaude الحديثة، حسّنت ترميز العربية فانخفض عدد التوكنات، لكن الفجوة مع الإنجليزية لم تُغلق بالكامل بعد.
✓ استخدام صحيح
صاحب متجر إلكتروني سعودي يبني روبوت محادثة لخدمة العملاء بالعربية، فيقارن قبل الاختيار كيف يرمّز كل نموذج نصوصه العربية، لأن الفارق قد يعني ضعف الفاتورة الشهرية.
لماذا: استخدام صحيح لأن عدد التوكنات هو أساس التسعير، ومقارنة كفاءة الترميز العربي قرار مالي عملي قبل الالتزام بنموذج معين.
طالبة تلخّص بحثًا عربيًا طويلًا بنموذج لغوي، فتقسّمه إلى أجزاء لأنها تعرف أن النص العربي يستهلك توكنات أكثر وقد يتجاوز نافذة السياق.
لماذا: فهم صحيح للعلاقة بين الترميز العربي وسعة النموذج، فقسّمت النص بدل أن تتفاجأ بقطع الملخص أو تجاهل أجزاء منه.
✕ خطأ شائع
موظف يظن أن "الترميز العربي" يعني تشفير النص العربي لحمايته من الاختراق، فيسأل عن قوة التشفير.
الصواب: خطأ شائع بسبب تشابه اللفظ. الترميز هنا (Tokenization) لا علاقة له بالتشفير الأمني (Encryption). الأول تقطيع لغوي لفهم النص، والثاني حماية للبيانات.
صانع محتوى يفترض أن كل كلمة عربية تساوي توكن واحد، فيحسب تكلفة مقالاته على واجهة برمجة التطبيقات بعدد الكلمات فقط.
الصواب: حساب خاطئ سيفاجئه بفاتورة أعلى. الكلمة العربية الواحدة تتحول غالبًا إلى 2 أو 3 توكنات أو أكثر. الصواب استخدام أدوات عدّ التوكنات التي توفرها الشركات قبل تقدير التكلفة.
كيف تميّزه بسرعة
الالتباس الأكثر شيوعًا هو الخلط بين الترميز (Tokenization) والتشفير (Encryption) بسبب تقارب الترجمتين. الترميز عملية لغوية داخل النموذج تقطّع النص لفهمه وحساب تكلفته، ولا علاقة لها بالأمان أو الخصوصية. تجنّب الخلط بتذكّر القاعدة: الترميز يُقطّع ليفهم، والتشفير يُخفي ليحمي.
لماذا يهمّك؟
كل من يستخدم الذكاء الاصطناعي بالعربية يدفع فعليًا ثمن جودة الترميز، سواء بالمال أو بجودة الإجابات. فهم هذا المصطلح يساعدك على اختيار النموذج الأنسب لغويًا وماليًا، وتفسير سبب ارتفاع تكلفة مشاريعك العربية مقارنة بالإنجليزية. كما يفسّر لماذا تتفاوت النماذج في فهم اللهجات والتشكيل والنصوص العربية الطويلة.
أدوات تستخدم هذا المفهوم
مصطلحات ذات صلة
كل ما يهمّك في الذكاء الاصطناعي، في 60 ثانية يوميًا
نرصد المئات من المصادر ونرسل لك الخلاصة فقط. بلا حشو، وبلا رسائل مزعجة.