الجملة نفسها تكلّف أكثر بالعربية
تُسعَّر النماذج كلها بالرمز، وقوائم الأسعار متاحة للمقارنة في كل مكان. أما ما لا تخبرك به أي قائمة أسعار فهو كم رمزًا يصير إليه نصك فعلًا — وذلك يتوقف على الخط الذي تكتب به. فالمعنى نفسه قد يكلّف 429 رمزًا بالعربية على نموذج و1483 على آخر، لعمل واحد وبالسعر نفسه للرمز. وهذه أرقام مقيسة لا مقدَّرة.
فاتورتك هي سعر الرمز مضروبًا في عدد الرموز. النصف الأول منشور في كل مكان، والنصف الثاني غير منشور أصلًا. وفي الأعمال العربية يتفاوت هذا النصف الثاني بمقدار 3.6× بين النماذج المقيسة هنا، وهو فارق قد يفوق أي فرق في السعر بينها.
جملة واحدة، بثمانية عشر وجهًا
الكلمات نفسها عبر كل مُرمِّز، فلا يتغير بين هذه الأرقام إلا المفردات التي تقرؤها. الإنجليزية تستقر على نحو عشرين رمزًا في كل مكان تقريبًا. أما العربية فتتراوح من 13 رمزًا إلى 52 — بفارق 4.0×، لجملة واحدة لم يمسّها أحد بينهما. فالنموذج الذي تعلّم الخط يُبقي الكلمات كاملة، والذي لم يتعلّمه ينفق عدة رموز على الحرف الواحد.
In the UAE, everyone is Emirati through their love for this land and their contributions to it.
في الإمارات الكل إماراتي، بحبه لهذه الأرض وعطائه لها.
ALLaM 7B
SDAIAنموذج كبيرالمفردات 64,000المربّع المعلَّم بـ · رمز ليس حرفًا أصلًا — شظيّة من تسلسل UTF-8 لا تعني شيئًا بمفردها. وتُعرض ولا تُخفى، لأن صفًّا منها هو بيت القصيد.
ولاحظ أن العربية هنا أقصر من الإنجليزية على المُرمِّزات الأفضل. فالجمل المفردة تتفاوت، وهذه الجملة موجزة في العربية على غير المعتاد — أما الأرقام المقيسة على النصوص كاملة، وفيها تكلّف العربية أكثر على كل مُرمِّز بلا استثناء، ففي الجدول أدناه.
هل النموذج الصغير أقل كلفة؟
النموذج الصغير هو النصيحة المعتادة لخفض الكلفة: يعمل على أجهزتك، وسعر الرمز فيه أرخص، وهو في كثير من المهام كافٍ. أما في الأعمال العربية فالنصيحة ناقصة، لأن النموذج الصغير كثيرًا ما يُعطى مفردات صغيرة — ومن يدفع ثمن المفردات الصغيرة هو الخط الذي لم يُبنَ النموذج حوله.
لكن الصغير ليس رديئًا بالضرورة، والكبير ليس مأمونًا بالضرورة. فالمجموعتان في النماذج المقيسة هنا تغطيان المدى نفسه تقريبًا: الكبيرة من 1.19× إلى 3.83×، والصغيرة من 1.32× إلى 4.22×. وأفضل نموذج صغير يتفوق على كل الكبيرة إلا واحدًا، وأسوأ نموذج كبير أسوأ من أكثر الصغيرة.
وأوضح دليل زوجٌ من عائلة واحدة. فهذان يتساويان إلى المنزلة العشرية الثانية لأنهما يتشاركان المُرمِّز نفسه — أي أن الأصغر لا يدفع في العربية أي ثمن لكونه أصغر:
اسأل عن المفردات التي أُعطيها النموذج لا عن عدد معاملاته. الأولى تخبرك بكلفة عربيتك، والثاني لا يخبرك عنها بشيء.
العربية والصينية، قياسًا بالإنجليزية
الرموز اللازمة للمواد الـ6 نفسها، نسبةً إلى الإنجليزية. وما دون 1.00 يعني أن اللغة أرخص من الإنجليزية على ذلك النموذج. مرتبة بحسب رقم العربية، الأفضل أولًا.
نص القياس — 6 مواد تستضيفها الأمم المتحدة
| النموذج | المفردات | الإنجليزية | العربية | الصينية |
|---|---|---|---|---|
| ALLaM 7BSDAIAنموذج كبير | 64,000 | 362 | 1.19× | 3.87× |
| Falcon H1 34BTIIنموذج كبير | 261,120 | 350 | 1.31× | 0.87× |
| BLOOMZ 560MBigScienceنموذج صغير | 250,680 | 356 | 1.32× | 0.83× |
| Aya 101Cohereنموذج كبير | 250,100 | 463 | 1.35× | 0.80× |
| Jais family 13BInceptionنموذج كبير | 84,992 | 356 | 1.37× | 2.11× |
| GPT-4o / GPT-5 familyOpenAIنموذج كبير | — | 352 | 1.62× | 1.16× |
| gpt-oss 20BOpenAIنموذج كبير | 199,998 | 352 | 1.62× | 1.16× |
| Fanar 1 9BQCRIنموذج كبير | 128,256 | 357 | 1.63× | 1.77× |
| Gemma 2 9BGoogleنموذج كبير | 256,000 | 350 | 1.67× | 1.01× |
| Gemma 2 2BGoogleنموذج صغير | 256,000 | 350 | 1.67× | 1.01× |
| DeepSeek V3DeepSeekنموذج كبير | 128,000 | 351 | 1.74× | 0.90× |
| Qwen3 8BAlibabaنموذج كبير | 151,643 | 354 | 1.81× | 0.92× |
| Qwen2.5 0.5BAlibabaنموذج صغير | 151,643 | 354 | 1.81× | 0.92× |
| Llama 3.xMetaنموذج كبير | 128,000 | 354 | 1.82× | 1.22× |
| AceGPT v2 8BFreedomIntelligenceنموذج كبير | 128,000 | 354 | 1.82× | 1.22× |
| GPT-4 / GPT-3.5OpenAIنموذج كبير | — | 354 | 3.25× | 1.76× |
| Phi-3.5 miniMicrosoftنموذج صغير | 32,000 | 399 | 3.60× | 1.88× |
| Mistral 7BMistral AIنموذج كبير | 32,768 | 369 | 3.83× | 1.54× |
| SmolLM2 1.7BHugging Faceنموذج صغير | 49,152 | 351 | 4.22× | 2.52× |
العبرة بالمفردات لا بالحجم
لكل مُرمِّز مفردات ثابتة، وما خرج عنها يُكسَّر إلى أجزاء. فالنماذج ذات المفردات الكبيرة فيها متسع للكلمات العربية والصينية، وذات المفردات الصغيرة تنفق ذلك المتسع على الإنجليزية وتدفع ثمن كل خط آخر حرفًا حرفًا. والأمر يتبع حجم المفردات تتبّعًا شبه تام — لا حجم النموذج. فـBLOOMZ 560M لديه 250,680 رمزًا في مفرداته ويتعامل مع العربية أفضل من نماذج تفوقه حجمًا أضعافًا، بينما Mistral 7B لا يفعل. بل إن نموذجين من عائلة واحدة، أحدهما ستة عشر ضعف الآخر، يتساويان تمامًا لأنهما يتشاركان المُرمِّز نفسه.
شهريًا وسنويًا، بأرقامك أنت
حدّد حجم عملك والسعر الذي تدفعه فعلًا. فأعداد الرموز مقيسة، أما السعر فسعرك أنت، لأن النماذج التي تنشر أسعارها والنماذج التي تنشر مُرمِّزاتها ليست القائمة نفسها، وقرن إحداهما بالأخرى تخمين.
رموز الإدخال فقط، بمعدل 1.15 رمز لكل كلمة إنجليزية مقيسًا على هذه النصوص. أما الإخراج فيُسعَّر على حدة وغالبًا أعلى، وتنطبق عليه النسبة نفسها.
نماذج لا تنشر مُرمِّزاتها
لا يمكن عرض عدد إلا حيث يكون المُرمِّز منشورًا. وهذه تُركت بلا رقم بدل تقديرها:
- Claudeلا تنشر Anthropic مُرمِّزًا بأي صورة.
- Geminiلا تنشر Google مُرمِّز Gemini، والأعداد لا تأتي إلا من واجهة برمجية محاسَبة.
- ALLaMنموذج السعودية الوطني لا ينشر ملف مُرمِّز على عنوانه.
- Aya Expanseمحجوب. وAya 101 المقيس أعلاه نموذج آخر أقدم.
من أين جاءت كل مفردات
تحجب Meta وGoogle وInception مستودعاتها، فثلاثة من الصفوف أعلاه قُرئت من نسخ منشورة لا من أصحابها. والنسخة لا تساوي إلا بقدر أمانتها، فقوبلت كل واحدة بنسخة ثانية من ناشر لا صلة له بالأول: حجم المفردات نفسه، ومعرّفات الرموز نفسها للنص نفسه، رقمًا رقمًا. وحين يتفق طرفان لا صلة بينهما اتفاقًا تامًا، فالنسخة هي الأصل.
- ALLaM 7Bقُرئ من JasperV13/Yehia-7B-DPO-Reasoning-previewقوبل بـ ALLaM-AI/ALLaM-7B-Instruct-preview tokenizer.model, byte-identical
- Gemma 2 9Bقُرئ من unsloth/gemma-2-9b-itقوبل بـ rinna/gemma-2-baku-2b
- Gemma 2 2Bقُرئ من unsloth/gemma-2-2b-itقوبل بـ rinna/gemma-2-baku-2b
- Llama 3.xقُرئ من NousResearch/Meta-Llama-3.1-8B-Instructقوبل بـ unsloth/Llama-3.3-70B-Instruct
المنهجية
تتطلب مقارنة المُرمِّزات بين اللغات نصوصًا متوازية تحمل المعنى نفسه على وجه التقريب. يستخدم هذا القياس المواد الـ6 نفسها من الإعلان العالمي لحقوق الإنسان في صفحات الأمم المتحدة الإنجليزية والعربية والصينية، لأنها نصوص ثابتة وكافية الحجم ومتقاربة المحتوى. أما موضوعها فعرضي: هذا قياس للترميز، لا تقييم لمعرفة حقوق الإنسان أو سياساتها.
والجملة المعروضة مقسَّمة رمزًا رمزًا منفصلة عن نصوص القياس عن قصد. فهي منقولة عن موقع رئيس الدولة الذي ينشرها بالعربية والإنجليزية، ولا تُستخدم إلا لإظهار انقسام النص إلى رموز. ولأنها موجزة في العربية على غير المعتاد، فإن إدخالها في النسب سيحرف المقارنة. فكل نسبة ورقم كلفة هنا مصدره الإعلان، والاقتباس لا يمد الصفحة إلا بالتقسيم المرئي.
ويُشغَّل على النص كل مُرمِّز منشور متاح: ملفات الرتب من OpenAI لمُرمِّزات GPT، وملفات المُرمِّز من Hugging Face لسائرها. وحين يكون مستودع المالك محجوبًا، يبيّن قسم مصادر الملفات النسخة المنشورة الموثقة والمقابلة بنسخة مستقلة. أعداد الرموز دقيقة لهذه النصوص، ولا تستند إلى قاعدة تخمينية.
وتُحسب النسب على النصوص كلها لا كمتوسط للمواد، فتزن المادة الطويلة أكثر من القصيرة — وهكذا تعمل الفاتورة.
والسجل اللغوي هنا رسمي قانوني. والنسب تتحرك بعض الشيء مع السجل، فخذ هذه الأرقام على أنها شكل المسألة لا رقمًا تقتبسه بمنزلتين عشريتين على نصك أنت.
النصوص Universal Declaration of Human Rights · قيس في 28 سبتمبر 2026