النسب المئوية تتحول مباشرة إلى درجات
حين ينشر اختبار عام نسبة مئوية، تكون الدرجة تلك النسبة مقسومة على عشرة. فـ72% تصبح 7.2. ولا تتحرك الدرجة حين تُضاف نماذج أخرى.
SWE-bench Verified: 75.6% ← 7.6
الدرجة لا قيمة لها ما لم تر كيف صُنعت. تشرح هذه الصفحة كل خطوة، بكلام مبسّط أولًا، ثم بالتفصيل الكامل.
الإصدار 2.3 · 26 سبتمبر 2026 · 43 من 108 نموذجًا مقيَّمة. والبقية تبقى فارغة حتى تتوافر أدلة كافية.
لا يُقيَّم السمك بقدرته على تسلّق الشجر. فنماذج الصور تُقيَّم بأمور كجودة الصورة والالتزام بالتعليمات، ونماذج المحادثة بالاستدلال والدقة والسرعة. ولكل فئة موادها الخاصة.
الاستدلال: 9. الدقة: 8. الكتابة: 7. وكل درجة مصدرها قياس عام أو قائمة تحقق منشورة، لا انطباع شخصي.
في نموذج المحادثة، يمثل الاستدلال 45% من الدرجة النهائية والكتابة 15%. ووزن كل مادة مكتوب بجانبها (w45، w15).
تكلفة النموذج لا تغيّر ما يستطيع فعله، ولذلك يُقاس السعر والإتاحة ويظهران في كل بطاقة لكن خارج الدرجة. وإلا تفوّق نموذج رخيص على آخر أقوى في ترتيب يدّعي أنه يقول أيهما أفضل.
حين ينشر المصدر هامش خطأ نأخذ طرفه المتحفظ، والنموذج الذي اختُبر بضع مئات المرات فقط لا يأخذ درجة أصلًا. والنموذجان المتداخلان في الهامش يظهران متعادلين، لأن الأدلة لا تفرّق بينهما.
الدرجات العالية في المواد الثقيلة ترفع النتيجة أكثر من مثيلاتها في المواد الخفيفة. وهذا هو الرقم في زاوية البطاقة، مثل 8.2/10.
يحتاج النموذج إلى درجات تغطي 80% على الأقل مما يُحتسب قبل أن ينال درجة نهائية، حتى لا تجعله مادة واحدة محظوظة يبدو رائعًا.
لا تدفع الشركات مقابل الإدراج أو التقييم، ولا ترى الدرجات قبل نشرها. وإن كان رقم خاطئًا، فعلاجه دليل أفضل لا مكالمة هاتفية.
يُقيَّم كل معيار بإحدى ثلاث قواعد. والقاعدة المستخدمة والمصدر والتاريخ تظهر بجانب كل درجة في صفحة النموذج، فيمكن التحقق من أي رقم.
حين ينشر اختبار عام نسبة مئوية، تكون الدرجة تلك النسبة مقسومة على عشرة. فـ72% تصبح 7.2. ولا تتحرك الدرجة حين تُضاف نماذج أخرى.
SWE-bench Verified: 75.6% ← 7.6
تُوضع تقييمات الساحات والسعر وطول السياق بين حد أدنى درجته 0 وحد أعلى درجته 10، وكلاهما منشور أدناه وثابت. وحين يعطي المصدر نطاق ثقة، تُحتسب الدرجة عند حده الأدنى. ولا شيء يتوقف على النماذج الأخرى التي نصادف إدراجها.
تقييم 1,450 على مقياس 700–1,550 ← 8.8
أمور مثل الترخيص أو ضوابط البيانات لا تُختبر بالأرقام، فلكل منها قائمة من خمسة بنود، كل بند بنقطتين. وتُنشر كل قائمة في هذه الصفحة قبل تقييم أي نموذج بها.
استيفاء 4 من 5 بنود ← 8.0
ضُبط كل مقياس في 20 سبتمبر 2026 من المدى المنشور للوحة الصدارة نفسها: الحد الأدنى هو أقل تقييم مدرج فيها والحد الأعلى أعلاه، مقرَّبين إلى أقرب 50 للخارج. وهي ثابتة. وتغيير أحدها يعني إدخالًا جديدًا في سجل التغييرات أسفل هذه الصفحة، وإعادة احتساب كل الدرجات.
| القياس | درجته 0 | درجته 10 | الشكل |
|---|---|---|---|
| LMArena text (hard prompts) | 700 | 1,550 | متساوٍ |
| LMArena text (creative writing) | 750 | 1,550 | متساوٍ |
| LMArena WebDev | 1,050 | 1,800 | متساوٍ |
| LMArena text-to-image | 850 | 1,450 | متساوٍ |
| LMArena text-to-image (text rendering) | 850 | 1,500 | متساوٍ |
| LMArena text-to-image (commercial design) | 850 | 1,450 | متساوٍ |
| LMArena image edit | 950 | 1,550 | متساوٍ |
| LMArena text-to-video | 1,000 | 1,550 | متساوٍ |
| LMArena image-to-video | 950 | 1,500 | متساوٍ |
| LMArena text (non-English prompts) | 750 | 1,550 | متساوٍ |
| السعر المخلوط لكل مليون توكن | $30 | $0.05 | ×10 steps |
| نافذة السياق (توكن) | 8,192 | 1,048,576 | ×10 steps |
«متساوٍ» يعني خطوات متساوية: فمنتصف المسافة بين الحدين درجته 5. و«خطوات ×10» تعني أن كل تضاعف عشري يحرّك الدرجة بالمقدار نفسه، وهكذا يتغير السعر وطول السياق فعلًا — فالفرق بين 0.10$ و1$ يساوي في أهميته الفرق بين 1$ و10$. وأي قياس يتجاوز أحد الطرفين يُقيَّد عنده، فلا شيء ينزل تحت 0 ولا يعلو فوق 10.
لوحات الصدارة العامة هي المادة الخام هنا، وهي منسوبة إلى أصحابها في كل درجة. وأربعة اختيارات مقصودة تفصل الدرجة في هذا الموقع عن مركز في أي منها.
التفضيل البشري يخبرك بما أعجب الناس. ولا يخبرك إن كانت الإجابة صحيحة، ولا إن كانت الشيفرة تعمل. والدرجة هنا تجمع أصوات التفضيل مع النجاح في مهام حقيقية من GitHub ومع الاتساق الواقعي المقاس، لأن مؤشرًا واحدًا لا يغطي ما وُجد النموذج له.
التقييم تقدير له هامش خطأ، وهذا الهامش أوسع لنموذج اختُبر بضع مئات المرات منه لنموذج اختُبر خمسين ألف مرة. وتُحتسب الدرجات عند الحد الأدنى للنطاق المنشور، فلا يبدو ضعف الاختبار تفوّقًا، وأي تقييم دون 500 صوت لا يُستخدم إطلاقًا.
حين يتداخل نطاقا نموذجين، تعجز الأدلة عن التفريق بينهما، فتعلّمهما لوحة الصدارة متعادلين إحصائيًا بدل عرض ترتيب هو في حقيقته ضجيج.
«رخيص» و«جيد» ادعاءان مختلفان. وكلاهما مقاس هنا، وكلاهما معروض في صفحة كل نموذج، لكن القدرة وحدها هي التي تحدد الترتيب — فتجيب اللوحة عن سؤال واحد في كل مرة.
لا شيء من هذا يجعل الدرجة الكلمة الأخيرة. فكل لوحة صدارة وراءها تقيس ما تستطيع قياسه، على الأسئلة التي جمعتها مصادفةً، في لحظة واحدة من الزمن. وما تضيفه هذه المنهجية أن كل رقم يمكن تتبّعه إلى مصدر عام مؤرَّخ، محسوب بقواعد منشورة، وصادق في بيان مدى رسوخه.
كلها مستقلة وعامة. وتُنسخ بياناتها في لقطة مؤرَّخة، فلا تتغير الدرجات إلا حين تُحدَّث اللقطة، والتاريخ ظاهر مع كل درجة.
Human-preference ratings from blind, side-by-side votes: text (hard prompts, creative writing), web development, text-to-image, image editing, text-to-video, and image-to-video. Its English and non-English categories split the same votes by the language of the prompt; they feed the multilingual board rather than any score.
Arenas published 2026-09-13 to 2026-09-25
How often a model sticks to the facts in a document it summarises (factual consistency rate).
Share of real GitHub issues resolved. Only runs using the same open harness (mini-SWE-agent) are counted, so results are comparable.
List prices, context windows, supported features, and the number of independent providers serving each model.
المصادر أعلاه تُجرى بالإنجليزية، فهي لا تقول شيئًا عن إجادة النموذج للعربية. وهذان المصدران يقولان، وهما لوحتا القياس العربيتان الوحيدتان اليوم اللتان تنشران نتائجهما في صورة يستطيع أي أحد قراءتها والتحقق منها. وهما يغذّيان لوحة النماذج العربية في الصفحة الرئيسة لا درجات الدليل: فمركز النموذج هناك قياس منفصل في ميدان نماذج مختلف، ولا تقرأ أيًّا من الرقمين على أنه الآخر.
تعرض الصفحة الرئيسة اللوحتين لكل نموذج ورقمًا مجموعًا واحدًا. ولا يُؤخذ متوسطهما ببساطة: فالمقياسان غير متبادلين، وعلى 25 نموذجًا خاضها الجانبان يكون الاتفاق متوسطًا لا وثيقًا (r = 0.67). ولذلك يُلائَم خط على تلك النماذج 25 بالضبط — AraGen ≈ -0.169 + 0.795 × OALL — وتُحوَّل نتيجة OALL إلى لغة AraGen حاملةً خطأ ±2.2 من العلامة بثقة 95%، ثم يُجمع الرقمان بوزن كلٍّ منهما بحسب رسوخه. ولذلك يحمل النموذج الذي قاسته لوحة واحدة نطاقًا واسعًا، وتُحتسب علامته — وفق قاعدة الحد الأدنى أعلاه — منخفضة فيتعادل مع كثير من الجدول. وهذا كلام الأدلة لا خلل في الجدول.
Free-form Arabic answers scored on six qualities — correctness, completeness, conciseness, helpfulness, honesty and harmlessness — by a judge model (claude-sonnet-4-20250514), published with a bootstrap 95% interval. 67 models measured.
The average of seven native Arabic benchmarks — AlGhafa, ArabicMMLU, EXAMS, MadinahQA, AraTrust, ALRAGE, ArbMMLU-HT — run zero-shot through LightEval. 163 models measured.
نقطتان لكل بند، تُراجَع على بيانات OpenRouter.
هذا مثال لنموذج لغوي. وهو ليس نموذجًا حقيقيًا؛ الدرجات مفترضة لبيان طريقة الحساب. والأرقام أدناه محسوبة بالشيفرة نفسها التي تقيّم الدليل.
| المعيار | الدرجة | الوزن | الدرجة × الوزن |
|---|---|---|---|
| Reasoning | 9 | 45 | 405 |
| Accuracy | 8 | 20 | 160 |
| Writing | 7 | 15 | 105 |
| Long context | 6 | 20 | 120 |
| الإجمالي | 100 | 790 |
790 ÷ 100 = 7.9
اجمع حاصل ضرب كل درجة في وزنها، ثم اقسم على مجموع الأوزان. ويُقرَّب الناتج إلى منزلة عشرية واحدة، في النهاية فقط. والسعر والإتاحة ليسا في هذا الجدول: فهما مقاسان ومعروضان في صفحة النموذج، لكنهما لا يُحتسبان في الدرجة.
بدرجتي الاستدلال والكتابة فقط، تغطي الأدلة 60% من الوزن، أي دون حد 80%. فلا توجد درجة إجمالية، وتقول البطاقة «قيد القياس» بدلًا منها. وحالما يتجاوز النموذج الحد، يستخدم المتوسط الدرجات الموجودة وأوزانها فقط.
مقدار استخدام كل حالة، من مؤشر Anthropic الاقتصادي. وهو يقيس ما يطلبه الناس من الذكاء الاصطناعي لا أي نموذج أجاب، والشائع ليس هو الجيد — ولذلك لا يُحتسب الاستخدام أبدًا في درجة أي نموذج.
اطّلع على حالات الاستخدامحصة الدولة من الاستخدام العالمي، واستخدامها لكل فرد، من المؤشر نفسه. وهما يصفان أين يُستخدم الذكاء الاصطناعي، لا جودة أي نموذج في تلك الدولة.
اطّلع على الخريطةالأوزان نسبية داخل كل بطاقة وتُعرض كحصة من الإجمالي. وهي مثبّتة قبل التقييم؛ وإن تغيّر أحدها، أُعيد احتساب كل درجة متأثرة وسُجّل التغيير أدناه.
| المعيار · ومصدر قياسه | الوزن |
|---|---|
Reasoning Preferred by people on hard, multi-step prompts. Rule BLMArena text arena, hard prompts | 45% |
Accuracy Sticks to the facts it was given, with few hallucinations. Rule AVectara hallucination leaderboard, factual consistency rate | 20% |
Writing Preferred by people for creative and long-form writing. Rule BLMArena text arena, creative writing | 15% |
Long context How much text it can take in at once. Rule BOpenRouter, context window | 20% |
Cost efficiency Price per token; cheaper is better. Rule BOpenRouter, blended price per token | يُعرض
ولا يُقيَّم |
Deployability Open weights, choice of hosts, and integration features. Rule CDeployability checklist (OpenRouter data) | يُعرض
ولا يُقيَّم |
| المعيار · ومصدر قياسه | الوزن |
|---|---|
Code quality Share of real GitHub issues it resolves on its own. Rule ASWE-bench Verified, % resolved (mini-SWE-agent harness) | 45% |
Web development Preferred by people for building working web apps. Rule BLMArena WebDev arena | 40% |
Codebase context How much code it can take in at once. Rule BOpenRouter, context window | 15% |
Cost efficiency Price per token; cheaper is better. Rule BOpenRouter, blended price per token | يُعرض
ولا يُقيَّم |
| المعيار · ومصدر قياسه | الوزن |
|---|---|
Image quality Preferred by people across all kinds of image prompts. Rule BLMArena text-to-image arena | 40% |
Text rendering Preferred by people for images that contain text. Rule BLMArena text-to-image, text rendering | 20% |
Commercial design Preferred by people for ads, product shots, and branding. Rule BLMArena text-to-image, commercial design | 20% |
Editing Preferred by people for editing existing images. Rule BLMArena image-edit arena | 20% |
| المعيار · ومصدر قياسه | الوزن |
|---|---|
Text-to-video Preferred by people for video made from a written prompt. Rule BLMArena text-to-video arena | 60% |
Image-to-video Preferred by people for video made from a starting image. Rule BLMArena image-to-video arena | 40% |
| المعيار · ومصدر قياسه | الوزن |
|---|---|
Output quality Naturalness, fidelity, and musicality — or transcription accuracy. غير مقيَّم بعد: لا مصدر مستقل | 35% |
Control Steering of voice, emotion, structure, or style. غير مقيَّم بعد: لا مصدر مستقل | 20% |
Language coverage Breadth and quality across languages and accents. غير مقيَّم بعد: لا مصدر مستقل | 15% |
Latency Fast enough for real-time or high-volume use. غير مقيَّم بعد: لا مصدر مستقل | 10% |
Licensing & safety Commercial rights and consent safeguards. غير مقيَّم بعد: لا مصدر مستقل | 10% |
Cost efficiency Price per minute or per track. غير مقيَّم بعد: لا مصدر مستقل | 10% |
| المعيار · ومصدر قياسه | الوزن |
|---|---|
Answer grounding Accurate answers anchored in retrieved sources. غير مقيَّم بعد: لا مصدر مستقل | 30% |
Citations Clear, checkable references back to sources. غير مقيَّم بعد: لا مصدر مستقل | 20% |
Integrations Connectors to company data, clouds, and tools. غير مقيَّم بعد: لا مصدر مستقل | 20% |
Governance Permissions, audit, data residency, and admin controls. غير مقيَّم بعد: لا مصدر مستقل | 15% |
Cost efficiency Predictable pricing at organisational scale. غير مقيَّم بعد: لا مصدر مستقل | 15% |
إن تغيّرت قاعدة أو وزن، يُدرج هنا بتاريخه، وتُعاد حساب كل درجة متأثرة.