108 نموذج ذكاء اصطناعي،
تحت المجهر.
دليل عملي للنماذج التي تشكّل الذكاء الاصطناعي في اللغة والبرمجة والصورة والفيديو والصوت وبيئة المؤسسات. يوضّح ما يتفوق فيه كل نموذج فعليًا، وأين يقصّر، ومن أين جاء، ومتى صدر.
- نماذج مرصودة
- 108
- فئات
- 06
- دول المنشأ
- 12
- حالات استخدام
- 116
الأعلى تقييمًا
43 نموذجًا لديها قياسات مستقلة كافية للتقييم. تُقيَّم كل فئة وفق معاييرها الخاصة، لذا يبقى هذا العرض المختلط دليلًا تقريبيًا — استخدم التبويبات للمقارنة بين المتماثلات.
الأعلى تقييمًا
- 01Claude Fable 5.1Anthropic · الولايات المتحدة · نماذج اللغةيقوده الاستدلال — 1,526 rating في مسائل LMArena الصعبة، وهو الأعلى مناصفةً بين نماذج اللغة.9.6
- 02Claude Opus 5Anthropic · الولايات المتحدة · نماذج اللغةيقوده الاستدلال — 1,525 rating في مسائل LMArena الصعبة، وهو الأعلى مناصفةً بين نماذج اللغة.متعادل إحصائيًا مع #19.6
- 03Claude Fable 5Anthropic · الولايات المتحدة · نماذج اللغةيقوده الاستدلال — 1,508 rating في مسائل LMArena الصعبة، وهو الثالث بين نماذج اللغة.متعادل إحصائيًا مع #19.5
- 04MiMo v2.6Xiaomi · الصين · نماذج اللغةيقوده الاستدلال — 1,511 rating في مسائل LMArena الصعبة، وهو الثالث بين نماذج اللغة.متعادل إحصائيًا مع #19.4
- 05DeepSeek V4.1 FlashDeepSeek · الصين · نماذج اللغةيقوده الكتابة — 1,436 rating في الكتابة الإبداعية على LMArena، وترتيبه 10 من 27 من نماذج اللغة.9.2
- 06GPT-5.6OpenAI · الولايات المتحدة · نماذج اللغةأقوى ما فيه الدقة — 87.6% consistent في لوحة Vectara للهلوسة، وترتيبه 12 من 16 من نماذج اللغة.متعادل إحصائيًا مع #59.2
- 07DeepSeek V4DeepSeek · الصين · نماذج اللغةيقوده الكتابة — 1,446 rating في الكتابة الإبداعية على LMArena، وترتيبه 8 من 27 من نماذج اللغة.متعادل إحصائيًا مع #59.1
- 08Gemini 3 FlashGoogle · الولايات المتحدة · نماذج اللغةأقوى ما فيه الدقة — 86.5% consistent في لوحة Vectara للهلوسة، وترتيبه 13 من 16 من نماذج اللغة.متعادل إحصائيًا مع #59.1
- 09GPT-6 AstraOpenAI · الولايات المتحدة · نماذج اللغةيقوده الكتابة — 1,423 rating في الكتابة الإبداعية على LMArena، وترتيبه 12 من 27 من نماذج اللغة.متعادل إحصائيًا مع #59.1
لا يُنشر سوى الصدارة. فكلما نزلنا في الترتيب صارت الدرجات في معظمها لنماذج أقدم محفوظة للرجوع إليها، أو لنماذج بالكاد تملك قياسات تكفي للتقييم، ما يجعل جدول «الأدنى تقييمًا» حديثًا عن ثغرات الأدلة أكثر منه عن المنتجات. وصفحة كل نموذج تعرض درجاته وما ينقصه.
تقيس الدرجة القدرة فقط: السعر والإتاحة مقاسان أيضًا، لكنهما يظهران في صفحة كل نموذج بدل دمجهما في هذا الرقم. وتُحتسب الدرجات عند الحد الأدنى لنطاق الثقة لكل مصدر، والنماذج المتداخلة النطاقات تُعلَّم متعادلة لأن الأدلة لا تفرّق بينها. أما النماذج التي تقل قياساتها المستقلة عن الحد المطلوب فهي قيد التقييم ولا تظهر هنا إطلاقًا. كيف يعمل التقييم
نماذج صُنعت في العالم العربي
مرتّبة بحسب إجادتها للعربية — وهو ما لا تقوله الدرجات أعلاه، لأن المقاييس التي تقف وراءها تُجرى بالإنجليزية. وتنشر لوحتان مستقلتان قياسًا للعربية في صورة يمكن قراءتها والتحقق منها. وتُعرض اللوحتان لكل نموذج، وتُدمجان في الرقم الذي يُرتَّب به الجدول.
AraGen v3 · 67 · 4 أبريل 2026OALL v2 · 163 · 2 مارس 2026
الأرقام الكبيرة نتيجة كل لوحة على مقياسها هي. أما ترتيب الجدول فبالرقم المجموع الذي بجانبها، ولذلك قد يحمل نموذج رقمًا عاليًا هنا ويبقى في أسفل الترتيب: فالرقم المجموع يحمل كلفة التحويل بين المقياسين، والصف يبيّن أي لوحة قاسته.
- 01Jais 2 70B ChatInception · الإماراتدُرّب من الصفر على العربية والإنجليزية بتعاون بين Inception وMBZUAI وCerebras، بمفردات عربية أولًا مبنية للعربية الفصحى واللهجات المحلية والتبديل بين العربية والإنجليزية. أوزانه مفتوحة برخصة Apache 2.0، إلا أن نافذته البالغة 8,192 رمزًا قصيرة بمقاييس اليوم.AraGen0.52 3C3H (0.48–0.57) · المركز 18 من 67 · 14 ديسمبر 2025OALLغير مقاسAraGen4.8OALL—غير مقاسالمجموع4.8
- 02Falcon H1 34B InstructTII · الإماراتنموذج أبوظبي الهجين بين Transformer وMamba، بـ 34 مليار معامل يغطي 18 لغة لا العربية وحدها. وقد أصدر TII بعده Falcon-H1-Arabic، وهو نسخة متخصصة في العربية لم تقِسها أي من لوحتي القياس هنا بعد.AraGen0.46 3C3H (0.41–0.51) · المركز 28 من 67 · 28 سبتمبر 2025OALLغير مقاسمتعادل إحصائيًا مع #1AraGen4.1OALL—غير مقاسالمجموع4.1
- 03Karnakمحوَّل عن OALLApplied Innovation Center · مصرنموذج مصر الحكومي، بُني في مركز الابتكار التطبيقي على أساس نموذج مفتوح الأوزان، ودُرّب على مواد منشورة في مصر وعبر العالم العربي، ويتعامل مع العربية الفصحى والعامية المصرية. وفُتح Karnak Chat تجربةً عامة في أغسطس 2026.AraGenغير مقاسOALL79.3% متوسط · المركز 1 من 163 · 15 فبراير 2026متعادل إحصائيًا مع #1AraGen—غير مقاسOALL7.9المجموع2.2
- 04Fanar 1 9B InstructQCRI · قطرنموذج قطر، استُكمل تدريبه من Gemma 2 على تريليون رمز عربي وإنجليزي في QCRI، ويغطي اللهجات الخليجية والشامية والمصرية، ومُواءَم عن قصد مع القيم الإسلامية والثقافة العربية. نافذته 4,096 رمزًا، وقد أعلن QCRI بعده Fanar 2.0 بـ 27 مليار معامل لم تقِسه أي من اللوحتين.AraGen0.16 3C3H (0.12–0.20) · المركز 54 من 67 · 30 سبتمبر 2025OALL70.3% متوسط · المركز 25 من 163 · 7 يونيو 2025AraGen1.2OALL7.0المجموع1.3
- 05Yehia 7Bمحوَّل عن OALLNavid AI · السعوديةتهيئة سعودية لنموذج ALLaM من سدايا، دُرّبت بطريقة GRPO على الصفات الست نفسها التي يحكم بها AraGen. ويتقدّم على ALLaM الذي بُني عليه بأقل من نصف نقطة في متوسط مقاييس العربية.AraGenغير مقاسOALL65.7% متوسط · المركز 48 من 163 · 3 مارس 2025متعادل إحصائيًا مع #4AraGen—غير مقاسOALL6.6المجموع1.3
- 06ALLaM 7B Instructمحوَّل عن OALLSDAIA · السعوديةنموذج السعودية الوطني، دُرّب من الصفر في المركز الوطني للذكاء الاصطناعي بسدايا على 5.2 تريليون رمز، منها 1.2 تريليون عربية وإنجليزية مختلطة. أوزانه مفتوحة برخصة Apache 2.0، ونافذته 4,096 رمزًا.AraGenغير مقاسOALL65.3% متوسط · المركز 53 من 163 · 19 فبراير 2025متعادل إحصائيًا مع #4AraGen—غير مقاسOALL6.5المجموع1.2
المقياسان غير متبادلين، فلا يُؤخذ متوسطهما ببساطة. بل يُلائَم خط على 25 نموذجًا خاضها الجانبان، والاتفاق عليها متوسط لا وثيق (r = 0.67). وتحويل نتيجة OALL إلى لغة AraGen يكلّف ±2.2 من العلامة بثقة 95%، ثم يُوزن الرقمان بحسب رسوخ كل منهما، فتزن الدرجة المقاسة مباشرةً أضعاف المحوَّلة.
ولذلك يحمل النموذج الذي قاسته لوحة واحدة نطاقًا واسعًا، وتُحتسب علامته عند حدّه الأدنى كسائر علامات الموقع، فيتعادل مع كثير من الجدول. وهذه قراءة صادقة لا خلل في الجدول: فعربيته جيدة بقدر ما تقوله اللوحة التي قاسته، أما ما يعنيه ذلك على المقياس الآخر فغير معلوم. فاقرأ عمودَي المصدرين لا الرقم المجموع وحده — وحيث يختلفان، فالاختلاف هو الخلاصة.
يتبع رقم كل لوحة القاعدة نفسها المتّبعة في بقية الموقع: نسبة منشورة مقسومة على 10، لا تقدير أبدًا. وهذه النماذج مفصولة عن المئة في الدليل لأنها تُقاس بمقاييس أخرى وفي ميدان آخر — فمركزها هنا لا يقول شيئًا عن موقعها عالميًا، ومركزها هناك لا يقول شيئًا عن عربيتها. كيف يعمل التقييم
خارج الإنجليزية
تفصل LMArena الأصوات العمياء المتقابلة نفسها بحسب لغة السؤال. وهذه نماذج الدليل في الأسئلة التي لم تكن بالإنجليزية — المصوّتون أنفسهم، والنماذج نفسها، وعمل مختلف. ولا تفرد أي ساحة العربية وحدها، ولهذا بُنيت اللوحة أعلاه على مقاييس عربية.
LMArena402 نموذجًا مقاسًا، نُشرت في 25 سبتمبر 2026
- 01Claude Fable 5.1Anthropic · الولايات المتحدةالمركز 1 من 402 خارج الإنجليزية · المركز 6 من 408 في الإنجليزية1,509 rating (1,501–1,517) · 5,914 votes9.4
- 02Claude Opus 5Anthropic · الولايات المتحدةالمركز 3 من 402 خارج الإنجليزية · المركز 3 من 408 في الإنجليزية1,500 rating (1,494–1,506) · 16,025 votesمتعادل إحصائيًا مع #19.3
- 03Claude Opus 5.5Anthropic · الولايات المتحدةالمركز 2 من 402 خارج الإنجليزية · المركز 5 من 408 في الإنجليزية1,513 rating (1,498–1,528) · 1,473 votesمتعادل إحصائيًا مع #19.3
- 04Claude Fable 5Anthropic · الولايات المتحدةالمركز 9 من 402 خارج الإنجليزية · المركز 7 من 408 في الإنجليزية1,483 rating (1,477–1,488) · 20,949 votes9.1
- 05Gemini 3 ProGoogle · الولايات المتحدةالمركز 15 من 402 خارج الإنجليزية · المركز 24 من 408 في الإنجليزية1,474 rating (1,470–1,479) · 25,032 votesمتعادل إحصائيًا مع #49.0
- 06MiMo v2.6Xiaomi · الصينالمركز 21 من 402 خارج الإنجليزية · المركز 9 من 408 في الإنجليزية1,474 rating (1,462–1,486) · 2,542 votesمتعادل إحصائيًا مع #48.9
- 07Gemini 3 FlashGoogle · الولايات المتحدةالمركز 31 من 402 خارج الإنجليزية · المركز 38 من 408 في الإنجليزية1,458 rating (1,453–1,464) · 18,810 votes8.8
- 08DeepSeek V4.1 FlashDeepSeek · الصينالمركز 40 من 402 خارج الإنجليزية · المركز 34 من 408 في الإنجليزية1,452 rating (1,443–1,462) · 4,161 votesمتعادل إحصائيًا مع #78.7
- 09GPT-5.6OpenAI · الولايات المتحدةالمركز 36 من 402 خارج الإنجليزية · المركز 48 من 408 في الإنجليزية1,450 rating (1,445–1,456) · 20,560 votesمتعادل إحصائيًا مع #78.7
- 10DeepSeek V4DeepSeek · الصينالمركز 49 من 402 خارج الإنجليزية · المركز 44 من 408 في الإنجليزية1,438 rating (1,434–1,443) · 32,388 votes8.5
- 11ERNIE 5.0Baidu · الصينالمركز 53 من 402 خارج الإنجليزية · المركز 68 من 408 في الإنجليزية1,436 rating (1,431–1,441) · 21,343 votesمتعادل إحصائيًا مع #108.5
- 12Claude Sonnet 5Anthropic · الولايات المتحدةالمركز 63 من 402 خارج الإنجليزية · المركز 56 من 408 في الإنجليزية1,431 rating (1,426–1,436) · 25,237 votesمتعادل إحصائيًا مع #108.4
- 13Gemma 4Google · الولايات المتحدةالمركز 71 من 402 خارج الإنجليزية · المركز 78 من 408 في الإنجليزية1,431 rating (1,422–1,441) · 3,811 votesمتعادل إحصائيًا مع #108.4
- 14GLM-5Zhipu AI · الصينالمركز 65 من 402 خارج الإنجليزية · المركز 47 من 408 في الإنجليزية1,430 rating (1,425–1,435) · 16,309 votesمتعادل إحصائيًا مع #108.4
- 15GPT-6 AstraOpenAI · الولايات المتحدةالمركز 72 من 402 خارج الإنجليزية · المركز 77 من 408 في الإنجليزية1,431 rating (1,422–1,440) · 4,297 votesمتعادل إحصائيًا مع #108.4
- 16Grok 4.6SpaceXAI · الولايات المتحدةالمركز 83 من 402 خارج الإنجليزية · المركز 110 من 408 في الإنجليزية1,422 rating (1,415–1,428) · 12,779 votesمتعادل إحصائيًا مع #108.3
يتجاوز 31 من نماذج الدليل حدّ الأصوات على هذه اللوحة. وتُعرض أعلى 16 منها، بدءًا بأعلى علامة.
يُحتسب المركزان في ميدان النماذج نفسه، فيمكن قراءة أحدهما مقابل الآخر — لكن اقرأهما برفق. فعند أي مركز تتداخل التقييمات داخل نطاقات ثقة بعضها بعضًا، حتى إن فرقًا بعشرين مركزًا لا يكاد يُميَّز من الضوضاء. والنموذج البعيد عن مركزه الإنجليزي يستحق النظر، أما بضعة مراكز فلا.
تُحتسب العلامة على مقياس الساحة الثابت عند الحد الأدنى لكل نطاق منشور، وهي القاعدة نفسها التي تتبعها درجات الدليل، ويُعامل أي تقييم دون 500 صوت معاملة غير المقاس لا الضعيف. كيف يعمل التقييم
نافذة السياق، كل النماذج في مشهد واحد
- Claude Opus 5.5
- GPT-6 Sol
- GPT-6 Luna
- Grok 4.7
- MiMo v2.6
- DeepSeek V4.1 Flash
- Claude Fable 5
- Claude Fable 5.1
- GPT-6 Astra
- GPT-5.6
- Claude Opus 5
- Claude Sonnet 5
- Claude Haiku 4.5
- Gemini 3 Pro
- Gemini 3 Flash
- Grok 4.6
- DeepSeek V4
- GLM-5
- Qwen3-Max
- Llama 4
- Mistral Medium 3.5
- Gemma 4
- Phi-4
- Mistral Small 4
- Kimi K2
- ERNIE 5.0
- Nemotron 3 Ultra
- Jamba 2
- Hunyuan Large
- Reka Flash 3
- Grok 4 Fast
- Doubao 1.5
- Solar Pro 2
- Yi-Lightning
- Aya Expanse
- GPT-4o
- Command R+
- Step 5 Preview
- GPT-5.3 Codex
- Claude Opus 4.6 (Claude Code)
- Qwen3 Coder 480B
- Cursor Composer
- MiniMax M2.1
- Devin
- GitHub Copilot
- Amazon Q Developer
- Windsurf
- Tabnine
- Replit Agent
- Aider
- Gemini 3 Flash
- Gemini 3 Pro
- GLM-5
- Claude Haiku 4.5
- GPT-6 Astra
- Midjourney V8.1
- GPT Image 2
- Gemini 3 Pro Image
- FLUX.2
- Ideogram 4
- Recraft V4.1
- Adobe Firefly Image 5
- Seedream 5.0
- Grok Imagine Image
- DALL-E 3
- Stable Diffusion 3.5
- Leonardo AI
- Playground v3
- NightCafe
- Microsoft Designer
- Kandinsky 4
- Luma Photon
- Freepik Mystic
- Veo 3.1
- Sora 2
- Kling 3
- Runway Gen-4.5
- Seedance 2
- Luma Ray 3.2
- MiniMax Hailuo 2.3
- Wan 2.7
- Grok Imagine Video
- Pika 2.5
- CogVideoX
- Haiper 2.5
- Vidu Q3
- Genmo Mochi 1
- LTX-2.3
- HunyuanVideo 1.5
- Synthesia
- D-ID
- Suno v5
- Udio v4
- ElevenLabs (Voice & Music)
- Google Lyria 3
- MiniMax Music 2.5
- Stable Audio 2.5
- Whisper
- Murf AI
- Play.ht (PlayAI)
- WellSaid Labs
- Descript Overdub
- AIVA
- Boomy
- Amazon Polly
- Perplexity Sonar / Deep Research
- NotebookLM
- Cohere Command A+
- Amazon Nova
- Glean
- Microsoft 365 Copilot
- You.com
- Writer Palmyra
في هذا الدليل
آخر ما صدر
من أين تأتي النماذج
دولة المقر الرئيسي لكل جهة صانعة. تتركّز الصدارة في بلدين، لكن أوروبا والخليج وإسرائيل وآسيا والمحيط الهادئ تصدر جميعها نماذج تستحق المتابعة.
- الولايات المتحدة62
- الصين22
- المملكة المتحدة6
- كندا4
- إسرائيل4
- أستراليا2
- فرنسا2
- ألمانيا1
- لوكسمبورغ1
- روسيا1
- كوريا الجنوبية1
- إسبانيا1