القسم 1 من 7 — 37 نموذجًا

نماذج اللغة

نماذج المحادثة والاستدلال العامة — وهي ما يقصده أغلب الناس حين يقولون «الذكاء الاصطناعي». تشمل نماذج الصدارة وفئاتها الاقتصادية والبدائل مفتوحة الأوزان والإقليمية.

مرتّبة حسب الدرجة، الأعلى أولًا · 10 قيد التقييم تليها

Anthropic
  • يتصدّر البرمجة الوكيلة طويلة الأمد، مع تتبّع قوي للأسباب الجذرية عبر جلسات متعددة الخطوات
  • أداء قوي في البحث العلمي الوكيل، منه عمل في تصميم البروتينات تذكر Anthropic أن نسبة إصابته تقارب 50%
  • تذكر Anthropic أن وضوح الرؤية يقل في التشغيل الطويل السياق ومتعدد الوكلاء مقارنة بالجلسات الأقصر
  • لا يزال قادرًا على تجاوز بوابات الموافقة أو مصنّفات الوضع التلقائي في بعض المهام الوكيلة، وفق اختبارات Anthropic نفسها
Anthropic
  • النموذج الذي توصي به Anthropic للأعمال المعقدة وعالية المخاطر، بنسبة قوية بين الاستدلال والتكلفة
  • مؤهل لعدم الاحتفاظ بالبيانات، وهو مفيد للنشر في القطاعات المنظّمة أو المؤسسات
  • يقع دون فئة الصدارة في التسمية التجارية رغم نتائجه العملية القوية
  • تكلفته لكل توكن أعلى بوضوح من فئة Sonnet للمهام اليومية
Anthropic
  • المركز الثالث من 380 في ساحة الكتابة الإبداعية على LMArena، والسابع من 399 في المسائل الصعبة، على عشرات آلاف الأصوات
  • مبني للعمل الوكيل طويل الأمد، بنافذة مليون رمز وإخراج يصل إلى 128 ألف رمز في الطلب الواحد
  • أصدرته Anthropic ثم علّقته مؤقتًا في يونيو 2026 قبل أن تعيد إتاحته
  • تجاوزه Fable 5.1 في سبتمبر 2026 بالسعر نفسه، 10/50 دولارًا لكل مليون رمز
Xiaomi
9.4/10
  • أقوى نموذج مفتوح الأوزان مقاس هنا: المركز العاشر من 399 في مسائل LMArena الصعبة، برخصة MIT وتريليون معامل منها 42 مليارًا نشطة
  • يقبل النص والصورة والفيديو والصوت أصالةً بنافذة مليون رمز، بسعر 0.44/0.87 دولار لكل مليون رمز
  • Xiaomi حديثة العهد بإصدارات الصف الأول، فسجلّها التشغيلي رقيق إلى جانب المختبرات الراسخة
  • المركز 27 في الكتابة الإبداعية مقابل العاشر في المسائل الصعبة — فهو أقوى في الاستدلال منه في الكتابة التعبيرية
DeepSeek
  • برخصة MIT وقابل للتنزيل، بـ 552 مليار معامل منها 8 مليارات نشطة فقط، ويخدمه 27 مزوّدًا مستقلًا
  • تذكر DeepSeek نتيجة 74.2% في Deep-SWE v1.1، متقدمًا على Opus 5 (74.0%) وGPT-5.6 Sol (73.0%)
  • المركز 36 من 409 في ساحة النصوص العامة على LMArena، بعيدًا خلف النماذج الرائدة التي يوازيها في مقاييس البرمجة المنشورة
  • نموذج من طبقة Flash بحكم التصميم: وخط Pro من DeepSeek نفسها أقوى في الرياضيات والاستدلال الطويل
OpenAI
9.2/10
  • استدلال وكيل من الطراز الأول، مع البحث وتنفيذ الشيفرة واستخدام الحاسوب في واجهة برمجية واحدة
  • مخرجات منضبطة وقليلة الهلوسة في المهام الطويلة متعددة الخطوات
  • الطلبات طويلة السياق فوق 272 ألف توكن تقريبًا يُعاد تسعيرها بارتفاع حاد
  • أبطأ من معظم منافسيه في إخراج أول إجابة عند أقصى درجات الاستدلال
DeepSeek
  • نموذج صدارة مفتوح الأوزان فعليًا يمكنك استضافته بنفسك، بخلاف منافسيه المغلقين
  • تكلفة واجهة برمجية منخفضة جدًا، خصوصًا في نوافذ التسعير خارج أوقات الذروة
  • إصدار V4 Pro نصّي فقط؛ ومدخلات الصورة محصورة في نسخة Flash تجريبية
  • يتأخر عن المختبرات المغلقة الرائدة في اختبارات الذكاء المجمّعة
Google
  • من أسرع النماذج من فئة الصدارة في سرعة التوليد
  • سعره تنافسي بقوة لحركة الإنتاج عالية التدفق
  • حلّت محله إصدارات Flash الأحدث (3.5 إلى 3.8) بوصفها النموذج السريع الافتراضي لدى Google
  • إعدادات الاستدلال الأعلى تضيف تكلفة وزمن استجابة ملحوظين
OpenAI
  • مصنّف الأول من بين 128 نموذجًا في ساحة WebDev على LMArena لبناء تطبيقات ويب عاملة، متقدمًا بوضوح على كل منافسيه
  • تذكر OpenAI نتائج هي الأفضل على FrontierMath وARC-AGI-3 واستخدام الحاسوب في OSWorld 2.0
  • في الاستخدام اليومي يفضّل الناس منافسين كثيرين عليه: المركز 49 من 402 في مسائل LMArena الصعبة، بفارق كبير خلف Claude
  • يستخدم أسلوب استدلال «التكرار المعتم» تقول OpenAI إن مراقبته أصعب في تدقيق سلسلة التفكير
Anthropic
  • سريع وقادر، وبسعر يناسب الاستخدام الإنتاجي اليومي
  • خيار افتراضي قوي للبرمجة والمستندات الطويلة دون تكلفة فئة Opus
  • تفعيل أقصى وضع تفكير قد يضخّم إنفاق التوكن بهدوء
  • يتأخر عن Opus في أصعب مسائل الاستدلال متعدد الخطوات
Google
  • مدخلات متعددة الوسائط أصلية تشمل النص والصورة والصوت والفيديو وملفات PDF
  • نافذة سياق ضخمة مع استرجاع قوي للمستندات الطويلة
  • أبطأ في أول استجابة من فئة Flash لدى Google نفسها
  • لا ينتج صورًا ولا صوتًا، بل يفهمهما فقط
OpenAI
8.8/10
  • المركز الخامس من 133 في ساحة WebDev على LMArena، وهو أقوى حضور لـ OpenAI في بناء تطبيقات ويب عاملة بعد Astra
  • اتساق وقائعي 93.5% على لوحة Vectara للهلوسة، متقدمًا على GPT-6 Astra البالغ 91.3%
  • المركز 156 من 409 في ساحة النصوص العامة على LMArena — ففي المقارنات العمياء يفضّل الناس عليه نماذج كثيرة أرخص
  • يقع دون Astra في تشكيلة OpenAI نفسها، فلا يحمل قدرات النموذج الرائد
SpaceXAI
8.6/10
  • يتصدّر عدة اختبارات للمهام الوكيلة وأتمتة سطر الأوامر
  • بحث أصلي وفوري في X والويب مدمج في النموذج
  • لا يمكن إيقاف وضع الاستدلال، فيضيف تكلفة وزمن استجابة إلى كل طلب
  • يصطدم بقفزة سعرية حادة بمجرد تجاوز السياق 200 ألف توكن تقريبًا
OpenAI
  • مسعّر للحجم الكبير بـ 0.10/0.50 دولار لكل مليون رمز، أي جزء من عشرين من سعر Sol، وبنافذة السياق نفسها البالغة 1.05 مليون رمز
  • مبني للأعمال المكتبية كثيفة التكرار — استخراج الحقول من المستندات وتلخيص التذاكر — حيث تهم الإنتاجية أكثر من العمق
  • المركز 160 من 409 في ساحة النصوص العامة والمركز 155 في الكتابة الإبداعية: ليس نموذجًا يُلجأ إليه في العمل الصعب أو التعبيري
  • تضعه OpenAI طبقتين دون Astra، فالاستدلال المعقّد والتشغيل الوكيل الطويل خارج مهمته
Google
8.4/10
  • مصمم خصيصًا للتشغيل على الجهاز وعلى الأطراف
  • نسخ صغيرة، من 4B إلى 12B، تعمل جيدًا على عتاد متواضع
  • ليس مخصصًا لمنافسة نماذج الصدارة في الاستدلال الصعب
  • نافذة سياق محدودة مقارنة بنماذج Gemini السحابية
Zhipu AI
8.4/10
  • أداء برمجي ينافس Claude أو يضاهيه في عدة اختبارات
  • مفتوح الأوزان، ما يمنح مرونة للنشر الذاتي أو الضبط الدقيق
  • منظومة أدوات وتكاملات أصغر من المختبرات الثلاثة الكبرى
  • أقل اختبارًا في بيئات الإنتاج خارج عمليات النشر داخل الصين
SpaceXAI
8.2/10
  • تذكر SpaceXAI أن نتيجته في Terminal-Bench 4.0 تضاعفت تقريبًا إلى 38.0% من 20.3% لـ Grok 4.6 في مهام الطرفية الممتدة لساعات
  • يحافظ على سعر Grok 4.6 البالغ 2/6 دولارات لكل مليون رمز رغم نموذج أساس أكبر وتدريب تعزيزي أطول
  • المركز 151 من 399 في مسائل LMArena الصعبة — فالمكاسب التي تذكرها الجهة الصانعة في المقاييس الوكيلة لا تظهر في التفضيل البشري الأعمى
  • تضعه أرقام SpaceXAI نفسها خلف Claude Fable 5.1 في CursorBench 4.0، 46.3% مقابل 51.8%
Anthropic
  • أرخص فئات Claude، ومناسب تمامًا للمهام البسيطة عالية الحجم
  • زمن استجابة منخفض، جيد لأحمال المحادثة والتصنيف
  • نافذة سياق أصغر (200 ألف توكن) من Sonnet 5 وOpus 5 (مليون)
  • أضعف بوضوح من Sonnet أو Opus في الاستدلال الصعب
SpaceXAI
  • فئة Grok الاقتصادية الأسرع، للاستخدام عالي الحجم أو الحساس لزمن الاستجابة
  • يرث تكامل Grok الأصلي مع بحث X والويب
  • أقل قدرة بوضوح من Grok 4.6 في الاستدلال الصعب
  • حلّ محله Grok 4.1 Fast ونماذج سريعة أحدث من SpaceXAI
Mistral AI
  • أداء قوي متعدد اللغات، خصوصًا عبر اللغات الأوروبية
  • ترخيص Apache 2.0 يتيح استخدامًا تجاريًا غير مقيّد
  • ميزانية بحث أصغر من مختبرات الصدارة الأمريكية والصينية، ويظهر ذلك في سقف الأداء
  • قلة شهرة الاسم قد تعقّد إجراءات الشراء في المؤسسات
Alibaba
7.9/10
  • ينافس أفضل النماذج المغلقة في اختبارات الاستدلال والبرمجة
  • عائلة واسعة من الأحجام، من المناسب للأجهزة الطرفية إلى حجم الصدارة
  • أوزانه مغلقة: بخلاف نماذج Qwen المفتوحة، لا يمكن استضافته ذاتيًا
  • صقل لغته الإنجليزية يتأخر قليلًا عن مختبرات الصدارة الغربية
Meta
7.8/10
  • أوسع نموذج مفتوح الأوزان انتشارًا في بيئات المؤسسات
  • منظومة ضخمة من النسخ المضبوطة والأدوات ودعم المجتمع
  • الترخيص يقيّد الاستخدام المجاني بعد تجاوز الناشر 700 مليون مستخدم شهريًا
  • يتخلف عن Qwen وDeepSeek وGLM في عدة اختبارات لعام 2026
Moonshot AI
7.4/10
  • يبرع في المستندات الطويلة والكتابة كثيفة المصادر وملخصات البحث، ويحافظ على السياق جيدًا
  • مفتوح الأوزان مع قدرات وكيلة وبرمجية قوية في تحديث K2
  • منظومة وتكاملات أصغر من المختبرات المغلقة الثلاثة الكبرى
  • أقل إثباتًا في الاستخدام الإنتاجي الحساس لزمن الاستجابة
OpenAI
7.0/10
  • نموذج ناضج ومجرَّب لا يزال مدمجًا على نطاق واسع في المنتجات
  • توازن جيد بين السرعة والتكلفة ومدخلات الوسائط المتعددة للاستخدام اليومي
  • تجاوزه GPT-5.6 بوضوح في الاستدلال الصعب والمهام الوكيلة
  • توجّه OpenAI تدفع المستخدمين الجدد نحو نماذج أحدث
Cohere
  • مبني خصيصًا لتغطية عشرات اللغات، منها لغات قليلة الخدمة
  • مفتوح الأوزان، ومفيد للبحث والتطبيقات كثيفة التوطين
  • ليس مخصصًا لمنافسة نماذج الصدارة في الاستدلال المتمحور حول الإنجليزية
  • سجل إنتاجي أصغر من خط Command التجاري لدى Cohere
Cohere
  • مبني خصيصًا للتوليد المعزّز بالاسترجاع وسير عمل البحث في المؤسسات
  • سلوك قوي في الاستشهاد والإسناد عند وصله بمخزن مستندات
  • أقل ملاءمة للاستخدام الإبداعي المفتوح أو المحادثة العامة
  • صار الآن دون نموذج Cohere الأحدث Command A+
Microsoft
5.7/10
  • أداؤه أعلى من حجمه، خصوصًا في الرياضيات والمنطق
  • صغير بما يكفي للتشغيل محليًا أو على الأطراف بتكلفة زهيدة
  • اتساع معرفته العامة أضيق من نماذج الصدارة الأكبر
  • أقل ملاءمة للمهام الوكيلة الطويلة المفتوحة
Anthropic
قيد التقييم
  • يتصدّر LMArena وحده في المسائل الصعبة (1,545) وفي ساحة WebDev (1,827)، وهو أعلى تقييم على أيٍّ من اللوحتين
  • تذكر Anthropic انخفاضًا يقارب 40% في كلفة المهمة عن Opus 5 وسرعة إخراج أعلى بأكثر من 30%، بسعر 4/20 دولارًا لكل مليون رمز
  • صدر قبل أسابيع، فما زالت الكتابة الإبداعية دون حدّ الأصوات في هذا الموقع ولا يوجد اختبار هلوسة بعد — ودرجته الإجمالية معلّقة
  • لا يزال في الطبقة الأغلى: أضعاف سعر النماذج السريعة التي يجري عليها معظم العمل كثيف الحجم
Mistral AI
قيد التقييم
  • نموذج واحد مفتوح الأوزان يجمع الاستدلال ومدخلات الصورة والبرمجة الوكيلة، تحت ترخيص Apache 2.0
  • تصميم خليط الخبراء يفعّل 6.5B فقط من أصل 119B معاملًا لكل توكن، فيبقى الاستدلال كفؤًا
  • نموذج من الفئة الصغيرة: يتأخر عن نماذج الصدارة في أصعب مهام الاستدلال
  • بإجمالي 119B معاملًا، تحتاج استضافته الذاتية ذاكرة أكبر بكثير من نسخ Small السابقة
Baidu
قيد التقييم
  • تكامل عميق مع محرك بحث Baidu ومنظومة السوق الصينية
  • فهم وتوليد قويان للغة الصينية
  • حضور ودعم أدوات أضعف خارج الصين
  • أداؤه بالإنجليزية يتأخر عن مختبرات الصدارة الغربية
NVIDIA
قيد التقييم
  • مفتوح بالكامل: الأوزان وبيانات التدريب والوصفات منشورة تحت ترخيص OpenMDW-1.1 المتساهل
  • هجين Mamba-Transformer بـ550B معاملًا (55B نشطة) مبني للوكلاء طويلي التشغيل
  • بـ550B معاملًا، تحتاج استضافته الذاتية عنقود وحدات معالجة رسومية متعددة
  • أكفأ صيغه (NVFP4) مصممة لعتاد NVIDIA
AI21 Labs
قيد التقييم
  • معمارية هجينة Transformer-Mamba تمنح إنتاجية عالية جدًا واستهلاك ذاكرة منخفضًا عند السياق الطويل
  • من أكبر نوافذ السياق بين النماذج مفتوحة الأوزان، موجّه لعمل المستندات الطويلة في المؤسسات
  • يحتاج أسلوب تكميم خاصًا به ليبلغ أرقام الكفاءة تلك
  • سجل استخدام وحضور أصغر بكثير من Llama أو Qwen أو DeepSeek
Tencent
قيد التقييم
  • حضور قوي في السوقين الاستهلاكي والمؤسسي الصيني عبر منظومة Tencent
  • عائلة واسعة متعددة الوسائط تشمل النص والصورة والفيديو تحت علامة واحدة
  • تبنٍّ وأدوات محدودة خارج الصين
  • أقل اختبارًا مقابل نماذج الصدارة الغربية في القياسات المستقلة
Reka AI
قيد التقييم
  • نموذج متعدد الوسائط مضغوط وكفؤ يسهل استضافته ذاتيًا
  • نسبة جيدة بين التكلفة والأداء لمهام الوسائط المتوسطة
  • يتأخر عن مختبرات الصدارة في أصعب اختبارات الاستدلال
  • شهرة ومجتمع أصغر بكثير من المختبرات الكبرى
ByteDance
قيد التقييم
  • مدمج بعمق في تطبيقات ByteDance الاستهلاكية ومنظومتها
  • أداء عام تنافسي بتكلفة منخفضة
  • مبني أساسًا للسوق الصينية، وحضوره محدود في غيرها
  • قياساته أقل شفافية في المقارنة بنماذج الصدارة العالمية
Upstage
قيد التقييم
  • أداء قوي قياسًا بحجمه، ورائج في الاستخدام الكوري وحالات الاسترجاع المعزّز في المؤسسات
  • كفء بما يكفي للتشغيل الاقتصادي على نطاق واسع
  • حضور عالمي أضيق من المختبرات الأمريكية والصينية الكبرى
  • يتأخر عن نماذج الصدارة في أصعب مهام الاستدلال العام
01.AI
قيد التقييم
  • نموذج سريع ومنخفض التكلفة وأداؤه جيد مقابل سعره
  • تغطية معقولة لعدة لغات منها الإنجليزية والصينية
  • يتأخر عن نماذج الصدارة في الاستدلال والبرمجة المعقدة
  • منظومة مطورين أصغر من Qwen أو DeepSeek