Mistral Small 4Mistral Small 4
قيد التقييم
- الجهة الصانعة
- Mistral AI
- تاريخ الإصدار
- 16 مارس 2026
نقاط القوة والضعف
- +نموذج واحد مفتوح الأوزان يجمع الاستدلال ومدخلات الصورة والبرمجة الوكيلة، تحت ترخيص Apache 2.0
- +تصميم خليط الخبراء يفعّل 6.5B فقط من أصل 119B معاملًا لكل توكن، فيبقى الاستدلال كفؤًا
- −نموذج من الفئة الصغيرة: يتأخر عن نماذج الصدارة في أصعب مهام الاستدلال
- −بإجمالي 119B معاملًا، تحتاج استضافته الذاتية ذاكرة أكبر بكثير من نسخ Small السابقة
التقييم
في انتظار التقييمReasoningw45—
لا يوجد قياس مستقل بعد
Accuracyw20—
لا يوجد قياس مستقل بعد
Writingw15—
لا يوجد قياس مستقل بعد
Long contextw20—
لا يوجد قياس مستقل بعد
السعر والإتاحة
مقاسان بالطريقة نفسها، وخارج الدرجة عن عمد: تكلفة النموذج لا تغيّر ما يستطيع فعله.
w = الوزن، أي حصة كل معيار من الدرجة الإجمالية. والدرجات الغائبة لا تُحتسب لصالح النموذج ولا ضده. كيف يعمل التقييم
- +يتصدّر LMArena وحده في المسائل الصعبة (1,545) وفي ساحة WebDev (1,827)، وهو أعلى تقييم على أيٍّ من اللوحتين
- +تذكر Anthropic انخفاضًا يقارب 40% في كلفة المهمة عن Opus 5 وسرعة إخراج أعلى بأكثر من 30%، بسعر 4/20 دولارًا لكل مليون رمز
- −صدر قبل أسابيع، فما زالت الكتابة الإبداعية دون حدّ الأصوات في هذا الموقع ولا يوجد اختبار هلوسة بعد — ودرجته الإجمالية معلّقة
- −لا يزال في الطبقة الأغلى: أضعاف سعر النماذج السريعة التي يجري عليها معظم العمل كثيف الحجم
- +المركز الخامس من 133 في ساحة WebDev على LMArena، وهو أقوى حضور لـ OpenAI في بناء تطبيقات ويب عاملة بعد Astra
- +اتساق وقائعي 93.5% على لوحة Vectara للهلوسة، متقدمًا على GPT-6 Astra البالغ 91.3%
- −المركز 156 من 409 في ساحة النصوص العامة على LMArena — ففي المقارنات العمياء يفضّل الناس عليه نماذج كثيرة أرخص
- −يقع دون Astra في تشكيلة OpenAI نفسها، فلا يحمل قدرات النموذج الرائد
- +مسعّر للحجم الكبير بـ 0.10/0.50 دولار لكل مليون رمز، أي جزء من عشرين من سعر Sol، وبنافذة السياق نفسها البالغة 1.05 مليون رمز
- +مبني للأعمال المكتبية كثيفة التكرار — استخراج الحقول من المستندات وتلخيص التذاكر — حيث تهم الإنتاجية أكثر من العمق
- −المركز 160 من 409 في ساحة النصوص العامة والمركز 155 في الكتابة الإبداعية: ليس نموذجًا يُلجأ إليه في العمل الصعب أو التعبيري
- −تضعه OpenAI طبقتين دون Astra، فالاستدلال المعقّد والتشغيل الوكيل الطويل خارج مهمته
- +تذكر SpaceXAI أن نتيجته في Terminal-Bench 4.0 تضاعفت تقريبًا إلى 38.0% من 20.3% لـ Grok 4.6 في مهام الطرفية الممتدة لساعات
- +يحافظ على سعر Grok 4.6 البالغ 2/6 دولارات لكل مليون رمز رغم نموذج أساس أكبر وتدريب تعزيزي أطول
- −المركز 151 من 399 في مسائل LMArena الصعبة — فالمكاسب التي تذكرها الجهة الصانعة في المقاييس الوكيلة لا تظهر في التفضيل البشري الأعمى
- −تضعه أرقام SpaceXAI نفسها خلف Claude Fable 5.1 في CursorBench 4.0، 46.3% مقابل 51.8%