Cognition AI

Devin

قيد التقييم
الجهة الصانعة
Cognition AI
المنشأ
الولايات المتحدة
تاريخ الإصدار
12 مارس 2024

نقاط القوة والضعف

  • يعمل باستقلال في السحابة، بما في ذلك ليلًا ودون إشراف
  • قوي في المهام الكبيرة محددة المعالم كعمليات الترحيل وإعادة الهيكلة
  • التسعير بالاستخدام يصبح مكلفًا سريعًا مع الأحمال الثقيلة
  • يحتاج مواصفات واضحة مسبقًا؛ وضعيف في العمل الاستكشافي المفتوح

التقييم

في انتظار التقييم
  • Code qualityw45—

    لا يوجد قياس مستقل بعد

  • Web developmentw40—

    لا يوجد قياس مستقل بعد

  • Codebase contextw15—

    لا يوجد قياس مستقل بعد

السعر والإتاحة

مقاسان بالطريقة نفسها، وخارج الدرجة عن عمد: تكلفة النموذج لا تغيّر ما يستطيع فعله.

  • Cost efficiencyخارج التقييم—

    لا يوجد قياس مستقل بعد

w = الوزن، أي حصة كل معيار من الدرجة الإجمالية. والدرجات الغائبة لا تُحتسب لصالح النموذج ولا ضده. كيف يعمل التقييم

المزيد في البرمجة والوكلاء

عرض الكل →
StepFun
قيد التقييم
  • خليط خبراء بـ 600 مليار معامل منها 27 مليارًا نشطة ونافذة مليون رمز، مبني للعمل الوكيل طويل الأمد
  • دولار واحد للإدخال و2.70 دولار للإخراج لكل مليون رمز، مع وعد بفتح الأوزان في أكتوبر 2026
  • أنتج نحو 1.7 ضعف وسيط رموز الإخراج في مؤشر Artificial Analysis، فالكلفة الفعلية أعلى بكثير من السعر المعلن
  • إصدار تجريبي بلا نتيجة مستقلة في مقاييس البرمجة بعد، فلا يحمل درجة إجمالية هنا
OpenAI
قيد التقييم
  • أتمتة ممتازة لسطر الأوامر وعمليات git وتتبّع أعطال CI/CD
  • أوفر بكثير في التوكن من منافسيه كثيفي الاستدلال في المهام الروتينية
  • يحتاج تعليمات مفصّلة لا لبس فيها؛ ويتعثّر مع الطلبات المبهمة
  • نافذة سياق أصغر من بعض منافسيه، وهو قيد على المستودعات الضخمة
Anthropic
  • قوي في استنتاج المقصود من الطلبات المبهمة ومن السياق المعماري
  • سياق بمليون توكن يدعم إعادة هيكلة متماسكة عبر ملفات ومستودعات متعددة
  • قد يستهلك توكن أكثر بكثير من نماذج برمجية أخف في العمل الروتيني
  • يسرد استدلاله بإسهاب، ما يبطئ المهام السريعة
Alibaba
  • أداء مفتوح الأوزان قريب من المتصدّرين المملوكين
  • مجاني للاستضافة الذاتية، وجذاب للفرق الحساسة للتكلفة أو المعزولة عن الإنترنت
  • يحتاج بنية تحتية جادة لتشغيله بحجمه الكامل
  • أدواته وتكاملاته مع بيئات التطوير أقل نضجًا من Copilot أو Cursor أو Codex