دراسة حول مشاكل اختبار SWE-Bench Pro
دراسة تكشف مشكلات في اختبار البرمجة SWE-Bench Pro
لماذا يهم هذا الخبر؟
تظهر الدراسة ضعف دقة وثبات اختبار البرمجة المستخدم في تقييم نماذج الذكاء الاصطناعي.
سياق الخبر
A new analysis from OpenAI reveals issues in SWE-Bench Pro, a popular coding benchmark, raising concerns about reliability and accuracy in evaluating AI models.
فتح الخبر الأصلي