التقنية محايد تحليل ذكي آلي InfoQ 05 آب 2026, 01:05

Ponytail: تصحيح معيار الأداء بعد تحدي المساهمين

حققت مستودع Ponytail، الذي يحتوي على ملفات تعليمات فقط، أكثر من 44,000 نجمة على GitHub في تسعة أيام من خلال منع وكلاء البرمجة من الإفراط في البناء. بعد انتقاد المساهمين، أعاد الصيانة بناء المعيار ونشر رقم أقل يبلغ 54٪.

Ponytail Agent Skill Corrects Its Own Benchmark After Contributor Challenge

لماذا يهم هذا الخبر؟

تسلط هذه الحادثة الضوء على أهمية الشفافية والتدقيق المجتمعي في تقييم أداء أدوات الذكاء الاصطناعي، خاصةً عندما يتعلق الأمر بالمقاييس الرئيسية مثل كفاءة الكود.

سياق الخبر

A single-author repo of instruction files, not code, Ponytail passed 44,000 GitHub stars in nine days by making coding agents stop over-building. Its headline claim of 80-94% less code came from a flawed baseline; after a contributor said so, the maintainer rebuilt the benchmark as a real agentic run and published a lower figure of 54%. By Steef-Jan Wiggers

فتح الخبر الأصلي
تغطية مرتبطة

المزيد من أخبار التقنية