Claude Fable 5.1 برنده برترین رتبه‌بندی کدنویسی شد اما در کدهای خصوصی بیش از ۶۰٪ شکست خورد

Claude Fable 5.1 برنده برترین رتبه‌بندی کدنویسی شد اما در کدهای خصوصی بیش از ۶۰٪ شکست خورد

برنده جدید رتبه‌بندی کدنویسی هوش مصنوعی، Claude Fable 5.1، در واقعیت بیش از ۶۰٪ از تلاش‌های خود را در کدهای خصوصی ناکام گذاشته است. این مدل با کسب نمره ۳۸.۸ درصد در آزمون Real-SWE، که توسط Specific Labs (پشتیبانی شده توسط Y Combinator) طراحی شده، برتری خود را نسبت به رقبایی مانند GPT-6 Astra و Gemini 3.8 Flash اثبات کرد.

تفاوت کدهای خصوصی و عمومی

Real-SWE برخلاف رتبه‌بندی‌های معمول که از کدهای عمومی استفاده می‌کنند، از کدهای خصوصی شرکت‌های واقعی استفاده می‌کند. این مجموعه شامل یک محصول مصرفی با بیش از ۲۰۰ هزار کاربر و یک پلتفرم مالی است که بیش از ۱۰۰ هزار صورت‌حساب بانکی پردازش کرده است. استفاده از کدهای خصوصی باعث می‌شود مدل‌ها با کدهایی روبرو شوند که احتمالاً در داده‌های آموزشی آن‌ها وجود نداشته است.

نتیجه‌گیری آزمون

در این آزمون، Claude Fable 5.1 با نمره ۳۸.۸ درصد رتبه اول را کسب کرد. GPT-6 Astra با ۳۳.۸ درصد و Gemini 3.8 Flash با ۳۱.۲ درصد در رتبه‌های بعدی قرار گرفتند. با این حال، حتی برنده اصلی نیز در بیش از ۶۰٪ از موارد شکست خورد. خطاهای ادغام و فرضیات بدون تأیید از دلایل اصلی شکست مدل‌ها بودند. برخی از وظایف سخت، مانند رفع باگ حوزه مالی، تنها در کمتر از ۵٪ موارد حل شدند.