برنده جدید رتبهبندی کدنویسی هوش مصنوعی، Claude Fable 5.1، در واقعیت بیش از ۶۰٪ از تلاشهای خود را در کدهای خصوصی ناکام گذاشته است. این مدل با کسب نمره ۳۸.۸ درصد در آزمون Real-SWE، که توسط Specific Labs (پشتیبانی شده توسط Y Combinator) طراحی شده، برتری خود را نسبت به رقبایی مانند GPT-6 Astra و Gemini 3.8 Flash اثبات کرد.
تفاوت کدهای خصوصی و عمومی
Real-SWE برخلاف رتبهبندیهای معمول که از کدهای عمومی استفاده میکنند، از کدهای خصوصی شرکتهای واقعی استفاده میکند. این مجموعه شامل یک محصول مصرفی با بیش از ۲۰۰ هزار کاربر و یک پلتفرم مالی است که بیش از ۱۰۰ هزار صورتحساب بانکی پردازش کرده است. استفاده از کدهای خصوصی باعث میشود مدلها با کدهایی روبرو شوند که احتمالاً در دادههای آموزشی آنها وجود نداشته است.
نتیجهگیری آزمون
در این آزمون، Claude Fable 5.1 با نمره ۳۸.۸ درصد رتبه اول را کسب کرد. GPT-6 Astra با ۳۳.۸ درصد و Gemini 3.8 Flash با ۳۱.۲ درصد در رتبههای بعدی قرار گرفتند. با این حال، حتی برنده اصلی نیز در بیش از ۶۰٪ از موارد شکست خورد. خطاهای ادغام و فرضیات بدون تأیید از دلایل اصلی شکست مدلها بودند. برخی از وظایف سخت، مانند رفع باگ حوزه مالی، تنها در کمتر از ۵٪ موارد حل شدند.