شرکت آنتروپیک (Anthropic) بهتازگی مدل هوش مصنوعی Claude Fable 5.1 را به عنوان پیشرفتهترین مدل خود برای کدنویسی و کارهای پژوهشی معرفی کرده است. با وجود تبلیغات گسترده و ادعای بهبود چشمگیر در بنچمارکها، بررسیهای عملی روی کارهای واقعی نشان میدهد که این مدل جدید در وظایف روزمره تفاوت چندانی با نسخه قبلی یعنی Fable 5 ندارد و حتی در مواردی ممکن است هزینههای بیشتری به کاربران تحمیل کند.
ادعای بنچمارکها در برابر واقعیت عملی
در زمان رونمایی، آنتروپیک به بنچمارک پژوهشی Terminal-Bench-Science اشاره کرد که در آن مدل Fable 5.1 موفق به کسب امتیاز ۵۲.۶ درصد شده است، در حالی که نسخه قبلی تنها ۲۴.۷ درصد امتیاز کسب کرده بود. این بنچمارک توانایی مدل را در کار با ترمینال و انجام وظایف علمی چندمرحلهای میسنجد. با این حال، آزمایشهای مستقل روی چهار سناریوی واقعی شامل پژوهشهای عاملی (Agentic)، کدنویسی، استدلال ریاضی و تحلیل دادههای حسگرها نشان میدهد که هر دو مدل عملکردی کاملاً مشابه و بدون خطا (امتیاز ۲۴ از ۲۴) ارائه میدهند.
جزئیات آزمایشها و تفاوت در هزینهها
در آزمایشهای انجامشده، مدل Claude Fable 5.1 در وظایف سادهتر مانند حل مسائل ریاضی و رفع باگهای برنامهنویسی پایتون، کمی سریعتر و خلاصهتر عمل کرد. اما در پیچیدهترین آزمایش یعنی تحلیل دادههای نامنظم حسگرها، مدل قدیمیتر Fable 5 عملکرد بهتری ثبت کرد. در این سناریو، مدل Fable 5 کار را در ۴ مرحله و با هزینه ۰.۱۳۴ دلار به پایان رساند، در حالی که Fable 5.1 به دلیل نیاز به یک مرحله اضافه و ارسال مجدد کل تاریخچه گفتگو، ۵ مرحله زمان برد و هزینه آن با افزایشی بیش از دو برابری به ۰.۳۰۴ دلار رسید.
در مجموع این آزمایشها، اگرچه Fable 5.1 کل فرآیند را کمی سریعتر انجام داد (۸۲.۹ ثانیه در برابر ۸۴.۹ ثانیه)، اما ۷۰ درصد توکن بیشتری مصرف کرد و هزینه نهایی آن ۳۴ درصد بیشتر از نسخه قبلی شد. تعرفه هر دو مدل یکسان و معادل ۱۰ دلار به ازای هر میلیون توکن ورودی و ۵۰ دلار به ازای هر میلیون توکن خروجی است.
نتیجهگیری برای کاربران
بررسیها نشان میدهد برای کاربرانی که از این مدلها برای کارهای روزمره مانند اصلاح کد، پاکسازی دادهها و تحلیلهای معمولی استفاده میکنند، ارتقا به Claude Fable 5.1 تغییر محسوسی در کیفیت خروجی ایجاد نخواهد کرد و حتی ممکن است در کارهای طولانیتر هزینه بیشتری به همراه داشته باشد. با این حال، این نتایج لزوماً به معنای نادرست بودن بنچمارکهای رسمی نیست، چرا که آن بنچمارکها برای کارهای پژوهشی بسیار طولانی و پیچیده طراحی شدهاند که فراتر از کاربردهای روزانه اکثر کاربران است.