ارزیابی عملکرد واقعی کلود ۵.۱ در برابر نسخه ۵؛ آیا مدل جدید آنتروپیک واقعاً قوی‌تر است؟

ارزیابی عملکرد واقعی کلود ۵.۱ در برابر نسخه ۵؛ آیا مدل جدید آنتروپیک واقعاً قوی‌تر است؟

شرکت آنتروپیک (Anthropic) به‌تازگی مدل هوش مصنوعی Claude Fable 5.1 را به عنوان پیشرفته‌ترین مدل خود برای کدنویسی و کارهای پژوهشی معرفی کرده است. با وجود تبلیغات گسترده و ادعای بهبود چشمگیر در بنچمارک‌ها، بررسی‌های عملی روی کارهای واقعی نشان می‌دهد که این مدل جدید در وظایف روزمره تفاوت چندانی با نسخه قبلی یعنی Fable 5 ندارد و حتی در مواردی ممکن است هزینه‌های بیشتری به کاربران تحمیل کند.

ادعای بنچمارک‌ها در برابر واقعیت عملی

در زمان رونمایی، آنتروپیک به بنچمارک پژوهشی Terminal-Bench-Science اشاره کرد که در آن مدل Fable 5.1 موفق به کسب امتیاز ۵۲.۶ درصد شده است، در حالی که نسخه قبلی تنها ۲۴.۷ درصد امتیاز کسب کرده بود. این بنچمارک توانایی مدل را در کار با ترمینال و انجام وظایف علمی چندمرحله‌ای می‌سنجد. با این حال، آزمایش‌های مستقل روی چهار سناریوی واقعی شامل پژوهش‌های عاملی (Agentic)، کدنویسی، استدلال ریاضی و تحلیل داده‌های حسگرها نشان می‌دهد که هر دو مدل عملکردی کاملاً مشابه و بدون خطا (امتیاز ۲۴ از ۲۴) ارائه می‌دهند.

جزئیات آزمایش‌ها و تفاوت در هزینه‌ها

در آزمایش‌های انجام‌شده، مدل Claude Fable 5.1 در وظایف ساده‌تر مانند حل مسائل ریاضی و رفع باگ‌های برنامه‌نویسی پایتون، کمی سریع‌تر و خلاصه‌تر عمل کرد. اما در پیچیده‌ترین آزمایش یعنی تحلیل داده‌های نامنظم حسگرها، مدل قدیمی‌تر Fable 5 عملکرد بهتری ثبت کرد. در این سناریو، مدل Fable 5 کار را در ۴ مرحله و با هزینه ۰.۱۳۴ دلار به پایان رساند، در حالی که Fable 5.1 به دلیل نیاز به یک مرحله اضافه و ارسال مجدد کل تاریخچه گفتگو، ۵ مرحله زمان برد و هزینه آن با افزایشی بیش از دو برابری به ۰.۳۰۴ دلار رسید.

در مجموع این آزمایش‌ها، اگرچه Fable 5.1 کل فرآیند را کمی سریع‌تر انجام داد (۸۲.۹ ثانیه در برابر ۸۴.۹ ثانیه)، اما ۷۰ درصد توکن بیشتری مصرف کرد و هزینه نهایی آن ۳۴ درصد بیشتر از نسخه قبلی شد. تعرفه هر دو مدل یکسان و معادل ۱۰ دلار به ازای هر میلیون توکن ورودی و ۵۰ دلار به ازای هر میلیون توکن خروجی است.

نتیجه‌گیری برای کاربران

بررسی‌ها نشان می‌دهد برای کاربرانی که از این مدل‌ها برای کارهای روزمره مانند اصلاح کد، پاک‌سازی داده‌ها و تحلیل‌های معمولی استفاده می‌کنند، ارتقا به Claude Fable 5.1 تغییر محسوسی در کیفیت خروجی ایجاد نخواهد کرد و حتی ممکن است در کارهای طولانی‌تر هزینه بیشتری به همراه داشته باشد. با این حال، این نتایج لزوماً به معنای نادرست بودن بنچمارک‌های رسمی نیست، چرا که آن بنچمارک‌ها برای کارهای پژوهشی بسیار طولانی و پیچیده طراحی شده‌اند که فراتر از کاربردهای روزانه اکثر کاربران است.