تیم Qwen شرکت علیبابا مدل Qwen3.8-2.4T-A95B را به عنوان اولین مدل در کلاس Qwen-Max با وزنهای متنباز (open weights) عرضه کرده است. این مدل با ۲.۴ تریلیون پارامتر کل (که ۹۵ میلیارد پارامتر آن در هر توکن فعال میشود) برای پردازشهای سنگین مبتنی بر عاملهای هوشمند و استدلالهای چندمرحلهای طراحی شده است. در همین راستا، آمازون راهنمای فنی جامعی برای استقرار این مدل غولپیکر روی زیرساخت Amazon SageMaker HyperPod با استفاده از موتور استنتاج vLLM منتشر کرده است.
ویژگیهای معماری مدل Qwen3.8-2.4T-A95B
این مدل از معماری پیشرفته Mixture of Experts (MoE) با ۵۱۲ کارشناس مسیریابیشده و یک کارشناس مشترک بهره میبرد که در هر گام، ۱۰ کارشناس فعال میشوند. طراحی هیبریدی توجه (Attention) در این مدل، شامل ترکیبی از لایههای Gated DeltaNet (توجه خطی با حافظه ثابت) و Gated Attention (توجه درجه دوم کامل) با نسبت ۳ به ۱ است. این رویکرد باعث میشود که مصرف حافظه و محاسبات در طولبافتهای طولانی تا سقف ۱,۰۱۰,۰۰۰ توکن بهینهسازی شود. علاوه بر این، مدل مذکور از قابلیت بومی Multi-Token Prediction (MTP) برای رمزگشایی حدسی (speculative decoding) بدون نیاز به مدل کمکی پشتیبانی میکند.
کوانتایزیشن و نیازمندیهای سختافزاری
میزبانی از یک مدل ۲.۴ تریلیون پارامتری به زیرساخت سختافزاری بسیار قدرتمندی نیاز دارد. با استفاده از روشهای کوانتایزیشن NVFP4 (W4A4) یا MXFP4، حجم مدل به حدود ۱.۲ ترابایت کاهش مییابد. این بهینهسازی امکان قرارگیری کامل مدل را روی یک نود واحد مجهز به ۸ پردازنده گرافیکی NVIDIA B300 Blackwell Ultra (نمونههای ml.p6-b300 در آمازون) فراهم میکند.
مزایای استفاده از Amazon SageMaker HyperPod
استقرار مدلهای بزرگ MoE فراتر از تامین پردازنده گرافیکی، نیازمند مدیریت هوشمند زیرساخت است. پلتفرم SageMaker HyperPod با هماهنگسازی مبتنی بر Amazon EKS و ارائه ابزار Inference Operator مزایای زیر را ارائه میدهد:
- مدیریت خودکار زیرساخت: دانلود خودکار وزنهای مدل از Hugging Face یا Amazon S3، تخصیص بهینه منابع گرافیکی و پایش سلامت نودها.
- قابلیت انعطافپذیری و پایداری: جایگزینی خودکار نودهای آسیبدیده بدون دخالت کاربر و مقیاسپذیری خودکار با استفاده از KEDA.
- قابلیت Disaggregated Prefill and Decode (DPD): جداسازی مراحل پیشپردازش (Prefill) و تولید توکن (Decode) در استخرهای پردازشی مجزا برای تضمین تاخیر کم و پایدار در بارهای کاری همزمان.