راهنمای استقرار مدل ۲.۴ تریلیون پارامتری Qwen3.8 روی Amazon SageMaker HyperPod

راهنمای استقرار مدل ۲.۴ تریلیون پارامتری Qwen3.8 روی Amazon SageMaker HyperPod

تیم Qwen شرکت علی‌بابا مدل Qwen3.8-2.4T-A95B را به عنوان اولین مدل در کلاس Qwen-Max با وزن‌های متن‌باز (open weights) عرضه کرده است. این مدل با ۲.۴ تریلیون پارامتر کل (که ۹۵ میلیارد پارامتر آن در هر توکن فعال می‌شود) برای پردازش‌های سنگین مبتنی بر عامل‌های هوشمند و استدلال‌های چندمرحله‌ای طراحی شده است. در همین راستا، آمازون راهنمای فنی جامعی برای استقرار این مدل غول‌پیکر روی زیرساخت Amazon SageMaker HyperPod با استفاده از موتور استنتاج vLLM منتشر کرده است.

ویژگی‌های معماری مدل Qwen3.8-2.4T-A95B

این مدل از معماری پیشرفته Mixture of Experts (MoE) با ۵۱۲ کارشناس مسیریابی‌شده و یک کارشناس مشترک بهره می‌برد که در هر گام، ۱۰ کارشناس فعال می‌شوند. طراحی هیبریدی توجه (Attention) در این مدل، شامل ترکیبی از لایه‌های Gated DeltaNet (توجه خطی با حافظه ثابت) و Gated Attention (توجه درجه دوم کامل) با نسبت ۳ به ۱ است. این رویکرد باعث می‌شود که مصرف حافظه و محاسبات در طول‌بافت‌های طولانی تا سقف ۱,۰۱۰,۰۰۰ توکن بهینه‌سازی شود. علاوه بر این، مدل مذکور از قابلیت بومی Multi-Token Prediction (MTP) برای رمزگشایی حدسی (speculative decoding) بدون نیاز به مدل کمکی پشتیبانی می‌کند.

کوانتایزیشن و نیازمندی‌های سخت‌افزاری

میزبانی از یک مدل ۲.۴ تریلیون پارامتری به زیرساخت سخت‌افزاری بسیار قدرتمندی نیاز دارد. با استفاده از روش‌های کوانتایزیشن NVFP4 (W4A4) یا MXFP4، حجم مدل به حدود ۱.۲ ترابایت کاهش می‌یابد. این بهینه‌سازی امکان قرارگیری کامل مدل را روی یک نود واحد مجهز به ۸ پردازنده گرافیکی NVIDIA B300 Blackwell Ultra (نمونه‌های ml.p6-b300 در آمازون) فراهم می‌کند.

مزایای استفاده از Amazon SageMaker HyperPod

استقرار مدل‌های بزرگ MoE فراتر از تامین پردازنده گرافیکی، نیازمند مدیریت هوشمند زیرساخت است. پلتفرم SageMaker HyperPod با هماهنگ‌سازی مبتنی بر Amazon EKS و ارائه ابزار Inference Operator مزایای زیر را ارائه می‌دهد:

  • مدیریت خودکار زیرساخت: دانلود خودکار وزن‌های مدل از Hugging Face یا Amazon S3، تخصیص بهینه منابع گرافیکی و پایش سلامت نودها.
  • قابلیت انعطاف‌پذیری و پایداری: جایگزینی خودکار نودهای آسیب‌دیده بدون دخالت کاربر و مقیاس‌پذیری خودکار با استفاده از KEDA.
  • قابلیت Disaggregated Prefill and Decode (DPD): جداسازی مراحل پیش‌پردازش (Prefill) و تولید توکن (Decode) در استخرهای پردازشی مجزا برای تضمین تاخیر کم و پایدار در بارهای کاری همزمان.