کنفرانس PyTorch آمریکای شمالی ۲۰۲۶ (PyTorch Conference North America 2026) که در روزهای ۲۰ و ۲۱ اکتبر در سن خوزه، کالیفرنیا برگزار میشود، میزبان ارائهها، دموهای زنده و نشستهای تخصصی متعددی با محوریت موتور استنتاج محبوب vLLM خواهد بود. این نشستها موضوعات متنوعی از جمله مدیریت KV cache، معماریهای سرویسدهی توزیعشده (disaggregated serving)، سازگاری سختافزاری، بهینهسازی هسته (kernel optimization) و یکپارچهسازی با PyTorch را پوشش میدهند.
مدیریت KV Cache و معماری سرویسدهی توزیعشده
یکی از محورهای اصلی این کنفرانس، بهبود کارایی و مدیریت حافظه پنهان در مدلهای بزرگ زبانی (LLM) است. در همین راستا، متخصصانی از Red Hat به بررسی نحوه بازطراحی انتزاعهای توجه (attention abstractions) در vLLM و پشتیبانی از معماریهای جدید خواهند پرداخت. همچنین، ارائهای مشترک از سوی Mistral AI، آمازون و Red Hat به موضوع انتقال پیشرفته KV cache بین مراحل prefill و decode در معماریهای توزیعشده اختصاص دارد که به کاهش زمان تولید اولین توکن (TTFT) کمک میکند.
شرکت IBM نیز فریمورک بومی جدیدی را برای انتقال لایهای KV cache معرفی خواهد کرد که از حافظه CPU به عنوان هاب انتقال سراسری استفاده میکند تا سربار انتقال در GPU به حداقل برسد. علاوه بر این، ابزار متنباز LMCache برای کش کردن پرامپتها در سطح کلاستر و سیستم مدیریت اختصاصی هوآوی برای مدلهایی مانند DeepSeek-V4 و MLA معرفی خواهند شد.
موازیسازی پویا و سازگاری سختافزاری
شرکت NVIDIA در این رویداد قابلیت «موازیسازی الاستیک متخصصان» (Elastic Expert Parallelism) را در vLLM معرفی میکند که امکان افزودن یا حذف پویای منابع پردازشی در زمان اجرا را با کمترین اختلال فراهم میسازد. در بخش سازگاری سختافزاری نیز، گوگل دموهایی از اجرای vLLM روی تراشههای Cloud TPU با استفاده از TorchTPU ارائه خواهد داد و آمازون (AWS) نیز اجرای بومی اکوسیستم PyTorch روی تراشههای Trainium را به نمایش میگذارد. همچنین، شرکتهای IBM و Meta راهکاری برای تعریف مدلهای مستقل از سختافزار ارائه میدهند تا اجرای vLLM روی شتابدهندههای مختلف بدون نیاز به تغییر در کدهای اصلی امکانپذیر شود.