طراحی هم‌زمان مکانیزم توجه در مدل‌های هوش مصنوعی برای استنتاج سریع و تعاملی در زمینه‌‌های طولانی

طراحی هم‌زمان مکانیزم توجه در مدل‌های هوش مصنوعی برای استنتاج سریع و تعاملی در زمینه‌‌های طولانی

با رایج‌تر شدن بارهای کاری عاملیت‌محور (agentic) و زمینه‌های طولانی (long-context)، طول زمینه افزایش یافته و مکانیزم توجه (attention) سهم بزرگ‌تری از زمان استنتاج (inference time) را به خود اختصاص می‌دهد (شکل ۱).

از آنجا که مکانیزم توجه اکنون بیشترین سهم را در این هزینه محاسباتی دارد، نحوه طراحی آن — و نه صرفاً نحوه پیاده‌سازی آن — به‌طور فزاینده‌ای عملکرد استنتاج مدل را تعیین می‌کند. شکل‌دهی به معماری مدل بر اساس نحوه اجرای آن توسط پردازنده‌های گرافیکی (GPU)، فرض پایه در «طراحی هم‌زمان» (co-design) مدل‌های هوش مصنوعی است.