طراحی همزمان مکانیزم توجه در مدلهای هوش مصنوعی برای استنتاج سریع و تعاملی در زمینههای طولانی
با رایجتر شدن بارهای کاری عاملیتمحور (agentic) و زمینههای طولانی (long-context)، طول زمینه افزایش یافته و مکانیزم توجه (attention) سهم بزرگتری از زمان استنتاج (inference time) را به خود اختصاص میدهد (شکل ۱).
از آنجا که مکانیزم توجه اکنون بیشترین سهم را در این هزینه محاسباتی دارد، نحوه طراحی آن — و نه صرفاً نحوه پیادهسازی آن — بهطور فزایندهای عملکرد استنتاج مدل را تعیین میکند. شکلدهی به معماری مدل بر اساس نحوه اجرای آن توسط پردازندههای گرافیکی (GPU)، فرض پایه در «طراحی همزمان» (co-design) مدلهای هوش مصنوعی است.