مدیریت پردازنده‌های گرافیکی؛ چرا GPUهای بیکار حکم هواپیماهای زمین‌گیر را دارند؟

مدیریت پردازنده‌های گرافیکی؛ چرا GPUهای بیکار حکم هواپیماهای زمین‌گیر را دارند؟

جزئیات مدل Dharma-OCR-LITE

مدل جدید Dharma-AI/Dharma-OCR-LITE یک مدل تبدیل تصویر و متن به متن (Image-Text-to-Text) با ۴ میلیارد پارامتر (4B) است که اخیراً به‌روزرسانی شده و برای استخراج متن و جداول از تصاویر اسناد به کار می‌رود. این مدل تاکنون ۱.۶۵ هزار بار مورد استفاده قرار گرفته و در محیط‌های مختلف پیاده‌سازی شده است.

مرز جدید: مدیریت ناوگان ایجنت‌های هوش مصنوعی

در بحث‌های اخیر جامعه فناوری، کارشناسان معتقدند مرز بعدی هوش مصنوعی، مدیریت کامل یک ناوگان از ایجنت‌ها (Fleet of Agents) است. به گفته GabrielPimenta99 (نویسنده مقاله)، بخش مغفول‌مانده این است که با توسعه ناوگان ایجنت‌ها، هزینه به‌ازای هر توکن (Per-token cost) به صورت خطی همراه با رشد کسب‌وکار افزایش می‌یابد.

در یک نقطه مشخص، شرکت‌های بزرگ پرداخت این منحنی هزینه‌ای را متوقف کرده و مدل‌ها را به صورت درون‌سازمانی (In-house) مستقر می‌کنند. این اقدام هزینه را حذف نمی‌کند، بلکه تنها لیست قیمت ارائه‌دهندگان سرویس را با «شاخص بهره‌وری» (Utilization number) جایگزین می‌سازد.

زمان‌بندی GPU؛ گلوگاه اصلی پردازش هوش مصنوعی

ناوگان‌های ایجنت فشار بسیار سنگینی بر نرخ بهره‌وری وارد می‌کنند. پردازش‌هایی مانند:

  • استنتاج لحظه‌ای تحت توافق‌نامه‌های سطح خدمات تاخیر (Latency SLAs)
  • پردازش‌های دسته‌ای (Batch jobs)
  • بازآموزی مدل‌ها (Retraining)
  • ارزیابی‌ها (Evals)

همگی ماهیت نوسانی و انفجاری دارند و برای مصرف یک منابع محدود با هم رقابت می‌کنند. از این رو، بخش عمده‌ای از مدیریت ناوگان ایجنت‌ها به یک مسئله زمان‌بندی پردازنده‌های گرافیکی (GPU Scheduling) تبدیل می‌شود.

blockquote>

کاربری با نام blacker521 در این رابطه می‌نویسد: «زمان‌بندی، گلوگاه اصلی این مسئله است. یک مکانیسم ایزوله‌سازی مشابه CPU یا یک معماری مبتنی بر محیط ایزوله (Sandbox) روی GPUها می‌تواند این مشکل را به میزان قابل‌توجهی کاهش دهد.»

blockquote>