مدیریت GPU: چرا پردازندههای گرافیکی بیکار مانند هواپیماهای زمینگیر شده هستند؟
جزئیات مدلها و برنامههای مطرحشده
در این مقاله به مدل Dharma-AI/Dharma-OCR-LITE اشاره شده است؛ یک مدل ۴ میلیارد پارامتری (4B) در حوزه تبدیل تصویر به متن (Image-Text-to-Text) که برای استخراج متن و جداول از تصاویر اسناد کاربرد دارد.
چالش جدید: مدیریت ناوگان عاملها و زمانبندی GPU
بحثهای اخیر در میان فعالان حوزه فناوری نشان میدهد که مرز بعدی هوش مصنوعی، مدیریت یک ناوگان کامل از عاملها (Agents) است. با این حال، چالش اصلی که هنوز در قیمتگذاریها لحاظ نشده، مقیاسپذیری خطی هزینههای مربوط به هر توکن با رشد کسبوکار است.
شرکتهای بزرگ در نقطهای مشخص از پرداخت این هزینههای تصاعدی دست برمیدارند و مدلها را به صورت داخلی (In-house) مستقر میکنند. این اقدام هزینهها را از بین نمیبرد، بلکه فقط لیست قیمت تامینکنندگان را با «نرخ بهرهبرداری» (Utilization rate) جایگزین میکند.
چرا بهرهبرداری از GPUها پیچیده است؟
ناوگانهای عاملی فشار شدیدی بر نرخ بهرهبرداری وارد میکنند. عواملی مانند:
- استنتاج لحظهای (Real-time inference) تحت توافقنامههای سطح خدمات تاخیر (Latency SLAs)
- پردازشهای دستهای (Batch jobs)
- بازآموزی مدلها (Retraining)
- ارزیابیها (Evals)
همگی فرآیندهایی نوسانی و ناگهانی (Bursty) هستند که برای استفاده از یک استخر محدود از منابع سختافزاری به رقابت میپردازند. از این رو، بخش عمدهای از مدیریت ناوگان هوش مصنوعی، به یک مسئله زمانبندی GPU (GPU Scheduling) تبدیل خواهد شد.
راهکارهای پیشنهادی کارشناسان
به باور کارشناسان، زمانبندی گلوگاه (Bottleneck) اصلی این چالش است. ایجاد یک مکانیسم جداسازی شبیه به پردازنده مرکزی (CPU isolation) یا یک معماری مبتنی بر سندباکس (Sandbox) روی پردازندههای گرافیکی، میتواند این مشکل را تا حد زیادی برطرف سازد.