مدیریت پردازندههای گرافیکی؛ چرا GPUهای بیکار حکم هواپیماهای زمینگیر را دارند؟
جزئیات مدل Dharma-OCR-LITE
مدل جدید Dharma-AI/Dharma-OCR-LITE یک مدل تبدیل تصویر و متن به متن (Image-Text-to-Text) با ۴ میلیارد پارامتر (4B) است که اخیراً بهروزرسانی شده و برای استخراج متن و جداول از تصاویر اسناد به کار میرود. این مدل تاکنون ۱.۶۵ هزار بار مورد استفاده قرار گرفته و در محیطهای مختلف پیادهسازی شده است.
مرز جدید: مدیریت ناوگان ایجنتهای هوش مصنوعی
در بحثهای اخیر جامعه فناوری، کارشناسان معتقدند مرز بعدی هوش مصنوعی، مدیریت کامل یک ناوگان از ایجنتها (Fleet of Agents) است. به گفته GabrielPimenta99 (نویسنده مقاله)، بخش مغفولمانده این است که با توسعه ناوگان ایجنتها، هزینه بهازای هر توکن (Per-token cost) به صورت خطی همراه با رشد کسبوکار افزایش مییابد.
در یک نقطه مشخص، شرکتهای بزرگ پرداخت این منحنی هزینهای را متوقف کرده و مدلها را به صورت درونسازمانی (In-house) مستقر میکنند. این اقدام هزینه را حذف نمیکند، بلکه تنها لیست قیمت ارائهدهندگان سرویس را با «شاخص بهرهوری» (Utilization number) جایگزین میسازد.
زمانبندی GPU؛ گلوگاه اصلی پردازش هوش مصنوعی
ناوگانهای ایجنت فشار بسیار سنگینی بر نرخ بهرهوری وارد میکنند. پردازشهایی مانند:
- استنتاج لحظهای تحت توافقنامههای سطح خدمات تاخیر (Latency SLAs)
- پردازشهای دستهای (Batch jobs)
- بازآموزی مدلها (Retraining)
- ارزیابیها (Evals)
همگی ماهیت نوسانی و انفجاری دارند و برای مصرف یک منابع محدود با هم رقابت میکنند. از این رو، بخش عمدهای از مدیریت ناوگان ایجنتها به یک مسئله زمانبندی پردازندههای گرافیکی (GPU Scheduling) تبدیل میشود.
blockquote>
کاربری با نام blacker521 در این رابطه مینویسد: «زمانبندی، گلوگاه اصلی این مسئله است. یک مکانیسم ایزولهسازی مشابه CPU یا یک معماری مبتنی بر محیط ایزوله (Sandbox) روی GPUها میتواند این مشکل را به میزان قابلتوجهی کاهش دهد.»
blockquote>