آموزش فدرال مدل‌های هوش مصنوعی چندوجهی با NVIDIA FLARE

آموزش فدرال مدل‌های هوش مصنوعی چندوجهی با NVIDIA FLARE

مدل‌های زبانی-بینایی (VLM) امروزی کاربردهای گسترده‌ای مانند پاسخ‌دهی به سوالات بصری و شرح تصاویر دارند. با این حال، داده‌های مورد نیاز برای آموزش این مدل‌ها معمولاً در سازمان‌های مختلف پراکنده است و به دلیل مسائل حریم خصوصی امکان تجمیع آن‌ها وجود ندارد. یادگیری فدرال (Federated Learning) این مشکل را حل می‌کند، اما انتقال به‌روزرسانی‌های حجیم این مدل‌ها در شبکه، پهنای باند و حافظه سرورها را به شدت تحت فشار قرار می‌دهد.

کاهش چشمگیر ترافیک شبکه با راهکار FedUMM

برای حل این چالش، انویدیا پلتفرم متن‌باز NVIDIA FLARE را توسعه داده است که از الگوهای ارتباطی کارآمد پشتیبانی می‌کند. یکی از این راهکارها FedUMM نام دارد که با همکاری دانشگاه William & Mary و انویدیا توسعه یافته است. این ابزار با استفاده از معماری یادگیری فدرال، به جای انتقال کل مدل، تنها آداپتورهای سبک‌وزن LoRA را روی یک هسته منجمد (frozen) از مدل BLIP مبادله می‌کند. این روش حجم داده‌های انتقالی هر کلاینت را در هر مرحله از ۲۸.۶ گیگابایت به تنها ۰.۰۹۴ گیگابایت کاهش می‌دهد، بدون اینکه افت محسوسی در عملکرد مدل ایجاد شود. پروژه FedUMM موفق به دریافت جایزه مقاله دانشجویی برجسته در کارگاه FL@FM در کنفرانس TheWebConf 2026 شده است.

مدیریت بهینه حافظه و پهنای باند در NVIDIA FLARE

فریم‌ورک NVIDIA FLARE علاوه بر روش‌های مبتنی بر پارامترهای کارآمد، راهکارهای مهندسی پیشرفته‌ای را برای مدیریت به‌روزرسانی‌های بزرگ ارائه می‌دهد. قابلیت «برون‌سپاری اشیاء بزرگ» (Large-object externalization) پیام‌های کنترلی را سبک نگه می‌دارد و داده‌های سنگین را به صورت جداگانه منتقل می‌کند. همچنین ابزار Tensor Downloader در جریان‌های کاری PyTorch، تانسورها را به صورت بخش‌بخش (incremental) استریم می‌کند تا مصرف حافظه به حداقل برسد. علاوه بر این، در نسخه NVIDIA FLARE 2.8.0، قابلیت ذخیره‌سازی موقت روی دیسک (disk offload) اضافه شده است که با نوشتن به‌روزرسانی‌ها روی فایل‌های safetensors موقت، مانع از رشد خطی مصرف حافظه رم سرور در زمان تجمیع داده‌های کلاینت‌های متعدد می‌شود.