شیائومی مدل‌های هوش مصنوعی MiMo-V2.6 و ابزارهای یادگیری تقویتی خود را متن‌باز کرد

شیائومی مدل‌های هوش مصنوعی MiMo-V2.6 و ابزارهای یادگیری تقویتی خود را متن‌باز کرد

شرکت شیائومی به طور رسمی وزن‌ها، مستندات فنی و منابع یادگیری تقویتی (RL) مربوط به سری مدل‌های چندوجهی MiMo-V2.6 خود را در قالب دو مخزن MiMo-V2.6-Pro و MiMo-V2.6-Flash در پلتفرم Hugging Face به صورت متن‌باز منتشر کرد. این اقدام فراتر از نمایش‌های تبلیغاتی پیشین، دسترسی مستقیم توسعه‌دهندگان به کدهای یادگیری تقویتی و بیش از ۷,۰۰۰ محیط ارزیابی و وظیفه (Task Environment) را فراهم می‌کند.

مشخصات فنی مدل‌های Pro و Flash

هر دو مدل Pro و Flash به عنوان مدل‌های چندوجهی بومی (Native Multimodal) با پنجره بافتار (Context Window) ۱ میلیون توکنی طراحی شده‌اند. مدل MiMo-V2.6-Pro از معماری مخلوطی از خبرگان پویا (Sparse Mixture-of-Experts یا MoE) بهره می‌برد و دارای ۱.۰۲ تریلیون پارامتر کل است که حدود ۴۲ میلیارد پارامتر آن فعال هستند. در مقابل، مدل سبک‌تر MiMo-V2.6-Flash در مجموع ۳۰۹ میلیارد پارامتر دارد که حدود ۱۵ میلیارد پارامتر آن فعال است.

جزئیات آموزش و ادعاهای عملکردی شیائومی

طبق اعلام شیائومی، این مدل‌ها فرآیند آموزش یادگیری تقویتی خود را در کمتر از ۶ روز و طی ۳۰ گام RL روی حدود ۷۵۰ هزار مسیر حرکتی (Trajectory) به پایان رسانده‌اند. این فرآیند شامل ترکیبی از وظایف برنامه‌نویسی، عامل‌های عمومی، وظایف بینایی و امنیت سایبری بوده است. شیائومی مدعی است که نرخ موفقیت مدل Flash حدود ۲۵ درصد و مدل Pro حدود ۱۲ درصد بهبود یافته و امتیاز آن‌ها در بنچمارک DeepSWE v1.1 ارتقا یافته است؛ با این حال، این ادعاها و نتایج بنچمارک‌ها هنوز توسط مراجع مستقل ارزیابی و تایید نشده‌اند.

ابزارها و اکوسیستم متن‌باز ارائه‌شده

دارایی‌های متن‌باز ارائه‌شده فراتر از وزن‌های مدل است و شامل یک فریم‌ورک یادگیری تقویتی سرتاسری (End-to-End) مبتنی بر کتابخانه verl، بیش از ۷,۰۰۰ محیط ارزیابی در زمینه‌های مهندسی نرم‌افزار، بازتولید آسیب‌پذیری‌های امنیتی و طراحی وب، و همچنین مدل پایه Distill-Qwen-9B برای شروع آزمایش‌های جامعه کاربری می‌شود. با وجود این ابزارها، توسعه‌دهندگان در سناریوهای عملیاتی همچنان با چالش هزینه‌های بالای میزبانی و سرویس‌دهی مدل‌های بزرگ MoE مواجه خواهند بود.