شرکت شیائومی به طور رسمی وزنها، مستندات فنی و منابع یادگیری تقویتی (RL) مربوط به سری مدلهای چندوجهی MiMo-V2.6 خود را در قالب دو مخزن MiMo-V2.6-Pro و MiMo-V2.6-Flash در پلتفرم Hugging Face به صورت متنباز منتشر کرد. این اقدام فراتر از نمایشهای تبلیغاتی پیشین، دسترسی مستقیم توسعهدهندگان به کدهای یادگیری تقویتی و بیش از ۷,۰۰۰ محیط ارزیابی و وظیفه (Task Environment) را فراهم میکند.
مشخصات فنی مدلهای Pro و Flash
هر دو مدل Pro و Flash به عنوان مدلهای چندوجهی بومی (Native Multimodal) با پنجره بافتار (Context Window) ۱ میلیون توکنی طراحی شدهاند. مدل MiMo-V2.6-Pro از معماری مخلوطی از خبرگان پویا (Sparse Mixture-of-Experts یا MoE) بهره میبرد و دارای ۱.۰۲ تریلیون پارامتر کل است که حدود ۴۲ میلیارد پارامتر آن فعال هستند. در مقابل، مدل سبکتر MiMo-V2.6-Flash در مجموع ۳۰۹ میلیارد پارامتر دارد که حدود ۱۵ میلیارد پارامتر آن فعال است.
جزئیات آموزش و ادعاهای عملکردی شیائومی
طبق اعلام شیائومی، این مدلها فرآیند آموزش یادگیری تقویتی خود را در کمتر از ۶ روز و طی ۳۰ گام RL روی حدود ۷۵۰ هزار مسیر حرکتی (Trajectory) به پایان رساندهاند. این فرآیند شامل ترکیبی از وظایف برنامهنویسی، عاملهای عمومی، وظایف بینایی و امنیت سایبری بوده است. شیائومی مدعی است که نرخ موفقیت مدل Flash حدود ۲۵ درصد و مدل Pro حدود ۱۲ درصد بهبود یافته و امتیاز آنها در بنچمارک DeepSWE v1.1 ارتقا یافته است؛ با این حال، این ادعاها و نتایج بنچمارکها هنوز توسط مراجع مستقل ارزیابی و تایید نشدهاند.
ابزارها و اکوسیستم متنباز ارائهشده
داراییهای متنباز ارائهشده فراتر از وزنهای مدل است و شامل یک فریمورک یادگیری تقویتی سرتاسری (End-to-End) مبتنی بر کتابخانه verl، بیش از ۷,۰۰۰ محیط ارزیابی در زمینههای مهندسی نرمافزار، بازتولید آسیبپذیریهای امنیتی و طراحی وب، و همچنین مدل پایه Distill-Qwen-9B برای شروع آزمایشهای جامعه کاربری میشود. با وجود این ابزارها، توسعهدهندگان در سناریوهای عملیاتی همچنان با چالش هزینههای بالای میزبانی و سرویسدهی مدلهای بزرگ MoE مواجه خواهند بود.