پژوهشگران مدل حرکتی Omega-0 برای روبات‌های انسان‌نما معرفی کردند

پژوهشگران مدل حرکتی Omega-0 برای روبات‌های انسان‌نما معرفی کردند

روبات‌های انسان‌نما (humanoid robots) به روش آموزشی کاربردی‌تری دست یافته‌اند. پژوهشگرانی از Nanyang Technological University، Peking University، HKUST و BAAI از مدل جدیدی به نام Omega-0 رونمایی کرده‌اند؛ یک مدل اکشن جهانی با پیش‌بینی پنهان (latent-prediction world action model) که به روبات انسان‌نما اجازه می‌دهد به‌طور هم‌زمان راه برود، نگاه کند و مشغول به کار شود.

طبق گزارش‌های منتشرشده، این مدل در ۱۱ وظیفه واقعی در محیط خانه به نرخ موفقیت ۸۱.۸ درصد دست یافته و عملکرد بهتری نسبت به مدل‌های pi-0.5، EgoVLA، GR00T-N1.7 و psi-0 ثبت کرده است. دستاورد اصلی این پروژه بیش از آنکه به این عدد مربوط باشد، به معماری آن بازمی‌گردد؛ این مدل به جای پیش‌بینی پیکسل‌های آینده، ویژگی‌های بصری (visual features) آینده را پیش‌بینی می‌کند و به یک ترنسفورمر نفوذی (diffusion transformer) اجازه می‌دهد تا حرکات کل بدن را تولید کند.

معماری آموزشی Omega-0 از سه مرحله تشکیل شده است: مرحله اول، پیش‌آموزش مدل بینایی-زبان (vision-language model) حرکت کل بدن است. در این مرحله از یک توکن‌ساز به نام Whole-Body FAST برای تبدیل مسیرهای حرکتی پیوسته به توکن‌های گسسته استفاده شد و سپس مدل Qwen3-VL-2B-Instruct تنظیم دقیق گردید. مرحله دوم، پیش‌آموزش پنهان حرکتی انسان-روبات با الهام از مفهوم V-JEPA است که ویژگی‌های بصری، زبان و حس عمقی (proprioception) روبات را ترکیب می‌کند. مرحله سوم نیز شامل تنظیم دقیق در محیط واقعی خانه با استراتژی پردازش زمان‌واقعی برای حفظ تداوم حرکتی است.

تیم پژوهشی برای آموزش این معماری، مجموعه داده Omega-HOME را با ۴۰.۳ ساعت داده از محیط‌های واقعی، ۴,۸۲۷ مسیر حرکتی و ۲۴ نوع وظیفه مختلف ایجاد کرد. این مجموعه داده شامل هشت دسته‌بندی از کارهای خانگی مانند جابه‌جایی اشیاء، تمیز کردن سطوح، استفاده از وسایل برقی و مرتب‌سازی است.

برای جلوگیری از تداخل داده‌های آموزشی با فرایند ارزیابی، ۱۱ وظیفه مربوط به مرحله ارتقا از مجموعه داده اصلی جدا شدند تا صحت ارزیابی تضمین شود. اگرچه مسیر دستیابی به روبات‌هایی که بتوانند به‌طور کاملاً مستقل کارهایی نظیر تا کردن لباس‌ها را انجام دهند همچنان طولانی است، اما معماری Omega-0 مسیر روشنی را برای خودکارسازی بلندمدت و تعامل ایمن روبات‌ها ترسیم می‌کند.

چرا این خبر مهم است؟

محیط خانه یکی از پیچیده‌ترین مقاصد برای به‌کارگیری روبات‌های انسان‌نما است، زیرا به درک پیوسته از محیط و هماهنگی کامل اعضای بدن نیاز دارد. مدل Omega-0 با پیوند دادن پیش‌بینی محیط آینده و تولید حرکت کل بدن، گامی کلیدی برای حل هم‌زمان این دو چالش برداشته است. این معماری الگوی جدیدی را در حوزه هوش مصنوعی تجسم‌یافته (embodied AI) ارائه می‌دهد.