روباتهای انساننما (humanoid robots) به روش آموزشی کاربردیتری دست یافتهاند. پژوهشگرانی از Nanyang Technological University، Peking University، HKUST و BAAI از مدل جدیدی به نام Omega-0 رونمایی کردهاند؛ یک مدل اکشن جهانی با پیشبینی پنهان (latent-prediction world action model) که به روبات انساننما اجازه میدهد بهطور همزمان راه برود، نگاه کند و مشغول به کار شود.
طبق گزارشهای منتشرشده، این مدل در ۱۱ وظیفه واقعی در محیط خانه به نرخ موفقیت ۸۱.۸ درصد دست یافته و عملکرد بهتری نسبت به مدلهای pi-0.5، EgoVLA، GR00T-N1.7 و psi-0 ثبت کرده است. دستاورد اصلی این پروژه بیش از آنکه به این عدد مربوط باشد، به معماری آن بازمیگردد؛ این مدل به جای پیشبینی پیکسلهای آینده، ویژگیهای بصری (visual features) آینده را پیشبینی میکند و به یک ترنسفورمر نفوذی (diffusion transformer) اجازه میدهد تا حرکات کل بدن را تولید کند.
معماری آموزشی Omega-0 از سه مرحله تشکیل شده است: مرحله اول، پیشآموزش مدل بینایی-زبان (vision-language model) حرکت کل بدن است. در این مرحله از یک توکنساز به نام Whole-Body FAST برای تبدیل مسیرهای حرکتی پیوسته به توکنهای گسسته استفاده شد و سپس مدل Qwen3-VL-2B-Instruct تنظیم دقیق گردید. مرحله دوم، پیشآموزش پنهان حرکتی انسان-روبات با الهام از مفهوم V-JEPA است که ویژگیهای بصری، زبان و حس عمقی (proprioception) روبات را ترکیب میکند. مرحله سوم نیز شامل تنظیم دقیق در محیط واقعی خانه با استراتژی پردازش زمانواقعی برای حفظ تداوم حرکتی است.
تیم پژوهشی برای آموزش این معماری، مجموعه داده Omega-HOME را با ۴۰.۳ ساعت داده از محیطهای واقعی، ۴,۸۲۷ مسیر حرکتی و ۲۴ نوع وظیفه مختلف ایجاد کرد. این مجموعه داده شامل هشت دستهبندی از کارهای خانگی مانند جابهجایی اشیاء، تمیز کردن سطوح، استفاده از وسایل برقی و مرتبسازی است.
برای جلوگیری از تداخل دادههای آموزشی با فرایند ارزیابی، ۱۱ وظیفه مربوط به مرحله ارتقا از مجموعه داده اصلی جدا شدند تا صحت ارزیابی تضمین شود. اگرچه مسیر دستیابی به روباتهایی که بتوانند بهطور کاملاً مستقل کارهایی نظیر تا کردن لباسها را انجام دهند همچنان طولانی است، اما معماری Omega-0 مسیر روشنی را برای خودکارسازی بلندمدت و تعامل ایمن روباتها ترسیم میکند.
چرا این خبر مهم است؟
محیط خانه یکی از پیچیدهترین مقاصد برای بهکارگیری روباتهای انساننما است، زیرا به درک پیوسته از محیط و هماهنگی کامل اعضای بدن نیاز دارد. مدل Omega-0 با پیوند دادن پیشبینی محیط آینده و تولید حرکت کل بدن، گامی کلیدی برای حل همزمان این دو چالش برداشته است. این معماری الگوی جدیدی را در حوزه هوش مصنوعی تجسمیافته (embodied AI) ارائه میدهد.