X Square Robot از HOST رونمایی کرد؛ رباتی که از ویدیوهای ۲۹ ثانیه‌ای یاد می‌گیرد

X Square Robot از HOST رونمایی کرد؛ رباتی که از ویدیوهای ۲۹ ثانیه‌ای یاد می‌گیرد

استارتاپ هوش مصنوعی تجسم‌یافته (embodied-AI) مستقر در پکن، X Square Robot، فریمورک یادگیری در زمان استنتاج (inference-time learning) خود به نام HOST را به صورت متن‌باز منتشر کرده است. این فناوری به ربات‌های انسان‌نما اجازه می‌دهد با تماشای یک ویدیوی کوتاه نمایشی، مهارت مورد نظر را در اولین تلاش اجرا کنند.

طبق گزارش‌ها، HOST با تماشای یک کلیپ ۲۹ ثانیه‌ای، نرخ موفقیت ۶۲ درصدی در اجرای وظایف را به دست می‌آورد. در مقایسه، استاندارد فعلی صنعت برای دستیابی به نرخ موفقیت ۳۸ درصد، به حدود ۵۰ نمایش تخصصی و چهار ساعت تنظیم دقیق (fine-tuning) نیاز دارد.

فرایند متداول جمع‌آوری داده‌های هوش مصنوعی تجسم‌یافته مبتنی بر داده‌های عملیات از راه دور (teleoperation) است. در این روش، یک مهندس با پوشیدن هدست واقعیت مجازی (VR)، بازوی ربات را فریم به فریم در حین انجام یک وظیفه هدایت می‌کند و این فرایند را ده‌ها بار تکرار می‌کند. سپس تنظیمات تحت نظارت (supervised fine-tuning) به مدت یک شب اجرا می‌شود. هزینه یک ربات جمع‌آوری داده به تنهایی صدها هزار دلار است و هر نمایش می‌تواند بیش از صد دلار هزینه جانبی داشته باشد. کارخانه‌های داده در هند و کارگران پاره‌وقت در شهرهای کوچک چین به عنوان ارزان‌ترین منابع داده‌های حرکتی شناخته می‌شوند، اما هزینه‌ها همچنان مقیاس‌پذیر نیستند.

HOST این فرایند را معکوس می‌کند. به جای اینکه از ربات خواسته شود حرکات مفاصل انسان را تقلید کند، HOST از ربات می‌خواهد وضعیت نهایی را تصور کرده و حرکت را معکوس‌سازی (reverse-engineer) کند. این فریمورک از دو ماژول داخلی تشکیل شده است:

  • ماژول بینایی (vision module): ویدیوی نمایش انسانی را تماشا کرده و صحنه را همان‌طور که ربات می‌بیند، رندر می‌کند.
  • ماژول عمل (action module): مسیر مفاصل را محاسبه می‌کند که همان رندر را تولید کند.

یک ماژول هم‌ترازی زمان‌بندی پویا (dynamic time-warping alignment) فریم‌های ویدیوی انسانی را به مراحل اجرای ربات نگاشت می‌کند و خطای هم‌ترازی را حدود یک مرتبه کاهش می‌دهد.

این رویکرد ریشه در نظریه علوم شناختی شبیه‌سازی (simulation theory) دارد که استدلال می‌کند انسان‌ها مهارت‌های حرکتی جدید را با تمرین ذهنی نتیجه مطلوب قبل از اقدام یاد می‌گیرند. تیم چینی این منطق را وارد یادگیری رباتیک کرده و تنظیمات آفلاین را با یادگیری درون متنی (in-context learning) در زمان استنتاج جایگزین کرده است. ربات روی داده‌های جدید دوباره آموزش نمی‌بیند؛ بلکه ویدیو را به عنوان یک پرامپت مصرف می‌کند.

X Square Robot در اواخر سال ۲۰۲۳ تأسیس شد و تاکنون بیش از یک میلیارد یوان چین در هشت مرحله سرمایه‌گذاری جذب کرده است. از جمله سرمایه‌گذاران آن می‌توان به Meituan Strategic Investment، Alibaba Cloud، Lenovo Capital و Delian Capital اشاره کرد. انتشار متن‌باز این فناوری، یک شرط‌بندی عمدی برای جذب توسعه‌دهندگان و ایجاد فرصت‌های آزمایشی در سطح سازمانی است.

عدد ۶۲ درصد یک معیار پژوهشی است و به معنای آمادگی ربات خانگی برای استقرار نیست، اما گفتگو درباره آینده خطوط لوله آموزشی هوش مصنوعی تجسم‌یافته را تغییر می‌دهد، به خصوص اگر یادگیری در زمان استنتاج به استاندارد تبدیل شود.

چرا این خبر مهم است؟

HOST رویکرد سنتی جمع‌آوری داده‌های رباتیک را زیر سؤال می‌برد و نشان می‌دهد که ربات‌ها می‌توانند با تماشای ویدیوهای کوتاه، مهارت‌های جدیدی بیاموزند. این تغییر می‌تواند هزینه‌ها و زمان آموزش ربات‌ها را به شدت کاهش دهد و راه را برای کاربردهای گسترده‌تر هوش مصنوعی تجسم‌یافته هموار کند. علاوه بر این، انتشار متن‌باز این فناوری، فرصت‌های جدیدی برای مشارکت جامعه توسعه‌دهندگان و نوآوری‌های آینده فراهم می‌کند.

وضعیت کاربران ایرانی

این خبر به‌طور مستقیم به وضعیت کاربران ایرانی اشاره‌ای ندارد، اما فناوری‌های مشابه می‌توانند در آینده در صنایع مختلف از جمله تولید، خدمات و آموزش در ایران کاربرد داشته باشند.