استارتاپ هوش مصنوعی تجسمیافته (embodied-AI) مستقر در پکن، X Square Robot، فریمورک یادگیری در زمان استنتاج (inference-time learning) خود به نام HOST را به صورت متنباز منتشر کرده است. این فناوری به رباتهای انساننما اجازه میدهد با تماشای یک ویدیوی کوتاه نمایشی، مهارت مورد نظر را در اولین تلاش اجرا کنند.
طبق گزارشها، HOST با تماشای یک کلیپ ۲۹ ثانیهای، نرخ موفقیت ۶۲ درصدی در اجرای وظایف را به دست میآورد. در مقایسه، استاندارد فعلی صنعت برای دستیابی به نرخ موفقیت ۳۸ درصد، به حدود ۵۰ نمایش تخصصی و چهار ساعت تنظیم دقیق (fine-tuning) نیاز دارد.
فرایند متداول جمعآوری دادههای هوش مصنوعی تجسمیافته مبتنی بر دادههای عملیات از راه دور (teleoperation) است. در این روش، یک مهندس با پوشیدن هدست واقعیت مجازی (VR)، بازوی ربات را فریم به فریم در حین انجام یک وظیفه هدایت میکند و این فرایند را دهها بار تکرار میکند. سپس تنظیمات تحت نظارت (supervised fine-tuning) به مدت یک شب اجرا میشود. هزینه یک ربات جمعآوری داده به تنهایی صدها هزار دلار است و هر نمایش میتواند بیش از صد دلار هزینه جانبی داشته باشد. کارخانههای داده در هند و کارگران پارهوقت در شهرهای کوچک چین به عنوان ارزانترین منابع دادههای حرکتی شناخته میشوند، اما هزینهها همچنان مقیاسپذیر نیستند.
HOST این فرایند را معکوس میکند. به جای اینکه از ربات خواسته شود حرکات مفاصل انسان را تقلید کند، HOST از ربات میخواهد وضعیت نهایی را تصور کرده و حرکت را معکوسسازی (reverse-engineer) کند. این فریمورک از دو ماژول داخلی تشکیل شده است:
- ماژول بینایی (vision module): ویدیوی نمایش انسانی را تماشا کرده و صحنه را همانطور که ربات میبیند، رندر میکند.
- ماژول عمل (action module): مسیر مفاصل را محاسبه میکند که همان رندر را تولید کند.
یک ماژول همترازی زمانبندی پویا (dynamic time-warping alignment) فریمهای ویدیوی انسانی را به مراحل اجرای ربات نگاشت میکند و خطای همترازی را حدود یک مرتبه کاهش میدهد.
این رویکرد ریشه در نظریه علوم شناختی شبیهسازی (simulation theory) دارد که استدلال میکند انسانها مهارتهای حرکتی جدید را با تمرین ذهنی نتیجه مطلوب قبل از اقدام یاد میگیرند. تیم چینی این منطق را وارد یادگیری رباتیک کرده و تنظیمات آفلاین را با یادگیری درون متنی (in-context learning) در زمان استنتاج جایگزین کرده است. ربات روی دادههای جدید دوباره آموزش نمیبیند؛ بلکه ویدیو را به عنوان یک پرامپت مصرف میکند.
X Square Robot در اواخر سال ۲۰۲۳ تأسیس شد و تاکنون بیش از یک میلیارد یوان چین در هشت مرحله سرمایهگذاری جذب کرده است. از جمله سرمایهگذاران آن میتوان به Meituan Strategic Investment، Alibaba Cloud، Lenovo Capital و Delian Capital اشاره کرد. انتشار متنباز این فناوری، یک شرطبندی عمدی برای جذب توسعهدهندگان و ایجاد فرصتهای آزمایشی در سطح سازمانی است.
عدد ۶۲ درصد یک معیار پژوهشی است و به معنای آمادگی ربات خانگی برای استقرار نیست، اما گفتگو درباره آینده خطوط لوله آموزشی هوش مصنوعی تجسمیافته را تغییر میدهد، به خصوص اگر یادگیری در زمان استنتاج به استاندارد تبدیل شود.
چرا این خبر مهم است؟
HOST رویکرد سنتی جمعآوری دادههای رباتیک را زیر سؤال میبرد و نشان میدهد که رباتها میتوانند با تماشای ویدیوهای کوتاه، مهارتهای جدیدی بیاموزند. این تغییر میتواند هزینهها و زمان آموزش رباتها را به شدت کاهش دهد و راه را برای کاربردهای گستردهتر هوش مصنوعی تجسمیافته هموار کند. علاوه بر این، انتشار متنباز این فناوری، فرصتهای جدیدی برای مشارکت جامعه توسعهدهندگان و نوآوریهای آینده فراهم میکند.
وضعیت کاربران ایرانی
این خبر بهطور مستقیم به وضعیت کاربران ایرانی اشارهای ندارد، اما فناوریهای مشابه میتوانند در آینده در صنایع مختلف از جمله تولید، خدمات و آموزش در ایران کاربرد داشته باشند.