جمینای رباتیکس ER 2: ارتقای رباتیک با درک ویدیو، مدیریت وظایف و همکاری چندرباتی
برای اینکه رباتها بتوانند به انسانها در محیطهای روزمره کمک کنند، تنها استدلال فضایی دقیق کافی نیست. رباتها باید سریع فکر کنند، زمانبندی تصمیمات خود را تنظیم نمایند و با سرعت آنی دنیای واقعی استدلال کنند. به همین دلیل، امروز ما مدل «Gemini Robotics ER 2» را به عنوان توانمندترین مدل «استدلال تجسمیافته» (Embodied Reasoning) خود برای حوزه رباتیک معرفی میکنیم.
مدل Gemini Robotics ER 2 را میتوان به عنوان یک مغز سطح بالا برای رباتها در نظر گرفت. این مدل به رباتها اجازه میدهد با انسانها گفتگو کنند، دنیای فیزیکی را درک کنند و وظایف چندمرحلهای را برنامهریزی نمایند. سپس اجرای حرکتی به یک مدل سطح پایینتر بینایی-زبان-عمل (Vision-Language-Action یا VLA) واگذار میشود. علاوه بر این، Gemini Robotics ER 2 میتواند ابزارهایی مانند جستجوی گوگل (Google Search) را برای یافتن اطلاعات یا هر تابع تعریفشده دیگری توسط کاربر فراخوانی کند. طراحی این مدل به ربات امکان میدهد همزمان با انجام اقدامات خود، درباره مرحله بعدی نیز «فکر» کند.
مدل Gemini Robotics ER 2 ارتقای چشمگیری نسبت به نسخه Gemini Robotics ER 1.6 محسوب میشود. رباتها اکنون با مشاهده فیدهای ویدیویی مداوم میتوانند پیشرفت خود را پیگیری کنند، در صورت بروز مشکل با شرایط سازگار شوند و دقیقاً بدانند چه زمانی باید به مرحله بعد بروند. ما همچنین قابلیت همکاری چندرباتی را معرفی میکنیم که به رباتها امکان میدهد در فضاهای مشترک با یکدیگر همکاری کرده و گردشهای کاری پیچیدهای را که یک ربات به تنهایی قادر به انجام آنها نیست، تکمیل کنند.
مدل Gemini Robotics ER 2 هماکنون از طریق API جمینای، Google AI Studio و به صورت پیشنمایش خصوصی در پلتفرم ایجنت سازمانی جمینای (Gemini Enterprise Agent Platform) در دسترس توسعهدهندگان قرار دارد. برای کمک به شروع کار، نمونههایی از نحوه پیکربندی مدل و پرامپتنویسی برای پیشبرد وظایف کاربردیتر هوش مصنوعی فیزیکی به اشتراک گذاشته شده است.
توسعه قابلیتهای عاملیت فیزیکی
اکثر وظایف در دنیای فیزیکی پیچیده هستند و برای تکمیل به مراحل متعددی نیاز دارند. مدل Gemini Robotics ER 2 یک عامل فیزیکی (Physical Agent) است که مراحل را برای ربات مدیریت کرده و امکان خوداصلاحی و تعمیمدهی به موقعیتهای جدیدتر را فراهم میسازد. برای ایجاد یک ساختار عاملی (Agentic)، توسعهدهندگان میتوانند رابطهای کنترلی سطح پایین مانند مدلهای بینایی-زبان-عمل (VLA) یا APIهای مسیریابی را به عنوان ابزار تعریف کرده و جریانهای چندرسانهای ویدیو، صوت یا متن را به طور مستقیم به مدل ارسال کنند.
مدل Gemini Robotics ER 2 این گردش کارِ مدیریت ابزار را بهبود میبخشد. ما میتوانیم عملکرد آن را با رباتها در محیط شبیهسازیشده، با استفاده از کنترل واقعی ربات و حتی همراه با یک اپراتور انسانی که ربات را از راه دور کنترل میکند، ارزیابی کنیم.