رونمایی از Gemini Robotics ER 2؛ ارتقای رباتیک با درک ویدیویی، ارکستراسیون وظایف و همکاری چند رباتی
برای اینکه رباتها بتوانند به انسانها در محیطهای روزمره کمک کنند، تنها استدلال فضایی دقیق کافی نیست. رباتها باید سریع فکر کنند، تصمیمات خود را زمانبندی نمایند و متناسب با سرعت واقعی جهان فیزیکی استدلال کنند.
به همین دلیل، امروز مدل Gemini Robotics ER 2 معرفی شده است که قدرتمندترین مدل «استدلال تجسمیافته» (embodied reasoning) برای رباتیک محسوب میشود. میتوان Gemini Robotics ER 2 را به عنوان یک مغز سطح بالا برای رباتها در نظر گرفت. این مدل به رباتها امکان میدهد با انسانها گفتگو کنند، جهان فیزیکی را درک نمایند و وظایف چندمرحلهای را برنامهریزی کنند. سپس اجرای حرکتی را به مدلهای سطح پایینتر بینایی-زبان-عمل (VLA یا Vision-Language-Action) واگذار میکند. همچنین Gemini Robotics ER 2 به صورت بومی میتواند ابزارهایی مانند جستجوی گوگل (Google Search) یا هر تابع تعریفشده دیگری از سوی کاربر را برای یافتن اطلاعات فراخوانی کند. طراحی این مدل به ربات اجازه میدهد همزمان با انجام اقدامات خود، به مرحله بعدی نیز «فکر» کند.
مدل Gemini Robotics ER 2 یک ارتقای چشمگیر نسبت به Gemini Robotics ER 1.6 به شمار میرود. رباتها اکنون با تماشای ورودیهای ویدیویی مداوم میتوانند پیشرفت خود را پیگیری کرده، در صورت بروز مشکل با شرایط سازگار شوند و دقیقاً بدانند چه زمانی باید به مرحله بعد بروند. علاوه بر این، قابلیت همکاری چند رباتی (multi-robot collaboration) نیز معرفی شده است که به رباتها اجازه میدهد در فضاهای مشترک با یکدیگر همکاری کرده و جریانهای کاری پیچیدهای را که یک ربات به تنهایی قادر به انجام آن نیست، تکمیل کنند.
مدل Gemini Robotics ER 2 هماکنون از طریق Gemini API، Google AI Studio و به صورت پیشنمایش خصوصی در Gemini Enterprise Agent Platform در دسترس توسعهدهندگان قرار دارد. برای کمک به شروع کار، نمونههایی از نحوه پیکربندی مدل و پرامپتنویسی برای انجام وظایف کاربردیتر هوش مصنوعی فیزیکی به اشتراک گذاشته شده است.
پیشبرد قابلیتهای عاملیت فیزیکی
بیشتر وظایف در جهان فیزیکی پیچیده هستند و برای تکمیل به چندین مرحله نیاز دارند. مدل Gemini Robotics ER 2 یک عامل فیزیکی (physical agent) است که مراحل را برای ربات ارکستراسیون (مدیریت و هماهنگی) کرده و آن را قادر میسازد خود را اصلاح کند و با موقعیتهای جدید تعمیم دهد. برای ایجاد یک ساختار عاملی (agentic)، توسعهدهندگان میتوانند رابطهای کنترلی سطح پایین — مانند مدلهای بینایی-زبان-عمل (VLA) یا APIهای مسیریابی — را به عنوان ابزار تعریف کرده و ویدیو، صوت یا متن چندوجهی را به صورت مستقیم به مدل استریم کنند.
مدل Gemini Robotics ER 2 این گردش کاری ارکستراسیون ابزار را بهبود میبخشد. امکان ارزیابی عملکرد آن با رباتها در محیط شبیهسازی، با استفاده از کنترل واقعی ربات و حتی در کنار یک انسان که ربات را از راه دور کنترل میکند، فراهم شده است.