جمینای رباتیکس ER 2؛ ارتقای رباتیک با درک ویدیو، ارکستراسیون وظایف و همکاری چند رباتی
برای اینکه رباتها بتوانند در محیطهای روزمره به انسانها کمک کنند، تنها داشتن استدلال فضایی (Spatial reasoning) دقیق کافی نیست. رباتها باید سریع فکر کنند، زمانبندی تصمیمات خود را تنظیم نمایند و با سرعت آنی و لحظهای جهان فیزیکی استدلال کنند.
به همین دلیل، امروز مدل Gemini Robotics ER 2 را معرفی میکنیم که توانمندترین مدل «استدلال تجسمیافته» (Embodied reasoning) ما برای حوزه رباتیک است. میتوان Gemini Robotics ER 2 را به عنوان یک مغز سطح بالا برای رباتها در نظر گرفت. این مدل به رباتها اجازه میدهد با انسانها گفتگو کنند، جهان فیزیکی را درک نمایند و وظایف چندمرحلهای را برنامهریزی کنند. سپس، اجرای حرکتی را به مدلهای سطح پایینتر بینایی-زبان-عمل (Vision-Language-Action / VLA) واگذار میکند. همچنین Gemini Robotics ER 2 میتواند به صورت بومی ابزارهایی مانند جستجوی گوگل را برای یافتن اطلاعات یا هر تابع تعریفشده دیگری توسط کاربر فراخوانی کند. طراحی این مدل به ربات اجازه میدهد در حالی که اقدامات خود را انجام میدهد، همزمان به مرحله بعدی «فکر» کند.
مدل Gemini Robotics ER 2 ارتقای چشمگیری نسبت به نسخه Gemini Robotics ER 1.6 محسوب میشود. رباتها اکنون با مشاهده فیدهای ویدیویی مداوم میتوانند پیشرفت خود را پیگیری کنند، در صورت بروز مشکل خود را تطبیق دهند و دقیقاً بدانند چه زمانی باید به مرحله بعدی بروند. ما همچنین قابلیت همکاری چند رباتی (Multi-robot collaboration) را معرفی کردهایم که به رباتها امکان میدهد در فضاهای مشترک با یکدیگر همکاری کنند و جریانهای کاری پیچیدهای را که یک ربات به تنهایی قادر به انجام آن نیست، به پایان برسانند.
مدل Gemini Robotics ER 2 هماکنون از طریق Gemini API، Google AI Studio و به صورت پیشنمایش خصوصی در Gemini Enterprise Agent Platform در دسترس توسعهدهندگان قرار دارد. برای کمک به شروع کار، نمونههایی از نحوه پیکربندی مدل و پرامپتنویسی برای پیشبرد وظایف کاربردیتر هوش مصنوعی فیزیکی را به اشتراک میگذاریم.
پیشبرد قابلیتهای عاملیت فیزیکی
اکثر وظایف در جهان فیزیکی پیچیده هستند و برای تکمیل به مراحل متعددی نیاز دارند. Gemini Robotics ER 2 یک عامل فیزیکی (Physical agent) است که مراحل را برای ربات سازماندهی کرده و امکان اصلاح خودکار و تعمیم به موقعیتهای جدیدتر را فراهم میکند. برای ایجاد یک ساختار عاملی (Agentic setup)، توسعهدهندگان میتوانند رابطهای کنترلی سطح پایین — مانند مدلهای بینایی-زبان-عمل (VLA) یا APIهای مسیریابی — را به عنوان ابزار تعریف کرده و ویدیو، صوت یا متن چندوجهی را مستقیماً به مدل استریم کنند.
مدل Gemini Robotics ER 2 این جریان کاری ارکستراسیون ابزار را بهبود میبخشد. ما میتوانیم عملکرد آن را با رباتها در شبیهسازی، با استفاده از کنترل واقعی ربات در دنیای واقعی و حتی همگامسازی آن با انسانی که ربات را از راه دور کنترل میکند، ارزیابی کنیم.