Gemini Robotics ER 2؛ ارتقای رباتیک با درک ویدیو، ارکستراسیون وظایف و همکاری چند ربات
برای اینکه رباتها بتوانند در محیطهای روزمره به انسانها کمک کنند، تنها داشتن استدلال فضایی (spatial reasoning) دقیق کافی نیست. رباتها همچنین باید سریع فکر کنند، زمانبندی تصمیمگیریهای خود را تنظیم نمایند و با سرعت آنی و لحظهای دنیای فیزیکی استدلال کنند.
به همین دلیل، امروز مدل Gemini Robotics ER 2 را عرضه میکنیم؛ قدرتمندترین مدل «استدلال تجسمیافته» (embodied reasoning) ما برای حوزه رباتیک. Gemini Robotics ER 2 را میتوان به عنوان یک مغز سطح بالا برای رباتها در نظر گرفت. این مدل به رباتها اجازه میدهد با انسانها گفتگو کنند، دنیای فیزیکی را درک نمایند و وظایف چندمرحلهای را برنامهریزی کنند. سپس اجرای حرکتی را به مدلهای سطح پایینتر «تصویر-زبان-عمل» (Vision-Language-Action یا VLA) میسپارد. همچنین Gemini Robotics ER 2 میتواند به صورت بومی ابزارهایی مانند جستجوی گوگل (Google Search) را برای یافتن اطلاعات یا هر تابع دیگری که توسط کاربر تعریف شده، فراخوانی کند. طراحی این مدل به ربات اجازه میدهد همزمان با انجام اقدامات خود، درباره مرحله بعدی «فکر» کند.
مدل Gemini Robotics ER 2 یک ارتقای چشمگیر نسبت به Gemini Robotics ER 1.6 محسوب میشود. رباتها اکنون با تماشای جریانهای ویدیویی مداوم، میتوانند پیشرفت خود را پیگیری کرده، در صورت بروز خطا خود را تطبیق دهند و دقیقاً بدانند چه زمانی باید به مرحله بعدی بروند. علاوه بر این، ما قابلیت همکاری چند ربات (multi-robot collaboration) را معرفی کردهایم که به رباتها امکان میدهد در فضاهای مشترک با یکدیگر همکاری کرده و گردشهای کاری پیچیدهای را که یک ربات به تنهایی قادر به انجام آن نیست، به پایان برسانند.
مدل Gemini Robotics ER 2 هماکنون از طریق Gemini API و Google AI Studio به صورت عمومی در دسترس توسعهدهندگان قرار دارد و پیشنمایش خصوصی آن نیز در Gemini Enterprise Agent Platform ارائه شده است. برای کمک به شروع کار، ما نمونههایی از نحوه پیکربندی مدل و پرامپتنویسی برای اجرای وظایف کاربردیتر هوش مصنوعی فیزیکی را به اشتراک میگذاریم.
پیشبرد قابلیتهای عاملیت فیزیکی
اکثر وظایف در دنیای فیزیکی پیچیده هستند و برای تکمیل به مراحل متعددی نیاز دارند. مدل Gemini Robotics ER 2 یک عامل فیزیکی (physical agent) است که مراحل را برای ربات ارکستره (هماهنگ) میکند، امکان اصلاح خودکار (self-correct) را به آن میدهد و تعمیم به موقعیتهای جدیدتر را فراهم میسازد. برای ساخت یک سیستم عاملی (agentic setup)، توسعهدهندگان میتوانند رابطهای کنترل سطح پایین — مانند مدلهای تصویر-زبان-عمل (VLA) یا APIهای مسیریابی — را به عنوان ابزار تعریف کرده و ویدیو، صوت یا متن چندوجهی را به صورت مستقیم به مدل استریم کنند.
مدل Gemini Robotics ER 2 این گردش کار ارکستراسیون ابزار را بهبود میبخشد. ما میتوانیم عملکرد آن را با رباتها در محیط شبیهسازی، با استفاده از کنترل واقعی ربات در دنیای واقعی و حتی در کنار یک انسان که ربات را از راه دور کنترل میکند، ارزیابی کنیم.