رونمایی از Gemini Robotics ER 2؛ ارتقای رباتیک با درک ویدیویی، ارکستراسیون وظایف و همکاری چند رباتی

برای اینکه ربات‌ها بتوانند به انسان‌ها در محیط‌های روزمره کمک کنند، تنها استدلال فضایی دقیق کافی نیست. ربات‌ها باید سریع فکر کنند، تصمیمات خود را زمان‌بندی نمایند و متناسب با سرعت واقعی جهان فیزیکی استدلال کنند.

به همین دلیل، امروز مدل Gemini Robotics ER 2 معرفی شده است که قدرتمندترین مدل «استدلال تجسم‌یافته» (embodied reasoning) برای رباتیک محسوب می‌شود. می‌توان Gemini Robotics ER 2 را به عنوان یک مغز سطح بالا برای ربات‌ها در نظر گرفت. این مدل به ربات‌ها امکان می‌دهد با انسان‌ها گفتگو کنند، جهان فیزیکی را درک نمایند و وظایف چندمرحله‌ای را برنامه‌ریزی کنند. سپس اجرای حرکتی را به مدل‌های سطح پایین‌تر بینایی-زبان-عمل (VLA یا Vision-Language-Action) واگذار می‌کند. همچنین Gemini Robotics ER 2 به صورت بومی می‌تواند ابزارهایی مانند جستجوی گوگل (Google Search) یا هر تابع تعریف‌شده دیگری از سوی کاربر را برای یافتن اطلاعات فراخوانی کند. طراحی این مدل به ربات اجازه می‌دهد هم‌زمان با انجام اقدامات خود، به مرحله بعدی نیز «فکر» کند.

مدل Gemini Robotics ER 2 یک ارتقای چشمگیر نسبت به Gemini Robotics ER 1.6 به شمار می‌رود. ربات‌ها اکنون با تماشای ورودی‌های ویدیویی مداوم می‌توانند پیشرفت خود را پیگیری کرده، در صورت بروز مشکل با شرایط سازگار شوند و دقیقاً بدانند چه زمانی باید به مرحله بعد بروند. علاوه بر این، قابلیت همکاری چند رباتی (multi-robot collaboration) نیز معرفی شده است که به ربات‌ها اجازه می‌دهد در فضاهای مشترک با یکدیگر همکاری کرده و جریان‌های کاری پیچیده‌ای را که یک ربات به تنهایی قادر به انجام آن نیست، تکمیل کنند.

مدل Gemini Robotics ER 2 هم‌اکنون از طریق Gemini API، Google AI Studio و به صورت پیش‌نمایش خصوصی در Gemini Enterprise Agent Platform در دسترس توسعه‌دهندگان قرار دارد. برای کمک به شروع کار، نمونه‌هایی از نحوه پیکربندی مدل و پرامپت‌نویسی برای انجام وظایف کاربردی‌تر هوش مصنوعی فیزیکی به اشتراک گذاشته شده است.

پیشبرد قابلیت‌های عاملیت فیزیکی

بیشتر وظایف در جهان فیزیکی پیچیده هستند و برای تکمیل به چندین مرحله نیاز دارند. مدل Gemini Robotics ER 2 یک عامل فیزیکی (physical agent) است که مراحل را برای ربات ارکستراسیون (مدیریت و هماهنگی) کرده و آن را قادر می‌سازد خود را اصلاح کند و با موقعیت‌های جدید تعمیم دهد. برای ایجاد یک ساختار عاملی (agentic)، توسعه‌دهندگان می‌توانند رابط‌های کنترلی سطح پایین — مانند مدل‌های بینایی-زبان-عمل (VLA) یا APIهای مسیریابی — را به عنوان ابزار تعریف کرده و ویدیو، صوت یا متن چندوجهی را به صورت مستقیم به مدل استریم کنند.

مدل Gemini Robotics ER 2 این گردش کاری ارکستراسیون ابزار را بهبود می‌بخشد. امکان ارزیابی عملکرد آن با ربات‌ها در محیط شبیه‌سازی، با استفاده از کنترل واقعی ربات و حتی در کنار یک انسان که ربات را از راه دور کنترل می‌کند، فراهم شده است.