Gemini Robotics ER 2؛ ارتقای رباتیک با درک ویدیو، ارکستراسیون وظایف و همکاری چند ربات

Gemini Robotics ER 2؛ ارتقای رباتیک با درک ویدیو، ارکستراسیون وظایف و همکاری چند ربات

برای اینکه ربات‌ها بتوانند در محیط‌های روزمره به انسان‌ها کمک کنند، تنها داشتن استدلال فضایی (spatial reasoning) دقیق کافی نیست. ربات‌ها همچنین باید سریع فکر کنند، زمان‌بندی تصمیم‌گیری‌های خود را تنظیم نمایند و با سرعت آنی و لحظه‌ای دنیای فیزیکی استدلال کنند.

به همین دلیل، امروز مدل Gemini Robotics ER 2 را عرضه می‌کنیم؛ قدرتمندترین مدل «استدلال تجسم‌یافته» (embodied reasoning) ما برای حوزه رباتیک. Gemini Robotics ER 2 را می‌توان به عنوان یک مغز سطح بالا برای ربات‌ها در نظر گرفت. این مدل به ربات‌ها اجازه می‌دهد با انسان‌ها گفتگو کنند، دنیای فیزیکی را درک نمایند و وظایف چندمرحله‌ای را برنامه‌ریزی کنند. سپس اجرای حرکتی را به مدل‌های سطح پایین‌تر «تصویر-زبان-عمل» (Vision-Language-Action یا VLA) می‌سپارد. همچنین Gemini Robotics ER 2 می‌تواند به صورت بومی ابزارهایی مانند جستجوی گوگل (Google Search) را برای یافتن اطلاعات یا هر تابع دیگری که توسط کاربر تعریف شده، فراخوانی کند. طراحی این مدل به ربات اجازه می‌دهد هم‌زمان با انجام اقدامات خود، درباره مرحله بعدی «فکر» کند.

مدل Gemini Robotics ER 2 یک ارتقای چشمگیر نسبت به Gemini Robotics ER 1.6 محسوب می‌شود. ربات‌ها اکنون با تماشای جریان‌های ویدیویی مداوم، می‌توانند پیشرفت خود را پیگیری کرده، در صورت بروز خطا خود را تطبیق دهند و دقیقاً بدانند چه زمانی باید به مرحله بعدی بروند. علاوه بر این، ما قابلیت همکاری چند ربات (multi-robot collaboration) را معرفی کرده‌ایم که به ربات‌ها امکان می‌دهد در فضاهای مشترک با یکدیگر همکاری کرده و گردش‌های کاری پیچیده‌ای را که یک ربات به تنهایی قادر به انجام آن نیست، به پایان برسانند.

مدل Gemini Robotics ER 2 هم‌اکنون از طریق Gemini API و Google AI Studio به صورت عمومی در دسترس توسعه‌دهندگان قرار دارد و پیش‌نمایش خصوصی آن نیز در Gemini Enterprise Agent Platform ارائه شده است. برای کمک به شروع کار، ما نمونه‌هایی از نحوه پیکربندی مدل و پرامپت‌نویسی برای اجرای وظایف کاربردی‌تر هوش مصنوعی فیزیکی را به اشتراک می‌گذاریم.

پیشبرد قابلیت‌های عاملیت فیزیکی

اکثر وظایف در دنیای فیزیکی پیچیده هستند و برای تکمیل به مراحل متعددی نیاز دارند. مدل Gemini Robotics ER 2 یک عامل فیزیکی (physical agent) است که مراحل را برای ربات ارکستره (هماهنگ) می‌کند، امکان اصلاح خودکار (self-correct) را به آن می‌دهد و تعمیم به موقعیت‌های جدیدتر را فراهم می‌سازد. برای ساخت یک سیستم عاملی (agentic setup)، توسعه‌دهندگان می‌توانند رابط‌های کنترل سطح پایین — مانند مدل‌های تصویر-زبان-عمل (VLA) یا APIهای مسیریابی — را به عنوان ابزار تعریف کرده و ویدیو، صوت یا متن چندوجهی را به صورت مستقیم به مدل استریم کنند.

مدل Gemini Robotics ER 2 این گردش کار ارکستراسیون ابزار را بهبود می‌بخشد. ما می‌توانیم عملکرد آن را با ربات‌ها در محیط شبیه‌سازی، با استفاده از کنترل واقعی ربات در دنیای واقعی و حتی در کنار یک انسان که ربات را از راه دور کنترل می‌کند، ارزیابی کنیم.