جمینای رباتیکس ER 2؛ ارتقای رباتیک با درک ویدیو، ارکستراسیون وظایف و همکاری چند رباتی

جمینای رباتیکس ER 2؛ ارتقای رباتیک با درک ویدیو، ارکستراسیون وظایف و همکاری چند رباتی

برای اینکه ربات‌ها بتوانند در محیط‌های روزمره به انسان‌ها کمک کنند، تنها داشتن استدلال فضایی (Spatial reasoning) دقیق کافی نیست. ربات‌ها باید سریع فکر کنند، زمان‌بندی تصمیمات خود را تنظیم نمایند و با سرعت آنی و لحظه‌ای جهان فیزیکی استدلال کنند.

به همین دلیل، امروز مدل Gemini Robotics ER 2 را معرفی می‌کنیم که توانمندترین مدل «استدلال تجسم‌یافته» (Embodied reasoning) ما برای حوزه رباتیک است. می‌توان Gemini Robotics ER 2 را به عنوان یک مغز سطح بالا برای ربات‌ها در نظر گرفت. این مدل به ربات‌ها اجازه می‌دهد با انسان‌ها گفتگو کنند، جهان فیزیکی را درک نمایند و وظایف چندمرحله‌ای را برنامه‌ریزی کنند. سپس، اجرای حرکتی را به مدل‌های سطح پایین‌تر بینایی-زبان-عمل (Vision-Language-Action / VLA) واگذار می‌کند. همچنین Gemini Robotics ER 2 می‌تواند به صورت بومی ابزارهایی مانند جستجوی گوگل را برای یافتن اطلاعات یا هر تابع تعریف‌شده دیگری توسط کاربر فراخوانی کند. طراحی این مدل به ربات اجازه می‌دهد در حالی که اقدامات خود را انجام می‌دهد، هم‌زمان به مرحله بعدی «فکر» کند.

مدل Gemini Robotics ER 2 ارتقای چشمگیری نسبت به نسخه Gemini Robotics ER 1.6 محسوب می‌شود. ربات‌ها اکنون با مشاهده فیدهای ویدیویی مداوم می‌توانند پیشرفت خود را پیگیری کنند، در صورت بروز مشکل خود را تطبیق دهند و دقیقاً بدانند چه زمانی باید به مرحله بعدی بروند. ما همچنین قابلیت همکاری چند رباتی (Multi-robot collaboration) را معرفی کرده‌ایم که به ربات‌ها امکان می‌دهد در فضاهای مشترک با یکدیگر همکاری کنند و جریان‌های کاری پیچیده‌ای را که یک ربات به تنهایی قادر به انجام آن نیست، به پایان برسانند.

مدل Gemini Robotics ER 2 هم‌اکنون از طریق Gemini API، Google AI Studio و به صورت پیش‌نمایش خصوصی در Gemini Enterprise Agent Platform در دسترس توسعه‌دهندگان قرار دارد. برای کمک به شروع کار، نمونه‌هایی از نحوه پیکربندی مدل و پرامپت‌نویسی برای پیشبرد وظایف کاربردی‌تر هوش مصنوعی فیزیکی را به اشتراک می‌گذاریم.

پیشبرد قابلیت‌های عاملیت فیزیکی

اکثر وظایف در جهان فیزیکی پیچیده هستند و برای تکمیل به مراحل متعددی نیاز دارند. Gemini Robotics ER 2 یک عامل فیزیکی (Physical agent) است که مراحل را برای ربات سازماندهی کرده و امکان اصلاح خودکار و تعمیم به موقعیت‌های جدیدتر را فراهم می‌کند. برای ایجاد یک ساختار عاملی (Agentic setup)، توسعه‌دهندگان می‌توانند رابط‌های کنترلی سطح پایین — مانند مدل‌های بینایی-زبان-عمل (VLA) یا APIهای مسیریابی — را به عنوان ابزار تعریف کرده و ویدیو، صوت یا متن چندوجهی را مستقیماً به مدل استریم کنند.

مدل Gemini Robotics ER 2 این جریان کاری ارکستراسیون ابزار را بهبود می‌بخشد. ما می‌توانیم عملکرد آن را با ربات‌ها در شبیه‌سازی، با استفاده از کنترل واقعی ربات در دنیای واقعی و حتی همگام‌سازی آن با انسانی که ربات را از راه دور کنترل می‌کند، ارزیابی کنیم.