جمینای رباتیکس ER 2: ارتقای رباتیک با درک ویدیو، مدیریت وظایف و همکاری چندرباتی

جمینای رباتیکس ER 2: ارتقای رباتیک با درک ویدیو، مدیریت وظایف و همکاری چندرباتی

برای اینکه ربات‌ها بتوانند به انسان‌ها در محیط‌های روزمره کمک کنند، تنها استدلال فضایی دقیق کافی نیست. ربات‌ها باید سریع فکر کنند، زمان‌بندی تصمیمات خود را تنظیم نمایند و با سرعت آنی دنیای واقعی استدلال کنند. به همین دلیل، امروز ما مدل «Gemini Robotics ER 2» را به عنوان توانمندترین مدل «استدلال تجسم‌یافته» (Embodied Reasoning) خود برای حوزه رباتیک معرفی می‌کنیم.

مدل Gemini Robotics ER 2 را می‌توان به عنوان یک مغز سطح بالا برای ربات‌ها در نظر گرفت. این مدل به ربات‌ها اجازه می‌دهد با انسان‌ها گفتگو کنند، دنیای فیزیکی را درک کنند و وظایف چندمرحله‌ای را برنامه‌ریزی نمایند. سپس اجرای حرکتی به یک مدل سطح پایین‌تر بینایی-زبان-عمل (Vision-Language-Action یا VLA) واگذار می‌شود. علاوه بر این، Gemini Robotics ER 2 می‌تواند ابزارهایی مانند جستجوی گوگل (Google Search) را برای یافتن اطلاعات یا هر تابع تعریف‌شده دیگری توسط کاربر فراخوانی کند. طراحی این مدل به ربات امکان می‌دهد هم‌زمان با انجام اقدامات خود، درباره مرحله بعدی نیز «فکر» کند.

مدل Gemini Robotics ER 2 ارتقای چشمگیری نسبت به نسخه Gemini Robotics ER 1.6 محسوب می‌شود. ربات‌ها اکنون با مشاهده فیدهای ویدیویی مداوم می‌توانند پیشرفت خود را پیگیری کنند، در صورت بروز مشکل با شرایط سازگار شوند و دقیقاً بدانند چه زمانی باید به مرحله بعد بروند. ما همچنین قابلیت همکاری چندرباتی را معرفی می‌کنیم که به ربات‌ها امکان می‌دهد در فضاهای مشترک با یکدیگر همکاری کرده و گردش‌های کاری پیچیده‌ای را که یک ربات به تنهایی قادر به انجام آن‌ها نیست، تکمیل کنند.

مدل Gemini Robotics ER 2 هم‌اکنون از طریق API جمینای، Google AI Studio و به صورت پیش‌نمایش خصوصی در پلتفرم ایجنت سازمانی جمینای (Gemini Enterprise Agent Platform) در دسترس توسعه‌دهندگان قرار دارد. برای کمک به شروع کار، نمونه‌هایی از نحوه پیکربندی مدل و پرامپت‌نویسی برای پیشبرد وظایف کاربردی‌تر هوش مصنوعی فیزیکی به اشتراک گذاشته شده است.

توسعه قابلیت‌های عاملیت فیزیکی

اکثر وظایف در دنیای فیزیکی پیچیده هستند و برای تکمیل به مراحل متعددی نیاز دارند. مدل Gemini Robotics ER 2 یک عامل فیزیکی (Physical Agent) است که مراحل را برای ربات مدیریت کرده و امکان خوداصلاحی و تعمیم‌دهی به موقعیت‌های جدیدتر را فراهم می‌سازد. برای ایجاد یک ساختار عاملی (Agentic)، توسعه‌دهندگان می‌توانند رابط‌های کنترلی سطح پایین مانند مدل‌های بینایی-زبان-عمل (VLA) یا APIهای مسیریابی را به عنوان ابزار تعریف کرده و جریان‌های چندرسانه‌ای ویدیو، صوت یا متن را به طور مستقیم به مدل ارسال کنند.

مدل Gemini Robotics ER 2 این گردش کارِ مدیریت ابزار را بهبود می‌بخشد. ما می‌توانیم عملکرد آن را با ربات‌ها در محیط شبیه‌سازی‌شده، با استفاده از کنترل واقعی ربات و حتی همراه با یک اپراتور انسانی که ربات را از راه دور کنترل می‌کند، ارزیابی کنیم.