جمینای رباتیکس ER 2: ارتقای رباتیک با درک ویدیو، سازمان‌دهی وظایف و همکاری چند ربات

جمینای رباتیکس ER 2: ارتقای رباتیک با درک ویدیو، سازمان‌دهی وظایف و همکاری چند ربات

برای اینکه ربات‌ها بتوانند به انسان‌ها در محیط‌های روزمره کمک کنند، صرفاً استدلال فضایی دقیق کافی نیست. ربات‌ها باید سریع فکر کنند، تصمیمات خود را زمان‌بندی نمایند و با سرعت آنی جهان فیزیکی استدلال کنند.

به همین دلیل، ما امروز Gemini Robotics ER 2 را معرفی می‌کنیم؛ تواناترین مدل «استدلال تجسم‌یافته» (Embodied Reasoning) ما برای رباتیک. Gemini Robotics ER 2 را مانند یک مغز سطح بالا برای ربات‌ها تصور کنید. این مدل به ربات‌ها امکان می‌دهد با انسان‌ها گفتگو کنند، جهان فیزیکی را درک نمایند و وظایف چندمرحله‌ای را برنامه‌ریزی کنند. سپس اجرای حرکتی را به هر مدل بینایی-زبان-عمل (Vision-Language-Action یا VLA) در سطح پایین‌تر می‌سپارد. Gemini Robotics ER 2 همچنین می‌تواند به‌طور بومی ابزارهایی مانند جستجوی گوگل (Google Search) یا هر تابع تعریف‌شده توسط کاربر را فراخوانی کند. طراحی این مدل به ربات اجازه می‌دهد در حالی که اقدامات خود را انجام می‌دهد، هم‌زمان درباره مرحله بعدی «فکر» کند.

ارتقای چشمگیر نسبت به نسخه قبل و قابلیت‌های جدید

مدل Gemini Robotics ER 2 یک ارتقای چشمگیر نسبت به Gemini Robotics ER 1.6 محسوب می‌شود. ربات‌ها اکنون با تماشای جریان‌های ویدیویی مداوم، می‌توانند پیشرفت خود را پیگیری کنند، در صورت بروز مشکل خود را تطبیق دهند و دقیقاً بدانند چه زمانی باید به مرحله بعدی بروند. ما همچنین قابلیت همکاری چند ربات (Multi-robot collaboration) را معرفی می‌کنیم که به ربات‌ها امکان می‌دهد در فضاهای مشترک با یکدیگر کار کرده و جریان‌های کاری پیچیده‌ای را که یک ربات به تنهایی قادر به انجام آن نیست، تکمیل کنند.

مدل Gemini Robotics ER 2 هم‌اکنون از طریق Gemini API، Google AI Studio و به صورت پیش‌نمایش خصوصی در Gemini Enterprise Agent Platform در دسترس توسعه‌دهندگان قرار دارد. برای کمک به شروع کار شما، نمونه‌هایی از نحوه پیکربندی مدل و پرامپت‌نویسی برای پیشبرد وظایف کاربردی‌تر هوش مصنوعی فیزیکی را به اشتراک می‌گذاریم.

پیشبرد قابلیت‌های عاملیت فیزیکی

بیشتر وظایف در دنیای فیزیکی پیچیده هستند و برای تکمیل به مراحل متعددی نیاز دارند. مدل Gemini Robotics ER 2 یک «عامل فیزیکی» (Physical Agent) است که مراحل را برای ربات سازمان‌دهی کرده و امکان اصلاح خودکار و تعمیم به موقعیت‌های جدیدتر را فراهم می‌کند. برای ساخت یک سیستم عاملی، توسعه‌دهندگان می‌توانند رابط‌های کنترلی سطح پایین — مانند مدل‌های بینایی-زبان-عمل (VLA) یا APIهای مسیریابی — را به عنوان ابزار تعریف کرده و ویدیو، صوت یا متن چندوجهی را مستقیماً به مدل سرازیر (Stream) کنند.

مدل Gemini Robotics ER 2 این جریان کاری سازمان‌دهی ابزار را بهبود می‌بخشد. ما می‌توانیم عملکرد آن را با ربات‌ها در محیط شبیه‌سازی، با استفاده از کنترل واقعی ربات، و حتی همگام با انسانی که ربات را از راه دور کنترل می‌کند، ارزیابی کنیم.