جمینای رباتیکس ER 2: ارتقای رباتیک با درک ویدیو، سازماندهی وظایف و همکاری چند ربات
برای اینکه رباتها بتوانند به انسانها در محیطهای روزمره کمک کنند، صرفاً استدلال فضایی دقیق کافی نیست. رباتها باید سریع فکر کنند، تصمیمات خود را زمانبندی نمایند و با سرعت آنی جهان فیزیکی استدلال کنند.
به همین دلیل، ما امروز Gemini Robotics ER 2 را معرفی میکنیم؛ تواناترین مدل «استدلال تجسمیافته» (Embodied Reasoning) ما برای رباتیک. Gemini Robotics ER 2 را مانند یک مغز سطح بالا برای رباتها تصور کنید. این مدل به رباتها امکان میدهد با انسانها گفتگو کنند، جهان فیزیکی را درک نمایند و وظایف چندمرحلهای را برنامهریزی کنند. سپس اجرای حرکتی را به هر مدل بینایی-زبان-عمل (Vision-Language-Action یا VLA) در سطح پایینتر میسپارد. Gemini Robotics ER 2 همچنین میتواند بهطور بومی ابزارهایی مانند جستجوی گوگل (Google Search) یا هر تابع تعریفشده توسط کاربر را فراخوانی کند. طراحی این مدل به ربات اجازه میدهد در حالی که اقدامات خود را انجام میدهد، همزمان درباره مرحله بعدی «فکر» کند.
ارتقای چشمگیر نسبت به نسخه قبل و قابلیتهای جدید
مدل Gemini Robotics ER 2 یک ارتقای چشمگیر نسبت به Gemini Robotics ER 1.6 محسوب میشود. رباتها اکنون با تماشای جریانهای ویدیویی مداوم، میتوانند پیشرفت خود را پیگیری کنند، در صورت بروز مشکل خود را تطبیق دهند و دقیقاً بدانند چه زمانی باید به مرحله بعدی بروند. ما همچنین قابلیت همکاری چند ربات (Multi-robot collaboration) را معرفی میکنیم که به رباتها امکان میدهد در فضاهای مشترک با یکدیگر کار کرده و جریانهای کاری پیچیدهای را که یک ربات به تنهایی قادر به انجام آن نیست، تکمیل کنند.
مدل Gemini Robotics ER 2 هماکنون از طریق Gemini API، Google AI Studio و به صورت پیشنمایش خصوصی در Gemini Enterprise Agent Platform در دسترس توسعهدهندگان قرار دارد. برای کمک به شروع کار شما، نمونههایی از نحوه پیکربندی مدل و پرامپتنویسی برای پیشبرد وظایف کاربردیتر هوش مصنوعی فیزیکی را به اشتراک میگذاریم.
پیشبرد قابلیتهای عاملیت فیزیکی
بیشتر وظایف در دنیای فیزیکی پیچیده هستند و برای تکمیل به مراحل متعددی نیاز دارند. مدل Gemini Robotics ER 2 یک «عامل فیزیکی» (Physical Agent) است که مراحل را برای ربات سازماندهی کرده و امکان اصلاح خودکار و تعمیم به موقعیتهای جدیدتر را فراهم میکند. برای ساخت یک سیستم عاملی، توسعهدهندگان میتوانند رابطهای کنترلی سطح پایین — مانند مدلهای بینایی-زبان-عمل (VLA) یا APIهای مسیریابی — را به عنوان ابزار تعریف کرده و ویدیو، صوت یا متن چندوجهی را مستقیماً به مدل سرازیر (Stream) کنند.
مدل Gemini Robotics ER 2 این جریان کاری سازماندهی ابزار را بهبود میبخشد. ما میتوانیم عملکرد آن را با رباتها در محیط شبیهسازی، با استفاده از کنترل واقعی ربات، و حتی همگام با انسانی که ربات را از راه دور کنترل میکند، ارزیابی کنیم.