جمینای رباتیکس ۲ هوش سراسری بدن را به ربات‌ها می‌آورد

جمینای رباتیکس ۲ هوش سراسری بدن را به ربات‌ها می‌آورد

هوش سراسری برای نسل جدید ربات‌ها

از پاها تا نوک انگشتان؛ ما در حال آموزش کنترل هوشمندانه سراسر بدن، مهارت‌های حرکتی ظریف و کار گروهی به ربات‌ها هستیم تا طیف گسترده‌ای از وظایف پیچیده را انجام دهند.

برای دهه‌ها، آرزوی ربات‌هایی را داشتیم که بتوانند به‌طور یکپارچه وارد دنیای ما شده و یاری‌رسان باشند. اکنون این چشم‌انداز گام بلندی به جلو برداشته است.

اکثر ربات‌های امروزی برای انجام زنجیره‌ای از وظایف محدود و تکراری از قبل برنامه‌ریزی یا از راه دور هدایت می‌شوند. آن‌ها فاقد توانایی یادگیری واقعی یا سازگاری با محیط‌های غیرقابل‌پیش‌بینی هستند. علاوه بر این، انتقال مهارت‌های آموخته‌شده از بدنه یک ربات به ربات دیگر بسیار دشوار است. برای حل چالش‌ها در مقیاس بزرگ، ربات‌ها در هر شکل و اندازه‌ای به مدل‌های هوش مصنوعی نیاز دارند که به آن‌ها قدرت تفکر، اقدام و تعامل هوشمندانه برای انجام ایمن وظایف را بدهد.

ما پیش از این نشان دادیم که چگونه درک چندوجهی جمینای می‌تواند عمل در دنیای واقعی را هدایت کند. امروز Gemini Robotics 2 را معرفی می‌کنیم؛ لایه هوشمندی که قدرت‌بخش نسل بعدی ربات‌های کاملاً تطبیق‌پذیر است. این پیشرفت بزرگ با برداشتن نخستین گام‌های عملی، کنترل هوشمندانه سراسر بدن (Whole-body Control)، مهارت‌های حرکتی پیشرفته و همکاری چند ربات را ممکن می‌سازد.

مدل Gemini Robotics 2 ربات‌ها را قادر می‌سازد تا در مورد هر حرکت استدلال کنند. به عنوان مثال، یک ربات انسان‌نما می‌تواند راه برود، خم شود، کشش به خرج دهد و اجسام را برای تمیز کردن یک اتاق شلوغ جابه‌جا کند. این مدل حتی می‌تواند با ربات‌های دیگر برای اتمام سریع‌تر کار همکاری کند. این هوش پیشرفته می‌تواند به‌صورت محلی روی دستگاه اجرا شده و در عرض چند ساعت با بدنه‌های رباتیک کاملاً جدید تطبیق یابد.

معرفی سه مدل قدرتمند جدید

ما این دستاورد را از طریق سه مدل بسیار توانمند امکان‌پذیر کرده‌ایم:

  • Gemini Robotics 2: پیشرفته‌ترین مدل بینایی-زبان-عملیات (Vision-Language-Action یا VLA) ما که ورودی‌های بینایی و متنی را به کنترل حرکتی تبدیل می‌کند. این مدل قادر به کنترل کامل ربات‌های انسان‌نما از پا تا نوک انگشتان و سایر ربات‌های دو بازو است و سطح جدیدی از مهارت حرکتی دست‌ها و گیره‌ها را ارائه می‌دهد.
  • Gemini Robotics ER 2: توانمندترین مدل استدلال تجسم‌یافته (Embodied Reasoning یا ER) ما که یک مدل بینایی-زبانی (VLM) است و به‌عنوان عامل (Agent) عمل می‌کند. این مدل به ربات‌ها امکان می‌دهد با انسان‌ها ارتباط برقرار کنند، دنیای فیزیکی را درک کرده و وظایف چندمرحله‌ای را که چند دقیقه طول می‌کشند برنامه‌ریزی نمایند.
  • Gemini Robotics On-Device 2: کارآمدترین مدل بینایی-زبان-عملیات ما که برای اجرا به‌صورت محلی روی تجهیزات رباتیک بهینه‌سازی شده است. این مدل می‌تواند تنها با چند ساعت داده، با بدنه‌های کاملاً جدید ربات تطبیق یابد.

مدل Gemini Robotics 2 با استفاده از یک نقطه چک‌پوینت مشترک، سه بدنه متفاوت شامل ربات Apptronik Apollo 2 با دست‌های SharpaWave، ربات Apollo 2 با دست‌های Inspire و پلتفرم Franka Duo با گیره Robotiq را کنترل می‌کند. در حالی که این مدل در وظایف سراسری بدن و کارهای بر پایه گیره به نرخ موفقیت متوسط تا بالا دست می‌یابد، دستکاری ظریف چندانگشتی همچنان چالش‌برانگیز است.

مدل استدلال Gemini Robotics ER 2 اکنون در Google AI Studio و بخش پیش‌نمایش خصوصی Gemini Enterprise Agent Platform در دسترس است. مدل‌های VLA و On-Device نیز در اختیار شرکای دسترسی اولیه قرار گرفته‌اند.

ربات‌های انسان‌نما در حرکت: مدیریت وظایف سراسری بدن

دنیای ما برای حرکات انسانی ساخته شده است؛ حرکاتی که نیازمند خم شدن، دسترسی و حفظ تعادل در فضاهای تنگ و شلوغ است. در حالی که مدل‌های قبلی ما بخش بالاتنه ربات را برای کارهای روی میز کنترل می‌کردند، Gemini Robotics 2 هوش مصنوعی فیزیکی را به حرکات سراسر بدن گسترش می‌دهد.

برای نخستین بار، مدل ما می‌تواند کل ربات‌های انسان‌نما را کنترل کرده و قصد کاربر را به کنترل هوشمندانه سراسر بدن تبدیل کند. به عنوان مثال، هنگام کنترل ربات انسان‌نمای Apollo 2 ساخت شرکت Apptronik، می‌توانیم بگوییم: «آبپاش را در سطل سبز رنگ طبقه پایین بگذار». ربات دستور را پردازش کرده، به سمت میز حرکت می‌کند، آبپاش را برمی‌دارد، چند گام به سمت قفسه‌ها برمی‌دارد و آن را با دقت در مقصد قرار می‌دهد.

ارائه ظرافت و مهارت پیشرفته به دست‌ها و گیره‌ها

ربات‌ها برای اینکه در خانه‌ها و محیط‌های کاری ما واقعاً مفید باشند، به ظرافت نیاز دارند. Gemini Robotics 2 سطح جدیدی از مهارت فیزیکی را در عملگرهای نهایی مختلف (End Effectors)، چه دست باشد و چه گیره (Gripper)، آزاد می‌کند.

این مدل اکنون می‌تواند دست پنج‌انگشتی SharpaWave با ۲۲ درجه آزادی را روی ربات Apollo 2 برای انجام کارهای ظریف مانند گره زدن یا بستن کیسه زیپ‌دار کنترل کند. همچنین می‌تواند گیره‌های موازی دو انگشتی استاندارد را روی پلتفرم Franka Duo برای انجام کارهای پیچیده هدایت نماید.

استدلال عاملی و همکاری چندرباتی

اکثر وظایف دنیای واقعی نیازمند مراحل متعدد در طول زمان هستند. مدل استدلال تجسم‌یافته Gemini Robotics ER 2 به‌عنوان مغز سطح بالای ربات عمل کرده، دستورات کاربر را پردازش و با انسان‌ها ارتباط برقرار می‌کند. این مدل اتاق را بررسی کرده، مراحل لازم را استدلال می‌کند، با مدل VLA برای اجرای اقدامات هماهنگ می‌شود و پیشرفت کار را زیر نظر می‌گیرد.

در این به‌روزرسانی، ربات‌ها می‌توانند زنجیره‌های طولانی‌تری از وظایف را که چند دقیقه طول کشیده و شامل صدها تصمیم‌گیری است اجرا کنند. علاوه بر این، ویژگی همکاری چندرباتی به انواع مختلف ربات‌ها اجازه می‌دهد با یکدیگر ارتباط برقرار کرده و فرآیندهای پیچیده‌ای را که یک ربات به تنهایی قادر به انجامش نیست، حل کنند.

تطبیق سریع مدل‌های روی دستگاه برای هر رباتی

بسیاری از برنامه‌های رباتیک باید بدون تاخیر شبکه یا اتصال اینترنت کار کنند. مدل Gemini Robotics On-Device 2 برای مدیریت همین محدودیت‌ها ساخته شده است. این مدل به‌طور بومی چندبدنه‌ای بوده و از تکنیک‌های پیشرفته انتقال حرکت (Motion Transfer) بهره می‌برد. ما اکنون می‌توانیم با کمتر از ۲۰۰ نمونه آموزشی و تنها در چند ساعت داده، مدل را با بدنه‌های جدید ربات‌های دو بازو (مانند پلتفرم‌های Dexmate، SO101 و Trossen) تطبیق دهیم.

تعهد به رباتیک ایمن و مسئولانه

ایمنی پایه و اساس تحقیقات رباتیک ماست. با افزایش توانایی‌های فیزیکی ربات‌ها، ما رویکردی چندلایه متشکل از تدابیر ایمنی فیزیکی سنتی و چارچوب‌های ایمن هوش مصنوعی را به کار گرفته‌ایم.

ما بنچمارک جدید ASIMOV-Agentic را برای ارزیابی ایمنی عاملی معرفی می‌کنیم که توانایی عامل استدلال‌کننده را در رد درخواست‌های ناایمن و درخواست مداخله انسانی در شرایط عدم قطعیت می‌سنجد. همچنین Gemini Robotics ER 2 ایمن‌ترین مدل رباتیک ما تا به امروز در رعایت محدودیت‌های ایمنی و تشخیص حضور انسان در نزدیکی ربات است.

حرکت به سمت هوش مصنوعی فیزیکی عمومی

مدل Gemini Robotics 2 نقطه عطفی مهم در مسیر دستیابی به هوش عمومی مصنوعی (AGI) در دنیای فیزیکی است. هدف ما ایجاد هوش پایه فیزیکی است که بتواند در کنار انسان‌ها برای حل چالش‌های پیچیده کار کند.

این پروژه بزرگ حاصل تلاش و توسعه تیم متخصصان و محققان Gemini Robotics در گوگل است.