→ بازگشت به مجله
اخبار و فناوری هوش مصنوعی

Gemini Robotics 2 گوگل: چرا گره‌زدن یک کیسه زباله از پشتک‌زدن ربات‌ها سخت‌تر است؟

پشتک‌زدن یک اجرای از‌قبل‌حفظ‌شده است؛ اما گره‌زدن یک کیسه زباله نه. این‌جاست که Gemini Robotics 2 وارد میدان می‌شود و نشان می‌دهد ربات‌های گوگل چطور با دنیای غیرقابل‌پیش‌بینی کنار می‌آیند.

در این ویدیوی رسمی، گوگل دیپ‌مایند نشان می‌دهد ربات انسان‌نما چطور هم‌زمان تعادل بدن، حرکت پاها و دقت انگشتان را کنترل می‌کند: خم می‌شود، وسیله برمی‌دارد، و کارهایی مثل گره‌زدن را انجام می‌دهد که به تطبیق لحظه‌ای نیاز دارند نه تکرار یک حرکت حفظ‌شده.

گفتار ویدیو انگلیسی است، اما زیرنویس فارسی دارد. روی چرخ‌دنده ⚙️ بزنید، بعد زیرنویس، سپس ترجمه خودکار و از فهرست فارسی را انتخاب کنید.
ویدیوی رسمی معرفی — کانال Google DeepMind، ۳۰ ژوئیه ۲۰۲۶.

شاید عجیب به نظر برسد، اما رباتی که یاد می‌گیرد یک کیسه زباله را گره بزند، به یک معنای مهم از رباتی که پشتک می‌زند پیشرفته‌تر است. گوگل دیپ‌مایند در ۳۰ ژوئیه ۲۰۲۶ نسل جدید Gemini Robotics 2 را معرفی کرد و همین تفاوت، دقیقاً همان چیزی است که این مدل را از دموهای وایرال قبلی ربات‌ها جدا می‌کند.

شرکتGoogle DeepMind
معرفی شد۳۰ ژوئیه ۲۰۲۶
تعداد مدل‌هاسه مدل
قابلیت جدیدکنترل تمام بدن

چرا اجراهای پرزرق‌وبرق ربات‌ها گمراه‌کننده‌اند؟

بیشتر ویدیوهای وایرال ربات‌ها، در واقع اجرای یک زنجیره حرکت از‌قبل‌آموخته‌شده هستند؛ ربات مسیر را حفظ کرده و هر بار دقیقاً همان حرکت را تکرار می‌کند. تا وقتی همه‌چیز طبق برنامه پیش برود نتیجه چشمگیر است، اما با کوچک‌ترین تغییر در محیط، ممکن است همان اجرا بشکند.

یک کیسه زباله دقیقاً نقطه مقابل این شرایط است. این کیسه یک شیء تغییرشکل‌پذیر (Deformable Object) است و با هر بار لمس‌شدن شکلش عوض می‌شود؛ پس هیچ دو گره‌ای مثل هم نیستند و ربات نمی‌تواند فقط یک حرکت ثابت را حفظ و تکرار کند. باید هر بار، از نو، بفهمد با چه شکلی طرف است.

رباتی که یک کیسه زباله را گره می‌زند، از رباتی که پشتک می‌زند پیشرفته‌تر است.

Gemini Robotics 2 دقیقاً چطور کار می‌کند؟

گوگل این نسل را در قالب سه مدل جداگانه منتشر کرده که هرکدام نقش متفاوتی دارند.

مدل اول، Gemini Robotics ER 2، یک مدل استدلال فیزیکی (Embodied Reasoning Model) است؛ نقشش دیدن محیط، درک شرایط و برنامه‌ریزی مراحل انجام کار است، چیزی شبیه مغز سطح‌بالای ربات.

این برنامه سپس در اختیار مدل دوم، یعنی Gemini Robotics 2 که یک مدل تصویر-زبان-عمل (VLA) است، قرار می‌گیرد. این مدل تصاویر دوربین را مستقیماً به فرمان‌های حرکتی موتورهای ربات تبدیل می‌کند؛ یعنی فاصله بین «دیدن» و «انجام‌دادن» را پر می‌کند.

مدل سوم، Gemini Robotics On-Device 2، نسخهٔ سبک‌تری است که روی خود ربات و بدون نیاز به اتصال دائم به سرور اجرا می‌شود. نکتهٔ قابل‌توجه دربارهٔ این مدل، سرعت تطبیق آن است: گوگل می‌گوید سازگارکردن آن با یک بدنهٔ رباتیک جدید تنها چند ساعت طول می‌کشد، نه چند ماه.

دوربین‌های ربات Camera Input Gemini Robotics ER 2 درک محیط و برنامه‌ریزی مراحل (Embodied Reasoning) مغز سطح‌بالای ربات Gemini Robotics 2 (VLA) تبدیل تصویر به فرمان حرکتی (Vision-Language-Action) پل بین دیدن و انجام‌دادن کنترل تمام بدن ربات انسان‌نما از پاها تا نوک انگشت‌ها (Whole-body Control) خم‌شدن، راه‌رفتن، برداشتن اشیا

از یک بازو تا یک ربات انسان‌نمای کامل

نکته مهم دیگر این است که این نسل از Gemini Robotics حالا می‌تواند به‌جای کنترل‌کردن فقط دست‌ها روی یک میز، تمام بدن یک Humanoid Robot یا «ربات انسان‌نما» را هماهنگ کند؛ از پاها تا نوک انگشت‌ها. نسل قبلی عمدتاً بالاتنه را کنترل می‌کرد.

همین موضوع به ربات اجازه می‌دهد کارهایی مثل خم‌شدن، راه‌رفتن یا دسترسی به وسایل روی قفسه را هم انجام دهد؛ کارهایی که تا پیش از این بیرون از توان اکثر دموهای دست‌محور بود.

نمونهٔ دقیق‌تری از همان قابلیت: ربات برای رسیدن به یک شیء زانو خم می‌کند، تعادلش را حفظ می‌کند و هم‌زمان دست‌ها را برای برداشتن آماده می‌کند. نکتهٔ اصلی این است که این‌ها حرکت‌های جداگانه نیستند؛ یک مدل واحد همهٔ بدن را با هم هماهنگ می‌کند.

کانال Google DeepMind، ۳۰ ژوئیه ۲۰۲۶.

در سمت مهارت دست هم عدد مشخصی وجود دارد: این سیستم می‌تواند دست‌های پنج‌انگشتی با ۲۲ درجهٔ آزادی را کنترل کند. همین سطح از دقت است که کارهایی مثل گره‌زدن یا پیچاندن یک لامپ را ممکن می‌کند. گوگل این مدل‌ها را روی چند بدنهٔ رباتیک مختلف نشان داده است؛ از جمله ربات انسان‌نمای Apollo 2 و بازوهای Franka Duo.

وقتی دو ربات با هم کار می‌کنند

قابلیتی که در این نسل تازه است و کمتر دربارهٔ آن صحبت شده، همکاری چندرباتی (Multi-robot Collaboration) است. دو ربات می‌توانند با یکدیگر ارتباط برقرار کنند، کار را بین خودشان تقسیم کنند و کاری را به انجام برسانند که هیچ‌کدام به‌تنهایی از پس آن برنمی‌آیند.

این از یک بهبود ساده در مهارت مهم‌تر است؛ چون یعنی مدل باید علاوه بر محیط، وضعیت و نقش یک ربات دیگر را هم در برنامه‌ریزی خودش حساب کند.

ایمنی: بنچمارک ASIMOV یعنی چه؟

در کنار توانایی فیزیکی، گوگل دیپ‌مایند برای سنجش ایمنی این ربات‌ها از خانواده‌ای از تست‌ها به نام ASIMOV استفاده می‌کند؛ نامی که از آیزاک آسیموف و سه قانون معروف رباتیکش در سال ۱۹۴۲ الهام گرفته شده.

نکته مهمی که باید بهش دقت کرد: ASIMOV اجرای مستقیم آن سه قانون داخل کد ربات نیست، بلکه یک مجموعه بنچمارک برای سنجش درک خطر و ایمنی تصمیم‌های ربات در موقعیت‌های واقعی است.

نسخهٔ به‌روزشدهٔ آن، ASIMOV-Agentic، سه چیز مشخص را اندازه می‌گیرد: اینکه ربات بتواند درخواست‌های ناایمن را رد کند، پیش‌بینی کند که آیا انجام یک کار اساساً شدنی است یا نه، و وقتی مطمئن نیست، خودش از انسان کمک بخواهد. این آخری از بقیه مهم‌تر است؛ چون رباتی که می‌داند کِی نمی‌داند، بسیار ایمن‌تر از رباتی است که همیشه تلاش می‌کند.

این فناوری چه معنایی برای آینده دارد؟

این‌ها هنوز دموهای تحقیقاتی‌اند و با رباتی که هر روز، بدون خطا و به‌طور کاملاً مستقل کارهای خانه را انجام دهد فاصله داریم. دسترسی به این مدل‌ها هم عمومی نیست: فقط ER 2 در Google AI Studio به‌صورت پیش‌نمایش عمومی در دسترس است و دو مدل دیگر پشت برنامهٔ شرکای منتخب قرار دارند.

اما جهت‌گیری روشن است: به‌جای حفظ‌کردن حرکت‌های ثابت، مدل‌هایی که محیط را می‌بینند، درک می‌کنند و خودشان را با شرایط متغیر تطبیق می‌دهند.

شاید هوش مصنوعی بعد از تسخیر گوشی‌ها و کامپیوترها، حالا قدم‌به‌قدم دارد وارد دنیای فیزیکی هم می‌شود؛ و این‌بار نقطه شروعش پشتک نیست، یک گره ساده روی یک کیسه زباله است.

مسیر یادگیری بعدی

این راهنما بخشی از مسیرهای عملی آموزش هوش مصنوعی در AIwithSaeed است.

دیدن مسیرهای یادگیری ←

پرسش‌های متداول

Gemini Robotics 2 چیست؟

Gemini Robotics 2 مدل جدید رباتیک گوگل دیپ‌مایند است که با کمک یک مدل استدلال فیزیکی به نام Gemini Robotics ER 2 و یک مدل Vision-Language-Action، تصاویر دوربین را مستقیماً به فرمان‌های حرکتی ربات تبدیل می‌کند و می‌تواند تمام بدن یک ربات انسان‌نما را کنترل کند.

چرا بستن یک کیسه زباله برای ربات‌ها این‌قدر سخت است؟

چون کیسه یک شیء تغییرشکل‌پذیر (Deformable Object) است و با هر بار لمس‌شدن شکل تازه‌ای پیدا می‌کند. ربات نمی‌تواند یک حرکت ثابت را حفظ و تکرار کند؛ باید هر بار از نو شرایط را درک و خودش را با آن تطبیق دهد.

آیا بنچمارک ASIMOV یعنی گوگل قوانین آسیموف را داخل ربات‌ها اجرا کرده؟

نه دقیقاً. ASIMOV یک مجموعه تست برای سنجش ایمنی، درک خطر و رعایت محدودیت‌های فیزیکی است؛ نامش از آیزاک آسیموف الهام گرفته شده، اما اجرای مستقیم سه قانون رباتیک او داخل کد ربات نیست.

آیا این ربات‌ها الان آماده استفاده روزمره در خانه هستند؟

نه هنوز. این‌ها دموهای تحقیقاتی‌اند و تا رباتی که به‌طور کاملاً مستقل و بدون خطا کارهای روزمره را انجام دهد، فاصله زیادی وجود دارد.

منابع و ارجاعات

  1. Gemini Robotics 2 brings whole body intelligence to robots - Google DeepMind
  2. Gemini Robotics — مدل‌ها و قابلیت‌ها - Google DeepMind
  3. Gemini Robotics: Responsibly advancing AI and robotics - Google DeepMind
  4. Google DeepMind's Gemini Robotics 2 brings whole-body control - The Verge
ادامه یادگیری

مطلب‌های بعدی