arXiv:2609.09158ترجمه شده

TANGO: Humanoid Navigation in Cluttered Environments with a Whole-Body Vision-Language-Action Model

Anqi Li، Yuxin Chen، Zhaobo Li، Zhuo Cao، Junli Ren، Masayoshi Tomizuka، Dhruv Shah

چکیده

ما به مسئله‌ی حرکت روبات انسان‌شبیه در محیط‌های داخلی پرزرق و برق می‌پردازیم. برخلاف روش‌های رایج که مسیریابی را به‌عنوان یک مسأله‌ی برنامه‌ریزی مسیر دوبعدی مدل می‌کنند، حرکت انسان‌شبیه در فضاهای پرزرق و برق نیازمند تنظیم کلی بدن با توجه به هندسه است؛ از جمله تنظیم دست‌ها، تنه و گام برای دستیابی به حرکت بدون برخورد در فضاهای سه‌بعدی پیچیده. ما TANGO را معرفی می‌کنیم، اولین چارچوب مسیریابی کامل بدن برای حرکت انسان‌شبیه در محیط‌های پرزرق و برق مبتنی بر زبان و بینایی که بر اساس دستور زبانی عمل می‌کند. با دریافت یک دستور زبانی طبیعی و مشاهدات RGB از منظر خود، TANGO مستقیماً ۲۹ درجه آزادی از فضای همکاتنی را به‌عنوان اقدام‌های فضایی پیش‌بینی می‌کند تا کنترل کلی بدن را به‌دست آورد. TANGO را به‌طور کامل در شبیه‌ساز آموزش می‌دهیم؛ این آموزش شامل تولید رفتارهای حرکتی متنوع بدون برخورد از طریق مسیر یابی جهانی، تولید حرکت کامل بدن بر پایهٔ حرکت کاتالیستیک، ویرایش حرکت با در نظر گرفتن موانع و ردیابی مبتنی بر یادگیری تقویتی است. این خط لوله، نظارت بر اقدام‌های دارای قابلیت دینامیک را برای یادگیری سیاست‌های کامل بدن مبتنی بر زبان فراهم می‌سازد. در آزمایش‌های گسترده در شبیه‌ساز، TANGO عملکرد پیشرفته‌ای در مسیریابی بینایی-زبانی نشان می‌دهد؛ در حالی که در مقایسه با پایه‌های ماژولار قوی، در حرکت در صحنه‌های چالش‌برانگیز که نیاز به مذاکمت موانع دارند، عملکرد برتری دارد. در نهایت، TANGO را بدون هیچ آموزش پیشین روی روبات انسان‌شبیه Unitree G1 قرار می‌دهیم و مشاهده می‌کنیم که حرکت راهنمایی‌شده توسط زبان در صحنه‌های واقعی پرزرق و برق به‌طور محکم انجام می‌شود، apesar از این که روی هیچ داده‌ای از مسیریابی واقعی آموزش نداده‌ایم.

متن کامل

علوم کامپیوتر > رباتیک arXiv:2609.09158v1 (cs) [ارسال شده در ۸ سپتامبر ۲۰۲۶] عنوان: TANGO: ناوبری انسان‌نما در محیط‌های شلوغ با یک مدل کامل‌بدنی بصری-زبانی-عملی نویسندگان: انقی لی، یوشین چن، ژائوبو لی، جوئو چائو، جونلی رن، ماسایوشی تومیزوکا، دروو شاه مشاهده PDF مقاله با عنوان TANGO: ناوبری انسان‌نما در محیط‌های شلوغ با یک مدل کامل‌بدنی بصری-زبانی-عملی، توسط انقی لی و ۶ نویسنده دیگر مشاهده PDF HTML (آزمایشی) چکیده: ما مسئله ناوبری در محیط‌های داخلی شلوغ با ربات انسان‌نما را مطالعه می‌کنیم. برخلاف روش‌های سنتی که ناوبری را به‌عنوان یک مسئله برنامه‌ریزی مسیر دوبعدی مدل‌سازی می‌کنند، عبور انسان‌نما در محیط‌های شلوغ نیاز به همگام‌سازی مستمر و آگاهانه با هندسه در تمام بدن دارد؛ شامل جای‌گذاری هماهنگ بازوها، تنظیم وضعیت تنه، و تنظیم قدم‌زنی برای حرکت بدون برخورد در فضاهای سه‌بعدی پیچیده. ما TANGO را معرفی می‌کنیم؛ اولین چارچوب ناوبری بصری-زبانی کامل‌بدنی برای عبور انسان‌نما تحت شرط زبانی در محیط‌های شلوغ. با توجه به دستور زبان طبیعی و مشاهدات RGB اگوسانتریک، TANGO به‌طور مستقیم اقدامات فضای مفصلی ۲۹-درجه-آزادی (DoF) را برای کنترل کامل‌بدنی در مرحله بعدی پیش‌بینی می‌کند. ما TANGO را به‌طور کامل در شبیه‌سازی آموزش می‌دهیم؛ از طریق مصنوعی‌سازی رفتارهای متنوع عبور بدون برخورد با برنامه‌ریزی مسیر جهانی، تولید حرکت کامل‌بدنی کینماتیکی، ویرایش آگاهانه حرکت نسبت به موانع، و ردیابی مبتنی بر یادگیری تقویتی (RL). این خط لوله نظارت بر اقدامات قابل اجرای دینامیکی را برای یادگیری سیاست‌های کامل‌بدنی تحت شرط زبانی فراهم می‌کند. در آزمایش‌های گسترده شبیه‌سازی، TANGO عملکردی در سطح پیشتاز در ناوبری بصری-زبانی نشان می‌دهد و همچنین از خط پایه‌های ماژولار قوی‌تر در ناوبری از صحنه‌های چالش‌برانگیز که مذاکره با موانع را مستلزم می‌شود، عملکرد بهتری دارد. در پایان، ما TANGO را بدون نیاز به آموزش (صفر‌شات) روی ربات انسان‌نمای Unitree G1 پیاده‌سازی می‌کنیم و عبور راهنمایی‌شده توسط زبان در صحنه‌های واقعی شلوغ را بدون آموزش روی هرگونه داده ناوبری واقعی مشاهده می‌کنیم. موضوعات: رباتیک (cs.RO)؛ هوش مصنوعی (cs.AI) ارجاع به‌صورت: arXiv:2609.09158 [cs.RO] (یا arXiv:2609.09158v1 [cs.RO] برای این نسخه) https://doi.org/10.48550/arXiv.2609.09158 برای یادگیری بیشتر DOI صادرشده توسط arXiv از طریق DataCite (در انتظار ثبت) تاریخچه ارسال از: انقی لی [مشاهده ایمیل] [v1] سه‌شنبه، ۸ سپتامبر ۲۰۲۶ ۱۷:۵۹:۵۵ UTC (۴۶,۶۸۱ کیلوبایت) ابزارهای بیبليوگرافیک ابزارهای بیبليوگرافیک و ارجاع‌دهی مرورگر بیبليوگرافیک (چیست مرورگر بیبليوگرافیک؟) مقالات مرتبط (چیست Connected Papers؟) Litmaps (چیست Litmaps؟) scite.ai (چیست Smart Citations؟) کد، داده، رسانه کد، داده و رسانه مرتبط با این مقاله alphaXiv (چیست alphaXiv؟) لینک‌های به کد CatalyzeX Code Finder for Papers (چیست CatalyzeX؟) DagsHub (چیست DagsHub؟) GotitPub (چیست GotitPub؟) Huggingface (چیست Hugging Face؟) ScienceCast (چیست ScienceCast؟) نمونه‌ها نمونه‌ها رپلیکا تغییرپذیری (Replicate) - چه است؟ تغییرپذیری فضاها (Hugging Face Spaces) - چه است؟ تغییرپذیری TXYZ.AI - چه است؟ مقاله‌های مرتبط - ابزارهای توصیه‌کننده و جستجو پیوند به تأثیر گل تأثیر تغییرپذیری نهاده‌های اصلی - CORE Recommender - چیست؟ شرح arXivLabs ایده‌ای برای پروژه دارید که ارزش جامعه arXiv را افزایش خواهد داد؟ کدام نویسندگان این مقاله موافق‌کنندگان هستند؟ غیرفعال کردن MathJax - چه است؟