چکیده
ما به مسئلهی حرکت روبات انسانشبیه در محیطهای داخلی پرزرق و برق میپردازیم. برخلاف روشهای رایج که مسیریابی را بهعنوان یک مسألهی برنامهریزی مسیر دوبعدی مدل میکنند، حرکت انسانشبیه در فضاهای پرزرق و برق نیازمند تنظیم کلی بدن با توجه به هندسه است؛ از جمله تنظیم دستها، تنه و گام برای دستیابی به حرکت بدون برخورد در فضاهای سهبعدی پیچیده. ما TANGO را معرفی میکنیم، اولین چارچوب مسیریابی کامل بدن برای حرکت انسانشبیه در محیطهای پرزرق و برق مبتنی بر زبان و بینایی که بر اساس دستور زبانی عمل میکند. با دریافت یک دستور زبانی طبیعی و مشاهدات RGB از منظر خود، TANGO مستقیماً ۲۹ درجه آزادی از فضای همکاتنی را بهعنوان اقدامهای فضایی پیشبینی میکند تا کنترل کلی بدن را بهدست آورد. TANGO را بهطور کامل در شبیهساز آموزش میدهیم؛ این آموزش شامل تولید رفتارهای حرکتی متنوع بدون برخورد از طریق مسیر یابی جهانی، تولید حرکت کامل بدن بر پایهٔ حرکت کاتالیستیک، ویرایش حرکت با در نظر گرفتن موانع و ردیابی مبتنی بر یادگیری تقویتی است. این خط لوله، نظارت بر اقدامهای دارای قابلیت دینامیک را برای یادگیری سیاستهای کامل بدن مبتنی بر زبان فراهم میسازد. در آزمایشهای گسترده در شبیهساز، TANGO عملکرد پیشرفتهای در مسیریابی بینایی-زبانی نشان میدهد؛ در حالی که در مقایسه با پایههای ماژولار قوی، در حرکت در صحنههای چالشبرانگیز که نیاز به مذاکمت موانع دارند، عملکرد برتری دارد. در نهایت، TANGO را بدون هیچ آموزش پیشین روی روبات انسانشبیه Unitree G1 قرار میدهیم و مشاهده میکنیم که حرکت راهنماییشده توسط زبان در صحنههای واقعی پرزرق و برق بهطور محکم انجام میشود، apesar از این که روی هیچ دادهای از مسیریابی واقعی آموزش ندادهایم.
متن کامل
علوم کامپیوتر > رباتیک arXiv:2609.09158v1 (cs) [ارسال شده در ۸ سپتامبر ۲۰۲۶]
عنوان: TANGO: ناوبری انساننما در محیطهای شلوغ با یک مدل کاملبدنی بصری-زبانی-عملی
نویسندگان: انقی لی، یوشین چن، ژائوبو لی، جوئو چائو، جونلی رن، ماسایوشی تومیزوکا، دروو شاه
مشاهده PDF مقاله با عنوان TANGO: ناوبری انساننما در محیطهای شلوغ با یک مدل کاملبدنی بصری-زبانی-عملی، توسط انقی لی و ۶ نویسنده دیگر
مشاهده PDF HTML (آزمایشی)
چکیده: ما مسئله ناوبری در محیطهای داخلی شلوغ با ربات انساننما را مطالعه میکنیم. برخلاف روشهای سنتی که ناوبری را بهعنوان یک مسئله برنامهریزی مسیر دوبعدی مدلسازی میکنند، عبور انساننما در محیطهای شلوغ نیاز به همگامسازی مستمر و آگاهانه با هندسه در تمام بدن دارد؛ شامل جایگذاری هماهنگ بازوها، تنظیم وضعیت تنه، و تنظیم قدمزنی برای حرکت بدون برخورد در فضاهای سهبعدی پیچیده. ما TANGO را معرفی میکنیم؛ اولین چارچوب ناوبری بصری-زبانی کاملبدنی برای عبور انساننما تحت شرط زبانی در محیطهای شلوغ. با توجه به دستور زبان طبیعی و مشاهدات RGB اگوسانتریک، TANGO بهطور مستقیم اقدامات فضای مفصلی ۲۹-درجه-آزادی (DoF) را برای کنترل کاملبدنی در مرحله بعدی پیشبینی میکند. ما TANGO را بهطور کامل در شبیهسازی آموزش میدهیم؛ از طریق مصنوعیسازی رفتارهای متنوع عبور بدون برخورد با برنامهریزی مسیر جهانی، تولید حرکت کاملبدنی کینماتیکی، ویرایش آگاهانه حرکت نسبت به موانع، و ردیابی مبتنی بر یادگیری تقویتی (RL). این خط لوله نظارت بر اقدامات قابل اجرای دینامیکی را برای یادگیری سیاستهای کاملبدنی تحت شرط زبانی فراهم میکند. در آزمایشهای گسترده شبیهسازی، TANGO عملکردی در سطح پیشتاز در ناوبری بصری-زبانی نشان میدهد و همچنین از خط پایههای ماژولار قویتر در ناوبری از صحنههای چالشبرانگیز که مذاکره با موانع را مستلزم میشود، عملکرد بهتری دارد. در پایان، ما TANGO را بدون نیاز به آموزش (صفرشات) روی ربات انساننمای Unitree G1 پیادهسازی میکنیم و عبور راهنماییشده توسط زبان در صحنههای واقعی شلوغ را بدون آموزش روی هرگونه داده ناوبری واقعی مشاهده میکنیم.
موضوعات: رباتیک (cs.RO)؛ هوش مصنوعی (cs.AI)
ارجاع بهصورت: arXiv:2609.09158 [cs.RO] (یا arXiv:2609.09158v1 [cs.RO] برای این نسخه)
https://doi.org/10.48550/arXiv.2609.09158
برای یادگیری بیشتر
DOI صادرشده توسط arXiv از طریق DataCite (در انتظار ثبت)
تاریخچه ارسال از: انقی لی [مشاهده ایمیل] [v1] سهشنبه، ۸ سپتامبر ۲۰۲۶ ۱۷:۵۹:۵۵ UTC (۴۶,۶۸۱ کیلوبایت)
ابزارهای بیبليوگرافیک
ابزارهای بیبليوگرافیک و ارجاعدهی
مرورگر بیبليوگرافیک (چیست مرورگر بیبليوگرافیک؟)
مقالات مرتبط (چیست Connected Papers؟)
Litmaps (چیست Litmaps؟)
scite.ai (چیست Smart Citations؟)
کد، داده، رسانه
کد، داده و رسانه مرتبط با این مقاله
alphaXiv (چیست alphaXiv؟)
لینکهای به کد CatalyzeX Code Finder for Papers (چیست CatalyzeX؟)
DagsHub (چیست DagsHub؟)
GotitPub (چیست GotitPub؟)
Huggingface (چیست Hugging Face؟)
ScienceCast (چیست ScienceCast؟)
نمونهها
نمونهها رپلیکا
تغییرپذیری (Replicate) - چه است؟
تغییرپذیری فضاها (Hugging Face Spaces) - چه است؟
تغییرپذیری TXYZ.AI - چه است؟
مقالههای مرتبط - ابزارهای توصیهکننده و جستجو
پیوند به تأثیر
گل تأثیر
تغییرپذیری نهادههای اصلی - CORE Recommender - چیست؟
شرح arXivLabs
ایدهای برای پروژه دارید که ارزش جامعه arXiv را افزایش خواهد داد؟
کدام نویسندگان این مقاله موافقکنندگان هستند؟
غیرفعال کردن MathJax - چه است؟