arXiv:2608.31167ترجمه شده

سان: برنامه‌های پایدار برای سیاست‌های کنترل تا یادگیری تا واقعی مبتنی بر زبان

Weiqi Wang، Zhi Li، Yudong Lei، David Martinez، Xiaofeng Gao، Yuxin Jiang، Chenfanfu Jiang، Yingnian Wu، Demetri Terzopoulos، Ran Gong

چکیده

بین کنترل مبتنی بر مدل و سیاست‌های یادگرفته در Manifold Policy Horizon، اختلافی ناچیز وجود دارد: این رویکرد اهداف مشخص‌شده را اجرا می‌کند و یادگیری آن رفتار را به یک سیاست واکنش‌گرا تبدیل می‌کند، اما پروتکل‌های موجود سیمانتیک وظیفه را حذف می‌کنند؛ در نتیجه، پاداش‌های دستی ایجاد شده و رفتار از همان چیزی که کنترل تأیید کرده بود، منحرف می‌شود. ما برنامه‌های Semantically UNified (SUN) را معرفی می‌کنیم؛ برنامه‌های اجرایی تایپ‌شده‌ای که روابط هندسی و تماس را به صورت یکباره تعریف کرده و به هزینه‌های Model Predictive Control (MPC) هماهنگ می‌شوند. این برنامه‌ها همچنین از پیش‌شرط‌های رضایت، پاداش‌های یادگیری تقویتی (RL)، محافظ‌های انتقال و تشخیصات کامپایل استفاده می‌کنند. سیستم ما، Kuafu، که توسط سیستم‌های بینایی زبانی بزرگ هدایت می‌شود، SUN Programs را به‌طور خودکار از زبان و سیمانتیک محیط استخراج می‌کند، توانایی اجرا را از طریق MPC فیلتر می‌کند و در حین آموزش سیاست‌های مرحله‌ای، اصالت سیمانتیک را حفظ می‌نماید. در وظیفه نخست، Kuafu 82.03 درصد موفقیت کلان (macro-success) را دستیابی می‌کند که از پایه‌های پاداش‌های اندک (sparse-reward, 35.67%) و مرحله‌بندی مرحله‌ای (Stage-BC, 24.75%) برتری می‌یابد. در مقیاس 8192-طرفه، عملکرد Kuafu 10.57 برابر زمان مسیر موفق در تلپریشن انسانی را تولید می‌کند. با 500 مسیر در هر وظیفه، داده‌های Kuafu سیاست‌های DP3 را آموزش می‌دهد تا 46.0 درصد موفقیت شبیه‌سازی (به جای 22.4 درصد برای گزینه‌های جایگزین) و 34.7 درصد عملکرد روی روبات‌های فیزیکی Franka و Kinova را حاصل سازد. این نتایج نشان می‌دهد که سیمانتیک وظیفه‌ی فیلتر شده توسط شبیه‌سازی، می‌تواند کنترل را به سیاست‌های مقاوم و آماری تبدیل کند، بدون نیاز به نمایش یا پاداش‌های دستی چگال، و برنامه‌ریزی سمبولی و اجرا مبتنی بر داده را متحد سازد.

متن کامل

# SUN: برنامه‌های پایدار برای کنترل مبتنی بر زبان تا یادگیری تا سیاست‌های واقعی **نویسندگان:** ویچی وانگ، ژی لی، یودونگ لِی، دیوید مارتینز، شیاوفنگ گاو، یوکسین جیانگ، چنفانفو جیانگ، یینگین وو، دمتری ترزاپولیس، ران گونگ ## مشاهده PDF مقاله عنوان: SUN: برنامه‌های پایدار برای کنترل مبتنی بر زبان تا یادگیری تا سیاست‌های واقعی نویسندگان: ویچی وانگ و ۹ نویسنده دیگر **مشاهده PDF** | **HTML (آزمایشی)** ### چکیده پل زدن بین کنترل مبتنی بر مدل و سیاست‌های یادگیری‌شده در کارگیری با حد زمان طولانی، نگرانی پنهانی ایجاد کرده است: کنترل اهداف مشخص را اجرا می‌کند، یادگیری این رفتار را به یک سیاست واکنشی کاهش می‌یابد، در حالی که پروتکل‌های موجود، معنای وظیفه را دور می‌ریزند و منجر به پاداش‌های دستی و گرفتار شدن رفتار از آنچه کنترل این URL معرفی می‌کند می‌شود. در اینجا برنامه‌های **SUN** (Semantically UNIFIED) را معرفی می‌کنیم؛ اجراکننده‌های قابل‌نوع‌بندی که در آن روابط هندسی و تماس یکبار تعریف می‌شوند و به همگام‌سازی هزینه‌های کنترل پیش‌بینی‌شده (MPC)، شرایط رضایت، پاداش‌های یادگیری قوی، حفاظت‌های انتقال و تشخیص‌ها کامپایل می‌شوند. سیستم ما، **COAUF**، توسط سیستم‌های بزرگ بینایی و زبان، به‌صورت خودکار برنامه‌های SUN را از معنای زبانی و صحنه تولید می‌کند، اجرای سیاست را از طریق MPC بررسی می‌کند و در حین آموزش سیاست‌های واکنشی با شرایط مرحله‌ای، معنای وظیفه را حفظ می‌کند. در هشت وظیفه، COAUF 82.03 درصد موفقیت ماکرو را به دست می‌آورد؛ این عدد از پاداش‌های کم‌رنگ (35.67 درصد) و پایه‌های Stage-BC (24.75 درصد) برتری دارد. در مقیاس 8192، ترکیب ما ۱۰.۵۷ برابر زمان موفق‌ترین مسیر را در ساعت تل‌عملی انسانی تولید می‌کند. با ۵۰۰ مسیر برای هر وظیفه، داده‌های COAUF سیاست‌های DP3 را به ۴۶.۰ درصد موفقیت شبیه‌سازی (در مقابل ۲۲.۴ درصد برای راه‌حل‌های دیگر) و ۳۴.۷ درصد روی ربات‌های فیزیکی فرانکا و کینووا می‌آموزد. این نتایج نشان می‌دهند که فیلترشدن معنای وظیفه در شبیه‌سازی، می‌تواند کنترل را به سیاست‌های مقاوم تبدیل کند؛ بدون نیاز به نمونه‌های نمایشی یا پاداش‌های غلیظ دستی، و سیگنال‌های برنامه‌ریزی نمادین را با اجرای مبتنی بر داده ترکیب نماید. ### موضوعات روباتیک (cs.RO); هوش مصنوعی (cs.AI) --- **نقل‌کردن به arXiv:2608.31167 [cs.RO]** (یا arXiv:2608.31167v1 برای این نسخه) [https://doi.org/10.48550/arXiv.2608.31167](https://doi.org/10.48550/arXiv.2608.31167) **تمرکز بر یادگیری بیشتر** DOI معین‌شده توسط arXiv از طریق DataCite (در حال ثبت). --- ### تاریخچه ارسال از: ژی لی [مشاهده ایمیل] [v1] دوشنبه، ۳۱ اوت ۲۰۲۶ ۱۷:۵۹:۱۶ UTC (۳,۹۵۲ کیلوبایت) --- ### ابزارهای کتاب‌شناسی و نقل‌کردن | ابزار | شرح | |-------|------| | **کاوش کتاب‌شناسی** | پایگاه داده‌ای برای یافتن منابع مرتبط | | **رابط کاوش Connected Papers** | نمایش منابع مرتبط با مقاله فعلی | | **رابط کاوش Litmaps** | تعاملی برای بررسی پیوندهای علمی | | **scite.ai** | سینسیتیشن هوشمند برای استخراج نقل‌قول‌ها | | **کاوش کتاب‌شناسی (Connected Papers)** | پایگاه داده‌ای برای کاوش متقابل | | **کاوش کتاب‌شناسی (Litmaps)** | نقشه‌برداری علمی متقابل | | **رابط کاوش CatalyzeX Code Finder** | پیدا کردن کدها مرتبط با مقاله | | **رابط کاوش DagsHub** | تحلیل معماری‌های شبکه‌ای | | **رابط کاوش Gotit.pub** | جمع‌آوری مقالات و کدها | | **رابط کاوش Hugging Face** | دسترسی به مدل‌ها و زیرساخت AI | | **رابط کاوش ScienceCast** | تحلیل بازخورد جامعه علمی | ### نمونه‌ها (Demos) **User Safety:** safe --- *توجه: تمامی اصطلاحات فنی (SUN, MPC, Stage-BC, DP3, COAUF) و نام‌ها بدون تغییر باقی مانده‌اند تا یکپارگی متن حفظ شود.*