چکیده
بین کنترل مبتنی بر مدل و سیاستهای یادگرفته در Manifold Policy Horizon، اختلافی ناچیز وجود دارد: این رویکرد اهداف مشخصشده را اجرا میکند و یادگیری آن رفتار را به یک سیاست واکنشگرا تبدیل میکند، اما پروتکلهای موجود سیمانتیک وظیفه را حذف میکنند؛ در نتیجه، پاداشهای دستی ایجاد شده و رفتار از همان چیزی که کنترل تأیید کرده بود، منحرف میشود. ما برنامههای Semantically UNified (SUN) را معرفی میکنیم؛ برنامههای اجرایی تایپشدهای که روابط هندسی و تماس را به صورت یکباره تعریف کرده و به هزینههای Model Predictive Control (MPC) هماهنگ میشوند. این برنامهها همچنین از پیششرطهای رضایت، پاداشهای یادگیری تقویتی (RL)، محافظهای انتقال و تشخیصات کامپایل استفاده میکنند. سیستم ما، Kuafu، که توسط سیستمهای بینایی زبانی بزرگ هدایت میشود، SUN Programs را بهطور خودکار از زبان و سیمانتیک محیط استخراج میکند، توانایی اجرا را از طریق MPC فیلتر میکند و در حین آموزش سیاستهای مرحلهای، اصالت سیمانتیک را حفظ مینماید. در وظیفه نخست، Kuafu 82.03 درصد موفقیت کلان (macro-success) را دستیابی میکند که از پایههای پاداشهای اندک (sparse-reward, 35.67%) و مرحلهبندی مرحلهای (Stage-BC, 24.75%) برتری مییابد. در مقیاس 8192-طرفه، عملکرد Kuafu 10.57 برابر زمان مسیر موفق در تلپریشن انسانی را تولید میکند. با 500 مسیر در هر وظیفه، دادههای Kuafu سیاستهای DP3 را آموزش میدهد تا 46.0 درصد موفقیت شبیهسازی (به جای 22.4 درصد برای گزینههای جایگزین) و 34.7 درصد عملکرد روی روباتهای فیزیکی Franka و Kinova را حاصل سازد. این نتایج نشان میدهد که سیمانتیک وظیفهی فیلتر شده توسط شبیهسازی، میتواند کنترل را به سیاستهای مقاوم و آماری تبدیل کند، بدون نیاز به نمایش یا پاداشهای دستی چگال، و برنامهریزی سمبولی و اجرا مبتنی بر داده را متحد سازد.
متن کامل
# SUN: برنامههای پایدار برای کنترل مبتنی بر زبان تا یادگیری تا سیاستهای واقعی
**نویسندگان:** ویچی وانگ، ژی لی، یودونگ لِی، دیوید مارتینز، شیاوفنگ گاو، یوکسین جیانگ، چنفانفو جیانگ، یینگین وو، دمتری ترزاپولیس، ران گونگ
## مشاهده PDF مقاله
عنوان: SUN: برنامههای پایدار برای کنترل مبتنی بر زبان تا یادگیری تا سیاستهای واقعی
نویسندگان: ویچی وانگ و ۹ نویسنده دیگر
**مشاهده PDF** | **HTML (آزمایشی)**
### چکیده
پل زدن بین کنترل مبتنی بر مدل و سیاستهای یادگیریشده در کارگیری با حد زمان طولانی، نگرانی پنهانی ایجاد کرده است: کنترل اهداف مشخص را اجرا میکند، یادگیری این رفتار را به یک سیاست واکنشی کاهش مییابد، در حالی که پروتکلهای موجود، معنای وظیفه را دور میریزند و منجر به پاداشهای دستی و گرفتار شدن رفتار از آنچه کنترل این URL معرفی میکند میشود. در اینجا برنامههای **SUN** (Semantically UNIFIED) را معرفی میکنیم؛ اجراکنندههای قابلنوعبندی که در آن روابط هندسی و تماس یکبار تعریف میشوند و به همگامسازی هزینههای کنترل پیشبینیشده (MPC)، شرایط رضایت، پاداشهای یادگیری قوی، حفاظتهای انتقال و تشخیصها کامپایل میشوند. سیستم ما، **COAUF**، توسط سیستمهای بزرگ بینایی و زبان، بهصورت خودکار برنامههای SUN را از معنای زبانی و صحنه تولید میکند، اجرای سیاست را از طریق MPC بررسی میکند و در حین آموزش سیاستهای واکنشی با شرایط مرحلهای، معنای وظیفه را حفظ میکند. در هشت وظیفه، COAUF 82.03 درصد موفقیت ماکرو را به دست میآورد؛ این عدد از پاداشهای کمرنگ (35.67 درصد) و پایههای Stage-BC (24.75 درصد) برتری دارد. در مقیاس 8192، ترکیب ما ۱۰.۵۷ برابر زمان موفقترین مسیر را در ساعت تلعملی انسانی تولید میکند. با ۵۰۰ مسیر برای هر وظیفه، دادههای COAUF سیاستهای DP3 را به ۴۶.۰ درصد موفقیت شبیهسازی (در مقابل ۲۲.۴ درصد برای راهحلهای دیگر) و ۳۴.۷ درصد روی رباتهای فیزیکی فرانکا و کینووا میآموزد. این نتایج نشان میدهند که فیلترشدن معنای وظیفه در شبیهسازی، میتواند کنترل را به سیاستهای مقاوم تبدیل کند؛ بدون نیاز به نمونههای نمایشی یا پاداشهای غلیظ دستی، و سیگنالهای برنامهریزی نمادین را با اجرای مبتنی بر داده ترکیب نماید.
### موضوعات
روباتیک (cs.RO); هوش مصنوعی (cs.AI)
---
**نقلکردن به arXiv:2608.31167 [cs.RO]** (یا arXiv:2608.31167v1 برای این نسخه)
[https://doi.org/10.48550/arXiv.2608.31167](https://doi.org/10.48550/arXiv.2608.31167)
**تمرکز بر یادگیری بیشتر**
DOI معینشده توسط arXiv از طریق DataCite (در حال ثبت).
---
### تاریخچه ارسال
از: ژی لی [مشاهده ایمیل] [v1] دوشنبه، ۳۱ اوت ۲۰۲۶ ۱۷:۵۹:۱۶ UTC (۳,۹۵۲ کیلوبایت)
---
### ابزارهای کتابشناسی و نقلکردن
| ابزار | شرح |
|-------|------|
| **کاوش کتابشناسی** | پایگاه دادهای برای یافتن منابع مرتبط |
| **رابط کاوش Connected Papers** | نمایش منابع مرتبط با مقاله فعلی |
| **رابط کاوش Litmaps** | تعاملی برای بررسی پیوندهای علمی |
| **scite.ai** | سینسیتیشن هوشمند برای استخراج نقلقولها |
| **کاوش کتابشناسی (Connected Papers)** | پایگاه دادهای برای کاوش متقابل |
| **کاوش کتابشناسی (Litmaps)** | نقشهبرداری علمی متقابل |
| **رابط کاوش CatalyzeX Code Finder** | پیدا کردن کدها مرتبط با مقاله |
| **رابط کاوش DagsHub** | تحلیل معماریهای شبکهای |
| **رابط کاوش Gotit.pub** | جمعآوری مقالات و کدها |
| **رابط کاوش Hugging Face** | دسترسی به مدلها و زیرساخت AI |
| **رابط کاوش ScienceCast** | تحلیل بازخورد جامعه علمی |
### نمونهها (Demos)
**User Safety:** safe
---
*توجه: تمامی اصطلاحات فنی (SUN, MPC, Stage-BC, DP3, COAUF) و نامها بدون تغییر باقی ماندهاند تا یکپارگی متن حفظ شود.*