arXiv:2609.20820ترجمه شده

مدل‌های فضای کاری: حافظه رباتیک سبک با نظارت مبتنی بر اهمیت‌دستی

Nitish Dashora، Douglas Chen، Idan Shenfeld، John Marangola، Pulkit Agrawal، Max Simchowitz

چکیده

کارهای پیچیدهٔ دستکاری روباتگر اغلب به حافظهٔ بلندمدت از رویدادها و اقدامات گذشته نیاز دارند. چون شرط‌زنی بر تمام تاریخچه منجر به ارتباطات ضعیف و تخریب عملکرد می‌شود، بسیاری از روش‌های حافظه سیاست، اطلاعات تاریخی را از طریق پرس‌و‌جوهای پرهزین مدل‌های زبانی بزرگ (VLM) در حلقه فشرده می‌کنند تا فقط داده‌های مرتبط با وظیفه پردازش شوند. در این مقاله، یک رویکرد جایگزین پیشنهاد می‌دهیم که در زمان آموزش، پرس‌و‌جوهای پرhezین VLM انجام شود تا یک حافظهٔ پنهان سبک‌وزن یاد بگیرد که در زمان اجرا به‌صورت کارآمد قابل پرس‌و‌جو باشد. این نمایش را \textbf{workspace token} می‌نامیم و آن را به دو مرحله به دست می‌آوریم: (1) از یک VLM برای استخراج اطلاعات جار و تاریخی لازم برای تکمیل وظیفه استفاده می‌کنیم؛ (2) سپس این اطلاعات را با استفاده از یک تابع loss بازسازی مجموعه (set‑reconstruction decoder loss) به \textbf{workspace token} فشرده می‌کنیم. در هر دو محیط شبیه‌سازی و سخت‌افزار نشان می‌دهیم که \textbf{workspace token} می‌تواند به جای مشاهدات در زمان اجرا به‌عنوان ورودی به کار رود، به طوری که سیاست‌ها بتوانند وظایف حافظه‌محور را بدون استدلال VLM در حلقه حل کنند. در مقابل، مشاهده کردیم که \textbf{workspace token}‌ها نه تنها سبک‌تر هستند، بلکه عملکرد سیاست را نیز بهبود می‌بخشند.

متن کامل

مدل‌های جهانی: حافظه سبک‌وزن رباتیک از طریق نظارت مبتنی بر حساسیت نیتیش داشورا، دوغلاس چن، ایدان شنفلد، جان مارانگولا، پولک اگراوال، ماکس سیمچویتز **خلاصه:** وظایف پیچیده رباتیک مبتنی بر دستورالعمل به‌طور مکرر به حافظه بلندمدت از رویدادها و اقدامات گذشته نیاز دارند. اگرچه تنظیم سیاست‌ها بر اساس تاریخچه کامل منجر به در معرض قرار گرفتن سیاست‌ها در همبستگی‌های نادرست و کاهش عملکرد می‌شود، بسیاری از رویکردهای حافظه سیاست اطلاعات تاریخی را از طریق پرس‌وجوی پرهزینه VLM در حلقه بازگشتی فشرده‌سازی می‌کنند تا فقط اطلاعات مرتبط با وظیفه پردازش شوند. در این مقاله، ما یک رویکرد جایگزین ارائه می‌دهیم که در آن پرس‌وجوی VLM به‌صورت محاسباتی در زمان آموزش برای یادگیری حافظه پنهان سبک‌وزن انجام می‌شود تا در زمان اجرا به‌طور کارآمد قابل دسترسی برای پرسش باشد. نمایش ما، که آن را «توکن فضای کار» می‌نامیم، با (۱) استفاده از یک VLM برای شناسایی اطلاعات فعلی و تاریخی لازم برای تکمیل یک وظیفه، و سپس (۲) خلاصه‌سازی این اطلاعات به توکن فضای کار با استفاده از هزینه ضایع بازسازی مجموعه، آموزش‌دیده شده است. در هر دو شبیه‌سازی و روی سخت‌افزار واقعی، نشان می‌دهیم که توکن فضای کار می‌تواند به‌عنوان جایگزینی بدون تغییر برای مشاهدات در زمان اجرا استفاده شود، که به سیاست‌ها اجازه می‌دهد وظایف سنگین از نظر حافظه را بدون نیاز به استدلال VLM در حلقه بازگشتی حل کنند. به‌جالب توجه، متوجه شدیم که توکن‌های فضای کار نه تنها سبک‌تر بلکه منجر به بهبود عملکرد سیاست‌ها نیز می‌شوند. **توضیحات:** موضوعات: رباتیک (cs.RO)، هوش مصنوعی (cs.AI) ارجاع: arXiv:2609.20820 [cs.RO] (یا arXiv:2609.20820v1 [cs.RO] برای نسخه این مقاله) https://doi.org/10.48550/arXiv.2609.20820 تمرکز برای دانستن بیشتر درباره رابطه DOI منتشرشده توسط arXiv (در انتظار ثبت) تاریخ ارسال: نیتیش داشورا [نمایش ایمیل] [v1] ۱۷ سپتامبر ۲۰۲۶ ۱۷:۵۹:۳۵ UTC (۱۲٬۹۸۴ کیبایت) اطلاعات ارتباطی: تاریخچه ارسال از: نیتیش داشورا [نمایش ایمیل] [v1] ۱۷ سپتامبر ۲۰۲۶ ۱۷:۵۹:۳۵ UTC (۱۲٬۹۸۴ کیبایت) *نکته: بخش‌های اصلی مقاله که شامل عنوان، نویسندگان، خلاصه، توضیحات، ارجاعات و تاریخ ارسال است، ترجمه شده‌اند. ساختار اصلی مقاله حفظ شده است و اصطلاحات فنی به‌صورت مناسب به فارسی تبدیل شده‌اند.* تغییر وضعیت پیشنهاددهنده CORE (CORE چیست؟) نویسنده مکان مؤسسه موضوع درباره arXivLabs arXivLabs: پروژه‌های آزمایشی با همکاران جامعه arXivLabs چارچوبی است که به همکاران امکان می‌دهد ویژگی‌های جدید arXiv را مستقیماً در وب‌سایت ما توسعه و به اشتراک بگذارند. هر دو فرد و سازمان‌هایی که با arXivLabs کار می‌کنند، ارزش‌های ما در حوزه شفافیت، جامعه، برتری و حریم خصوصی داده‌های کاربر را پذیرفته و درک کرده‌اند. arXiv به این ارزش‌ها متعهد است و تنها با شراکتی کار می‌کند که به آن‌ها پایبند باشند. آیا ایده‌ای برای پروژه‌ای دارید که ارزش افزوده برای جامعه arXiv ایجاد کند؟ بیشتر درباره arXivLabs بدانید. کدام نویسندگان این مقاله تأییدکنندگان هستند؟ | غیرفعال کردن MathJax (MathJax چیست؟)