چکیده
User Safety: safe
متن کامل
**عنوان: ReWorld: یک مدل جهانی تعاملی با حافظه افق بلند**
**نویسندگان:** Zhifei Chen, Luozhou Wang, Guibao Shen, Dongyu Yan, Shuai Yang, Tianshuo Xu, Yihua Du, Wei Wang, Tianyi Gui, Lianghua Huang, Yingcong Chen
**چکیده:**
یک مدل جهانی تعاملی باید اقدامات کاربر را پیگیری کند، مکانهای نمایش دادهشده را به خاطر بسپارد و بهصورت بلادرنگ (real‑time) استریم نماید. تضاد در اینجا ساختاری است: کنترل به افقی کوتاه نیاز دارد، در حالی که حافظه به افقی نامحدود نیاز دارد. ReWorld این دو را در طول آموزش تفکیک میکند و در زمان استنتاج (inference) آنها را محدود میسازد. پنجرههای توجه مخلوط در هر سر (mixed per‑head attention windows) اکثر سرها را به گذشته نزدیک محدود میکنند؛ در مقابل، یک مجموعة کوچک از سرهای جهانی به کل تاریخچه توجه دارند. همچنین، مسیریابی تصادفی سرها (random head routing) مانع از اختصاص این قابلیتها به سرهای خاص میشود. حذف تصادفی تکهها (random chunk dropping) تاریخچههای پراکنده را در توزیع دادههای داخل (in‑distribution) قرار میدهد. در زمان استنتاج، کل گذشته تحت یک بودجه ثابت قرار میگیرد: یک حافظه نهان KV محدود که توسط یک بانک نقاط شاخص (landmark bank) با نمایهی وضعیت (pose‑indexed) پشتیبانی میشود و از طریق آن، نقاط شاخص نزدیک به وضعیت فعلی بازیابی میشود.
یک موتور داده با مقیاس متری هم‑تراز، هشت منبع (شامل پروازهای رندر شده در Unreal، گشتوگذار در بازی و فیلمهای دنیای واقعی) را روی یک مقیاس اقدام فیزیکی واحد قرار میدهد؛ به طوری که فشار دادن یک کلید یکسان، دوربین را در هر منبع به مسافتی یکسانی حرکت میدهد و مسیرهای پالیندرومی (palindrome trajectories) شواهد بازگشت لازم برای آموزش حافظه را فراهم میآورد. سپس تقطیر تطبیق توزیع (distribution‑matching distillation)، که به یک آداپتور LoRA محدود شده است، نمونهبرداری را به چهار گام فشرده میسازد: یک بدنه (backbone) واحد هم در حالت چندگامی با دقت بالا و هم در حالت تعاملی بلادرنگ کار میکند و ویدیوهای با رزولوشن ۷۰۴×۱۲۸۰ را در دنیای فوتورئالیستی، سبک بازی و استایل‑دار استریم مینماید.
تحت یک پروتکل سه محوره شامل پیروی از اقدام، یادآوری افق بلند و کیفیت ویدیو، این مدل نسبت به شش مدل جهانی تعاملی اخیر، بهترین دقت کنترل (خطای چرخش $11.95^\circ$ و بهترین سازگاری حرکت دوربین) و بهترین کیفیت تولید را به دست آورده است؛ همچنین در اجراهای رفتوبرگشتی یک دقیقهای ($64$ ثانیه، $384$ لیتنت)، حافظه نهان ۱۲‑تکهای ثابت آن همچنان نمای اولیه را بازسازی میکند — در بازههایی که پنجره لغزان (sliding window) شواهد را حذف کرده و توجه کامل KV با کمبود حافظه مواجه میشود.
**توضیحات:**
**موضوعات:** هوش مصنوعی (cs.AI)
**ارجاع:** arXiv:2608.23565 [cs.AI] (یا arXiv:2608.23565v1 [cs.AI] برای این نسخه)
https://doi.org/10.48550/arXiv.2608.23565
کد رسانه، داده و رسانه مرتبط با این مقاله alphaXiv Toggle alphaXiv (چه است alphaXiv?)
لینک به کد Toggle CatalyzeX Finder کد برای مقالات (چه است CatalyzeX?)
DagsHub Toggle DagsHub (چه است DagsHub?)
GotitPub Toggle Gotit.pub (چه است GotitPub?)
Huggingface Toggle Hugging Face (چه است Huggingface?)
ScienceCast Toggle ScienceCast (چه است ScienceCast?)
Demos Demos Toggle Replicate (چه است Replicate?)
Spaces Toggle Hugging Face Spaces (چه است Spaces?)
Spaces Toggle TXYZ.AI (چه است TXYZ.AI?)
پروژههای مرتبط، توصیهکنندگان و ابزارهای جستجو لینک به Influence Flower Influence Flower (چه هستند Influence Flowers?)
تغییر Core Recommender (چه است CORE?)
نویسندگان مقاله | غیرفعالسازی MathJax (چه است MathJax?)
arXivLabs: پروژههای آزمایشی با مشارکت جامعه
arXivLabs یک چارچوب است که به مشارکتکنندگان امکان میدهد ویژگیهای جدید arXiv را مستقیماً در وبسایت ما توسعه و به اشتراک بگذارند.
هم افراد و سازمانهایی که با arXivLabs کار میکنند، ارزشهای ما را پذیرفته و پذیرا شدهاند: شفافیت، جامعه، فراگردی و حریم خصوصی دادههای کاربری.
arXiv به این ارزشها متعهد است و تنها با شرکایی که به آنها پایبند هستند، کار میکند.
آیا ایدهای برای پروژهای دارید که ارزش اضافه برای جامعه arXiv ایجاد کند؟ برای اطلاعات بیشتر دربارهٔ arXivLabs بیشتر بخوانید.