arXiv:2609.24984ترجمه شده

User Safety: safe

Wangbo Yu، Kunhao Liu، Wenbo Hu، Shenghai Yuan، Chaoran Feng، Haiyang Zhou، Yukun Huang، Yiran Wang، Wang Zhao، Yingmin Luo، Ying Shan

چکیده

مدل‌های جهانی ویدیویی امکان کاوش تعاملی در محیط‌های پویا را فراهم می‌آورند، اما در حفظ تطابق با مشاهدات قبلی در افق‌های طولانی و در نقاط دیدگاه مختلف دچار مشکل می‌شوند. ما WorldCrafter را معرفی می‌کنیم، یک مدل جهانی ویدیویی که برای این منظور حافظه ضمنی با آگاهی سه‌بُعدی و قابلیت پرس‌وجو از راه دوربین را یاد می‌گیرد. نکتهٔ کلیدی این بینش آن است که دیدگاه درخواست‌شده تعیین می‌کند چگونه شواهد چندگانهٔ دید در بودجهٔ محدود توکن‌های تولیدکنندهٔ ویدیو فشرده شوند. هم‌زمان با آموزش تولیدکنندهٔ ویدیو، یک رمزگذار حافظه و ماژول خواندن مشروط به Pose، مشاهدات تاریخی را قبل از مرحلهٔ حذف نویز در مجموعه‌ای ثابت از توکن‌های ویژهٔ دیدگاه هدف ادغام می‌کنند، بدون نیاز به تطابقات صریح مبتنی بر عمق. با ترکیب این حافظه با زمینهٔ زمانی اخیر و تقطیر چندمرحله‌ای، WorldCrafter امکان کاوش جریان‌دار صحنه از یک تصویر ورودی یا یک پیام متنی را فراهم می‌آورد. آزمایش‌ها در صحنه‌های استاتیک و پویا نشان می‌دهند بهبودهای قابل‌توجهی در پایداری افق طولانی و دقت کنترل دوربین به‌دست می‌آید، در حالی که کیفیت بصری در کاوش مقیاس دقیقه‌ای حفظ می‌شود.

متن کامل

همهٔ افراد و سازمان‌هایی که با arXivLabs همکاری می‌کنند، ارزش‌های ما در زمینهٔ گشودگی، جامعه‌محوری، تعالی و حریم خصوصی داده‌های کاربران را پذیرفته و به آن پایبند شده‌اند. arXiv نیز در برابر این ارزش‌ها متعهد است و تنها با شرکایی که از این ارزش‌ها پیروی می‌کنند، همکاری می‌نماید. اگر ایده‌ای برای پروژه‌ای دارید که برای جامعهٔ arXiv ارزش‌افزوده باشد، دربارهٔ arXivLabs بیشتر بدانید. کدام یک از نویسندگان این مقاله تأییدکننده هستند؟ | غیرفعال‌سازی MathJax (MathJax چیست؟)