چکیده
مدلهای جهانی ویدیویی امکان کاوش تعاملی در محیطهای پویا را فراهم میآورند، اما در حفظ تطابق با مشاهدات قبلی در افقهای طولانی و در نقاط دیدگاه مختلف دچار مشکل میشوند. ما WorldCrafter را معرفی میکنیم، یک مدل جهانی ویدیویی که برای این منظور حافظه ضمنی با آگاهی سهبُعدی و قابلیت پرسوجو از راه دوربین را یاد میگیرد. نکتهٔ کلیدی این بینش آن است که دیدگاه درخواستشده تعیین میکند چگونه شواهد چندگانهٔ دید در بودجهٔ محدود توکنهای تولیدکنندهٔ ویدیو فشرده شوند. همزمان با آموزش تولیدکنندهٔ ویدیو، یک رمزگذار حافظه و ماژول خواندن مشروط به Pose، مشاهدات تاریخی را قبل از مرحلهٔ حذف نویز در مجموعهای ثابت از توکنهای ویژهٔ دیدگاه هدف ادغام میکنند، بدون نیاز به تطابقات صریح مبتنی بر عمق. با ترکیب این حافظه با زمینهٔ زمانی اخیر و تقطیر چندمرحلهای، WorldCrafter امکان کاوش جریاندار صحنه از یک تصویر ورودی یا یک پیام متنی را فراهم میآورد. آزمایشها در صحنههای استاتیک و پویا نشان میدهند بهبودهای قابلتوجهی در پایداری افق طولانی و دقت کنترل دوربین بهدست میآید، در حالی که کیفیت بصری در کاوش مقیاس دقیقهای حفظ میشود.