چکیده
هدف از پوششدهی ویدیوی غنی بدون نظارت ضعیف، شناسایی و توصیف رویدادهای متعدد در ویدیوهای بدون برش با استفاده از مجموعهای مرتب از نامههای رویداد برای هر ویدیو است. تحقیقات اخیر با استفاده از مدلهای زبانی هوش مصنوعی (LLM)، نامههای انتقالی کمکی را ترکیب کردهاند تا همراستایی بهتری بین بینایی و زبان ایجاد کنند. با این حال، این نامهها فاقد زمینبندی بصری هستند و بهطور سختگیرانه در هر شکاف بین رویدادها در یک موقعیت و مدت زمان ثابت تخصیص داده میشوند. برای مقابله با این مشکل، ما چارچوب «دیدن قبل از سنتز» (SBS) را پیشنهاد میکنیم که راهنمایی زبانی مبتنی بر بصری را بهطور تطبیقی و تنها در مکانهای مورد نیاز فراهم میکند. با استفاده از یک مدل هوش مصنوعی چندوجهی (VLM)، روایتهای سطح فریم برای شکافهای بین رویدادها تولید میکنیم و از تغییرات معنایی بین آنها برای تشخیص انتقالات استفاده میکنیم. برای انتقالات شناساییشده، ماسکهای زمانی بین رویدادها را بهطور دقیقتری اصلاح میکنیم، با ترکیب نقطه وسط زمانی با نقطه تغییر معنایی و انتخاب عرضی که همراستایی بصری-زبانی را به حداکثر میرساند. آزمایشهای انجامشده بر روی مجموعههای ActivityNet Captions و YouCook2 نشان میدهند که این روش عملکردی در سطح بهترین روشهای موجود در هر دو زمینه زیرنویسگذاری و موضعیابی دارد.
متن کامل
# علوم کامپیوتر > بینایی ماشین و بازشناسی الگو
**عنوان:** دیدن پیش از سنتز: کشف رویدادهای انتقالی هدایتشده توسط VLM برای شرحنویسی متراکم ویدئویی با نظارت ضعیف
**نویسندگان:** Ye-Chan Kim, Seunghee Choi, SeungJu Cha, Si-Woo Kim, Hwiseon Kim, Hyungee Kim, Dong-Jin Kim
**چکیده:**
هدف این مقاله، شرحنویسی متراکم ویدئویی با نظارت ضعیف (Weakly-Supervised Dense Video Captioning) است که همزمان مکانیابی و توصیف چندین رویداد در ویدئوهای برشنخورده را انجام میدهد؛ در حالی که در حال حاضر تنها مجموعهای منظم از شرحهای سطح رویداد برای هر ویدئویی در دسترس قرار دارد. کارهای اخیر برای ایجاد تراز بینایی-زبانی (vision-language alignment) بیشتر، شرحهای انتقالی کمکی را از طریق مدلهای زبانی بزرگ (LLM) سنتز میکنند، اما این شرحها فاقد استناد بصری (visual grounding) هستند و بهطور صلب به هر فاصله بینرویدادی در مکان و مدتزمانی ثابت اختصاص مییابند. برای رفع این مشکلات، ما چارچوب «دیدن پیش از سنتز» (Seeing Before Synthesizing یا SBS) را پیشنهاد میکنیم؛ چارچوبی که بهصورت تطبیقی و تنها در موارد ضروری، هدایت زبانی مستند به بصری را فراهم میکند. ما با بهرهگیری از یک مدل بینایی-زبانی (VLM)، روایتهای سطح فریم را برای فواصل بینرویدادی تولید کرده و انتقالها را از طریق تغییرات معنایی در آنها شناسایی میکنیم. سپس برای انتقالهای شناساییشده، ماسکهای زمانی بینرویدادی را از طریق ترکیب نقطه میانی زمانی با نقطه تغییر معنایی و انتخاب عرضی که تراز بینایی-زبانی را بیشینه میکند، بهبود میبخشیم. نتایج آزمایشی بر روی مجموعهدادههای ActivityNet Captions و YouCook2، عملکرد پیشرو (state-of-the-art) را در هر دو حوزه شرحنویسی و مکانیابی نشان میدهد.
**موضوعات:** بینایی ماشین و بازشناسی الگو (cs.CV)؛ هوش مصنوعی (cs.AI)
**ارجاع:** arXiv:2609.04183 [cs.CV]
---
## آرکو لابز (arXivLabs)
آرکو لابز (arXivLabs) یک چارچوب است که به همکاران اجازه میدهد تا ویژگیهای جدید آرکو (arXiv) را مستقیماً در وبسایت ما توسعه دهند و به اشتراک بگذارند.
هر افراد و سازمانهایی که با آرکو لابز (arXivLabs) کار میکنند، ارزشهای باز بودن، جامعه، عالیت و حریم خصوصی داده کاربر را پذیرفته و پایبند شدهاند.
آرکو (arXiv) به این ارزشها التزام دارد و فقط با شرکایی که به آنها پایبند هستند کار میکند.
ایدهای برای پروژهای دارید که ارزشی برای جامعه آرکو (arXiv) اضافه کند؟ بیشتر درباره آرکو لابز (arXivLabs) بدانید.
کدام نویسندگان این مقاله تأییدکننده هستند؟ | غیرفعال کردن MathJax (MathJax چیست؟)