چکیده
استدلال بصری ذاتی تولید بصری را به عنوان ابزار خود میشناسد: حالات بصری (یعنی تصاویر و ویدیوها) صرفاً ورودیهایی برای درک یا خروجیهایی برای نمایش نیستند، بلکه زیرساختهای معتبر اولیه برای حل مسئلههای فراتر از زبان هستند. با این حال، پیشرفت این حوزه به دلیل نبود وظایف آموزشی قابل مقیاسسازی، بازخورد قابل اعتماد و مقایسههای کنترلشده بین زیرساختهای تولیدی محدود میشود. در این راستا، ما VBVR-Pro را معرفی میکنیم؛ آزمایشگاهی بسته که استدلال بصری ذاتی را از طریق تولید قابل آموزش، قابل تأیید، قابل بهینهسازی و قابل کنترل تجربی میسازد.
**۱) مقیاسپذیری وظایف.** VBVR-Pro استدلال بصری را به فضای وظایف کنترلشدهای از ۳۰۰ وظیفه تولیدی تبدیل میکند. مدلهای آموزشداده شده بر پایه VBVR-Pro، انتقال قوی فراتر از مجموعه پیشنهادی را در هفت بنچمارک استدلال بصری خارجی مانند RISE-Video، MME-CoF-Pro و BabyVision نشان میدهند.
**۲) پاداشهای قابل تأیید.** VBVR-Pro از طریق ارائه نمرهدهندههای پاداش قابل تأیید، ابزاری برای ارزیابی مبتنی بر وظیفه فراهم میکند. با استفاده از مطالعه سیستماتیک مدلهای زبانی بزرگ چندموضوعی (MLLMs) به عنوان قاضی، الگوهای شکست تکرار شونده پارادایم رایج استدلال بصری را شناسایی میکنیم. در مقابل، نمرهدهندههای پیشنهادی بر اساس قواعد تعیینشده و ویژه هر وظیفه طراحی شدهاند و همافزایی دقیقی با قضاوتهای انسانی ایجاد میکنند. مهمترین نتیجه این است که این سیگنالهای پاداش قابل اعتماد، برای یادگیری تقویتی در مقیاس بزرگ عمل میکنند و عملکرد قویتری پس از RL در وظایف استدلال بصری به نمایش میگذارند.
**۳) مطالعه مکانیسم.** VBVR-Pro امکان مطالعات مدولاری کنترلشده در بیش از ۳۰ مولد تصویر، ویدیو و ترکیبی را فراهم میآورد. تحلیلهای ما نشان میدهد که تولید ویدیو برای وظایفی که نیاز به ردیابی پایدار وضعیت فضا-زمانی دارند، قویترین عملکرد را دارد، در حالی که تولید ترکیبی یک جایگزین کارآمد از نظر محاسباتی است. بهطور حیاتی، حذفها و جستجو نشاندهنده وجود مسیرهای ذاتی بصری است که برای استدلال بصری حیاتی هستند. تمام دادهها، مدلها، نمرهدهندهها و کد من را منتشر میکنیم.
متن کامل
1. بهبود جریان و خوانایی
2. ساختار جملهی فارسی طبیعیتر
3. ثبات در اصطلاحات
4. تصحیح هرگونه خطای ترجمه
مقررات:
- اصطلاحات و فرمولهای فنی بدون تغییر باقی بمانند.
- ساختار بخشها بدون تغییر باقی بماند.
- استنادها و منابع بدون تغییر باقی بمانند.
فقط متن فارسی بهبود یافته را ارائه دهید، بدون توضیحات یا یادداشتها.
---
علومی کامپیوتر > بینایی ماشین و تشخیص الگو
arXiv:2608.26105v1 (cs) [ارسال شده در ۲۶ آگوست ۲۰۲۶]
عنوان: VBVR-Pro: یک مجموعه مقیاسپذیر و قابل تأیید برای استدلال بصری بومی
نویسندگان: جونگشیانگ شو، روئیسی وانگ، فانی پو، مایجونشیان وانگ، ران جی، تونگشیو ژو، چنیانگ گو، جینگ زو، هونگکان شیائو، ییمنگ گنگ، وانکی این، وی چن، اسکار کیان، ژانگان یان، زیچی هوانگ، هایون دیائو، لیانگ پان، بو لی، شیانگیو فان، دژی لو، فِنگیوان یو، زهنونگ ژائو، چینگیینگ گائو، تینگهوی ژو، ییلان ژانگ، جینگچی تانگ، پینیوان فنگ، ژنگزه جیانگ، لتیان وانگ، زییو گوئو، رنروی ژانگ، جیننگ چن، سونیا جوزف، کنستانتین ونهوف، سامان موتامد، منگیو یانگ، چاندرا سریپادا، آلن یوئیل، فیلیپ تور، لوئمین ژانگ، ویکش کومار، دانیل خاشابی، نیکولاوس کریگسکورته، رافائل میلیر، وینسنت سی. مولر، آنی رائو، کوان وانگ، زیوی لیو، داهوا لین، لی یانگ، هوکین دنگ، ژونگآنگ کای
چکیده: استدلال بصری بومی، تولید بصری را به عنوان واسطهی خود استدلال در نظر میگیرد؛ یعنی حالتهای بصری (تصاویر و ویدئوها) نه تنها ورودیهایی برای درک یا خروجیهایی برای ارائه هستند، بلکه زیرلایههای درجه اول برای حل مسئله فراتر از زبان به شمار میروند. با این حال، پیشرفت همچنان با کمبود وظایف آموزشی مقیاسپذیر، بازخورد قابل اعتماد و مقایسههای کنترلشده در زیرلایههای تولیدی مواجه است. در این کار، ما VBVR-Pro را معرفی میکنیم؛ یک بستر آزمایشی حلقه بسته که استدلال بصری بومی را از طریق تولید، قابل آموزش، قابل تأیید، بهینهسازی و کنترل تجربی میسازد. ۱) مقیاسدهی وظیفه: VBVR-Pro استدلال بصری را به فضای وظیفه کنترلشدهای متشکل از ۳۰۰ وظیفه تولید شده به صورت رویهای تبدیل میکند. مدلهای آموزشدیده روی VBVR-Pro انتقال قوی فراتر از مجموعه پیشنهادی را در هفت معیار استدلال بصری خارجی مانند RISE-Video، MME-CoF-Pro و BabyVision نشان میدهند. ۲) پاداشهای قابل تأیید: VBVR-Pro امتیازدهندههای پاداش قابل تأیید را برای ارزیابی مبتنی بر وظیفه فراهم میکند. از طریق مطالعه نظاممند MLLMهای پیشرو به عنوان داور، ما حالتهای شکست تکراری پارادایم VLM-as-a-judge را شناسایی میکنیم. در مقابل، امتیازدهندههای پیشنهادی در قواعد قطعی و ویژه وظیفه ریشه دواندهاند و همراستایی ظریف با قضاوتهای انسانی را به دست میآورند. نکته مهم اینکه، آنها به عنوان سیگنالهای پاداش قابل اعتماد برای یادگیری تقویتی چندوظیفهای در مقیاس بزرگ عمل میکنند و عملکرد پس از RL قویتری را در وظایف استدلال بصری نشان میدهند. ۳) مطالعه مکانیزم: VBVR-Pro مطالعات مدیتیه کنترلشده را در بیش از ۳۰ تولیدکننده تصویر، ویدئو و درهمتنیده امکانپذیر میسازد. تحلیل ما نشان میدهد که تولید ویدئو برای وظایفی که نیاز به ردیابی حالت فضازمانی پایدار دارند همچنان قویترین است، در حالی که تولید درهمتنیده جایگزینی کارآمد از نظر محاسباتی ارائه میدهد. نکته حیاتی اینکه، تحلیلهای حذف و کاوش، وجود مسیرهای بومی بصری را نشان میدهند که برای استدلال بصری حیاتی هستند.
ما تمام دادهها، مدلها، معیارهای امتیازدهی و کد را منتشر میکنیم.
یادداشتها: موضوعها: بینایی کامپیوتری و شناخت الگو (cs.CV); هوش مصنوعی (cs.AI); یادگیری ماشین (cs.LG); چندرسانه (cs.MM); روباتیک (cs.RO)
ارجاع به: arXiv:2608.26105 [cs.CV] (یا arXiv:2608.26105v1 [cs.CV] برای این نسخه) https://doi.org/10.48550/arXiv.2608.26105