arXiv:2608.26105ترجمه شده

VBVR-Pro: مجموعه‌ای مقیاس‌پذیر و قابل تأیید برای استدلال بصری بومی

Junxiang Xu، Ruisi Wang، Fanyi Pu، Maijunxian Wang، Ran Ji، Tongxi Zhou، Chenyang Gu، Jing Zuo، Hongcan Xiao، Yimeng Geng، Wanqi Yin، Wei Chen، Oscar Qian، Zhengan Yan، Ziqi Huang، Haiwen Diao، Liang Pan، Bo Li، Xiangyu Fan، Dezhi Luo، Fengyuan Yu، Zehong Zhao، Qingying Gao، Tinghui Zhu، Yilan Zhang، Jingqi Tong، Pinyuan Feng، Zhengze Jiang، Letian Wang، Ziyu Guo، Renrui Zhang، Jieneng Chen، Sonia Joseph، Constantin Venhoff، Saman Motamed، Mengyue Yang، Chandra Sripada، Alan Yuille، Philip Torr، Lvmin Zhang، Vikash Kumar، Daniel Khashabi، Nikolaus Kriegeskorte، Raphaël Millière، Vincent C. Müller، Anyi Rao، Quan Wang، Ziwei Liu، Dahua Lin، Lei Yang، Hokin Deng، Zhongang Cai

چکیده

استدلال بصری ذاتی تولید بصری را به عنوان ابزار خود می‌شناسد: حالات بصری (یعنی تصاویر و ویدیوها) صرفاً ورودی‌هایی برای درک یا خروجی‌هایی برای نمایش نیستند، بلکه زیرساخت‌های معتبر اولیه برای حل مسئله‌های فراتر از زبان هستند. با این حال، پیشرفت این حوزه به دلیل نبود وظایف آموزشی قابل مقیاس‌سازی، بازخورد قابل اعتماد و مقایسه‌های کنترل‌شده بین زیرساخت‌های تولیدی محدود می‌شود. در این راستا، ما VBVR-Pro را معرفی می‌کنیم؛ آزمایشگاهی بسته که استدلال بصری ذاتی را از طریق تولید قابل آموزش، قابل تأیید، قابل بهینه‌سازی و قابل کنترل تجربی می‌سازد. **۱) مقیاس‌پذیری وظایف.** VBVR-Pro استدلال بصری را به فضای وظایف کنترل‌شده‌ای از ۳۰۰ وظیفه تولیدی تبدیل می‌کند. مدل‌های آموزش‌داده شده بر پایه VBVR-Pro، انتقال قوی فراتر از مجموعه پیشنهادی را در هفت بنچمارک استدلال بصری خارجی مانند RISE-Video، MME-CoF-Pro و BabyVision نشان می‌دهند. **۲) پاداش‌های قابل تأیید.** VBVR-Pro از طریق ارائه نمره‌دهنده‌های پاداش قابل تأیید، ابزاری برای ارزیابی مبتنی بر وظیفه فراهم می‌کند. با استفاده از مطالعه سیستماتیک مدل‌های زبانی بزرگ چندموضوعی (MLLMs) به عنوان قاضی، الگوهای شکست تکرار شونده پارادایم رایج استدلال بصری را شناسایی می‌کنیم. در مقابل، نمره‌دهنده‌های پیشنهادی بر اساس قواعد تعیین‌شده و ویژه هر وظیفه طراحی شده‌اند و هم‌افزایی دقیقی با قضاوت‌های انسانی ایجاد می‌کنند. مهم‌ترین نتیجه این است که این سیگنال‌های پاداش قابل اعتماد، برای یادگیری تقویتی در مقیاس بزرگ عمل می‌کنند و عملکرد قوی‌تری پس از RL در وظایف استدلال بصری به نمایش می‌گذارند. **۳) مطالعه مکانیسم.** VBVR-Pro امکان مطالعات مدولاری کنترل‌شده در بیش از ۳۰ مولد تصویر، ویدیو و ترکیبی را فراهم می‌آورد. تحلیل‌های ما نشان می‌دهد که تولید ویدیو برای وظایفی که نیاز به ردیابی پایدار وضعیت فضا-زمانی دارند، قوی‌ترین عملکرد را دارد، در حالی که تولید ترکیبی یک جایگزین کارآمد از نظر محاسباتی است. به‌طور حیاتی، حذف‌ها و جستجو نشان‌دهنده وجود مسیرهای ذاتی بصری است که برای استدلال بصری حیاتی هستند. تمام داده‌ها، مدل‌ها، نمره‌دهنده‌ها و کد من را منتشر می‌کنیم.

متن کامل

1. بهبود جریان و خوانایی 2. ساختار جمله‌ی فارسی طبیعی‌تر 3. ثبات در اصطلاحات 4. تصحیح هرگونه خطای ترجمه مقررات: - اصطلاحات و فرمول‌های فنی بدون تغییر باقی بمانند. - ساختار بخش‌ها بدون تغییر باقی بماند. - استنادها و منابع بدون تغییر باقی بمانند. فقط متن فارسی بهبود یافته را ارائه دهید، بدون توضیحات یا یادداشت‌ها. --- علومی کامپیوتر > بینایی ماشین و تشخیص الگو arXiv:2608.26105v1 (cs) [ارسال شده در ۲۶ آگوست ۲۰۲۶] عنوان: VBVR-Pro: یک مجموعه مقیاس‌پذیر و قابل تأیید برای استدلال بصری بومی نویسندگان: جونگ‌شیانگ شو، روئیسی وانگ، فانی پو، مایجون‌شیان وانگ، ران جی، تونگشیو ژو، چن‌یانگ گو، جینگ زو، هونگکان شیائو، ییمنگ گنگ، وانکی این، وی چن، اسکار کیان، ژانگان یان، زیچی هوانگ، هایون دیائو، لیانگ پان، بو لی، شیانگ‌یو فان، دژی لو، فِنگ‌یوان یو، زهنونگ ژائو، چینگ‌یینگ گائو، تینگ‌هوی ژو، ییلان ژانگ، جینگ‌چی تانگ، پین‌یوان فنگ، ژنگ‌زه جیانگ، لتیان وانگ، زی‌یو گوئو، رن‌روی ژانگ، جیننگ چن، سونیا جوزف، کنستانتین ونهوف، سامان موتامد، منگ‌یو یانگ، چاندرا سریپادا، آلن یوئیل، فیلیپ تور، لوئمین ژانگ، ویکش کومار، دانیل خاشابی، نیکولاوس کریگسکورته، رافائل میلیر، وینسنت سی. مولر، آنی رائو، کوان وانگ، زی‌وی لیو، داهوا لین، لی یانگ، هوکین دنگ، ژونگ‌آنگ کای چکیده: استدلال بصری بومی، تولید بصری را به عنوان واسطه‌ی خود استدلال در نظر می‌گیرد؛ یعنی حالت‌های بصری (تصاویر و ویدئوها) نه تنها ورودی‌هایی برای درک یا خروجی‌هایی برای ارائه هستند، بلکه زیرلایه‌های درجه اول برای حل مسئله فراتر از زبان به شمار می‌روند. با این حال، پیشرفت همچنان با کمبود وظایف آموزشی مقیاس‌پذیر، بازخورد قابل اعتماد و مقایسه‌های کنترل‌شده در زیرلایه‌های تولیدی مواجه است. در این کار، ما VBVR-Pro را معرفی می‌کنیم؛ یک بستر آزمایشی حلقه بسته که استدلال بصری بومی را از طریق تولید، قابل آموزش، قابل تأیید، بهینه‌سازی و کنترل تجربی می‌سازد. ۱) مقیاس‌دهی وظیفه: VBVR-Pro استدلال بصری را به فضای وظیفه کنترل‌شده‌ای متشکل از ۳۰۰ وظیفه تولید شده به صورت رویه‌ای تبدیل می‌کند. مدل‌های آموزش‌دیده روی VBVR-Pro انتقال قوی فراتر از مجموعه پیشنهادی را در هفت معیار استدلال بصری خارجی مانند RISE-Video، MME-CoF-Pro و BabyVision نشان می‌دهند. ۲) پاداش‌های قابل تأیید: VBVR-Pro امتیازدهنده‌های پاداش قابل تأیید را برای ارزیابی مبتنی بر وظیفه فراهم می‌کند. از طریق مطالعه نظام‌مند MLLMهای پیشرو به عنوان داور، ما حالت‌های شکست تکراری پارادایم VLM-as-a-judge را شناسایی می‌کنیم. در مقابل، امتیازدهنده‌های پیشنهادی در قواعد قطعی و ویژه وظیفه ریشه دوانده‌اند و هم‌راستایی ظریف با قضاوت‌های انسانی را به دست می‌آورند. نکته مهم اینکه، آن‌ها به عنوان سیگنال‌های پاداش قابل اعتماد برای یادگیری تقویتی چندوظیفه‌ای در مقیاس بزرگ عمل می‌کنند و عملکرد پس از RL قوی‌تری را در وظایف استدلال بصری نشان می‌دهند. ۳) مطالعه مکانیزم: VBVR-Pro مطالعات مدیتیه کنترل‌شده را در بیش از ۳۰ تولیدکننده تصویر، ویدئو و درهم‌تنیده امکان‌پذیر می‌سازد. تحلیل ما نشان می‌دهد که تولید ویدئو برای وظایفی که نیاز به ردیابی حالت فضازمانی پایدار دارند همچنان قوی‌ترین است، در حالی که تولید درهم‌تنیده جایگزینی کارآمد از نظر محاسباتی ارائه می‌دهد. نکته حیاتی اینکه، تحلیل‌های حذف و کاوش، وجود مسیرهای بومی بصری را نشان می‌دهند که برای استدلال بصری حیاتی هستند. ما تمام داده‌ها، مدل‌ها، معیارهای امتیازدهی و کد را منتشر می‌کنیم. یادداشت‌ها: موضوع‌ها: بینایی کامپیوتری و شناخت الگو (cs.CV); هوش مصنوعی (cs.AI); یادگیری ماشین (cs.LG); چندرسانه (cs.MM); روباتیک (cs.RO) ارجاع به: arXiv:2608.26105 [cs.CV] (یا arXiv:2608.26105v1 [cs.CV] برای این نسخه) https://doi.org/10.48550/arXiv.2608.26105