چکیده
بازیهای ویدئویی مدرن، بستری مناسب برای آزمایش قابلیتهای مدلهای هوش مصنوعی فراهم میکنند و تواناییهای درک بصری، تجزیه دستورالعملها، برنامهریزی هدفمند و کنترل دقیق اقدامات را در افقهای زمانی مختلف با یکدیگر ترکیب میکنند. با این حال، مجموعههای داده و معیارهای ارزیابی موجود، یا تنها طیف محدودی از بازیها را پوشش میدهند، فاقد دستورالعملهای زبانی هستند، یا بر اجراهای آنلاین با واریانس بالا متکیاند. برای رفع این چالشها، GameHorizon را معرفی میکنیم: مجموعهای یکپارچه از داده و ارزیابی که قابلیتهای گیمپلی را در افقهای زمانی مختلف برای خانوادههای متنوع مدلها اندازهگیری میکند. مجموعه GameHorizon از سه جزء تشکیل شده است. نخست، GameHorizon-Annotator یک خط لوله مقیاسپذیر و خودکار برای حاشیهنویسی دستورالعملهای چندافقی است. دوم، با استفاده از این خط لوله، GameHorizon-Data را ایجاد کردهایم؛ نخستین مجموعه داده مقیاسبزرگ از گیمپلی بازیهای AAA که ویدئوها، اقدامات بازیکن و دستورالعملهای چندافقی در آن از نظر زمانی همتراز شدهاند. این مجموعه شامل ۵٬۰۰۰ ساعت ضبط از ۲۱ بازی است که توسط ۱۰۰ بازیکن انسانی خبره جمعآوری شده است. سوم، GameHorizon-Bench را با آزمایشهای تکرارپذیر برونخط و آنلاین گامبهگام ساختهایم. مسیر برونخط، ارزیابی تکرارپذیر را با استفاده از هزاران پرسش استاندارد، سازمانیافته در سه وظیفه اصلی و مجموعهای از گونههای تشخیصی، امکانپذیر میکند؛ در حالی که مسیر آنلاین بررسی میکند که آیا امتیازهای برونخط بازتابدهنده قابلیتهای واقعی گیمپلی هستند یا خیر، و شکستها را به گامهای خاصی در گیمپلی بلندمدت نسبت میدهد. بر اساس مجموعه GameHorizon، ما ۴۷ مدل را از طریق بیش از یک میلیون فراخوانی مدل ارزیابی کردهایم که سلسلهمراتبی معنادار از دشواری وظایف و تفاوتهای آشکار در قابلیتهای مدلها را آشکار میکند. کار ما میتواند معیاری استاندارد برای ارزیابی قابلیتهای گیمپلی در افقهای زمانی مختلف و در میان خانوادههای مدلها فراهم کند. ما مجموعه داده، حاشیهنویس و معیار سنجش خود را برای تسهیل تحقیقات آینده منتشر خواهیم کرد.
متن کامل
Computer Science > Computer Vision and Pattern Recognition arXiv:2609.25001v1 (cs) [Submitted on 21 سپتامبر 2026]
Title: GameHorizon Suite: داده و ارزیابی چندافق در بازی
Authors: Yiran Wang, Xingyilang Yin, Junfu Pu, Guangzhi Wang, Kaifeng Li, Mingyu Ouyang, Huiqiang Sun, Lingen Li, Cheng Cheng, Wangbo Yu, Honghao Chen, Xiaodong Cun, Chi-Man Pun, Zhiguo Cao, Ying Shan
View a PDF of the paper titled GameHorizon Suite: Multi-Horizon Data and Evaluation in Gameplay, by Yiran Wang and 14 other authors
View PDF HTML (experimental)
Abstract: بازیهای ویدیویی مدرن یک بستر قابل اندازهگیری برای مدلهای هوش مصنوعی فراهم میکنند، که در آن درک بصری، تجزیه دستورالعملها، برنامهریزی هدف و کنترل دقیق عمل در افقهای زمانی مختلف ترکیب میشود. با این حال، مجموعه دادهها و بِنچمارکهای موجود یا محدودهای محدود از بازیها را پوشش میدهند، یا دستورالعملهای زبانی ندارند، یا به Rolloutهای آنلاین با واریانس بالا متکی هستند. برای رفع این چالشها، ما GameHorizon Suite را معرفی میکنیم، یک مجموعه داده و ارزیابی یکپارچه که عملکرد بازی را در افقهای مختلف برای خانوادههای مختلف مدلها اندازهگیری میکند. GameHorizon Suite از سه مؤلفه تشکیل شده است. اول، GameHorizon-Annotator یک خط لوله انوتیشن مقیاسپذیر و خودکار برای دستورالعملهای چندافق است. دوم، با استفاده از این خط لوله، ما GameHorizon-Data را ساختهایم، اولین مجموعه داده در مقیاس بزرگ از بازیهای AAA با ویدیوها، اقدامات بازیکن و دستورالعملهای چندافق همزمان، شامل ۵٬۰۰۰ ساعت ضبط از ۲۱ بازی که توسط ۱۰۰ بازیکن انسانی متخصص گردآوری شده است. سوم، ما GameHorizon-Bench را با آزمونهای آفلاین و آنلاین گامبهگام قابل تکرار ساختهایم. مسیر آفلاین امکان ارزیابی قابل تکرار با استفاده از هزاران سؤال استاندارد که به سه وظیفه اصلی و نسخههای تشخیصی تقسیم میشوند، فراهم میکند، در حالی که مسیر آنلاین بررسی میکند که آیا نتایج آفلاین تواناییهای واقعی بازی را منعکس میکنند و شکستها را به مراحل خاص در بازیهای افق طولانی مکانیابی میکند. بر پایهٔ GameHorizon Suite، ما ۴۷ مدل را از طریق بیش از یک میلیون فراخوانی مدل ارزیابی کردیم، که یک سلسله مراتب معنادار از دشواری وظیفه و تفاوتهای واضح در تواناییهای مدلها را نشان داد. کار ما میتواند یک معیار استاندارد برای ارزیابی تواناییهای بازی در افقهای مختلف و خانوادههای مدلها فراهم کند. ما مجموعه داده، انوتیتور و بِنچمارک خود را برای تسهیل تحقیقات آینده منتشر خواهیم کرد.
Comments: موضوعات: بینایی کامپیوتر و تشخیص الگو (cs.CV); هوش مصنوعی (cs.AI) استناد به: arXiv:2609.25001 [cs.CV] (یا arXiv:2609.25001v1 [cs.CV