arXiv:2609.01603ترجمه شده

ارزیابی کارآمد بنچمارک‌های عامل مهندسی نرم‌افزار از طریق ارزیابی آگاه از مسیر

Kefeng Duan، Dewu Zheng، Yanlin Wang، Xiwen Wang، Ensheng Shi، Xilin Liu، Yuchi Ma، Jiachi Chen، Mingwei Liu، Zibin Zheng

چکیده

ارزیابی عوامل مهندسی نرم‌افزار بر روی بنچمارک‌های واقعی، هزینه‌بر است؛ زیرا هر وظیفه ممکن است نیازمند کاوش چندمرحله‌ای کد، اصلاح آن و اجرای آزمون باشد. روش‌های ارزیابی کارآمد موجود، زیرمجموعه‌هایی نمادین را برای برآورد عملکرد کلی بنچمارک برمی‌گزینند، اما عمدتاً بر نتایج متمرکزاند: آن‌ها ماتریس‌های پاسخ‌های تاریخی پاس/رد یا معناشناسی ثابت وظایف را برازش می‌کنند و چگونگی حل مسئله توسط عوامل را نادیده می‌گیرند. ما در این مقاله، PTA-IRT را پیشنهاد می‌کنیم؛ چارچوبی مبتنی بر نظریه پاسخ‌های آیتم که با مسیرهای ترجیحی آگاه است و سیگنال‌های فرآیندی و نتایجی را با هم ادغام می‌کند. مسیرهای اجرای تاریخی، شواهدی فرآیندی فراتر از پاس/رد فراهم می‌آورند؛ از جمله زمینه کاوش‌شده، ویرایش‌های امتحان‌شده و مسیرهای حل مسئله. PTA-IRT از این شواهد به‌عنوان اطلاعاتی ترجیحی برای گزینش زیرمجموعه کالیبراسیون و برآورد توانایی عامل بهره می‌گیرد. در شرایط بودجه کالیبراسیون پایین، PTA-IRT به‌طور پیوسته از نظر امتیاز و بازیابی رتبه‌بندی در چهار بنچمارک SWE، عملکردی بهتر از خط‌های پایه پیشین IRT نشان می‌دهد. کد و داده‌ها به‌صورت عمومی در آدرس https://github.com/DeepSoftwareAnalytics/PTA-IRT در دسترس‌اند.

متن کامل

علوم کامپیوتر > مهندسی نرم‌افزار arXiv:2609.01603v1 (cs) [ارسال شده در ۱ سپتامبر ۲۰۲۶] عنوان: ارزیابی کارآمد عامل‌های مهندسی نرم‌افزار از طریق ارزیابی آگاهانه از مسیر (Trajectory) نویسندگان: کفنگ دوان، دووا زانگ، یانلین وان، شیاویان وان، اینشنگ شی، شیلین لیو، یوچی ما، جیاشی چن، میانگوی لیو، زیبین چنگ مشاهده PDF این مقاله با عنوان "ارزیابی کارآمد عامل‌های مهندسی نرم‌افزار از طریق ارزیابی آگاهانه از مسیر" توسط کفنگ دوان و ۹ نویسنده دیگر مشاهده PDF HTML (آزمایشی) چکیده: ارزیابی عامل‌های مهندسی نرم‌افزار در محیط‌های واقعی پرهزینه است، زیرا هر وظیفه ممکن است نیازمند کاوش کد، اصلاح آن و اجرای آزمون باشد. روش‌های ارزیابی کارآمد موجود، زیرمجموعه‌های نماینده‌ای را برای تخمین عملکرد کامل انتخاب می‌کنند، اما عمدتاً تنها بر نتیجه تمرکز دارند: یا ماتریس‌های تاریخی قبولی/ردی را جابجا می‌کنند یا معنای ایستای وظایف را در نظر گرفته و از روش حل مسئله چشم‌پوشی می‌کنند. ما PTA-IRT را پیشنهاد می‌کنیم؛ چارچوبی مبتنی بر نظریه پاسخ آیتم آگاه از مسیر ممتاز (Privileged Trajectory-Aware Item Response Theory) که سیگنال‌های فرآیند و نتیجه را ترکیب می‌کند. مسیرهای اجرایی تاریخی شواهدی در سطح فرآیند فراتر از قبولی/ردی فراهم می‌کنند، مانند زمینه کاوش‌شده، ویرایش‌های انجام‌شده و مسیرهای حل مسئله، که PTA-IRT برای انتخاب زیرمجموعه تقویم و تخمین توانایی از آن‌ها استفاده می‌کند. در شرایط بودجه‌های کم تقویم، PTA-IRT در چهار بستر SWE، عملکرد بهتری نسبت به روش‌های پایه IRT قبلی در ارزیابی امتیاز و بازیابی رتبه نشان می‌دهد. کد و داده‌ها در این URL عمومی در دسترس هستند. نظرات: موضوعات: مهندسی نرم‌افزار (cs.SE)؛ هوش مصنوعی (cs.AI)؛ محاسبه و زبان (cs.CL) ارجاع‌دهی به عنوان: arXiv:2609.01603 [cs.SE] (یا arXiv:2609.01603v1 [cs.SE] برای این نسخه) https://doi.org/10.48550/arXiv.2609.01603 برای یادگیری بیشتر درباره DOI منتشرشده توسط arXiv از طریق DataCite (در انتظار ثبت) تاریخچه ارسال: از: کفنگ دوان [مشاهده ایمیل] [v1] سه‌شنبه، ۱ سپتامبر ۲۰۲۶ ۱۷:۵۹:۴۶ UTC (482 KB) ابزارهای کتابشناسی ابزارهای کتابشناسی و ارجاع‌دهی مرورگر کتابشناسی قفل مرورگر کتابشناسی (مرورگر چیست؟) اسناد مرتبط قفل اسناد مرتبط (اسناد مرتبط چیست؟) Litmaps قفل Litmaps (Litmaps چیست؟) scite.ai قفل استنادات هوشمند scite (استنادات هوشمند چیست؟) کد، داده، رسانه کد، داده و رسانه مرتبط با این مقاله alphaXiv قفل alphaXiv (alphaXiv چیست؟) لینک به کد قفل یابنده کد CatalyzeX برای مقالات (CatalyzeX چیست؟) DagsHub قفل DagsHub (DagsHub چیست؟) GotitPub قفل Gotit.pub (GotitPub چیست؟) Huggingface قفل Hugging Face (Huggingface چیست؟) ScienceCast قفل ScienceCast (ScienceCast چیست؟) دموها دموها Replicate قفل Replicate (Replicate چیست؟) فضاها قفل فضاهای Hugging Face (فضاها چیست؟) فضاها قفل TXYZ.AI (TXYZ.AI چیست؟) اسناد مرتبط ابزارهای پیشنهادگر و جستجو لینک به تأثیر گل تأثیر گل (گل‌های تأثیر چیست؟) ابزار پیشنهادگر Core قفل Core Recommender (Core چیست؟) نویسنده/مکان/نهاد/موضوع در مورد arXivLabs arXivLabs: پروژه‌های آزمایشی با همکاران جامعه. arXivLabs چارچوبی است که به همکاران اجازه می‌دهد ویژگی‌های جدید arXiv را مستقیماً در وب‌سایت ما توسعه و به اشتراک بگذارند. هم افراد و هم سازمان‌هایی که با arXivLabs همکاری می‌کنند، ارزش‌های ما یعنی شفافیت، جامعه، تمیزی و حریم خصوصی داده‌های کاربران را پذیرفته و به آن‌ها پایبند هستند. arXiv متعهد به این ارزش‌ها است و تنها با شرکایی که به آن‌ها پایبندند همکاری می‌کند. ایده‌ای برای پروژه‌ای دارید که ارزشی به جامعه arXiv اضافه کند؟ بیشتر درباره arXivLabs بیاموزید. کدام نویسندگان این مقاله حامیان هستند؟ | غیرفعال کردن MathJax (MathJax چیست؟)