چکیده
برای بهبود توانایی مدلهای زبانی بزرگ در حل مسائل نرمافزاری واقعی، پژوهشهای پیشین بر ساخت دیتاستهای مسیر عامل (agent trajectory) در مقیاس بزرگ و انجام تنظیم دقیق نظارتی (SFT) بر مسیرهای موفق تمرکز کردهاند. با این حال، موفقیت در یک وظیفه لزوماً نشانگر ارائه نظارت با کیفیت بالا نیست: مسیرهای موفق ممکن است همچنان شامل گامهای نامؤثر، تکراری یا پرریسک باشند. استفاده مستقیم از چنین مسیرهایی برای SFT میتواند نظارت نویزی ایجاد کند و مدلها را به تقلید رفتارهای ناخواسته در حل مسئله ترغیب نماید. بنابراین، ما روشی برای انتخاب داده SFT با دو سطحی و دو مرحلهای به نام SWE-Prime پیشنهاد میکنیم که بهصورت تدریجی دادههای آموزشی را در سطوح مسیر و بخش فیلتر و انتخاب میکند. بهطور خاص، مرحله اول غربالگری سطح مسیر را بر اساس کیفیت فرآیند، کیفیت نتیجه و نمایندگی داده انجام میدهد و زیرمجموعهای با کیفیت و نمایندگی مناسب از مسیرهای موفق را انتخاب میکند. مرحله دوم انتخاب سطح بخش را با گروهبندی گامهای متوالی به بخشهای معنایی و ارزیابی هر بخش بر اساس سودمندی آن در راهحل نهایی، قابلیت یادگیری و خطرات بالقوه انجام میدهد. در طول SFT، تمام بخشها در توالی حفظ میشوند تا زمینه حفظ شود، در حالی که فقط بخشهای منتخب در محاسبه تابع زیان مشارکت میکنند. آزمایشها روی SWE-Bench Pro و SWE-Bench Verified نشان میدهند که آموزش بر روی ۱۰ درصد زیرمجموعه مسیرهای منتخب توسط SWE-Prime، عملکرد بهتری نسبت به آموزش بر روی کل دیتاست حلشده فراهم میکند و بهبودهای نسبی تا ۱۲.۲ درصد و ۲۴.۲ درصدی به دست میآورد.
متن کامل
عنوان: SWE-Prime: مسیر کمتر، عملکرد بهتر
نویسندگان: Dewu Zheng، Ruizhe Ye، Yanlin Wang، Yang Ye، Hongyu Zhang، Ensheng Shi، Xilin Liu، Yuchi Ma، Jianxing Yu، Zibin Zheng
خلاصه: برای بهبود توانایی مدلهای زبانی بزرگ در حل مسائل نرمافزاری واقعی، کارهای پیشین بر سر ساخت مجموعههای دادهی مسیر عامل در مقیاس بزرگ و انجام تنظیم دقیق تحت نظارت (SFT) بر روی مسیرها موفق تمرکز داشتهاند. با این حال، موفقیت در انجام وظیفه تضمینی برای نظارت با کیفیت بالا نیست: مسیرهای موفق ممکن است همچنان شامل مراحل ناکارآمد، تکراری یا پرخطر باشند. استفاده مستقیم از چنین مسیرهایی برای SFT میتواند نظارت نویزی ایجاد کرده و مدلها را ترغیب کند تا رفتارهای نامطلوب در حل مسئله را تقلید کنند. بنابراین، ما SWE-Prime را معرفی میکنیم که یک روش انتخاب دادههای SFT با گرانولاریته چندلایه و دو مرحلهای است که به تدریج دادههای آموزشی را در سطح مسیر و بخش فیلتر میکند. به طور خاص، مرحله اول غربالگری سطح مسیر بر اساس کیفیت فرآیند، کیفیت نتیجه و نمایندگی دادهها انجام میشود و زیرمجموعهای باکیفیت و نماینده از مسیرها را انتخاب میکند. مرحله دوم انتخاب سطح بخش را با گروهبندی پلههای متوالی به بخشهای معنایی و ارزیابی هر بخش بر اساس مشارکت آن در راهحل نهایی، قابلیت یادگیری و ریسکهای بالقوه انجام میدهد. در طول SFT، تمام بخشها به ترتیب باقی میمانند تا زمینه حفظ شود، در حالی که فقط بخشهای انتخاب شده در محاسبه هدرد مشارکت دارند. آزمایشات بر روی SWE-Bench Pro و SWE-Bench Verified نشان میدهد که آموزش بر روی زیرمجموعه مسیر ۱۰٪ انتخاب شده توسط SWE-Prime عملکرد آموزش بر روی مجموعه دادهی کامل حلشده را بهتر میرساند و سودهای عملکرد نسبی تا ۱۲.۲٪ و ۲۴.۲٪ به ترتیب حاصل میشود. نظرات: مهندسی نرمافزار (cs.SE)، هوش مصنوعی (cs.AI)، محاسبات و زبان (cs.CL) استناد: arXiv:2608.27449 [cs.SE] (یا arXiv:2608.27449v1 [cs.SE] برای این نسخه) https://doi.org/10.48550/arXiv.2608.27449
فوکوس برای یادداشت بیشتر: DOI منتشرشده توسط arXiv از طریق DataCite (در انتظار ثبت)
User Safety: safe