arXiv:2608.24804ترجمه شده

StarHarness: تکامل چارچوب‌های ارزیابی با جستجوی لایه‌ای برای محیط‌های سازمانی

Esakkivel Esakkiraja، Denis Akhiyarov، Vikas Yadav، Sai Rajeswar، Patrice Bechard، Sridhar Nemala، Sagar Davasam

چکیده

**StarHarness** را معرفی می‌کنیم، چارچوبی برای تکامل مهارهای (harness) اختصاص‌یافته به محیط، با حفظ ثابت بودن وزن‌های مدل. مهار تکامل‌یافته می‌تواند شامل چارچوب‌بندی وظیفه و دستور (prompt)، واسط‌های ابزاری، مهارت‌ها، ارائه‌دهندگان مبتنی بر MCP، معماری زیرعامل‌ها (subagent)، و پیکربندی حلقه‌ی عامل باشد. StarHarness با لایه‌بندی وظایف بر اساس رفتار شکست خط پایه، یک مجموعه‌ی تکاملی فشرده می‌سازد، وظایف جستجوی آشکار را از وظایف گزینش پنهان جدا می‌کند، و وظایف کنارگذاشته‌شده (held-out) را برای ارزیابی تعمیم‌پذیری اختصاص می‌دهد. در مجموعه‌داده‌های **ITBench SRE**، **EnterpriseOps-Gym ITSM** و **AutomationBench Finance**، تکامل مهار، عملکرد کلی بنچمارک را پس از ۴ تا ۱۲ تغییر پذیرفته‌شده در هر محیط، ۲۰ تا ۳۵ درصد نسبت به مهار پیش‌فرض بهبود می‌دهد. این بهبودها در وظایفی که از فرایند تکامل کنار گذاشته شده‌اند نیز پایدار باقی می‌مانند و بدون تکامل مجدد، به خانواده‌های مدل **GPT** و **Qwen** منتقل می‌شوند. تحلیل ردّ (trace) بهبودها را به اصلاح واسط‌ها، قراردادهای محیطی، و دانش عملیاتی‌ای نسبت می‌دهد که فضای جستجو را فشرده می‌سازد؛ در چندین پیکربندی، تشخیص‌های مثبت کاذب کمتر و مسیرهای (trajectory) کوتاه‌تری مشاهده می‌کنیم. بنابراین، StarHarness روشی عملی برای کاهش عدم‌تطبیق پایدار مدل و محیط در وظایف سازمانی غنی از ابزار ارائه می‌دهد.

متن کامل

**عنوان:** StarHarness: تکامل چارچوب‌های اجرایی با جستجوی لایه‌ای برای محیط‌های سازمانی **نویسندگان:** Esakkivel Esakkiraja, Denis Akhiyarov, Vikas Yadav, Sai Rajeswar, Patrice Bechard, Sridhar Nemala, Sagar Davasam **چکیده:** در این مقاله، StarHarness را معرفی می‌کنیم؛ چارچوبی برای تکامل چارچوب‌های اجرایی عامل‌های اختصاصی هر محیط، با حفظ ثابت وزن‌های مدل. چارچوب اجرایی تکامل‌یافته می‌تواند شامل قالب‌بندی دستورات و وظایف، واسط‌های ابزار، مهارت‌ها، ارائه‌دهندگان مبتنی بر MCP، ساختار زیرعامل، و پیکربندی حلقه عامل باشد. StarHarness مجموعه‌ای فشرده از تکامل را با لایه‌بندی وظایف بر اساس رفتار شکست مبنا تشکیل می‌دهد، وظایف جستجوی آشکار برای پیشنهاددهنده را از وظایف انتخاب پنهان تفکیک می‌کند، و وظایف کنارگذاشته‌شده را برای ارزیابی تعمیم‌پذیری ذخیره می‌نماید. در معیارهای ITBench SRE، EnterpriseOps-Gym ITSM و AutomationBench Finance، تکامل چارچوب اجرایی، عملکرد کلی معیار را ۲۰ تا ۳۵ درصد نسبت به چارچوب اجرایی پیش‌فرض، پس از ۴ تا ۱۲ پذیرش در هر محیط، بهبود می‌بخشد. این بهبودها بر روی وظایف حذف‌شده از فرایند تکامل باقی می‌مانند و بدون نیاز به تکامل مجدد، به خانواده‌های مدل GPT و Qwen منتقل می‌شوند. تحلیل ردپا، این بهبودها را با ترمیم واسط‌ها، قراردادهای محیطی، و دانش عملیاتی که جستجو را فشرده می‌سازد، مرتبط می‌سازد؛ همچنین در چندین پیکربندی، تشخیص‌های مثبت کاذب کمتر و مسیرهای کوتاه‌تری مشاهده می‌شود. بدین ترتیب، StarHarness روشی عملی برای کاهش عدم تطابق مداوم بین مدل و محیط در وظایف سازمانی غنی از ابزار ارائه می‌دهد.