arXiv:2609.09134ترجمه شده

هارس و مدل‌های هم‌تکامل: اصلاح در همان سیاست کمک به مدل‌های ضعیف در جایی که تقلید شکست می‌خورد

Zhou Yu، Bin Bi، Shiva Kumar Pentyala، Shubham Mehrotra، Sougata Chaudhuri، Shilpa Bhagavath، Zeyuan Chen، Ran Xu، Phil Mui، James Zhu، Sitaram Asur

چکیده

تله‌های عامل (پرامپت سیستمی، مجموعه ابزار، قلاب‌های اجرایی و ساختار حمایتی مدیریت زمینه در اطراف یک مدل) نقش تعیین‌کننده‌ای در موفقیت وظایف عاملی دارند. تکامل خودکار تله می‌تواند مدل‌های کوچک‌تر را در انجام وظایف تخصصی حوزه‌ای با هزینه‌ای بسیار کمتر از مدل‌های مرزی به عملکرد مؤثر برساند. از آنجا که هم تله و هم وزن‌های مدل رفتار را شکل می‌دهند، می‌پرسیم که تکامل تله و رگولاسازی سبک را چگونه باید ترکیب کرد. در هفت وظیفهٔ عاملی سازمانی، ابتدا تله را با بهره‌گیری از مدل ضعیف‌تر تکامل دادیم و سپس مشاهده کردیم که متخصص قوی‌تر اغلب از آن به‌طور مؤثرتری استفاده می‌کند؛ این امر نشان می‌دهد که نظارت متخصص می‌تواند شکاف باقی‌مانده را برطرف کند. با این حال، آموزش مدل ضعیف‌تر بر پایهٔ ردپای کامل متخصص در تلهٔ تکامل‌یافته نتیجهٔ مخالفی دارد: برای هر دو مدل Qwen3-Coder و Gemma 4، عملکرد در هر هفت وظیفه ۴ تا ۳۰ واحد کاهش می‌یابد، هرچند همان روش در تلهٔ تکامل‌نیافته مؤثر است. تحلیل ما نشان می‌دهد که این روش دانش را منتقل می‌کند و استفاده از اسکافولد را افزایش می‌دهد، اما سازگاری مدل–تله را مختل می‌کند: مدل ضعیف‌تر استراتژی برنامه‌ریزی متخصص را بدون توانایی اجرای آن اقتباس می‌کند و دیگر با سبک برنامه‌ریزی ذاتی خود، که تله برای آن طراحی شده است، هم‌خوانی ندارد. بنابراین، خط لوله‌ای برای تصحیح توسط متخصص طراحی کردیم که عامل MLE سطح متا آن را خودکار می‌کند؛ این خط لوله نقطهٔ شکست در اجرای مدل ضعیف‌تر را شناسایی می‌کند و تنها همان اجرای ناموفق را توسط متخصص بازنویسی می‌کند. این رویکرد سبک برنامه‌ریزی مدل را حفظ می‌کند و سود حاصل از تکامل تله را با سازگاری مدل ترکیب می‌کند. نتایج ما منشأ اختلاف میان به‌روزرسانی‌های تله و وزن را شناسایی و برطرف می‌کند و بازخورد سازگاری محافظه‌کارانه‌ای برای تکامل اقتصادی مشترک در وظایف سازمانی تخصصی ارائه می‌دهد.

متن کامل

عنوان: هم‌تکامل‌دهی حصارها و مدل‌ها: اصلاح سیاست‌درون کمک به مدل‌های ضعیف‌تر برای جلویی‌تر شدن جایی که تقلید شکست می‌خورد نویسندگان: Zhou Yu, Bin Bi, Shiva Kumar Pentyala, Shubham Mehrotra, Sougata Chaudhuri, Shilpa Bhagavath, Zeyuan Chen, Ran Xu, Phil Mui, James Zhu, Sitaram Asur نمایش PDF مقاله با عنوان هم‌تکامل‌دهی حصارها و مدل‌ها: اصلاح سیاست‌درون کمک به مدل‌های ضعیف‌تر برای جلویی‌تر شدن جایی که تقلید شکست می‌خورد، توسط Zhou Yu و ۱۰ نفر دیگر نمایش PDF HTML (آزمایشی) چکیده: حصارهای عامل (پرامپت سیستمی، مجموعه ابزار، قلاب‌های اجرا و زیرساخت مدیریت زمینه اطراف یک مدل) عوامل تعیین‌کننده‌ای در موفقیت وظایع عاملی هستند. تکامل خودکار حصارها می‌تواند به مدل‌های کوچکتر اجازه دهد در وظایع تخصصی حوزه با هزینه‌ای کمتر از مدل‌های مرزی عملکرد خوبی داشته باشند. از آنجا که هم حصارها و هم وزن‌های مدل رفتار را شکل می‌دهند، می‌پرسیم چگونه تکامل حصار و تنظیم دقیق سبک باید ترکیب شوند. در هفت وظیعه عامل سازمانی، ابتدا یک حصار با مدل ضعیف‌تر تکامل می‌دهیم، سپس می‌یابیم که یک متخصص قوی‌تر اغلب از آن به‌صورت مؤثرتری استفاده می‌کند، که نشان می‌دهد نظارت متخصص می‌تواند شکاف باقی‌مانده را ببندد. با این حال، آموزش مدل ضعیف‌تر بر روی ردیابی‌های کامل متخصص تحت حصار تکامل‌یافته با نتیجه مخالف همراه است: عملکرد در هفت وظیعه به ۴ تا ۳۰ نقطه افت می‌کند در Qwen3-Coder و Gemma 4، هرچند که همان روش تحت حصار تکامل‌نیافته نیز کمک می‌کند. تحلیل ما نشان می‌دهد که تقلید دانش را منتقل می‌کند و استفاده از اسکافولد را افزایش می‌دهد، اما سازگاری مدل-حصار را مختل می‌کند: مدل ضعیف‌تر استراتژی برنامه‌ریزی متخصص را بدون توانایی اجرای آن اتخاذ می‌کند و دیگر با حصاری که حول سبک برنامه‌ریزی ذاتی خودش تکامل یافته مطابقت ندارد. بنابراین ما یک خط لوله اصلاح متخصص سیاست‌درون توسعه می‌دهیم که توسط یک عامل سطح بالای MLE خودکارسازی شده، نقطه شکست در رول‌اوت خود مدل ضعیف‌تر را محلی‌سازی می‌کند و از متخصص می‌خواهد فقط آن نوبت را بازنویسی کند. این سبک برنامه‌ریزی مدل را حفظ می‌کند و سودهای تکامل حصار و سازگاری مدل را ترکیب می‌کند. نتایج ما یک منبع اختلاف بین به‌روزرسانی‌های حصار و وزن را شناسایی و حل می‌کنند و روی‌حلی حفظ‌کننده سازگاری برای تکامل همزمان اقتصادی در وظایع سازمانی تخصصی ارائه می‌دهند. موضوعات: هوش مصنوعی (cs.AI) ارجال: arXiv:2609.09134 [cs.AI] (یا arXiv:2609.09134v1 [cs.AI] برای این نسخه) https://doi.org/10.48550/arXiv.2609.09134 تمرکز برای یادگیری بیشتر arXiv-issued DOI از طریق DataCite (ثبت در انتظار) تاریخچه ارسال از: Zhou Yu [نمایش ایمیل] [v1] سه‌شنبه, ۸ سپتامبر ۲۰۲۶ ۱۷:۵۳:۴۹ UTC (۱۸۱ KB) ابزارهای بیبلیوگرافی ابزارهای بیبلیوگرافی و ارجاع بیبلیوگرافی اکسپلورر بیبلیوگرافی اکسپلورر (اکسپلورر چیست؟) Connected Papers Connected Papers (Connected Papers چیست؟) Litmaps Litmaps (Litmaps چیست؟) scite.ai scite Smart Citations (Smart Citations چیست؟) کد، داده، رسانه کد، داده و رسانه مرتبط با این مقاله alphaXiv T