arXiv:2608.31102ترجمه شده

آموزش پسین LLM به‌عنوان نگهداری قهوه‌ای‌میدان: نگاهی صنعتی به مهندسی داده‌انبار

Gopi Krishnan Rajbahadur، Amir M. Ebrahimi، Boyuan Chen، Ahmed E. Hassan

چکیده

پسا‌آموزش صنعتی یک رژیم قهوه‌ای‌میدانی (brownfield) است. تیم‌ها یک نقطه‌بازرسی (checkpoint) از‌پیش‌مستقر را به ارث می‌برند و باید در چارچوب بودجه‌های ثابت محاسبات و ترکیب، بهبودهای هدفمندی اعمال کنند، بدون آنکه سایر قابلیت‌ها دچار افت شوند. مصنوعه‌ی نگه‌داری‌شده به‌طور فزاینده داده‌محور است: رفتار توسط یک ترکیب پسا‌آموزشی دقیقاً تنظیم‌شده تعیین می‌شود و از طریق وصله‌های ترکیبی کراندار به‌جای بازآموزش از صفر، به‌روزرسانی می‌گردد. در این مقاله، با نگاه از درون یک تلاش صنعتی برای بهبود تولید کد، دیدگاه یک نگه‌دارنده‌ی سیستم را ارائه می‌دهیم که چرا این کار در عمل دشوار است؛ سه چالش تکرارشونده را استخراج می‌کنیم — طراحی ترکیب با حاصل‌جمع صفر، بازده (yield) به‌عنوان معیار الزام‌آور، و یکپارچه‌سازی سرتاسری در شرایط عدم قطعیت — و استدلال می‌کنیم که پیشرفت کمتر به دستورالعمل‌های یک‌بارمصرف وابسته است و بیشتر به یک نظم مهندسی برای برنامه‌نویسی داده‌محور نیاز دارد. در مطالعه‌ی موردی ما، مداخلاتی که نرخ تبدیل تقطیر معلم به داده‌های آموزشی قابل استفاده را افزایش داد، نظارت پذیرفته‌شده را با استفاده از همان معلم راه‌حل و چهار تلاش راه‌حل به‌ازای هر مسئله‌ی کاندیدا، ۲٫۸۴ برابر بهبود بخشید. در ارزیابی‌های اولیه‌ی ما، وصله‌ی مهندسی‌شده با بازده، امتیاز pass@1 را در CodeForces به میزان ۲٫۵۹+ نقطه (و pass@3 را ۳٫۱۱+) بهبود داد و امتیاز pass@1 را در LiveCodeBench v6 نگه‌داشته‌شده (held-out) به میزان ۶٫۱۱+ (و pass@3 را ۸٫۰۵+) ارتقا بخشید؛ تمامی این نتایج در ۱۶ ارزیابی تصادفی از هر بنچمارک با یک نقطه‌بازرسی ثابت به‌ازای هر شرایط، از نظر آماری معنادار بوده و مجموعه‌های رگرسیون داخلی AIME و MATH در محدوده‌ی تلرانس باقی ماندند.