چکیده
ایمنی کاربر: ایمن
متن کامل
**عنوان:**
مقیاسبندی تخصیص بهینه بودجه حاشیهنویسی SFT-RL از مدلهای زبانی کوچک به بزرگ
**نویسندگان:**
جینگتان وانگ، آرون ورما، شیائوچیانگ لین، ژنگوان لیو، نانسی اف. چن، دانیلا روس، برایان کیان هسیانگ لو
**چکیده:**
تقسیم بودجه حاشیهنویسی ثابت بین تنظیم دقیق نظارتی (SFT) و یادگیری تقویتی (RL) در پسآموزش مدلهای زبانی بزرگ (LLM) همچنان یک مشکل باز مانده است. کارهای پیشین تنها روندهای کلی را توصیف میکنند (به عنوان مثال، SFT در رژیمهای داده کم predominat است)، چارچوبی تخصیص principled ندارند و بررسی نمیکنند که آیا نسبت بهینه SFT‑RL برای مقیاسهای مختلف مدل قابل انتقال است یا خیر. ما این مشکل را از منظر نزدیک‑به‑بهینه بودن صحنه میکنیم: به جستجوی یک نسبت SFT‑RL بهینه واحد، ناحیه نزدیک‑به‑بهینه را تعریف میکنیم، یعنی مجموعهای از تخصیصهایی که عملکرد آنها در بازه تلرانس مشخصی از حداکثر عملکرد قرار دارد. بهطور تجربی، این ناحیه حتی برای تلرانسهای کوچک (۲ تا ۱۰ درصد) گسترده است؛ با افزایش مقیاس-model گسترش مییابد و بهصورت قابل اعتماد از مدلهای نماینده کوچک به مدلهای هدف بزرگ منتقل میشود. این نتیجه یک استراتژی عملی به وجود میآورد: کافی است با استفاده از یک مدل نماینده کوچک، ناحیه نزدیک‑به‑بهینه قابل انتقال را شناسایی کرد و از جستجوی جامع در مقیاس بزرگ صرفهجویی کرد. نتایج ما بهصورت پایدار در مختلف وظایف، خانوادههای مدل و هر دو روش RL مبتنی بر ترجیح off‑policy و reward‑modeling on‑policy تأیید میشود. همچنین بررسی میکنیم که چگونه عدم تقارن در هزینههای حاشیهنویسی دادههای SFT و RL ناحیه نزدیک‑به‑بهینه را تغییر میدهد.
**موضوعات:**
محاسبات و زبان (cs.CL)
هوش مصنوعی (cs.AI)
یادگیری ماشین (cs.LG)
**استناد:**
arXiv:2609.01573 [cs.CL] (یا arXiv:2609.01573v1 [cs.CL] برای این نسخه)
https://doi.org/10.48550/arXiv.2609.01573
(Influence Flowers چیست؟) توصیلگر هستهای CORE (CORE چیست؟) نویسنده محل انتشار سازمان موضوع دربارهٔ arXivLabs arXivLabs: پروژههای آزمایشی با همکاران جامعه arXivLabs چارچوبی است که به همکاران اجازه میدهد ویژگیهای جدیدی را مستقیماً در وبسایت ما توسعه دهند و به اشتراک بگذارند. هم افراد و هم سازمانهایی که با arXivLabs کار میکنند، ارزشهای ما در زمینههای openness، community، excellence و حریم خصوصی دادههای کاربری را پذیرفتهاند و آن را رعایت کردهاند. arXiv به این ارزشها متعهد است و تنها با شرکایی همکاری میکند که به آن پایبند باشند. ایدهای برای پروژهای دارید که ارزشی به جامعهٔ arXiv اضافه کند؟ دربارهٔ arXivLabs بیشتر بدانید. کدام نویسندگان این مقاله، حامی هستند؟ | غیرعالگسازی MathJax (MathJax چیست؟)