arXiv:2608.26070ترجمه شده

پیشوند لغزان برای مقیاس‌پذیری کارآمد در زمان آزمون

Niklas Muennighoff، Zhengyang Wang، Zeyi Chen، Weijia Shi، Binyuan Hui، John Yang، Dapeng Jiang، Mika Senghaas، Fares Obeid، Johannes Hagemann، Sami Jaghouar، Ludwig Schmidt، Percy Liang، Jason Wei، Andrew Y. Ng، Luke Zettlemoyer، Yejin Choi، Mike Lewis

چکیده

مقیاس‌دهی در زمان آزمون (test-time scaling) با بهره‌گیری از محاسبات اضافی در زمان آزمون، عملکرد مدل را بهبود می‌بخشد؛ برای نمونه، به مدل‌های زبانی اجازه می‌دهد هنگام حل یک مسئله، استدلال طولانی‌تری داشته باشند. از آنجا که مدل‌ها تمام ردپای استدلال را از طریق توجه کامل (full attention) در حافظه نگه می‌دارند، وظایف دشواری که نیازمند تفکر طولانی هستند می‌توانند هزینه‌های محاسباتی غیرقابل‌قبولی تحمیل کنند. با این حال، ما دریافتیم که بیشتر توکن‌های میانی استدلال، با ادامه‌دار شدن فرایند استدلال مدل، اهمیت خود را از دست می‌دهند. این یافته، ضرورت نگهداری تمامی آن‌ها را با تردید روبه‌رو می‌سازد. بر پایه‌ی این بینش، ما روش «پیشوند لغزان» (Prefix Sliding) را پیشنهاد می‌کنیم که در طول استدلال، توکن‌هایی را که نه بخشی از پیشوند هستند و نه در پنجره‌ی چند هزار توکن اخیر جای می‌گیرند، حذف می‌کند. پیشوند دربرگیرنده‌ی دستورالعمل‌های کلیدی و ابزارهای در دسترس مدل است، در حالی که توکن‌های اخیر، بازتاب استدلال جاری مدل هستند که بر روی آن کار می‌کند. این رویکرد، نیاز کلی حافظه را مستقل از طول مدت استدلال مدل محدود می‌سازد و مقیاس‌دهی کارآمد زمان آزمون را در افق‌های بلند امکان‌پذیر می‌کند. بدون نیاز به آموزش مجدد، پیشوند لغزان می‌تواند مدل‌های موجود را تا سه برابر سریع‌تر کند، بدون آن‌که از عملکرد آن‌ها کاسته شود. آموزش با استفاده از پیشوند لغزان به همراه یادگیری تقویتی (RL) می‌تواند به عملکردی بهتر دست یابد و مقیاس‌دهی به ردپاهای استدلال فراتر از صد هزار توکن را ممکن سازد. تحلیل‌های حذفی (ablation) نشان می‌دهند که پیشوند لغزان، در مقایسه با خلاصه‌سازی توکن‌های میانی یا پنجره‌ی لغزان ساده (vanilla sliding window)، عملکرد بهتری ارائه می‌دهد. کد پیاده‌سازی در آدرس https://github.com/Muennighoff/prefix-sliding در دسترس است.

متن کامل

**علوم کامپیوتر > محاسبات و زبان** arXiv:2608.26070v1 [cs.CL] [ارسال‌شده در ۲۶ اوت ۲۰۲۶] **عنوان:** پیشوند لغزان برای مقیاس‌بندی کارآمد در زمان آزمون **نویسندگان:** نیکلاس مونیگهوف، ژنگیانگ وانگ، زیی چن، ویجیا شی، بینیوان هوای، جان یانگ، داپنگ جیانگ، میکا سنگهاس، فارس عبید، یوهانس هاگمان، سامی جغوار، لودویگ اشمیت، پرسی لیانگ، جیسون وی، اندرو ی. نگ، لوک زتل‌مایر، یجین چوی، مایک لوئیس مشاهده PDF مقاله با عنوان «پیشوند لغزان برای مقیاس‌بندی کارآمد در زمان آزمون»، اثر نیکلاس مونیگهوف و ۱۷ نویسنده دیگر مشاهده PDF | مشاهده HTML (آزمایشی) **چکیده:** مقیاس‌بندی در زمان آزمون با بهره‌گیری از محاسبات اضافی در مرحله آزمون، عملکرد را بهبود می‌بخشد؛ برای نمونه، به مدل‌های زبانی امکان می‌دهد هنگام حل مسئله، مدت‌زمان بیشتری به استدلال اختصاص دهند. از آنجا که مدل‌ها مسیر کامل استدلال را از طریق مکانیزم توجه کامل در حافظه نگه می‌دارند، وظایف دشواری که نیازمند تفکر طولانی هستند، می‌توانند هزینه محاسباتی بسیار بالایی داشته باشند. با این حال، ما دریافتیم که بیشتر توکن‌های میانی استدلال، با ادامه یافتن فرایند استدلال توسط مدل، اهمیت خود را از دست می‌دهند. این مشاهده پرسشی اساسی را مطرح می‌کند: آیا نگهداری این توکن‌ها ارزش هزینه محاسباتی‌شان را دارد؟ بر پایه این بینش، ما **پیشوند لغزان** (Prefix Sliding) را پیشنهاد می‌کنیم؛ روشی که توکن‌هایی را در طول فرایند استدلال کنار می‌گذارد که در پیشوند یا پنجره چند هزار توکن اخیر قرار نمی‌گیرند. پیشوند شامل دستورالعمل‌ها و ابزارهای کلیدی در دسترس مدل است، در حالی که توکن‌های اخیر، استدلال جاری مدل را تشکیل می‌دهند. این رویکرد، مصرف حافظه کلی را صرف‌نظر از مدت‌زمان استدلال مدل محدود می‌سازد و امکان مقیاس‌بندی کارآمد در زمان آزمون با افق زمانی بلند را فراهم می‌کند. بدون نیاز به آموزش، پیشوند لغزان می‌تواند مدل‌های موجود را تا ۳ برابر سریع‌تر کند و در عین حال عملکرد آن‌ها را حفظ نماید. ترکیب پیشوند لغزان با یادگیری تقویتی می‌تواند با امکان‌پذیر ساختن مقیاس‌بندی به مسیرهای استدلال فراتر از صد هزار توکن، به عملکرد بهتری دست یابد. آزمایش‌های حذفی نشان می‌دهد که پیشوند لغزان عملکرد بهتری نسبت به خلاصه‌سازی توکن‌های میانی یا پنجره لغزان ساده دارد. کد این پژوهش در دسترس است: این پیوند **موضوعات:** محاسبات و زبان (cs.CL) | هوش مصنوعی (cs.AI) | یادگیری ماشین (cs.LG) **استناد:** arXiv:2608.26070 [cs.CL] (یا arXiv:2608.26070v1 [cs.CL] برای این نسخه) https://doi.org/10.48550/arXiv.2608.26070 **تاریخچه ارسال:** از: نیکلاس مونیگهوف [مشاهده ایمیل] نسخه ۱ — چهارشنبه، ۲۶ اوت ۲۰۲۶، ۱۷:۳۷:۱۵ UTC (۱٬۶۶۶ کیلوبایت)