arXiv:2608.28557ترجمه شده

Blog: مطالعه بهینه‌سازها

Ruoran Xu

چکیده

بهینه‌سازی شبکه‌های عصبی در سال‌های ۲۰۲۵-۲۰۲۶ دیگر به‌عنوان یک دنباله از ورژن‌های جدید Adam توصیف‌شده نیست. فضای طراحی از مختصات به ماتریس‌ها و لایه‌ها، از افق‌های آموزشی ثابت به سیاست‌های زمانی، و از قواعد به‌روزرسانی ریاضی به نمایش‌های وضعیتی که باید در شاردینگ و محاسبات کم‌درجه مقاومت کنند، گسترش یافته است. این مرور، به‌روزرسانی‌های اخیر را به‌صورت چهار محور به‌صورت تقریباً مستقل، بر اساس: تخمین زمانی، ژئوم‌تپو به‌روزرسانی، مدیریت افق، و نمایش و سیستم‌ها، سازماندهی می‌کند. این مرور، نرمالیزه طیف‌پذیری Muon، آمارهای ماتریسی تاریخی Shampoo و SOAP، روش‌های ماتریسی سازه‌دار و ترکیبی، بهینه‌سازهای کارآمد حافظه، آموزش بدون برنامه‌ریزی زمانی، اصلاحات بسته‌دار، و حالت‌های به‌روزرسانی به‌صورت کم‌درجه را به هم می‌چسباند. نتیجه کلیدی تجربی به‌طور عمدی غیر پیروزمندانه است: روش‌های آگاه از ماتریس یک پیشرفت واقعی را نشان می‌دهند، اما جایگزینی مستقل از زمینه برای AdamW وجود ندارد. درست‌ترین رتبه‌ها با مقیاس مدل، نسبت داده به پارامتر، اندازه بسته، زمان‌بندی، تقسیم پارامترها، بودجه تنظیم، و اینکه آیا معیار هدف توکن، FLOPs، زمان دیوار-ساعت یا حافظه است، تغییر می‌کند. پیامد عملی این است که طراحی به‌صورت ترکیبی به بهینه‌سازها نگاه می‌شود و پروتکل سخت‌تری برای ارزیابی ادعای بهینه‌سازها وجود دارد.

متن کامل

علوم کامپیوتر > یادگیری ماشین arXiv:2608.28557v1 [cs] [ارائه شده در ۲۸ اوت ۲۰۲۶] **عنوان:** وبلاگ: بررسی بهینه‌سازها **نویسنده:** رووران شو فایل PDF مقاله با عنوان «وبلاگ: بررسی بهینه‌سازها» نوشته رووران شو را مشاهده کنید | فایل PDF | HTML (آزمایشی) **چکیده:** بهینه‌سازی شبکه‌های عصبی در سال‌های ۲۰۲۵ تا ۲۰۲۶ دیگر نمی‌تواند به‌سادگی به‌عنوان توسعهٔ تدریجی انواع جدید آدام توصیف شود. فضای طراحی از روش‌های مختصاتی به ماتریس‌ها و لایه‌ها، از افق‌های آموزشی ثابت به سیاست‌های زمانی، و از قواعد به‌روزرسانی ریاضی محض به نمایش‌های حالت‌مند گسترش یافته است؛ نمایش‌هایی که باید در برابر شاردینگ و محاسبات کم‌دقت مقاوم باشند. این بررسی، بهینه‌سازهای نوین و روش‌های بهینه‌سازی آموزش را در چهار محور عمدتاً مستقل سازماندهی می‌کند: برآورد زمانی، هندسهٔ به‌روزرسانی، مدیریت افق، و نمایش و سیستم‌ها. این مرور، نرمال‌سازی طیفی Muon، آماریک ماتریسی Shampoo و SOAP، روش‌های ماتریسی تطبیقی و ترکیبی، بهینه‌سازهای کم‌حافظه، آموزش بدون برنامه‌ریزی، تصحیح دسته‌های کوچک، و حالت‌های بهینه‌ساز کوانتیزه‌شده را به یکدیگر پیوند می‌دهد. نتیجه‌گیری تجربی اصلی به‌گونه‌ای آگاهانه فروتنانه است: روش‌های آگاه از ساختار ماتریسی پیشرفت‌های واقعی نشان می‌دهند، اما جایگزینی عمومی و بدون وابستگی به زمینه برای AdamW وجود ندارد. رتبه‌بندی‌ها بر اساس مقیاس مدل، نسبت داده به پارامتر، اندازهٔ دسته، برنامه‌ریزی، تقسیم پارامتر، بودجهٔ تنظیم، و نوع معیار هدف (توکن‌ها، FLOPs، زمان دیواری، یا حافظه) تغییر می‌کنند. نتیجهٔ عملی آن، اتخاذ دیدگاهی ترکیبی در طراحی بهینه‌ساز و پروتکلی سخت‌گیرانه‌تر برای ارزیابی ادعاهای مربوط به بهینه‌سازها است. **موضوعات:** یادگیری ماشین (cs.LG)؛ هوش مصنوعی (cs.AI) **استناد:** arXiv:2608.28557 [cs.LG] (یا arXiv:2608.28557v1 [cs.LG] برای این نسخه) https://doi.org/10.48550/arXiv.2608.28557 **تاریخچه:** ارسال از: رووران شو [مشاهده ایمیل] | [v1] جمعه، ۲۸ اوت ۲۰۲۶، ۱۷:۳۵:۱۱ UTC (۴۳ کیلوبایت)