Weiqi Wang، Zhi Li، Yudong Lei، David Martinez و 6 نفر دیگر
بین کنترل مبتنی بر مدل و سیاستهای یادگرفته در Manifold Policy Horizon، اختلافی ناچیز وجود دارد: این رویکرد اهداف مشخصشده را اجرا میکند و یادگیری آن رفتار را به یک سیاست واکنشگرا تبدیل میکند، اما پروتکلهای موجود سیم…
به نظر میرسد متنی برای ویرایش ارائه نشده است. لطفاً متن فارسیای که نیاز به ویرایش و بهبود دارد را در پیام بعدی خود ارسال کنید تا بتوانم آن را بررسی و بهبود بخشم.
تأثیر اندازه مدلهای زبان بزرگ (LLM) بر عملکرد یادگیری متا همچنان به طور کامل مشخص نیست. ما یک ارزیابی کنترلشده از ۱۳ مدل متراکم و مدلهای Mixture-of-Experts از نسلهای Qwen3.5 و Qwen3.6، به همراه نسخههای اختصاصی GPT،…
Users of a deployed language model routinely encounter behaviours that testing almost never surfaces, since deployment puts the model through orders of magnitude more interactions than any evaluation can simulate. Automa…
Gopi Krishnan Rajbahadur، Amir M. Ebrahimi، Boyuan Chen، Ahmed E. Hassan
پساآموزش صنعتی یک رژیم قهوهایمیدانی (brownfield) است. تیمها یک نقطهبازرسی (checkpoint) ازپیشمستقر را به ارث میبرند و باید در چارچوب بودجههای ثابت محاسبات و ترکیب، بهبودهای هدفمندی اعمال کنند، بدون آنکه سایر قابل…
دادههای مصنوعی میتوانند در شرایطی که دادههای واقعی محدود هستند، به بهبود استنباط آماری کمک کنند. با این حال، استفاده نادرست از نمونههای مصنوعی بهجای دادههای واقعی، ممکن است منجر به سوگیری و نتایج غیرقابل اعتماد شود…
بهینهسازی شبکههای عصبی در سالهای ۲۰۲۵-۲۰۲۶ دیگر بهعنوان یک دنباله از ورژنهای جدید Adam توصیفشده نیست. فضای طراحی از مختصات به ماتریسها و لایهها، از افقهای آموزشی ثابت به سیاستهای زمانی، و از قواعد بهروزرسانی ر…
Hanzhang Jia، Liheng Zeng، Hao Cheng، Yi Gao و 1 نفر دیگر
سیستمهای عامل مدرن قابلیتهای خود را به صورت پویا در زمان اجرا مونتاژ میکنند. این ترکیب پویا اخیراً در چارچوب حساب دیفرانسیلی ترکیبپذیری فضایی به طور کامل مورد بررسی رسمی قرار گرفته است. در این چارچوب، یک قابلیت به عن…