Raphaël Bonnet-Guerrini، Johann Ioannou-Nikolaides، Inar Timiryasov، Vincenzo Piuri
ما نخستین کاربرد تفسیر مکانیکی مبتنی بر رمزگشای تنک-خارجی را در فیزیک ذرات ارائه میدهیم. با بررسی یک مدل پایهی نوترینو که بر دادههای IceCube آموزش دیده و برای بازسازی جهت تنظیم شده است، مجموعهای معتبر از مفاهیم فیزیک…
Jiarui Yan، Weiwei Sun، Sijie Li، Wenhan Li و 1 نفر دیگر
Large language models write correct code for isolated problems but remain far weaker at autonomous machine-learning development, where an agent must revise data pipelines, models, and validation over hours of feedback, a…
Roshan Prakash Rane، Marco Simnacher، Manuel Pfeuffer، Marc-Andre Schulz و 6 نفر دیگر
شبکههای عصبی عمیق اغلب از ارتباطات جعلی در دادههای آموزشی خود بهره میبرند؛ نقصی که با نام یادگیری میانبر شناخته میشود. روشهای تبیینپذیری مبتنی بر مفهوم، برای شناسایی این میانبرها، با بررسی این پرسش عمل میکنند که آ…
تفسیر نادرست قصد در طول تعاملات خودرو، به شکستهای مکرر برنامهریزی منجر میشود. ما یک لایهٔ تصمیمگیری را بررسی میکنیم که در آن یک ماژول قصد هدایتشونده با زبان، توصیفگرهای ساختاریافته را میخواند، یک امتیاز واگرایی ه…
Niklas Muennighoff، Zhengyang Wang، Zeyi Chen، Weijia Shi و 14 نفر دیگر
مقیاسدهی در زمان آزمون (test-time scaling) با بهرهگیری از محاسبات اضافی در زمان آزمون، عملکرد مدل را بهبود میبخشد؛ برای نمونه، به مدلهای زبانی اجازه میدهد هنگام حل یک مسئله، استدلال طولانیتری داشته باشند. از آنجا ک…
Zhaochen Yu، Yingcheng Wu، Zhenfei Yin، Kaiyuan Chen و 4 نفر دیگر
بهبود خود‑بازگشتی (RSI) در وظایف افقطولانی دشوار میماند؛ جایی که سابقههای رشدگی وضعیت وظیفه را مبهم میسازند و فراخوانی مهارت را نامتناسب میکنند. ما Recuris را معرفی میکنیم، یک معماری حافظه تجربی‑کار بازگشتی برای وظ…
Kai Ruan، Jinghao Lin، Qianshan Wei، Ziqi Zhou و 1 نفر دیگر
یادگیری تقویتی نسبی به گروه، منتظر بازپخشهای همزاد یکسان از یک پیام میماند که برای مسیرهای ابزی طولانی و هزینهبر متغیر است. بهینهسازی سیاست تکجریانی (SPO) با حذف این وابستگی، با استفاده از یک برآورد ارزش سطحی از پیا…