چکیده
متأسفانه متنی برای ویرایش ارائه نشده است. لطفاً متن فارسی مورد نظر خود را که مایل به بهبود ترجمه آن هستید، ارسال کنید تا بتوانم ویرایشهای لازم را انجام دهم.
متن کامل
علوم کامپیوتر > هوش مصنوعی arXiv:2609.01567v1 (cs) [ارسال شده در ۱ سپتامبر ۲۰۲۶]
**عنوان:** راهنمایی انتخابی عامل از طریق آنتروپی: یادگیری سیاستهای خودمختار از معلمان VLM ناقص
**نویسندگان:** ماتئو مرلر، جووانی بونتا، داویده زاگو، روزلا کانچلیهره، برناردو مانینی
مشاهده PDF مقالهای با عنوان «راهنمایی انتخابی عامل از طریق آنتروپی: یادگیری سیاستهای خودمختار از معلمان VLM ناقص»، توسط ماتئو مرلر و ۴ نویسنده دیگر
مشاهده PDF HTML (آزمایشی)
**چکیده:** مدلهای زبانی-بینایی (VLMs) پیشنیازهای مفیدی برای تصمیمگیری تعاملی فراهم میکنند، اما استفاده مستقیم از آنها به عنوان سیاست، پرهزینه و شکننده است: آنها باید در هر مرحله پرسوجو شوند، از تعامل با محیط بهبود نمییابند، و ممکن است خطاهای سیستماتیک را تکرار کنند. در این مقاله، بررسی میکنیم که چگونه میتوان یک سیاست خودمختار و کمهزینه را از یک معلم VLM آنلاین، پرهزینه، ناقص، اما آموزنده آموخت. ما SAGE (راهنمایی انتخابی عامل از طریق آنتروپی) را پیشنهاد میکنیم؛ چارچوبی که تنها زمانی از VLM پرسوجو میکند که یادگیرنده دچار عدم قطعیت باشد، در طول آموزش اقدام پیشنهادی را اجرا میکند، و راهنمایی را در یک سیاست سبک مبتنی بر یادگیری تقویتی (RL) تقطیر میکند. از آنجا که توصیههای VLM همیشه قابل اعتماد نیستند، SAGE میتواند با استفاده از مزیتهای مشتقشده از محیط، تقطیر اقدام معلم را وزندهی کند، بهجای آنکه همه پیشنهادات را به یک اندازه مفید بداند. در وظایف استدلال بینایی و ناوبری با پاداش تنک، SAGE سیاستهایی میآموزد که در زمان ارزیابی بدون راهنمایی VLM عمل میکنند و در چندین محیط نسبت به RL بدون راهنمایی بهبود مییابند؛ از جمله در تنظیماتی که سیاست آموختهشده از خود معلم VLM نیز فراتر میرود. نتایج نشان میدهد که راهنمایی انتخابی زمانی بیشترین سودمندی را دارد که VLM بتواند به عامل کمک کند تا مسیرهای با پاداش بالا را کشف کند، و زمانی کمتر مفید است که اکتشاف بدون راهنمایی از پیش موفق باشد یا اقدامات معلم به تجربه آموزنده منجر نشود. SAGE همچنین استفاده از VLM را با پرسوجو از معلم تنها در کسری از مراحل آموزش کاهش میدهد و در زمان استقرار به هیچ تماسی با VLM نیاز ندارد. در مجموع، یافتههای ما نشان میدهد که VLMها برای مفید بودن نیازی به استفاده به عنوان سیاستهای ثابت ندارند؛ بلکه میتوانند بهعنوان منابع راهنمایی موقت و ناقص عمل کنند که ارزش آنها از طریق تعامل آزمایشی و درونیسازی حاصل میشود.
**توضیحات:**
**موضوعات:** هوش مصنوعی (cs.AI)؛ محاسبات و زبان (cs.CL)؛ یادگیری ماشین (cs.LG)
**نحوه استناد:** arXiv:2609.01567 [cs.AI] (یا arXiv:2609.01567v1 [cs.AI] برای این نسخه)
https://doi.org/10.48550/arXiv.2609.01567
برای اطلاعات بیشتر درباره DOI صادرشده توسط arXiv از طریق DataCite (در انتظار ثبت) مراجعه کنید.
**مرجع مجله:** یافتههای EMNLP 2026
**تاریخچه ارسال:**
**از:** ماتئو مرلر [مشاهده ایمیل]
**[v1]** سهشنبه، ۱ سپتامبر ۲۰۲۶، ۱۷:۳۳:۴۱ UTC (۱,۹۳۹ KB)
**ابزارهای کتابشناختی**
ابزارهای کتابشناختی و استنادی
کاوشگر کتابشناختی
تغییر وضعیت کاوشگر کتابشناختی (کاوشگر چیست؟)
مقالات مرتبط
تغییر وضعیت مقالات مرتبط (مقالات مرتبط چیست؟)
نقشههای ادبیات
تغییر وضعیت نقشههای ادبیات (نقشههای ادبیات چیست؟)
scite.ai
تغییر وضعیت استنادهای هوشمند scite (استنادهای هوشمند چیست؟)
**کد، داده، رسانه**
کد، داده و رسانههای مرتبط با این مقاله
alphaXiv
تغییر وضعیت alphaXiv (alphaXiv چیست؟)
لینکها به کد | نمایش کلید | یافتنکننده کد CatalyzeX برای مقالات (CatalyzeX چیست؟) DagsHub | نمایش کلید | GotitPub (GotitPub چیست؟) Huggingface | نمایش کلید | ScienceCast (ScienceCast چیست؟) نمایشها | نمایش کلید Replicate (Replicate چیست؟) Spaces | نمایش کلید Hugging Face Spaces | نمایش کلید TXYZ.AI (TXYZ.AI چیست؟) مقالات مرتبط سامانههای پیشنهاددهنده و ابزارهای جستجو | لینک به Influence Flower Influence Flower (گلهای تأثیرگذار چیست؟) سامانه پیشنهاددهنده CORE | نمایش کلید (CORE چیست؟) نویسنده | مجله | مؤسسه | موضوع درباره arXivLabs arXivLabs: پروژههای آزمایشی با همکاران جامعه arXivLabs چارچوبی است که به همکاران امکان میدهد ویژگیهای جدید arXiv را مستقیماً در وبسایت ما توسعه داده و به اشتراک بگذارند. هم افراد و هم سازمانهایی که با arXivLabs کار میکنند، ارزشهای باز بودن، جامعهمحوری، برتری و حریم خصوصی دادههای کاربران ما را پذیرفتهاند. arXiv به این ارزشها متعهد است و تنها با شرکایی که آنها را رعایت میکنند همکاری میکند. آیا ایدهای برای پروژهای دارید که ارزش افزودهای برای جامعه arXiv داشته باشد؟ درباره arXivLabs بیشتر بدانید. کدام نویسندگان این مقاله تأییدکننده هستند؟ | غیرفعالسازی MathJax (MathJax چیست؟)