arXiv:2609.01597ترجمه شده

صعود یادگیری تقویتی زبانی

Kshitij Tayal، Arun Sharma، Genta Indra Winata، Anirban Das، Sambit Sahu

چکیده

زبان طبیعی به عنوان کانال اصلی بازخورد برای بهبود عملکرد عوامل زبانی در حال ظهور است؛ این زبان می‌تواند قصد، ترجیحات و ساختار علی را به شکلی قابل تفسیر برای هم انسان‌ها و هم مدل‌های زبانی مدرن منتقل کند. ما این الگو را یادگیری تقویتی کلامی (VRL) می‌نامیم و اولین توصیف جامع آن را ارائه می‌کنیم. ما این حوزه را حول یک محور واحد سازماندهی می‌کنیم: اینکه بازخورد کلامی کی و چگونه در چرخه زندگی عامل تأثیر می‌گذارد و چه چیزی را تغییر می‌دهد. این امر منجر به سه ستون می‌شود: (۱) زبان به عنوان سیگنال پایه‌گذاری، که در آن زبان خود وظیفه را با تعیین اهداف، حالات و ساختارهای پاداش تعریف می‌کند؛ (۲) زبان به عنوان بازخورد تأمل‌گرانه، که در آن زبان طبیعی در حین آزمایش، راهنمای استدلال است و نیازی به به‌روزرسانی پارامترهای مدل ندارد؛ (۳) زبان به عنوان سیگنال یادگیری، که در آن بازخورد مبتنی بر زبان، پارامترهای مدل را در طول آموزش شکل می‌دهد. در هر ستون، ما نمونه‌هایی از آثار را تلفیق می‌کنیم، زیرگروه‌های کلیدی رویکردها را شناسایی می‌کنیم و نقش متمایز زبان را در شکل‌دهی به رفتار عامل توضیح می‌دهیم. این طبقه‌بندی به طور کلی نشان می‌دهد که چگونه تقویت کلامی در حال بازسازی توسعه عامل است و در عین حال چالش‌ها و فرصت‌های ساخت عوامل توانمندتر و هماهنگ‌تر را نیز مشخص می‌کند.

متن کامل

علم کامپیوتر > محاسبات و زبان arXiv:2609.01597v1 (cs) [ارسال شده در ۱ سپتامبر ۲۰۲۶] **عنوان:** ظهور یادگیری تقویتی کلامی **نویسندگان:** کشیج تایال، آرون شارما، جنتا ایندیرا ویناتا، آنیربان داس، سامبیت ساهو مشاهده نسخه PDF مقاله با عنوان «ظهور یادگیری تقویتی کلامی» اثر کشیج تایال و ۴ نویسنده دیگر | مشاهده PDF | HTML (آزمایشی) **چکیده:** زبان طبیعی در حال تبدیل شدن به یک کانال بازخورد اصلی برای بهبود عوامل (agents) زبانی است؛ کانالی که قادر است قصد، ترجیحات و ساختارهای علّی را به شکلی منتقل کند که هم برای انسان‌ها و هم برای مدل‌های زبانی مدرن قابل تفسیر باشد. ما این پارادایم را «یادگیری تقویتی کلامی» (VRL) می‌نامیم و نخستین توصیف یکپارچه از آن را ارائه می‌دهیم. ما این حوزه را حول یک محور واحد سازماندهی می‌کنیم: اینکه بازخورد کلامی در «چه زمانی» از چرخه حیات یک عامل تأثیر می‌گذارد و «چه چیزی» را تغییر می‌دهد؛ این محور منجر به شکل‌گیری سه ستون اصلی می‌شود: (۱) **زبان به عنوان سیگنال زمینه‌ای**، که در آن زبان با تعیین اهداف، حالات و ساختارهای پاداش، خود وظیفه را تعریف می‌کند؛ (۲) **زبان به عنوان بازخورد تفکری**، که در آن زبان طبیعی بدون نیاز به به‌روزرسانی پارامترهای مدل، استدلال را در زمان آزمون هدایت می‌کند؛ (۳) **زبان به عنوان سیگنال یادگیری**، که در آن بازخورد مبتنی بر زبان، پارامترهای مدل را از طریق آموزش شکل می‌دهد. ما در هر یک از این ستون‌ها، کارهای مربوط به بازنمایی (representation) را ترکیب کرده، زیرمجموعه‌های کلیدی رویکردها را متمایز ساخته و نقش متفاوت زبان را در شکل‌دهی به رفتار عامل ترسیم می‌کنیم. در مجموع، این طبقه‌بندی نشان می‌دهد که چگونه یادگیری تقویتی کلامی در حال بازتعریف توسعه عامل‌ها است و هم‌زمان، چالش‌ها و فرصت‌های ساخت عامل‌های توانمندتر و همسوتر را مشخص می‌کند. **موضوعات:** محاسبات و زبان (cs.CL)؛ هوش مصنوعی (cs.AI) **استناد:** arXiv:2609.01597 [cs.CL] (یا arXiv:2609.01597v1 [cs.CL] برای این نسخه) https://doi.org/10.48550/arXiv.2609.01597 **سوابق ارسال:** از: کشیج تایال [مشاهده ایمیل] [v1] سه‌شنبه، ۱ سپتامبر ۲۰۲۶ ۱۷:۵۸:۱۸ UTC (۱,۶۶۷ کیلوبایت) نویسنده محل انتشار نهاد موضوع درباره arXivLabs: پروژه‌های آزمایشی با همکاری جامعه arXivLabs یک چارچوب است که به همکاران اجازه می‌دهد ویژگی‌های جدید arXiv را مستقیماً در وب‌سایت ما توسعه داده و به اشتراک بگذارند. هر فرد یا سازمانی که با arXivLabs همکاری می‌کند، ارزش‌های ما یعنی شفافیت، جامعه‌محوری، کیفیت و حریم خصوصی داده‌های کاربران را پذیرفته است. arXiv متعهد به این ارزش‌هاست و تنها با شرکایی همکاری می‌کند که از آن‌ها پیروی کنند. ایده‌ای برای پروژه‌ای دارید که به جامعه arXiv ارزش افزوده دهد؟ درباره arXivLabs بیشتر بیاموزید. کدام نویسندگان این مقاله تأییدکننده هستند؟ | غیرفعال کردن MathJax (MathJax چیست؟)