چکیده
اجزای تصمیمگیری در مدلهای بزرگ زبانی (LLM) که قادر به عمل در جریانهای کاری عامل (agent workflows) هستند، اغلب توصیهها یا قضاوتهای عملی را همراه با توضیحاتی تولید میکنند. اپراتورها ممکن است از عوامل نامگذاری برای نظارت بر سیستم، تشخیص خطاها یا تصمیمگیری درباره زمان ارتقای خروجی استفاده کنند. چنین استفادهای بر این فرض استوار است که توضیحات با رفتار تصمیمگیری قابل مشاهده این اجزای تصمیمگیری همخوانی داشته باشند. ما دو تفسیر از عوامل نامگذاری را آزمایش میکنیم: ضرورت (necessity) به معنای اینکه تغییر آن باعث تغییر خروجی میشود، و کفایت (sufficiency) به معنای اینکه حفظ آن در حال حذف اطلاعات قابل تغییر دیگر، خروجی را حفظ میکند. این تفسیرها را در دو حوزه کاربردی ارزیابی میکنیم: توصیهدهی مشاوران به مشتریان و ارزیابی پرسشها برای تعیین خوشبختی یا خطر. مدلها یک خروجی و سه عامل اول مؤثر بر آن را باز میگردانند. مداخلات کنترلشده در قالب جعبه سیاه، ضرورت (necessity) را برای هر عامل با اندازهگیری فراوانی تغییر آن و تغییر خروجی تخمین میزنند، و کفایت (sufficiency) را با اندازهگیری فراوانی حفظ آن در حال حذف اطلاعات قابل تغییر دیگر. در گروه هشت مدل از خانوادههای Claude، GPT و Gemini، هموارونیهای اسپیرمن (Spearman) میان رتبهبندی عوامل ذکرشده و امتیازات ضرورت و کفایت به شرح زیر است: 0.349 و 0.354 برای توصیه مشاور، و 0.431 و 0.580 برای نظارت بر پرسشها. علاوه بر این، یک عامل غیرذکرشده در 57.6% از پاسخهای مشاوران تحت ضرورت و 58.1% تحت کفایت، از کمترین امتیازدهیشده بین عوامل ذکرشده بالاتر است؛ نرخهای مربوط به نظارت بر پرسشها 25.8% و 8.9% هستند. سه عامل اول ذکرشده اطلاعات مفیدی دارند، اما بهطور قابل اعتماد سه عامل با تأثیر قویتر اندازهشده را در ضرورت یا کفایت شناسایی نمیکنند. این چارچوب، یک بررسی قابل اعتماد برای توضیحات مورد استفاده در نظارت بر عامل فراهم میکند، در حالی که به تصمیمات فردی LLM محدود میماند.
متن کامل
عنوان: ضروری یا کافی؟ ارزیابی توضیحات LLM با شواهد رفتاری
نویسندگان: Urja Pawar, Rajitha Ramanayake, Nabeel Kemal, Ashwin Kandath, Owen O'Neill, Guillaume Bourgeon, Houssem Chatbri
چکیده: اجزای تصمیمگیری مدلهای زبانی بزرگ (LLM) که میتوانند در گردشکار عامل عمل کنند، اغلب توصیهها یا قضاوتهای مرتبط با عمل را همراه با توضیحاتی تولید میکنند. عملگرا ممکن است از چنین عاملهایی برای نظارت بر سیستم، تشخیص خطاها یا تصمیمگیری درباره زمان بالا بردن خروجی استفاده کنند. این استفاده فرض میکند که توضیحات با رفتار قابل مشاهده تصمیمگیری همخوانی دارند. ما دو تفسیر از این عاملها را آزمایش میکنیم: ضرورت یعنی تغییر عامل باعث تغییر خروجی میشود؛ و کفایت یعنی حفظ عامل در حالی که اطلاعات قابل تغییر دیگر حذف شده، خروجی را حفظ میکند. این تفسیرها را در دو کاربرد سینتیتیک ارزیابی میکنیم: پیشنهاد مشاوران به مشتریان و تشخیص مضر بودن یا ریسک پرامپتها. مدلها یک خروجی و سه عامل برتر را برمیگردانند. مداخلات سیاهجعبهای کنترلشده برای هر عامل، یک امتیاز ضرورت (با اندازهگیری فرکانس تغییر عامل در تغییر خروجی) و یک امتیاز کفایت (با اندازهگیری فرکانس حفظ عامل در حفظ خروجی) محاسبه میکند. در هشت مدل از خانوادههای Claude، GPT و Gemini، همبستگی میانگین اسپیرمن بین رتبهبندی نقلقولشده و امتیازهای ضرورت و کفایت به ترتیب ۰.۳۴۹ و ۰.۳۵۴ برای پیشنهاد مشاور و ۰.۴۳۱ و ۰.۵۸۰ برای نظارت بر پرامپت بهدست آمد. علاوه بر این، یک عامل نقلقولنشده در ۵۷.۶٪ از پاسخهای مشاور تحت ضرورت و ۵۸.۱٪ تحت کفایت امتیاز بالاتری نسبت به عامل نقلقولشده کمترین امتیاز دارد؛ نسبتهای متناظر برای نظارت بر پرامپت ۲۵.۸٪ و ۸.۹٪ هستند. سه عامل برتر نقلقولشده اطلاعات مفیدی دارند اما بهطور قابل اعتماد سه عامل با تأثیر اندازهگیریشده قویترین را تحت ضرورت یا کفایت شناسایی نمیکنند. این چارچوب یک بررسی قابلیت اعتماد سیاهجعبهای برای توضیحات استفادهشده در نظارت بر عامل فراهم میکند و همزمان محدود به تصمیمات منفرد LLM میماند.
موضوعات: هوش مصنوعی (cs.AI)
منبع: arXiv:2609.05385 [cs.AI] (یا arXiv:2609.05385v1 [cs.AI] برای این نسخه)
https://doi.org/10.48550/arXiv.2609.05385
تاریخ ارسال: از: Urja Pawar [مشاهده ایمیل] [v1] Fri, 4 Sep 2026 17:37:17 UTC (3,875 KB)
آلفاکسوی (آلفاکسوی چیست؟) لینکهای کد، CatalyzeX Code Finder برای مقالات (CatalyzeX چیست؟) را فعال کنید. DagsHub (DagsHub چیست؟) را فعال کنید. GotitPub (GotitPub چیست؟) را فعال کنید. Huggingface (Huggingface چیست؟) را فعال کنید. ScienceCast (ScienceCast چیست؟) را فعال کنید. دموها: Replicate (Replicate چیست؟) را فعال کنید. Hugging Face Spaces (Spaces چیست؟) را فعال کنید. TXYZ.AI (TXYZ.AI چیست؟) را فعال کنید. مقالات مرتبط: توصیهکنندهها و ابزارهای جستجو. لینک به Influence Flower (Influence Flowers چیست؟). توصیهکنندهی اصلی: CORE (CORE چیست؟) را فعال کنید. نویسندگان، مکان برگزاری، مؤسسه، موضوع. دربارهی arXivLabs: arXivLabs پروژههای آزمایشی با همکاری جامعه است. arXivLabs یک چارچوب است که به همکاران امکان میدهد ویژگیهای جدید arXiv را مستقیماً در وبسایت ما توسعه داده و به اشتراک بگذارند. هم افراد و هم سازمانهایی که با arXivLabs کار میکنند، ارزشهای ما را در زمینهی باز بودن، جامعه، برتری و حریم خصوصی دادههای کاربران پذیرفتهاند. arXiv به این ارزشها متعهد است و تنها با شرکایی همکاری میکند که به آنها پایبند باشند. آیا ایدهای برای پروژهای دارید که برای جامعهی arXiv ارزش افزودهای ایجاد کند؟ بیشتر دربارهی arXivLabs بدانید. کدام یک از نویسندگان این مقاله حامی آن هستند؟ | MathJax (MathJax چیست؟) را غیرفعال کنید.