arXiv:2609.05385ترجمه شده

ضروری یا کافی؟ ارزیابی توضیحات مدل‌های زبانی بزرگ با شواهد رفتاری

Urja Pawar، Rajitha Ramanayake، Nabeel Kemal، Ashwin Kandath، Owen O'Neill، Guillaume Bourgeon، Houssem Chatbri

چکیده

اجزای تصمیم‌گیری در مدل‌های بزرگ زبانی (LLM) که قادر به عمل در جریان‌های کاری عامل (agent workflows) هستند، اغلب توصیه‌ها یا قضاوت‌های عملی را همراه با توضیحاتی تولید می‌کنند. اپراتورها ممکن است از عوامل نام‌گذاری برای نظارت بر سیستم، تشخیص خطاها یا تصمیم‌گیری درباره زمان ارتقای خروجی استفاده کنند. چنین استفاده‌ای بر این فرض استوار است که توضیحات با رفتار تصمیم‌گیری قابل مشاهده این اجزای تصمیم‌گیری همخوانی داشته باشند. ما دو تفسیر از عوامل نام‌گذاری را آزمایش می‌کنیم: ضرورت (necessity) به معنای اینکه تغییر آن باعث تغییر خروجی می‌شود، و کفایت (sufficiency) به معنای اینکه حفظ آن در حال حذف اطلاعات قابل تغییر دیگر، خروجی را حفظ می‌کند. این تفسیرها را در دو حوزه کاربردی ارزیابی می‌کنیم: توصیه‌دهی مشاوران به مشتریان و ارزیابی پرسش‌ها برای تعیین خوشبختی یا خطر. مدل‌ها یک خروجی و سه عامل اول مؤثر بر آن را باز می‌گردانند. مداخلات کنترل‌شده در قالب جعبه سیاه، ضرورت (necessity) را برای هر عامل با اندازه‌گیری فراوانی تغییر آن و تغییر خروجی تخمین می‌زنند، و کفایت (sufficiency) را با اندازه‌گیری فراوانی حفظ آن در حال حذف اطلاعات قابل تغییر دیگر. در گروه هشت مدل از خانواده‌های Claude، GPT و Gemini، هم‌وارونی‌های اسپیرمن (Spearman) میان رتبه‌بندی عوامل ذکرشده و امتیازات ضرورت و کفایت به شرح زیر است: 0.349 و 0.354 برای توصیه مشاور، و 0.431 و 0.580 برای نظارت بر پرسش‌ها. علاوه بر این، یک عامل غیرذکرشده در 57.6% از پاسخ‌های مشاوران تحت ضرورت و 58.1% تحت کفایت، از کمترین امتیازدهی‌شده بین عوامل ذکرشده بالاتر است؛ نرخ‌های مربوط به نظارت بر پرسش‌ها 25.8% و 8.9% هستند. سه عامل اول ذکرشده اطلاعات مفیدی دارند، اما به‌طور قابل اعتماد سه عامل با تأثیر قوی‌تر اندازه‌شده را در ضرورت یا کفایت شناسایی نمی‌کنند. این چارچوب، یک بررسی قابل اعتماد برای توضیحات مورد استفاده در نظارت بر عامل فراهم می‌کند، در حالی که به تصمیمات فردی LLM محدود می‌ماند.

متن کامل

عنوان: ضروری یا کافی؟ ارزیابی توضیحات LLM با شواهد رفتاری نویسندگان: Urja Pawar, Rajitha Ramanayake, Nabeel Kemal, Ashwin Kandath, Owen O'Neill, Guillaume Bourgeon, Houssem Chatbri چکیده: اجزای تصمیم‌گیری مدل‌های زبانی بزرگ (LLM) که می‌توانند در گردش‌کار عامل عمل کنند، اغلب توصیه‌ها یا قضاوت‌های مرتبط با عمل را همراه با توضیحاتی تولید می‌کنند. عملگرا ممکن است از چنین عامل‌هایی برای نظارت بر سیستم، تشخیص خطاها یا تصمیم‌گیری درباره زمان بالا بردن خروجی استفاده کنند. این استفاده فرض می‌کند که توضیحات با رفتار قابل مشاهده تصمیم‌گیری هم‌خوانی دارند. ما دو تفسیر از این عامل‌ها را آزمایش می‌کنیم: ضرورت یعنی تغییر عامل باعث تغییر خروجی می‌شود؛ و کفایت یعنی حفظ عامل در حالی که اطلاعات قابل تغییر دیگر حذف شده، خروجی را حفظ می‌کند. این تفسیرها را در دو کاربرد سینتیتیک ارزیابی می‌کنیم: پیشنهاد مشاوران به مشتریان و تشخیص مضر بودن یا ریسک پرامپت‌ها. مدل‌ها یک خروجی و سه عامل برتر را برمی‌گردانند. مداخلات سیاه‌جعبه‌ای کنترل‌شده برای هر عامل، یک امتیاز ضرورت (با اندازه‌گیری فرکانس تغییر عامل در تغییر خروجی) و یک امتیاز کفایت (با اندازه‌گیری فرکانس حفظ عامل در حفظ خروجی) محاسبه می‌کند. در هشت مدل از خانواده‌های Claude، GPT و Gemini، همبستگی میانگین اسپیرمن بین رتبه‌بندی نقل‌قول‌شده و امتیازهای ضرورت و کفایت به ترتیب ۰.۳۴۹ و ۰.۳۵۴ برای پیشنهاد مشاور و ۰.۴۳۱ و ۰.۵۸۰ برای نظارت بر پرامپت به‌دست آمد. علاوه بر این، یک عامل نقل‌قول‌نشده در ۵۷.۶٪ از پاسخ‌های مشاور تحت ضرورت و ۵۸.۱٪ تحت کفایت امتیاز بالاتری نسبت به عامل نقل‌قول‌شده کمترین امتیاز دارد؛ نسبت‌های متناظر برای نظارت بر پرامپت ۲۵.۸٪ و ۸.۹٪ هستند. سه عامل برتر نقل‌قول‌شده اطلاعات مفیدی دارند اما به‌طور قابل اعتماد سه عامل با تأثیر اندازه‌گیری‌شده قوی‌ترین را تحت ضرورت یا کفایت شناسایی نمی‌کنند. این چارچوب یک بررسی قابلیت اعتماد سیاه‌جعبه‌ای برای توضیحات استفاده‌شده در نظارت بر عامل فراهم می‌کند و همزمان محدود به تصمیمات منفرد LLM می‌ماند. موضوعات: هوش مصنوعی (cs.AI) منبع: arXiv:2609.05385 [cs.AI] (یا arXiv:2609.05385v1 [cs.AI] برای این نسخه) https://doi.org/10.48550/arXiv.2609.05385 تاریخ ارسال: از: Urja Pawar [مشاهده ایمیل] [v1] Fri, 4 Sep 2026 17:37:17 UTC (3,875 KB) آلفاکسوی (آلفاکسوی چیست؟) لینک‌های کد، CatalyzeX Code Finder برای مقالات (CatalyzeX چیست؟) را فعال کنید. DagsHub (DagsHub چیست؟) را فعال کنید. GotitPub (GotitPub چیست؟) را فعال کنید. Huggingface (Huggingface چیست؟) را فعال کنید. ScienceCast (ScienceCast چیست؟) را فعال کنید. دموها: Replicate (Replicate چیست؟) را فعال کنید. Hugging Face Spaces (Spaces چیست؟) را فعال کنید. TXYZ.AI (TXYZ.AI چیست؟) را فعال کنید. مقالات مرتبط: توصیه‌کننده‌ها و ابزارهای جستجو. لینک به Influence Flower (Influence Flowers چیست؟). توصیه‌کننده‌ی اصلی: CORE (CORE چیست؟) را فعال کنید. نویسندگان، مکان برگزاری، مؤسسه، موضوع. درباره‌ی arXivLabs: arXivLabs پروژه‌های آزمایشی با همکاری جامعه است. arXivLabs یک چارچوب است که به همکاران امکان می‌دهد ویژگی‌های جدید arXiv را مستقیماً در وب‌سایت ما توسعه داده و به اشتراک بگذارند. هم افراد و هم سازمان‌هایی که با arXivLabs کار می‌کنند، ارزش‌های ما را در زمینه‌ی باز بودن، جامعه، برتری و حریم خصوصی داده‌های کاربران پذیرفته‌اند. arXiv به این ارزش‌ها متعهد است و تنها با شرکایی همکاری می‌کند که به آنها پایبند باشند. آیا ایده‌ای برای پروژه‌ای دارید که برای جامعه‌ی arXiv ارزش افزوده‌ای ایجاد کند؟ بیشتر درباره‌ی arXivLabs بدانید. کدام یک از نویسندگان این مقاله حامی آن هستند؟ | MathJax (MathJax چیست؟) را غیرفعال کنید.