arXiv:2609.15989ترجمه شده

نقشه‌های فاسد، ردپاهای پاک: دور زدن نظارت بر زنجیره‌ی تفکر با تزریق نقشه

Keertana Chidambaram، Andrew Ilyas، Vasilis Syrgkanis

چکیده

نظارت بر زنجیره‌ی تفکر (CoT) یک استراتژی ایمنی است که در آن، استدلال یک مدل زبانی بزرگ را به عنوان یک «عامل» در نظر می‌گیرند و توسط یک «نظارتگر» (اغلب یک مدل زبانی دیگر) بررسی می‌کنند تا نشانه‌های برنامه‌ریزی ناامن، فریبکارانه یا عدم هماهنگی را شناسایی کند. ما دریافته‌ایم که قرار دادن یک استدلال آسیب‌رسان اما ظاهراً بی‌خطر در بافت عامل، می‌تواند آن را به انجام اقدامات خصمانه سوق دهد، در حالی که از نظارتگران پنهان می‌ماند؛ حمله‌ای که ما آن را «تزریق برنامه» می‌نامیم. ما برای نخستین بار این حمله را در تنظیم قابلیت نظارت بر پاسخ‌دهی به سوالات چندگزینه‌ای، که توسط لانهم و همکاران (۲۰۲۳) پیشنهاد شده است، با استفاده از چارچوب تحریک عامل-پژوهشگر لی و همکاران (۲۰۲۵) کشف کردیم. ما این حمله را تعمیم می‌دهیم و نشان می‌دهیم که رفتار کشف‌شده به وظایف دشوارتر نیز گسترش می‌یابد (دستیابی به نرخ اجتناب از نظارت ۲۵ تا ۳۳ درصد در معیارهای مختلف قابلیت نظارت) و به مدل‌های بزرگ‌تر مانند DeepSeek-R1 نیز تعمیم می‌یابد. در سراسر تنظیماتی که مطالعه کردیم، مدل‌های عامل نه تنها برنامه‌های تزریق‌شده را دنبال می‌کنند، بلکه آن‌ها را به عنوان استدلال خود بازنویسی می‌کنند، بدون اینکه به طور صریح به تزریق‌ها اشاره‌ای کنند. در نهایت، مواردی یافتیم که منابع نظارتگر اضافی می‌توانند مضر باشند — دادن دسترسی نظارتگر به برنامه تزریق‌شده، دقت تشخیص را تا ۵۰ درصد در وظیفه Bio-Math کاهش می‌دهد و در یک مطالعه موردی در مورد بودجه تفکر نظارتگر، ما رونوشت‌هایی یافتیم که توکن‌های تفکر اضافی صرف توجیه برنامه تزریق‌شده می‌شوند، نه صرف علامت‌گذاری آن.

متن کامل

امنیت کاربر: ایمن جستجوی پیشرفته | ابزارها | لینک به تأثیر گل (تأثیر گل‌ها چیست؟) | توصیه‌گر اصلی CORE (CORE چیست؟) | نویسنده | محل تحصیل | موضوع | درباره arXiv | arXivLabs: پروژه‌های آزمایشی با همکاری جامعه arXivLabs یک چارچوب است که به همکاران اجازه می‌دهد ویژگی‌های جدید arXiv را مستقیماً روی وب‌سایت ما توسعه داده و به اشتراک بگذارند. افراد و سازمان‌هایی که با arXivLabs همکاری می‌کنند، ارزش‌های ما از جمله گشودگی، جامعه‌محوری، تعالی و حریم خصوصی داده‌های کاربر را پذیرفته‌اند. arXiv به این ارزش‌ها متعهد است و تنها با شرکایی همکاری می‌کند که به آن‌ها پایبند باشند. ایده‌ای برای پروژه‌ای دارید که برای جامعه arXiv ارزشمند باشد؟ درباره arXivLabs بیشتر بدانید. کدام نویسندگان این مقاله را تأیید کرده‌اند؟ | غیرفعال‌سازی MathJax (MathJax چیست؟)