چکیده
عملکرد عاملهای مبتنی بر مدلهای زبانی بزرگ (LLM) از تعامل همزمان مدل پایه و چارچوب اجرایی در محیط نشأت میگیرد. این ویژگی آنها را در برابر آسیبهای ایمنی آسیبپذیر میسازد؛ چه در پاسخهای نهایی مضر و چه در مسیرهای اجرایی چندمرحلهای. سازوکارهای همراستاسازی ایمنی موجود عموماً بر بهروزرسانی چارچوب اجرایی بیرونی یا بهینهسازی سیاست تکیه دارند؛ با این حال، هیچیک از این دو رویکرد بهتنهایی قادر به پُر کردن شکاف میان کنترل زمان اجرا و ایمنی ذاتی نیست. در این مقاله، چارچوب خودتکاملی مبتنی بر تجربهای به نام SafeEvolve را برای همراستاسازی ایمنی عاملها پیشنهاد میکنیم. SafeEvolve از تجربه ایمنی حاصلشده از مسیرهای اجرایی تکمیلشدهٔ درونخطمشی بهره میبرد تا حلقهای پیوسته از همتکاملی چارچوب اجرایی و سیاست را هدایت کند. در بخش چارچوب اجرایی، SafeEvolve شواهد ایمنی سطحمسیر را به بهروزرسانیهای محدودشده در سطح مؤلفهها — شامل پرامپت ایمنی و مهارتهای سلسلهمراتبی — تبدیل میکند و مصنوعات چارچوب اجرایی قابلممیزی و قابلبازگشت تولید مینماید. در بخش سیاست، SafeEvolve از یک الگوی دومرحلهای SFT-RL پیروی میکند؛ بهگونهای که SFT مبتنی بر بهکارگیری چارچوب اجرایی، سیاست را برای بهرهگیری فعال از مصنوعات تکاملیافتهٔ چارچوب اجرایی آماده میسازد، و RL تقویتشده با چارچوب اجرایی، رفتارهای ایمنی خودمختار را در فرایند کاوش چندمرحلهای از طریق پاداشهای تجزیهشده توسط تأییدکننده شکل میدهد. SafeEvolve از طریق همتکاملی چارچوب اجرایی و سیاست، تجربه ایمنی را به یک چارچوب اجرایی تکاملیافته در زمان اجرا و رفتار سیاستی بهبودیافته تبدیل میکند. آزمایشها بر روی معیارهای ایمنی عاملی نشان میدهد که SafeEvolve در مقایسه با خطوط پایه موجود، به موازنهای قویتر میان ایمنی و سودمندی دست مییابد. برای مدل Qwen3.5-4B، این روش کاهش سهبرابری نرخ پذیرش حمله (ASR) را در AgentDojo به همراه داشته و در عین حال سودمندی در حالتهای خوشخیم را از ۵۹٫۷۹٪ به ۶۱٫۸۶٪ ارتقا میدهد.
متن کامل
علوم کامپیوتر > هوش مصنوعی
arXiv:2609.02786v1 (cs) [ارسال شده در ۲ سپتامبر ۲۰۲۶]
**عنوان:** SafeEvolve: تکامل همزمان مهار و سیاست از تجربه عامل برای همراستاسازی ایمنی
**نویسندگان:** Qinghua Mao، Wanying Qu، Dadi Guo، Leitao Yuan، Qingyu Liu، Yu Li، Guanxu Chen، Yanwei Fu، Xi Lin، Xia Hu، Dongrui Liu
مشاهده PDF مقاله با عنوان SafeEvolve: تکامل همزمان مهار و سیاست از تجربه عامل برای همراستاسازی ایمنی، توسط Qinghua Mao و ۱۰ نویسنده دیگر
مشاهده PDF
HTML (آزمایشی)
**چکیده:** عملکرد عاملهای مبتنی بر مدلهای زبانی بزرگ (LLM) بهطور مشترک توسط مدل پایه و مهار (harness) مورد استفاده در تعامل با محیط شکل میگیرد. این امر آنها را در معرض خطرات ایمنی هم در پاسخهای نهایی مضر و هم در مسیرهای اجرای چندمرحلهای قرار میدهد. مکانیزمهای همراستاسازی ایمنی موجود اغلب بهصورت جداگانه بر بهروزرسانیهای مهار خارجی یا بهینهسازی سیاست تکیه میکنند، با این حال استفاده از هر یک از این الگوها بهتنهایی نمیتواند شکاف میان کنترل زمان اجرا و ایمنی ذاتی را پر کند. ما SafeEvolve را پیشنهاد میکنیم، یک چارچوب خودتکاملی مبتنی بر تجربه برای همراستاسازی ایمنی عامل. SafeEvolve از تجربه ایمنی بهدستآمده از مسیرهای تکمیلشده on-policy برای هدایت یک حلقه پیوسته از تکامل همزمان مهار و سیاست بهره میبرد. در سمت مهار، SafeEvolve شواهد ایمنی سطح مسیر را به بهروزرسانیهای محدودشده در سطح مؤلفهها شامل prompt ایمنی و مهارتهای سلسلهمراتبی تبدیل میکند و مصنوعات مهار قابلممیزی و قابلبازگشت تولید میکند. در سمت سیاست، SafeEvolve از یک الگوی دومرحلهای SFT-RL پیروی میکند، که در آن SFT مبتنی بر استفاده از مهار، سیاست را برای بهرهبرداری فعالانه از مصنوعات تکاملیافته مهار bootstrap میکند، و RL تقویتشده با مهار، رفتارهای ایمنی مستقل را در طول کاوش چندمرحلهای از طریق پاداشهای تجزیهشده توسط تأییدکننده شکل میدهد. از طریق تکامل همزمان مهار و سیاست، SafeEvolve تجربه ایمنی را به یک مهار زمان اجرای تکاملیافته و رفتار سیاستی بهبودیافته تبدیل میکند. آزمایشها روی معیارهای ایمنی عاملی نشان میدهد که SafeEvolve به موازنه ایمنی-مفیدبودن قویتری نسبت به خطوط مبنای موجود دست مییابد. برای Qwen3.5-4B، SafeEvolve کاهشی $3\times$ در نرخ موفقیت حمله (ASR) روی AgentDojo به دست میآورد، در حالی که مفیدبودن سالم را از ۵۹.۷۹٪ به ۶۱.۸۶٪ بهبود میبخشد.
**توضیحات:** موضوعات: هوش مصنوعی (cs.AI)؛ رمزنگاری و امنیت (cs.CR)
**استناد به صورت:** arXiv:2609.02786 [cs.AI] (یا arXiv:2609.02786v1 [cs.AI] برای این نسخه)
https://doi.org/10.48550/arXiv.2609.02786
برای کسب اطلاعات بیشتر درباره DOI صادر شده توسط arXiv از طریق DataCite (ثبت در انتظار)
**تاریخچه ارسال:**
از: Qinghua Mao [مشاهده ایمیل]
[v1] چهارشنبه، ۲ سپتامبر ۲۰۲۶، ۱۶:۱۹:۵۴ UTC (۹,۸۳۵ KB)
**ابزارهای کتابشناختی**
ابزارهای کتابشناختی و استنادی
کاوشگر کتابشناختی
تغییر وضعیت کاوشگر کتابشناختی (کاوشگر چیست؟)
مقالات مرتبط
تغییر وضعیت مقالات مرتبط (مقالات مرتبط چیست؟)
نقشههای ادبیاتی
تغییر وضعیت نقشههای ادبیاتی (نقشههای ادبیاتی چیست؟)
scite.ai
تغییر وضعیت استنادهای هوشمند scite (استنادهای هوشمند چیست؟)
**کد، داده، رسانه**
کد، داده و رسانه مرتبط با این مقاله
alphaXiv
تغییر وضعیت alphaXiv (alphaXiv چیست؟)
پیوندها به کد
تغییر وضعیت CatalyzeX Code Finder for Papers (CatalyzeX Code Finder for Papers چیست؟)
DagsHub
تغییر وضعیت DagsHub (DagsHub چیست؟)
GotitPub
Gotit.pub (GotitPub چیست؟) Huggingface نمایش Hugging Face (Huggingface چیست؟) ScienceCast نمایش ScienceCast (ScienceCast چیست؟) دموها دموها Replicate نمایش Replicate (Replicate چیست؟) Spaces نمایش Hugging Face Spaces (Spaces چیست؟) Spaces نمایش TXYZ.AI (TXYZ.AI چیست؟) مقالات مرتبط ابزارهای توصیهگر و جستجو پیوند به Influence Flower Influence Flower (Influence Flowers چیست؟) نمایش توصیهگر هسته CORE Recommender (CORE چیست؟) نویسنده venue مؤسسه موضوع درباره arXivLabs arXivLabs: پروژههای آزمایشی با همکاری جامعه arXivLabs چارچوبی است که به همکاران اجازه میدهد تا ویژگیهای جدید arXiv را مستقیماً در وبسایت ما توسعه داده و به اشتراک بگذارند. هم افراد و هم سازمانهایی که با arXivLabs کار میکنند، ارزشهای ما در زمینه شفافیت، جامعه، تعالی و حریم خصوصی دادههای کاربران را پذیرفته و قبول کردهاند. arXiv متعهد به این ارزشها است و تنها با شرکایی که به آنها پایبند هستند همکاری میکند. ایدهای برای پروژهای دارید که برای جامعه arXiv ارزش افزوده ایجاد کند؟ درباره arXivLabs بیشتر بدانید. کدام نویسندگان این مقاله تأییدکننده هستند؟ | غیرفعالسازی MathJax (MathJax چیست؟)