arXiv:2608.27424ترجمه شده

فراتر از F1: ارزیابی پوشش و بازیابی از شکست در اسکنرهای امنیتی مدل‌های هوش مصنوعی

Qianlong Lan، Vinothini Pandurangan، Anuj Kaul، Indranil Sanyal

چکیده

اسکنرهای ایستا به‌طور روزافزونی برای شناسایی محتوای مخرب یا ناامن در مصنوعات یادگیری ماشین به‌کار گرفته می‌شوند؛ با این حال، معیارهای ارزیابی متداول تنها مواردی را در نظر می‌گیرند که اسکنر قضاوتی قابل استفاده در حوزه امنیت ارائه دهد. ما ابزارهای ModelScan، ModelAudit و Fickling را با استفاده از یک محک مبتنی بر مصنوعات و کنترل‌شده، بر روی مجموعه‌داده‌ای متشکل از ۱۷۰ مصنوع با تمرکز بر فرمت‌های Pickle و PyTorch ارزیابی می‌کنیم که شامل ۱۴۵ خانواده نمونه است. از این میان، ۱۳۵ مورد دارای حقیقت زمینه‌ای دودویی در حوزه امنیت هستند و ۱۰ مورد عمداً ناقص بوده و بدون برچسب‌گذاری‌اند. ما به‌طور صریح میان پوشش غیر N/A، تکمیل تحلیل، تصمیمات قطعی امنیتی، یافته‌های غیرمرتبط با امنیت، و نتایج پشتیبانی‌نشده تمایز قائل می‌شویم. در میان خانواده‌های دارای برچسب، ModelAudit برای تمامی ۱۳۵ خانواده (۱۰۰٪) تصمیم قطعی امنیتی تولید کرد، Fickling برای ۱۱۰ خانواده (۸۱/۵٪)، و ModelScan برای ۶۷ خانواده (۴۹/۶٪). در صورت ارائه قضاوت قطعی، ModelScan به دقت، بازخوانی و امتیاز F1 معادل ۱۰۰٪ دست یافت. Fickling هیچ نمونه مثبت حقیقی منحصربه‌فردی را فراتر از آنچه ترکیب ModelAudit و ModelScan شناسایی کرده بودند، نیافت. علاوه بر این، برای ۴۸ خانواده مخربی که ModelScan در تحلیل آن‌ها ناموفق بود، ModelAudit و Fickling هر دو شناسایی‌هایی مطابق با حقیقت زمینه‌ای ارائه دادند. این یافته‌ها بر ضرورت تفکیک دقت قضاوت از دسترس‌پذیری آن، و همچنین تفکیک پوشش شناسایی افزایشی از افزونگی در سطح ابزار، تأکید دارند.

متن کامل

علوم کامپیوتر > رمزنگاری و امنیت arXiv:2608.27424v1 (cs) [ارسال شده در ۲۷ اوت ۲۰۲۶] عنوان: فراتر از F1: ارزیابی پوشش و بازیابی شکست در اسکنرهای امنیتی مدل‌های هوش مصنوعی نویسندگان: کیانلونگ لان، وینوتینی پاندوراجان، آنوج کائول، ایندرانیل سانیاال مشاهده فایل PDF مقاله با عنوان «فراتر از F1: ارزیابی پوشش و بازیابی شکست در اسکنرهای امنیتی مدل‌های هوش مصنوعی» نوشته کیانلونگ لان و سه نویسنده دیگر مشاهده PDF HTML (آزمایشی) چکیده: اسکنرهای استاتیک به طور فزاینده‌ای برای شناسایی محتوای اجرایی یا ناامن در مدل‌های یادگیری ماشین مورد استفاده قرار می‌گیرند. با این حال، معیارهای ارزیابی معمولی تنها به مواردی می‌پردازند که اسکنر قضاوت امنیتی قابل قبول ارائه می‌دهد. ما مدل‌های ModelScan، ModelAudit و Fickling را با استفاده از یک بنچمارک کنترل‌شده و مبتنی بر مدل‌ها، بر روی یک مجموعه مصنوعی شامل ۱۷۰ مدل تمرکز بر Pickle و PyTorch در ۱۴۵ خانواده نمونه ارزیابی کردیم. از این میان، ۱۳۵ خانواده دارای حقیقت امنیتی باینری هستند و ۱۰ خانواده به طور عمدی بدون برچسب یا با برچسب نادرست هستند. ما به طور صریح پوشش غیر-N/A، تکمیل تحلیل، تصمیمات امنیتی قطعی، یافته‌های غیر امنیتی و نتایج پشتیبانی‌نشده را از هم جدا می‌کنیم. در خانواده‌های برچسب‌دار، ModelAudit تصمیمات امنیتی قطعی را برای همه ۱۳۵ خانواده (۱۰۰%) ارائه کرد، Fickling برای ۱۱۰ خانواده (۸۱.۵%) و ModelScan برای ۶۷ خانواده (۴۹.۶%) تصمیم‌گیری کردند. در صورتی که قضاوت قطعی انجام شود، ModelScan دقت، یادگیری و F1 را به میزان ۱۰۰% به دست آورد. Fickling هیچ خانواده مثبت واقعی منحصر به فردی را فراتر از آنچه توسط ترکیب ModelAudit و ModelScan یافت شده بود، شناسایی نکرد. علاوه بر این، در ۴۸ خانواده مخرب که ModelScan نتوانست تحلیل خود را به اتمام برساند، هر دو ModelAudit و Fickling تشخیص‌هایی را تولید کردند که با حقیقت مطابقت داشت. این یافته‌ها بر نیاز به جداسازی دقت قضاوت از در دسترس بودن آن، و همچنین پوشش تشخیص افزایشی از تکرار سطح ابزار، تاکید می‌کنند. موضوعات: رمزنگاری و امنیت (cs.CR)؛ هوش مصنوعی (cs.AI) استناد: arXiv:2608.27424 [cs.CR] (یا arXiv:2608.27424v1 [cs.CR] برای این نسخه) https://doi.org/10.48550/arXiv.2608.27424 برای کسب اطلاعات بیشتر به DOI صادر شده توسط arXiv از طریق DataCite (در انتظار ثبت نام) تاریخچه ارسال از: کیانلونگ لان [مشاهده ایمیل] [v1] پنجشنبه، ۲۷ اوت ۲۰۲۶، ۱۷:۴۹:۲۸ UTC (۲۳۷ کیلوبایت) ابزارهای کتاب‌شناسی ابزارهای کتاب‌شناسی و استناد جستجوی کتاب‌شناسی فعال‌سازی جستجوی کتاب‌شناسی (جستجوی کتاب‌شناسی چیست؟) Papers متصل‌شده فعال‌سازی Papers متصل‌شده (Papers متصل‌شده چیست؟) Litmaps فعال‌سازی Litmaps (Litmaps چیست؟) scite.ai فعال‌سازی scite استنادها هوشمند (استنادها هوشمند چیست؟) کد، داده، رسانه کد، داده و رسانه مرتبط با این مقاله alphaXiv فعال‌سازی alphaXiv (alphaXiv چیست؟) لینک‌های کد CatalyzeX Code Finder برای Papers (CatalyzeX چیست؟) فعال‌سازی DagsHub (DagsHub چیست؟) فعال‌سازی GotitPub (Gotit.pub چیست؟) فعال‌سازی Huggingface (Huggingface چیست؟) ScienceCast فعال‌سازی ScienceCast (ScienceCast چیست؟) دموها دموهای Replicate فعال‌سازی Replicate (Replicate چیست؟) Spaces فعال‌سازی Hugging Face Spaces (Spaces چیست؟) ایمنی کاربر: ایمن