چکیده
اسکنرهای ایستا بهطور روزافزونی برای شناسایی محتوای مخرب یا ناامن در مصنوعات یادگیری ماشین بهکار گرفته میشوند؛ با این حال، معیارهای ارزیابی متداول تنها مواردی را در نظر میگیرند که اسکنر قضاوتی قابل استفاده در حوزه امنیت ارائه دهد. ما ابزارهای ModelScan، ModelAudit و Fickling را با استفاده از یک محک مبتنی بر مصنوعات و کنترلشده، بر روی مجموعهدادهای متشکل از ۱۷۰ مصنوع با تمرکز بر فرمتهای Pickle و PyTorch ارزیابی میکنیم که شامل ۱۴۵ خانواده نمونه است. از این میان، ۱۳۵ مورد دارای حقیقت زمینهای دودویی در حوزه امنیت هستند و ۱۰ مورد عمداً ناقص بوده و بدون برچسبگذاریاند. ما بهطور صریح میان پوشش غیر N/A، تکمیل تحلیل، تصمیمات قطعی امنیتی، یافتههای غیرمرتبط با امنیت، و نتایج پشتیبانینشده تمایز قائل میشویم. در میان خانوادههای دارای برچسب، ModelAudit برای تمامی ۱۳۵ خانواده (۱۰۰٪) تصمیم قطعی امنیتی تولید کرد، Fickling برای ۱۱۰ خانواده (۸۱/۵٪)، و ModelScan برای ۶۷ خانواده (۴۹/۶٪). در صورت ارائه قضاوت قطعی، ModelScan به دقت، بازخوانی و امتیاز F1 معادل ۱۰۰٪ دست یافت. Fickling هیچ نمونه مثبت حقیقی منحصربهفردی را فراتر از آنچه ترکیب ModelAudit و ModelScan شناسایی کرده بودند، نیافت. علاوه بر این، برای ۴۸ خانواده مخربی که ModelScan در تحلیل آنها ناموفق بود، ModelAudit و Fickling هر دو شناساییهایی مطابق با حقیقت زمینهای ارائه دادند. این یافتهها بر ضرورت تفکیک دقت قضاوت از دسترسپذیری آن، و همچنین تفکیک پوشش شناسایی افزایشی از افزونگی در سطح ابزار، تأکید دارند.
متن کامل
علوم کامپیوتر > رمزنگاری و امنیت arXiv:2608.27424v1 (cs) [ارسال شده در ۲۷ اوت ۲۰۲۶] عنوان: فراتر از F1: ارزیابی پوشش و بازیابی شکست در اسکنرهای امنیتی مدلهای هوش مصنوعی نویسندگان: کیانلونگ لان، وینوتینی پاندوراجان، آنوج کائول، ایندرانیل سانیاال مشاهده فایل PDF مقاله با عنوان «فراتر از F1: ارزیابی پوشش و بازیابی شکست در اسکنرهای امنیتی مدلهای هوش مصنوعی» نوشته کیانلونگ لان و سه نویسنده دیگر مشاهده PDF HTML (آزمایشی) چکیده: اسکنرهای استاتیک به طور فزایندهای برای شناسایی محتوای اجرایی یا ناامن در مدلهای یادگیری ماشین مورد استفاده قرار میگیرند. با این حال، معیارهای ارزیابی معمولی تنها به مواردی میپردازند که اسکنر قضاوت امنیتی قابل قبول ارائه میدهد. ما مدلهای ModelScan، ModelAudit و Fickling را با استفاده از یک بنچمارک کنترلشده و مبتنی بر مدلها، بر روی یک مجموعه مصنوعی شامل ۱۷۰ مدل تمرکز بر Pickle و PyTorch در ۱۴۵ خانواده نمونه ارزیابی کردیم. از این میان، ۱۳۵ خانواده دارای حقیقت امنیتی باینری هستند و ۱۰ خانواده به طور عمدی بدون برچسب یا با برچسب نادرست هستند. ما به طور صریح پوشش غیر-N/A، تکمیل تحلیل، تصمیمات امنیتی قطعی، یافتههای غیر امنیتی و نتایج پشتیبانینشده را از هم جدا میکنیم. در خانوادههای برچسبدار، ModelAudit تصمیمات امنیتی قطعی را برای همه ۱۳۵ خانواده (۱۰۰%) ارائه کرد، Fickling برای ۱۱۰ خانواده (۸۱.۵%) و ModelScan برای ۶۷ خانواده (۴۹.۶%) تصمیمگیری کردند. در صورتی که قضاوت قطعی انجام شود، ModelScan دقت، یادگیری و F1 را به میزان ۱۰۰% به دست آورد. Fickling هیچ خانواده مثبت واقعی منحصر به فردی را فراتر از آنچه توسط ترکیب ModelAudit و ModelScan یافت شده بود، شناسایی نکرد. علاوه بر این، در ۴۸ خانواده مخرب که ModelScan نتوانست تحلیل خود را به اتمام برساند، هر دو ModelAudit و Fickling تشخیصهایی را تولید کردند که با حقیقت مطابقت داشت. این یافتهها بر نیاز به جداسازی دقت قضاوت از در دسترس بودن آن، و همچنین پوشش تشخیص افزایشی از تکرار سطح ابزار، تاکید میکنند. موضوعات: رمزنگاری و امنیت (cs.CR)؛ هوش مصنوعی (cs.AI) استناد: arXiv:2608.27424 [cs.CR] (یا arXiv:2608.27424v1 [cs.CR] برای این نسخه) https://doi.org/10.48550/arXiv.2608.27424 برای کسب اطلاعات بیشتر به DOI صادر شده توسط arXiv از طریق DataCite (در انتظار ثبت نام) تاریخچه ارسال از: کیانلونگ لان [مشاهده ایمیل] [v1] پنجشنبه، ۲۷ اوت ۲۰۲۶، ۱۷:۴۹:۲۸ UTC (۲۳۷ کیلوبایت) ابزارهای کتابشناسی ابزارهای کتابشناسی و استناد جستجوی کتابشناسی فعالسازی جستجوی کتابشناسی (جستجوی کتابشناسی چیست؟) Papers متصلشده فعالسازی Papers متصلشده (Papers متصلشده چیست؟) Litmaps فعالسازی Litmaps (Litmaps چیست؟) scite.ai فعالسازی scite استنادها هوشمند (استنادها هوشمند چیست؟) کد، داده، رسانه کد، داده و رسانه مرتبط با این مقاله alphaXiv فعالسازی alphaXiv (alphaXiv چیست؟) لینکهای کد CatalyzeX Code Finder برای Papers (CatalyzeX چیست؟) فعالسازی DagsHub (DagsHub چیست؟) فعالسازی GotitPub (Gotit.pub چیست؟) فعالسازی Huggingface (Huggingface چیست؟) ScienceCast فعالسازی ScienceCast (ScienceCast چیست؟) دموها دموهای Replicate فعالسازی Replicate (Replicate چیست؟) Spaces فعالسازی Hugging Face Spaces (Spaces چیست؟)
ایمنی کاربر: ایمن