فهرست این فصلبخش ۳، فصل ۲۰ — صفحهٔ ۲ از ۴
بخش ۳، فصل ۲۰ — صفحهٔ ۲ از ۴
ردهبندی هوش مصنوعی پیشبین (Predictive AI, PredAI)
متن اصلی فارسی با منشأ، شناسه و پیوند استناد پایدار.
۲.۲.۱. حملات گریز جعبهسفید
در «مدل تهدید» (Threat Model) جعبهسفید، مهاجم آگاهی کاملی از معماری و پارامترهای مدل دارد، چنانکه در بخش 2.1.4 بحث شد. چالش اصلی برای ساخت «نمونههای خصمانه» (adversarial examples) در این حالت، یافتن یک اغتشاش است که به یک نمونه آزمونی افزوده میشود و برچسب طبقهبندی آن را تغییر میدهد؛ اغلب با محدودیتهایی بر ویژگیهایی مانند محسوسبودن یا اندازه اغتشاش. در مدل تهدید جعبهسفید، رایج است که نمونههای خصمانه با حل یک مسئله بهینهسازی که از دیدگاه مهاجم نوشته میشود ساخته شوند؛ این مسئله تابع هدف بهینهسازی (مانند تغییر برچسب هدف به یک کلاس معیّن) و همچنین یک «سنجه» (Metrics) فاصله برای «سنجش» (Measure) شباهت میان نمونه آزمونی و نمونه خصمانه را مشخص میکند.
روشهای مبتنی بر بهینهسازی. Szedegy و همکاران [362] و Biggio و همکاران [38] بهطور مستقل استفاده از تکنیکهای بهینهسازی را برای تولید نمونههای خصمانه پیشنهاد کردند. در مدلهای تهدید آنان، به حریف اجازه داده میشود تمامیت مدل ML را بازرسی کند و گرادیانها را نسبت به تابع هزینه مدل محاسبه نماید. این حملات میتوانند هدفمند باشند (یعنی کلاس نمونه خصمانه توسط مهاجم انتخاب میشود) یا بدونهدف (یعنی نمونههای خصمانه به هر کلاس نادرست دیگری طبقهبندی نادرست میشوند).
Szedegy و همکاران [362] اصطلاح پرکاربرد «نمونههای خصمانه» را ابداع کردند. آنان هدفی را در نظر گرفتند که نُرم _`_ 2 اغتشاش را بهشرط تغییر پیشبینی مدل به کلاس هدف کمینه میکرد. بهینهسازی با روش limited-memory Broyden–Fletcher–Goldfarb–Shanno (L-BFGS) حل میشود. Biggio و همکاران [38] حالت یک طبقهبند دودویی با کلاسهای مخرب و سالم دارای یک تابع تمایزی پیوسته و مشتقپذیر را در نظر گرفتند. هدف بهینهسازی، کمینهکردن تابع تمایزی است تا نمونههای خصمانه با بیشترین اطمینان تولید شوند.
در حالی که Biggio و همکاران [38] روش خود را بر طبقهبندهای خطی، SVM هستهای و پرسپترونهای چندلایه اعمال کردند، Szedegy و همکاران [362] وجود نمونههای خصمانه را روی مدلهای «یادگیری عمیق» (Deep Learning) بهکاررفته در طبقهبندی تصویر نشان دادند. Goodfellow و همکاران [144] روشی کارآمد برای تولید نمونههای خصمانه در یادگیری عمیق معرفی کردند: «روش علامت گرادیان سریع» (Fast Gradient Sign Method، FGSM)، که تنها یک تکرار گرادیان نزولی را برای حل بهینهسازی انجام میدهد. این روش توسط Kurakin و همکاران [200] به یک حمله FGSM تکراری بسط داده شده است.
آثار بعدی اهداف و روشهای جدیدی برای بهینهسازی تولید نمونههای خصمانه با هدفهای کمینهکردن اغتشاشها و پشتیبانی از سنجههای فاصله متعدد پیشنهاد کردهاند. برخی از حملات قابلتوجه عبارتاند از:
- DeepFool یک حمله گریز بدونهدف برای نُرمهای _`_ 2 است که از تقریب خطی شبکه عصبی برای ساخت نمونههای خصمانه استفاده میکند [257].
- حمله Carlini-Wagner از اهداف متعددی استفاده میکند که هزینه یا لاجیتها را روی کلاس هدف و فاصله میان نمونه خصمانه و نمونه اصلی کمینه میکنند. این حمله از طریق روش جریمه بهینه میشود [65] و سه سنجه فاصله برای سنجش اغتشاشهای نمونههای خصمانه را در نظر میگیرد: _
_ 0 ، __ 2 و _`_ ∞ . این حمله در برابر دفاع تقطیر دفاعی مؤثر بوده است [284].
- حمله Projected Gradient Descent (PGD) [232] تابع هزینه را کمینه میکند و نمونههای خصمانه را در هر تکرار گرادیان نزولی به فضای اغتشاشهای مجاز تصویر میکند. PGD را میتوان به سنجههای فاصله _
_ 2 و __ ∞ برای سنجش اغتشاش نمونههای خصمانه اعمال کرد.
حملات گریز همگانی. Moosavi-Dezfooli و همکاران [256] نشان دادند چگونه میتوان اغتشاشهای همگانی کوچکی (نسبت به برخی نُرمها) ساخت که میتوان آنها را به بیشتر تصاویر افزود و به طبقهبندی نادرست واداشت. تکنیک آنان بر بهینهسازی متوالی اغتشاش همگانی با استفاده از مجموعهای از نقاط نمونهبرداریشده از توزیع دادهها متکی است. این یک نوع «حمله کارکردی» (Functional Attack) است. یک مشاهده جالب آن است که اغتشاشهای همگانی در میان معماریهای شبکههای عمیق تعمیم مییابند؛ این امر حاکی از شباهت در مرزهای تصمیمی است که مدلهای مختلف برای یک وظیفه واحد آموزش دیدهاند.
حملات قابلتحقق فیزیکی. اینها حملاتی در برابر سیستمهای ML هستند که میتوان آنها را بهطور عملی در دنیای فیزیکی پیادهسازی کرد [21، 200، 227]. یکی از نخستین نمونهها، حمله به سیستمهای تشخیص چهره توسط Sharif و همکاران [332] بود. این حمله با چاپ یک جفت قاب عینک قابل تحقق است و سیستمهای تشخیص چهره را چنان گمراه میکند که یا از «تشخیص» (Detection) بگریزند یا خود را بهجای فرد دیگری جا بزنند. Eykholt و همکاران [122] حملهای برای تولید اغتشاشهای استوار در شرایط مختلف پیشنهاد کردند که به نمونههای خصمانهای میانجامد که میتوانند در محیطهای فیزیکی گوناگون از طبقهبندهای بینایی بگریزند. این حمله برای گریز از یک طبقهبند تشخیص تابلوهای راهنمایی بهکار میرود که در آن برچسبهای سیاه و سفید بهصورت فیزیکی روی تابلوها الصاق میشوند. حمله ShapeShifter [81] برای گریز از آشکارسازهای اشیاء طراحی شد؛ مسئلهای که چالشبرانگیزتر از حمله به طبقهبندهای تصویر است، زیرا مهاجم باید از طبقهبندی در چندین کادر محدودکننده با مقیاسهای مختلف بگریزد. این حمله همچنین مستلزم آن است که اغتشاش بهاندازه کافی استوار باشد تا در برابر اعوجاجهای دنیای واقعی ناشی از فواصل دید، زاویهها، شرایط نورپردازی و محدودیتهای دوربین دوام بیاورد.
مدالیتههای داده دیگر. در کاربردهای بینایی کامپیوتر، نمونههای خصمانه اغلب بهگونهای طراحی میشوند که برای انسان نامحسوس باشند. بنابراین اغتشاشهایی که مهاجمان ایجاد میکنند باید چنان کوچک باشند که انسان تصاویر را بهدرستی تشخیص دهد، در حالی که طبقهبند ML فریب خورده و پیشبینی خود را تغییر میدهد. در مقابل، ممکن است یک شیء ماشهای در تصویر وجود داشته باشد که همچنان برای انسان نامحسوس یا بیضرر است اما موجب طبقهبندی نادرست مدل میشود. مفهوم نمونههای خصمانه به «دامنه» (domain)های دیگری مانند صوت، ویدئو، «پردازش زبان طبیعی» (Natural Language Processing، NLP) و امنیت سایبری بسط داده شده است. در برخی از این حالتها، محدودیتهای اضافی وجود دارد که نمونههای خصمانه باید رعایت کنند، مانند معناشناسی متن در NLP و محدودیتهای کاربردی در امنیت سایبری. چند اثر نماینده عبارتاند از:
- صوت: Carlini و Wagner [66] یک حمله هدفمند بر مدلهایی که از گفتار متن تولید میکنند را نشان دادند. آنان میتوانند یک شکلموج صوتی تولید کنند که به یک نمونه موجود بسیار شبیه است اما میتواند به هر متنی به انتخاب مهاجم رونویسی شود.
- ویدئو: حملات گریز خصمانه در برابر مدلهای طبقهبندی ویدئو را میتوان به حملات تنک که تعداد کمی از فریمهای ویدئو را دچار اغتشاش میکنند [401] و حملات متراکم که همه فریمهای یک ویدئو را دچار اغتشاش میکنند [215] تقسیم کرد. هدف مهاجم، تغییر برچسب طبقهبندی ویدئو است.
- متن: Jia و Liang [185] روشی برای تولید نمونههای متنی خصمانه توسعه دادند. این کار پیشگام با بسیاری از پیشرفتها در توسعه حملات خصمانه بر مدلهای پردازش زبان طبیعی (NLP) دنبال شد (ر.ک. یک مرور جامع در این موضوع [438]). La Malfa و Kwiatkowska [202] روشی برای صورتبندی رسمی تعریفهای اغتشاش در NLP با معرفی مفهوم استواری معنایی پیشنهاد کردند. چالشهای اصلی در NLP آن است که دامنه گسسته است نه پیوسته (مانند طبقهبندی تصویر، صوت و ویدئو)، و نمونههای خصمانه باید معناشناسی متن را رعایت کنند. این چالشها در حمله اخیر ASCIIart [186] علیه چتباتها نشان داده شدهاند. تصویری به سبک هنر ASCII از یک واژه ممنوع، چتبات را چنان فریب میدهد که اطلاعات زیانبار را ارائه کند، حتی وقتی چتبات واژه ساده انگلیسی را بهدرستی سانسور میکند. فاصله معنایی میان این دو درخواست دقیقاً صفر است و هر دو میبایست یکسان رفتار میشدند.
- امنیت سایبری: در کاربردهای امنیت سایبری، نمونههای خصمانه باید محدودیتهای تحمیلی از سوی معناشناسی کاربرد و بازنمایی ویژگیهای دادههای سایبری، مانند ترافیک شبکه یا فایلهای باینری برنامهها، را رعایت کنند. FENCE یک چارچوب کلی برای ساخت حملات گریز جعبهسفید با استفاده از بهینهسازی گرادیانی در دامنههای گسسته است و از طیفی از وابستگیهای ویژگی خطی و آماری پشتیبانی میکند [88]. FENCE به دو کاربرد امنیت شبکه اعمال شده است: تشخیص دامنه مخرب و طبقهبندی ترافیک شبکه مخرب. Sheatsley و همکاران [334] روشی پیشنهاد کردند که محدودیتها را در فضای ویژگی با استفاده از منطق صوری میآموزد و نمونههای خصمانه را با تصویرکردن آنها بر فضایی سازگار با محدودیتها میسازد. آنان این تکنیک را بر طبقهبندهای تشخیص نفوذ شبکه و فیشینگ اعمال کردند. هر دو مقاله مشاهده کردند که حملات برآمده از دامنههای پیوسته را نمیتوان بهسادگی در محیطهای مقیدشده بهکار برد، زیرا به نمونههای خصمانه غیرقابلتحقق میانجامند. Pierazzi و همکاران [295] دشواری اجرای حملات گریز قابلتحقق در امنیت سایبری را به دلیل محدودیتهای فضای ویژگی و چالش نگاشت حملات از فضای ویژگی به فضای مسئله بررسی کردند. آنان حملات گریز را در فضای مسئله صورتبندی و نمونههای خصمانه قابلتحققی برای بدافزار اندروید ساختند.
استناد
محمدعلی کهندژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C20-S08
شناسهٔ محتوا KDJ-AI-2026E1-P03-C20-S08-ADCCAA04
۲.۲.۲. حملات گریز جعبهسیاه
[ NISTAML.025 ]
حملات گریز جعبهسیاه در چارچوب یک مدل خصمانهٔ واقعبینانه طراحی میشوند که در آن مهاجم هیچ آگاهی پیشینی دربارهٔ معماری مدل یا دادههای آموزش ندارد. در عوض، مهاجم میتواند با یک مدل ML آموزشدیده از طریق پرسوجو روی نمونههای دادهای گوناگون و دریافت پیشبینیهای مدل تعامل کند. APIهای مشابهی توسط MLaaS ارائهشده از سوی ارائهدهندگان ابری عمومی فراهم میشود که در آن کاربران میتوانند پیشبینیهای مدل را روی پرسوجوهای منتخب بدون اطلاع از نحوهٔ آموزش مدل بهدست آورند. در ادبیات موضوع، دو ردهٔ اصلی از حملات گریز جعبهسیاه وجود دارد:
- حملات مبتنی بر امتیاز: در این حالت، مهاجمان امتیازهای اطمینان یا لوجیتهای مدل را بهدست میآورند و میتوانند از تکنیکهای بهینهسازی گوناگون برای ساخت «نمونههای خصمانه» (adversarial examples) استفاده کنند. یک روش رایج، بهینهسازی مرتبهٔ صفر است که گرادیانهای مدل را بدون محاسبهٔ صریح مشتقات تخمین میزند [80, 173]. سایر تکنیکهای بهینهسازی شامل بهینهسازی گسسته [254]، راهبردهای تکامل طبیعی [172] و گشتزنی تصادفی [262] است.
- حملات مبتنی بر تصمیم: در این حالت محدودتر، مهاجمان تنها برچسبهای نهایی پیشبینیشدهٔ مدل را بهدست میآورند. نخستین روش برای تولید حملات گریز، Boundary Attack بود که بر پایهٔ گشتزنی تصادفی در امتداد مرز تصمیم و نمونهگیری پسزنی استوار بود [47] و با بهبود تخمین گرادیان بهمنظور کاهش تعداد پرسوجوها در HopSkipJumpAttack توسعه یافت [79]. اخیراً چندین روش بهینهسازی جهت نزدیکترین مرز تصمیم را جستوجو میکنند (مانند حملهٔ OPT [86])، بهجای جستوجوی دودویی از sign SGD استفاده میکنند (مانند حملهٔ Sign-OPT [87]) یا از بهینهسازی بیزی بهره میبرند [344].
چالش اصلی در ساخت نمونههای خصمانه در حالتهای جعبهسیاه، کاهش تعداد پرسوجوها به مدلهای ML است. تکنیکهای اخیر میتوانند طبقهبندهای ML را با تعداد نسبتاً کمی پرسوجو — معمولاً کمتر از ۱۰۰۰ — با موفقیت دور بزنند [344].
استناد
محمدعلی کهندژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C20-S09
شناسهٔ محتوا KDJ-AI-2026E1-P03-C20-S09-F5A1A548
۲.۲.۳. انتقالپذیری حملات
روش دیگر برای تولید حملات خصمانه در شرایط مدلهای تهدید محدودشده، انتقال حملهای است که روی یک مدل ML متفاوت ساخته شده است. بهطور معمول، مهاجم یک مدل ML جایگزین آموزش میدهد، حملات خصمانهٔ جعبهسفید را روی مدل جایگزین تولید میکند و حملات را به مدل هدف منتقل میکند. روشهای گوناگون در نحوهٔ آموزش مدلهای جایگزین با یکدیگر تفاوت دارند. برای مثال، Papernot و همکاران [282, 283] مدل جایگزین را با پرسوجوهای مبتنی بر امتیاز به مدل هدف آموزش میدهند، در حالی که چندین مقاله یک گروهِ مجموعهای از مدلها را بدون پرسوجوی صریح از مدل هدف آموزش میدهند [218, 377, 397].
«انتقالپذیری» (Transferability) حملات پدیدهای جذاب است و ادبیات موجود میکوشد دلایل بنیادین انتقال «نمونههای خصمانه» (adversarial examples) میان مدلها را درک کند. چندین مقاله مشاهده کردهاند که مدلهای متفاوت در هر دو بُعد خوشخیم و خصمانه مرزهای تصمیمِ متقاطع میآموزند و این امر به انتقالپذیری بهتر میانجامد [144, 256, 377]. Demontis و همکاران [104] دو عامل اصلی را شناسایی کردهاند که به انتقالپذیری حملات، هم برای «گریز» (Evasion) و هم برای «مسمومسازی» (Poisoning)، کمک میکنند: آسیبپذیری خصمانهٔ ذاتی مدل هدف و «پیچیدگی» (Complexity) مدل جانشینِ بهکاررفته برای بهینهسازی حمله. EXPECTATION OVER TRANSFORMATION با هدف ساخته میشود که نمونههای خصمانه در برابر تبدیلهای تصویری رخداده در دنیای واقعی، مانند تغییر زاویه و زاویهٔ دید، پایداری کنند [21].
استناد
محمدعلی کهندژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C20-S10
شناسهٔ محتوا KDJ-AI-2026E1-P03-C20-S10-55C0BFC6
۲.۲.۴. حملات گریز در دنیای واقعی
اگرچه بسیاری از حملاتی که در این بخش بحث شد تنها در محیطهای پژوهشی به نمایش گذاشته شدهاند، چندین حمله گریز در دنیای واقعی نیز اثبات شده است و ما نمونههای برجسته آنها را در سیستمهای تشخیص چهره، تشخیص صفحات وب فیشینگ و طبقهبندی بدافزار بررسی میکنیم.
سیستمهای تشخیص چهره که برای تأیید هویت به کار میروند، هدف حملات گریز خصمانه قرار گرفتهاند؛ زیرا این سیستمها نقطه ورود به سیستمهای حیاتی محسوب میشوند و به کاربران امکان ارتکاب تقلب مالی را میدهند. در نیمه دوم سال ۲۰۲۰، سرویس تشخیص چهره ID.me بیش از ۸۰٬۰۰۰ مورد تلاش کاربران برای فریب مراحل تأیید هویت خود را شناسایی کرد؛ مراحلی که توسط چندین آژانس نیروی کار ایالتی استفاده میشد [276]. این حملات شامل مواردی مانند استفاده افراد از ماسک، بهکارگیری deepfakeها، یا استفاده از تصاویر و ویدئوهای افراد دیگر بود. هدف، ادعای تقلبی مزایای بیکاری بود که در چارچوب اقدامات امداد کووید ارائه شده بود. بعدها در سال ۲۰۲۲، به گفته دادستانهای فدرال ایالات متحده، مردی از نیوجرسی توانست بهعنوان بخشی از طرح تقلب به ارزش ۲٫۵ میلیون دلار در مزایای بیکاری، گواهینامههای جعلی رانندگی را از طریق ID.me تأیید کند. در این مورد، مظنون از کلاهگیسهای متنوعی برای گریز از سیستم تشخیص چهره استفاده کرد [156].
مطالعه موردی دیگر از حملات گریز در دنیای واقعی که توسط Apruzzese et al. گزارش شده است [17]، حملهای به یک تشخیصدهنده تجاری صفحات وب فیشینگ است. تشخیصدهنده فیشینگ مبتنی بر ML، مجموعهای از چندین مدل است که جنبههای مختلف تصویر را برای تعیین اینکه آیا یک تلاش فیشینگ هست تحلیل میکنند. ورودیهایی که توسط مدل نامطمئن علامتگذاری میشوند، برای بررسی به تحلیلگران امنیت ارجاع داده میشوند. نویسندگان از میان ۴۶۰۰ نمونه که توسط سیستم طبقهبندی تصویر ML نامطمئن علامتگذاری شده بودند، ۱۰۰ «نمونههای خصمانه» (adversarial examples) شناسایی کردند. نکته جالب اینکه تحلیل دستی این نمونههای خصمانه نشان داد که مهاجمان از حملات مبتنی بر بهینهسازی استفاده نمیکنند، بلکه از روشهای نسبتاً سادهای برای گریز بهره میگیرند؛ مانند برش تصویر، ماسکگذاری یا تکنیکهای تار کردن.
نمونههای دیگر حملات گریز که پژوهشگران در زمینه طبقهبندی بدافزار نشان دادهاند، در پایگاه دانش MITRE Adversarial Threat Landscape for Artificial-Intelligence Systems (ATLAS) فهرستبندی شدهاند [248]. شرکت Palo Alto Networks حملات گریز را علیه یک تشخیصدهنده یادگیری عمیق برای ترافیک فرماندهی و کنترل بدافزار و همچنین یک تشخیصدهنده «الگوریتم تولید دامنه» (Domain Generation Algorithm, DGA) باتنت گزارش کرده است. نمونهای از یک حمله گریز فراگیر علیه مدل تشخیص بدافزار مبتنی بر هوش مصنوعی شرکت Cylance کشف شد. پژوهشگران همچنین با آموزش یک مدل ML سایه و استفاده از بینشهای حاصل از آن برای حمله به سیستم واقعی، از سیستم محافظت از ایمیل شرکت ProofPoint عبور کردند. این موارد نمایشی از «آسیبپذیریها» (Vulnerabilities) گریز بهدست پژوهشگران هستند، اما به حملاتی در فضای واقعی منجر نشدهاند.
استناد
محمدعلی کهندژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C20-S11
شناسهٔ محتوا KDJ-AI-2026E1-P03-C20-S11-8F836BD6
۲.۲.۵. راهکارهای کاهشی
کاهش حملات گریز دشوار است، زیرا نمونههای خصمانه در معماریهای گوناگون مدلهای ML و دامنههای کاربردی متعدد بهوفور یافت میشوند. از توضیحهای ممکن برای وجود نمونههای خصمانه این است که مدلهای ML در حوزه بینایی کامپیوتر بر ویژگیهای غیر استوار (non-robust) تکیه میکنند که با ادراک انسانی همراستا نیستند [174]. در سالهای اخیر، بسیاری از راهکارهای کاهشی پیشنهادشده در برابر نمونههای خصمانه در مواجهه با حملات قویتر ناکارآمد بودهاند. افزون بر این، چندین مقاله ارزیابیهای گستردهای انجام داده و شمار زیادی از راهکارهای پیشنهادی را شکست دادهاند:
- Carlini و Wagner نشان دادند چگونه میتوان از ۱۰ روش برای تشخیص نمونههای خصمانه عبور کرد و چندین رهنمود برای ارزیابی دفاعها توصیف نمودند [64]. کارهای اخیر نشان میدهد که تشخیص نمونههای خصمانه بهاندازه ساختن یک دفاع دشوار است [373]. بنابراین، این مسیر برای کاهش نمونههای خصمانه به همان اندازه طراحی دفاعها چالشبرانگیز است.
- حمله Obfuscated Gradients [20] بهطور خاص برای شکست دادن چندین دفاع پیشنهادی طراحی شد که برای محافظت در برابر حملات مبتنی بر بهینهسازی، بر پوشاندن گرادیانها تکیه میکنند. این حمله بر یک تکنیک جدید به نام Backward Pass Differentiable Approximation تکیه دارد که گرادیان را در طول گذر رو به عقبِ پسانتشار تقریب میزند و نشان داده شد که از چندین دفاع پیشنهادی مبتنی بر پوشاندن گرادیان عبور میکند.
- Tramèr و همکاران [375] روششناسیای برای طراحی حملات سازگارشونده در برابر دفاعهای پیشنهادی توصیف کردند و ۱۳ دفاع موجود را دور زدند. آنان طرفدار طراحی حملات سازگارشونده برای آزمودن دفاعهای تازهپیشنهادشدهاند، نه صرفاً آزمودن دفاعها در برابر حملات مشهور.
از میان گستره وسیع دفاعهای پیشنهادی در برابر حملات گریز خصمانه، سه کلاس اصلی تابآور از کار درآمدهاند و پتانسیل فراهمکردن راهکار کاهشی در برابر حملات گریز را دارند:
- آموزش خصمانه (Adversarial training): که توسط Goodfellow و همکاران [144] معرفی و توسط Madry و همکاران [232] توسعه یافت، یک روش عمومی است که دادههای آموزش را با نمونههای خصمانهای که بهصورت تکراری در طول آموزش با برچسبهای صحیح آنها تولید میشوند، غنی میکند. هرچه حملات خصمانه برای تولید نمونههای خصمانه قویتر باشند، مدل آموزشدیده تابآورتر میشود. آموزش خصمانه به مدلهایی با بار معنایی بیشتری نسبت به مدلهای استاندارد میانجامد [379]، اما این مزیت معمولاً به بهای کاهش دقت مدل روی دادههای پاک بهدست میآید. افزون بر این، آموزش خصمانه به دلیل تولید تکراری نمونههای خصمانه در طول آموزش، پرهزینه است.
- هموارسازی تصادفی (Randomized smoothing): که توسط Lecuyer و همکاران [207] پیشنهاد و توسط Cohen و همکاران [94] بهبود یافت، روشی است که هر طبقهبند را با تولید محتملترین پیشبینیها زیر اعوجاج نوفه گاوسی، به یک طبقهبند هموارِ با استواریِ اثباتپذیر تبدیل میکند. این روش به استواریِ اثباتپذیر برای حملات گریز _
_ 2 میانجامد، حتی برای طبقهبندهای آموزشدیده روی مجموعهدادههای بزرگمقیاس مانند ImageNet. هموارسازی تصادفی معمولاً پیشبینی گواهیشده را تنها برای زیرمجموعهای از نمونههای آزمون فراهم میکند که تعداد دقیق آن به عواملی مانند اندازه اعوجاجهای بالقوه یا ویژگیهای دادههای آموزش و مدل بستگی دارد. نتایج اخیر با ترکیب یک مدل احتمالاتی انتشار حذفنوفه از پیش آموزشدیده و یک طبقهبند استاندارد با دقت بالا، مفهوم استواریِ خصمانه گواهیشده را به اعوجاجهای محدودشده به نرم __ 2 تعمیم دادهاند [62]. Li و همکاران [211] یک ردهشناسی برای راستیآزمایی استواری و آموزش الگوریتمهای نماینده توسعه دادند. آنان همچنین ویژگیها، قوتها، محدودیتها و پیوندهای بنیادین میان این رویکردها را، همراه با موانع نظری پیشروی این حوزه، آشکار ساختند.
- راستیآزمایی صوری (Formal verification): روش دیگر برای گواهیکردن استواریِ خصمانه یک شبکه عصبی بر تکنیکهایی از FORMAL METHODS متکی است. Reluplex از حلکنندههای ارضاپذیری پیمانهای نظریهها (SMT) برای راستیآزمایی استواریِ شبکههای عصبی پیشخور کوچک استفاده میکند [191]. AI۲ نخستین روش راستیآزمایی قابلکاربرد بر شبکههای عصبی کانولوشنی با استفاده از تکنیکهای تفسیر انتزاعی است [136]. این روشها در سیستمهای راستیآزمایی پسین مانند DeepPoly [346]، ReluVal [394] و تصاویر هندسی سریع (Fast Geometric Projections, FGP) [131] تعمیم یافته و به شبکههای بزرگتر مقیاسپذیر شدهاند. تکنیکهای راستیآزمایی صوری پتانسیل چشمگیری برای گواهیکردن استواریِ شبکههای عصبی دارند، اما با محدودیتهای نبود مقیاسپذیری، هزینه محاسباتی، و محدودیت در نوع عملیات جبری پشتیبانیشده مانند جمع و ضرب و غیره روبهرو هستند.
همه این راهکارهای کاهشی پیشنهادی، موازنههای ذاتی میان استواری و دقت را نشان میدهند و هزینههای محاسباتی بیشتری در طول آموزش به همراه دارند. بنابراین، طراحی مدلهای ML که در برابر گریز مقاومت کنند و در عین حال دقت را حفظ نمایند، همچنان یک مسئله باز است. ر.ک. بخش 4.1.1 برای بحث بیشتر درباره این موازنهها.
استناد
محمدعلی کهندژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C20-S12
شناسهٔ محتوا KDJ-AI-2026E1-P03-C20-S12-EC9735A3
۲.۳. حملات و کاهشهای مسمومسازی
حملات مسمومسازی بهطور کلی بهعنوان حملات خصمانه در مرحله آموزش الگوریتم یادگیری ماشین تعریف میشوند. نخستین حمله مسمومسازی شناختهشده برای تولید امضای کرم در سال ۲۰۰۶ توسعه یافت [291]. از آن زمان، حملات مسمومسازی در چندین حوزه کاربردی بهطور گسترده مطالعه شدهاند: امنیت رایانهای (برای تشخیص هرزنامه [269]، تشخیص نفوذ شبکه [384]، پیشبینی آسیبپذیری [318]، طبقهبندی بدافزار [329, 412])، بینایی رایانهای [137, 148, 330]، پردازش زبان طبیعی (NLP) [82, 213, 388]، و دادههای جدولی در حوزههای سلامت و امور مالی [179]. بهتازگی، حملات مسمومسازی در کاربردهای صنعتی نیز توجه بیشتری جلب کردهاند [199]. حتی میتوان این حملات را در مقیاس بزرگ هماهنگ کرد، بهگونهای که مهاجمی با منابع مالی محدود بتواند بخشی از مجموعهدادههای عمومی مورد استفاده برای آموزش مدل را کنترل کند [57].
حملات مسمومسازی قدرتمند هستند و میتوانند نقض دسترسپذیری یا یکپارچگی ایجاد کنند. حملات مسمومسازی دسترسپذیری معمولاً باعث افت بیهدف و گزینشناپذیر عملکرد مدل یادگیری ماشین روی همه نمونهها میشوند، درحالیکه حملات مسمومسازی هدفمند و حملات مسمومسازی درِ پشتی، نقض یکپارچگی را بر روی مجموعه کوچکی از نمونههای هدف ایجاد میکنند. حملات مسمومسازی از طیف گستردهای از قابلیتهای خصمانه (مثلاً مسمومسازی داده، مسمومسازی مدل، کنترل برچسبها، کنترل کد منبع، و کنترل دادههای آزمون) بهره میگیرند و به چند زیرمجموعه از حملات مسمومسازی منجر میشوند. این حملات در شرایط جعبهسفید [40, 179, 412]، جعبهخاکستری [179]، و جعبهسیاه [39] توسعه یافتهاند.
این بخش، حملات مسمومسازی دسترسپذیری، مسمومسازی هدفمند، مسمومسازی درِ پشتی، و مسمومسازی مدل را بر اساس هدف خصمانه آنها طبقهبندی میکند. برای هر رده از حملات مسمومسازی، تکنیکهای اجرای حمله، کاهشهای موجود، و محدودیتهای آنها نیز بحث میشود. طبقهبندی حملات مسمومسازی در این سند از چارچوب توسعهیافته توسط Cinà et al. [91] الهام گرفته شده که ارجاعهای بیشتری به حملات و کاهشهای مسمومسازی را در بر میگیرد.
استناد
محمدعلی کهندژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C20-S13
شناسهٔ محتوا KDJ-AI-2026E1-P03-C20-S13-E6E1357D