رفتن به محتوای اصلی
کهن‌دژکتاب مرجع هوش مصنوعی
منابعاعتبارسنجی
فهرست این فصلبخش ۳، فصل ۲۰ — صفحهٔ ۲ از ۴

بخش ۳، فصل ۲۰ — صفحهٔ ۲ از ۴

رده‌بندی هوش مصنوعی پیش‌بین (Predictive AI, PredAI)

متن اصلی فارسی با منشأ، شناسه و پیوند استناد پایدار.

۲.۲.۱. حملات گریز جعبه‌سفید

ترجمهٔ منبع

در «مدل تهدید» (Threat Model) جعبه‌سفید، مهاجم آگاهی کاملی از معماری و پارامترهای مدل دارد، چنان‌که در بخش 2.1.4 بحث شد. چالش اصلی برای ساخت «نمونه‌های خصمانه» (adversarial examples) در این حالت، یافتن یک اغتشاش است که به یک نمونه آزمونی افزوده می‌شود و برچسب طبقه‌بندی آن را تغییر می‌دهد؛ اغلب با محدودیت‌هایی بر ویژگی‌هایی مانند محسوس‌بودن یا اندازه اغتشاش. در مدل تهدید جعبه‌سفید، رایج است که نمونه‌های خصمانه با حل یک مسئله بهینه‌سازی که از دیدگاه مهاجم نوشته می‌شود ساخته شوند؛ این مسئله تابع هدف بهینه‌سازی (مانند تغییر برچسب هدف به یک کلاس معیّن) و همچنین یک «سنجه» (Metrics) فاصله برای «سنجش» (Measure) شباهت میان نمونه آزمونی و نمونه خصمانه را مشخص می‌کند.

روش‌های مبتنی بر بهینه‌سازی. Szedegy و همکاران [362] و Biggio و همکاران [38] به‌طور مستقل استفاده از تکنیک‌های بهینه‌سازی را برای تولید نمونه‌های خصمانه پیشنهاد کردند. در مدل‌های تهدید آنان، به حریف اجازه داده می‌شود تمامیت مدل ML را بازرسی کند و گرادیان‌ها را نسبت به تابع هزینه مدل محاسبه نماید. این حملات می‌توانند هدف‌مند باشند (یعنی کلاس نمونه خصمانه توسط مهاجم انتخاب می‌شود) یا بدون‌هدف (یعنی نمونه‌های خصمانه به هر کلاس نادرست دیگری طبقه‌بندی نادرست می‌شوند).

Szedegy و همکاران [362] اصطلاح پرکاربرد «نمونه‌های خصمانه» را ابداع کردند. آنان هدفی را در نظر گرفتند که نُرم _`_ 2 اغتشاش را به‌شرط تغییر پیش‌بینی مدل به کلاس هدف کمینه می‌کرد. بهینه‌سازی با روش limited-memory Broyden–Fletcher–Goldfarb–Shanno (L-BFGS) حل می‌شود. Biggio و همکاران [38] حالت یک طبقه‌بند دودویی با کلاس‌های مخرب و سالم دارای یک تابع تمایزی پیوسته و مشتق‌پذیر را در نظر گرفتند. هدف بهینه‌سازی، کمینه‌کردن تابع تمایزی است تا نمونه‌های خصمانه با بیشترین اطمینان تولید شوند.

در حالی که Biggio و همکاران [38] روش خود را بر طبقه‌بندهای خطی، SVM هسته‌ای و پرسپترون‌های چندلایه اعمال کردند، Szedegy و همکاران [362] وجود نمونه‌های خصمانه را روی مدل‌های «یادگیری عمیق» (Deep Learning) به‌کاررفته در طبقه‌بندی تصویر نشان دادند. Goodfellow و همکاران [144] روشی کارآمد برای تولید نمونه‌های خصمانه در یادگیری عمیق معرفی کردند: «روش علامت گرادیان سریع» (Fast Gradient Sign Method، FGSM)، که تنها یک تکرار گرادیان نزولی را برای حل بهینه‌سازی انجام می‌دهد. این روش توسط Kurakin و همکاران [200] به یک حمله FGSM تکراری بسط داده شده است.

آثار بعدی اهداف و روش‌های جدیدی برای بهینه‌سازی تولید نمونه‌های خصمانه با هدف‌های کمینه‌کردن اغتشاش‌ها و پشتیبانی از سنجه‌های فاصله متعدد پیشنهاد کرده‌اند. برخی از حملات قابل‌توجه عبارت‌اند از:

  • DeepFool یک حمله گریز بدون‌هدف برای نُرم‌های _`_ 2 است که از تقریب خطی شبکه عصبی برای ساخت نمونه‌های خصمانه استفاده می‌کند [257].
  • حمله Carlini-Wagner از اهداف متعددی استفاده می‌کند که هزینه یا لاجیت‌ها را روی کلاس هدف و فاصله میان نمونه خصمانه و نمونه اصلی کمینه می‌کنند. این حمله از طریق روش جریمه بهینه می‌شود [65] و سه سنجه فاصله برای سنجش اغتشاش‌های نمونه‌های خصمانه را در نظر می‌گیرد: __ 0 ، __ 2 و _`_ ∞ . این حمله در برابر دفاع تقطیر دفاعی مؤثر بوده است [284].
  • حمله Projected Gradient Descent (PGD) [232] تابع هزینه را کمینه می‌کند و نمونه‌های خصمانه را در هر تکرار گرادیان نزولی به فضای اغتشاش‌های مجاز تصویر می‌کند. PGD را می‌توان به سنجه‌های فاصله __ 2 و __ ∞ برای سنجش اغتشاش نمونه‌های خصمانه اعمال کرد.

حملات گریز همگانی. Moosavi-Dezfooli و همکاران [256] نشان دادند چگونه می‌توان اغتشاش‌های همگانی کوچکی (نسبت به برخی نُرم‌ها) ساخت که می‌توان آن‌ها را به بیشتر تصاویر افزود و به طبقه‌بندی نادرست واداشت. تکنیک آنان بر بهینه‌سازی متوالی اغتشاش همگانی با استفاده از مجموعه‌ای از نقاط نمونه‌برداری‌شده از توزیع داده‌ها متکی است. این یک نوع «حمله کارکردی» (Functional Attack) است. یک مشاهده جالب آن است که اغتشاش‌های همگانی در میان معماری‌های شبکه‌های عمیق تعمیم می‌یابند؛ این امر حاکی از شباهت در مرزهای تصمیمی است که مدل‌های مختلف برای یک وظیفه واحد آموزش دیده‌اند.

حملات قابل‌تحقق فیزیکی. این‌ها حملاتی در برابر سیستم‌های ML هستند که می‌توان آن‌ها را به‌طور عملی در دنیای فیزیکی پیاده‌سازی کرد [21، 200، 227]. یکی از نخستین نمونه‌ها، حمله به سیستم‌های تشخیص چهره توسط Sharif و همکاران [332] بود. این حمله با چاپ یک جفت قاب عینک قابل تحقق است و سیستم‌های تشخیص چهره را چنان گمراه می‌کند که یا از «تشخیص» (Detection) بگریزند یا خود را به‌جای فرد دیگری جا بزنند. Eykholt و همکاران [122] حمله‌ای برای تولید اغتشاش‌های استوار در شرایط مختلف پیشنهاد کردند که به نمونه‌های خصمانه‌ای می‌انجامد که می‌توانند در محیط‌های فیزیکی گوناگون از طبقه‌بندهای بینایی بگریزند. این حمله برای گریز از یک طبقه‌بند تشخیص تابلوهای راهنمایی به‌کار می‌رود که در آن برچسب‌های سیاه و سفید به‌صورت فیزیکی روی تابلوها الصاق می‌شوند. حمله ShapeShifter [81] برای گریز از آشکارسازهای اشیاء طراحی شد؛ مسئله‌ای که چالش‌برانگیزتر از حمله به طبقه‌بندهای تصویر است، زیرا مهاجم باید از طبقه‌بندی در چندین کادر محدودکننده با مقیاس‌های مختلف بگریزد. این حمله همچنین مستلزم آن است که اغتشاش به‌اندازه کافی استوار باشد تا در برابر اعوجاج‌های دنیای واقعی ناشی از فواصل دید، زاویه‌ها، شرایط نورپردازی و محدودیت‌های دوربین دوام بیاورد.

مدالیته‌های داده دیگر. در کاربردهای بینایی کامپیوتر، نمونه‌های خصمانه اغلب به‌گونه‌ای طراحی می‌شوند که برای انسان نامحسوس باشند. بنابراین اغتشاش‌هایی که مهاجمان ایجاد می‌کنند باید چنان کوچک باشند که انسان تصاویر را به‌درستی تشخیص دهد، در حالی که طبقه‌بند ML فریب خورده و پیش‌بینی خود را تغییر می‌دهد. در مقابل، ممکن است یک شیء ماشه‌ای در تصویر وجود داشته باشد که همچنان برای انسان نامحسوس یا بی‌ضرر است اما موجب طبقه‌بندی نادرست مدل می‌شود. مفهوم نمونه‌های خصمانه به «دامنه» (domain)‌های دیگری مانند صوت، ویدئو، «پردازش زبان طبیعی» (Natural Language Processing، NLP) و امنیت سایبری بسط داده شده است. در برخی از این حالت‌ها، محدودیت‌های اضافی وجود دارد که نمونه‌های خصمانه باید رعایت کنند، مانند معناشناسی متن در NLP و محدودیت‌های کاربردی در امنیت سایبری. چند اثر نماینده عبارت‌اند از:

  • صوت: Carlini و Wagner [66] یک حمله هدف‌مند بر مدل‌هایی که از گفتار متن تولید می‌کنند را نشان دادند. آنان می‌توانند یک شکل‌موج صوتی تولید کنند که به یک نمونه موجود بسیار شبیه است اما می‌تواند به هر متنی به انتخاب مهاجم رونویسی شود.
  • ویدئو: حملات گریز خصمانه در برابر مدل‌های طبقه‌بندی ویدئو را می‌توان به حملات تنک که تعداد کمی از فریم‌های ویدئو را دچار اغتشاش می‌کنند [401] و حملات متراکم که همه فریم‌های یک ویدئو را دچار اغتشاش می‌کنند [215] تقسیم کرد. هدف مهاجم، تغییر برچسب طبقه‌بندی ویدئو است.
  • متن: Jia و Liang [185] روشی برای تولید نمونه‌های متنی خصمانه توسعه دادند. این کار پیشگام با بسیاری از پیشرفت‌ها در توسعه حملات خصمانه بر مدل‌های پردازش زبان طبیعی (NLP) دنبال شد (ر.ک. یک مرور جامع در این موضوع [438]). La Malfa و Kwiatkowska [202] روشی برای صورت‌بندی رسمی تعریف‌های اغتشاش در NLP با معرفی مفهوم استواری معنایی پیشنهاد کردند. چالش‌های اصلی در NLP آن است که دامنه گسسته است نه پیوسته (مانند طبقه‌بندی تصویر، صوت و ویدئو)، و نمونه‌های خصمانه باید معناشناسی متن را رعایت کنند. این چالش‌ها در حمله اخیر ASCIIart [186] علیه چت‌بات‌ها نشان داده شده‌اند. تصویری به سبک هنر ASCII از یک واژه ممنوع، چت‌بات را چنان فریب می‌دهد که اطلاعات زیان‌بار را ارائه کند، حتی وقتی چت‌بات واژه ساده انگلیسی را به‌درستی سانسور می‌کند. فاصله معنایی میان این دو درخواست دقیقاً صفر است و هر دو می‌بایست یکسان رفتار می‌شدند.
  • امنیت سایبری: در کاربردهای امنیت سایبری، نمونه‌های خصمانه باید محدودیت‌های تحمیلی از سوی معناشناسی کاربرد و بازنمایی ویژگی‌های داده‌های سایبری، مانند ترافیک شبکه یا فایل‌های باینری برنامه‌ها، را رعایت کنند. FENCE یک چارچوب کلی برای ساخت حملات گریز جعبه‌سفید با استفاده از بهینه‌سازی گرادیانی در دامنه‌های گسسته است و از طیفی از وابستگی‌های ویژگی خطی و آماری پشتیبانی می‌کند [88]. FENCE به دو کاربرد امنیت شبکه اعمال شده است: تشخیص دامنه مخرب و طبقه‌بندی ترافیک شبکه مخرب. Sheatsley و همکاران [334] روشی پیشنهاد کردند که محدودیت‌ها را در فضای ویژگی با استفاده از منطق صوری می‌آموزد و نمونه‌های خصمانه را با تصویرکردن آن‌ها بر فضایی سازگار با محدودیت‌ها می‌سازد. آنان این تکنیک را بر طبقه‌بندهای تشخیص نفوذ شبکه و فیشینگ اعمال کردند. هر دو مقاله مشاهده کردند که حملات برآمده از دامنه‌های پیوسته را نمی‌توان به‌سادگی در محیط‌های مقیدشده به‌کار برد، زیرا به نمونه‌های خصمانه غیرقابل‌تحقق می‌انجامند. Pierazzi و همکاران [295] دشواری اجرای حملات گریز قابل‌تحقق در امنیت سایبری را به دلیل محدودیت‌های فضای ویژگی و چالش نگاشت حملات از فضای ویژگی به فضای مسئله بررسی کردند. آنان حملات گریز را در فضای مسئله صورت‌بندی و نمونه‌های خصمانه قابل‌تحققی برای بدافزار اندروید ساختند.
استناد

محمدعلی کهن‌دژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C20-S08

شناسهٔ محتوا KDJ-AI-2026E1-P03-C20-S08-ADCCAA04

پیوند مستقیم این بخش

۲.۲.۲. حملات گریز جعبه‌سیاه

ترجمهٔ منبع

[ NISTAML.025 ]

حملات گریز جعبه‌سیاه در چارچوب یک مدل خصمانهٔ واقع‌بینانه طراحی می‌شوند که در آن مهاجم هیچ آگاهی پیشینی دربارهٔ معماری مدل یا داده‌های آموزش ندارد. در عوض، مهاجم می‌تواند با یک مدل ML آموزش‌دیده از طریق پرس‌وجو روی نمونه‌های داده‌ای گوناگون و دریافت پیش‌بینی‌های مدل تعامل کند. APIهای مشابهی توسط MLaaS ارائه‌شده از سوی ارائه‌دهندگان ابری عمومی فراهم می‌شود که در آن کاربران می‌توانند پیش‌بینی‌های مدل را روی پرس‌وجوهای منتخب بدون اطلاع از نحوهٔ آموزش مدل به‌دست آورند. در ادبیات موضوع، دو ردهٔ اصلی از حملات گریز جعبه‌سیاه وجود دارد:

  • حملات مبتنی بر امتیاز: در این حالت، مهاجمان امتیازهای اطمینان یا لوجیت‌های مدل را به‌دست می‌آورند و می‌توانند از تکنیک‌های بهینه‌سازی گوناگون برای ساخت «نمونه‌های خصمانه» (adversarial examples) استفاده کنند. یک روش رایج، بهینه‌سازی مرتبهٔ صفر است که گرادیان‌های مدل را بدون محاسبهٔ صریح مشتقات تخمین می‌زند [80, 173]. سایر تکنیک‌های بهینه‌سازی شامل بهینه‌سازی گسسته [254]، راهبردهای تکامل طبیعی [172] و گشت‌زنی تصادفی [262] است.
  • حملات مبتنی بر تصمیم: در این حالت محدودتر، مهاجمان تنها برچسب‌های نهایی پیش‌بینی‌شدهٔ مدل را به‌دست می‌آورند. نخستین روش برای تولید حملات گریز، Boundary Attack بود که بر پایهٔ گشت‌زنی تصادفی در امتداد مرز تصمیم و نمونه‌گیری پس‌زنی استوار بود [47] و با بهبود تخمین گرادیان به‌منظور کاهش تعداد پرس‌وجوها در HopSkipJumpAttack توسعه یافت [79]. اخیراً چندین روش بهینه‌سازی جهت نزدیک‌ترین مرز تصمیم را جست‌وجو می‌کنند (مانند حملهٔ OPT [86])، به‌جای جست‌وجوی دودویی از sign SGD استفاده می‌کنند (مانند حملهٔ Sign-OPT [87]) یا از بهینه‌سازی بیزی بهره می‌برند [344].

چالش اصلی در ساخت نمونه‌های خصمانه در حالت‌های جعبه‌سیاه، کاهش تعداد پرس‌وجوها به مدل‌های ML است. تکنیک‌های اخیر می‌توانند طبقه‌بندهای ML را با تعداد نسبتاً کمی پرس‌وجو — معمولاً کمتر از ۱۰۰۰ — با موفقیت دور بزنند [344].

استناد

محمدعلی کهن‌دژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C20-S09

شناسهٔ محتوا KDJ-AI-2026E1-P03-C20-S09-F5A1A548

پیوند مستقیم این بخش

۲.۲.۳. انتقال‌پذیری حملات

ترجمهٔ منبع

روش دیگر برای تولید حملات خصمانه در شرایط مدل‌های تهدید محدودشده، انتقال حمله‌ای است که روی یک مدل ML متفاوت ساخته شده است. به‌طور معمول، مهاجم یک مدل ML جایگزین آموزش می‌دهد، حملات خصمانهٔ جعبه‌سفید را روی مدل جایگزین تولید می‌کند و حملات را به مدل هدف منتقل می‌کند. روش‌های گوناگون در نحوهٔ آموزش مدل‌های جایگزین با یکدیگر تفاوت دارند. برای مثال، Papernot و همکاران [282, 283] مدل جایگزین را با پرس‌وجوهای مبتنی بر امتیاز به مدل هدف آموزش می‌دهند، در حالی که چندین مقاله یک گروهِ مجموعه‌ای از مدل‌ها را بدون پرس‌وجوی صریح از مدل هدف آموزش می‌دهند [218, 377, 397].

«انتقال‌پذیری» (Transferability) حملات پدیده‌ای جذاب است و ادبیات موجود می‌کوشد دلایل بنیادین انتقال «نمونه‌های خصمانه» (adversarial examples) میان مدل‌ها را درک کند. چندین مقاله مشاهده کرده‌اند که مدل‌های متفاوت در هر دو بُعد خوش‌خیم و خصمانه مرزهای تصمیمِ متقاطع می‌آموزند و این امر به انتقال‌پذیری بهتر می‌انجامد [144, 256, 377]. Demontis و همکاران [104] دو عامل اصلی را شناسایی کرده‌اند که به انتقال‌پذیری حملات، هم برای «گریز» (Evasion) و هم برای «مسموم‌سازی» (Poisoning)، کمک می‌کنند: آسیب‌پذیری خصمانهٔ ذاتی مدل هدف و «پیچیدگی» (Complexity) مدل جانشینِ به‌کاررفته برای بهینه‌سازی حمله. EXPECTATION OVER TRANSFORMATION با هدف ساخته می‌شود که نمونه‌های خصمانه در برابر تبدیل‌های تصویری رخ‌داده در دنیای واقعی، مانند تغییر زاویه و زاویهٔ دید، پایداری کنند [21].

استناد

محمدعلی کهن‌دژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C20-S10

شناسهٔ محتوا KDJ-AI-2026E1-P03-C20-S10-55C0BFC6

پیوند مستقیم این بخش

۲.۲.۴. حملات گریز در دنیای واقعی

ترجمهٔ منبع

اگرچه بسیاری از حملاتی که در این بخش بحث شد تنها در محیط‌های پژوهشی به نمایش گذاشته شده‌اند، چندین حمله گریز در دنیای واقعی نیز اثبات شده است و ما نمونه‌های برجسته آن‌ها را در سیستم‌های تشخیص چهره، تشخیص صفحات وب فیشینگ و طبقه‌بندی بدافزار بررسی می‌کنیم.

سیستم‌های تشخیص چهره که برای تأیید هویت به کار می‌روند، هدف حملات گریز خصمانه قرار گرفته‌اند؛ زیرا این سیستم‌ها نقطه ورود به سیستم‌های حیاتی محسوب می‌شوند و به کاربران امکان ارتکاب تقلب مالی را می‌دهند. در نیمه دوم سال ۲۰۲۰، سرویس تشخیص چهره ID.me بیش از ۸۰٬۰۰۰ مورد تلاش کاربران برای فریب مراحل تأیید هویت خود را شناسایی کرد؛ مراحلی که توسط چندین آژانس نیروی کار ایالتی استفاده می‌شد [276]. این حملات شامل مواردی مانند استفاده افراد از ماسک، به‌کارگیری deepfakeها، یا استفاده از تصاویر و ویدئوهای افراد دیگر بود. هدف، ادعای تقلبی مزایای بیکاری بود که در چارچوب اقدامات امداد کووید ارائه شده بود. بعدها در سال ۲۰۲۲، به گفته دادستان‌های فدرال ایالات متحده، مردی از نیوجرسی توانست به‌عنوان بخشی از طرح تقلب به ارزش ۲٫۵ میلیون دلار در مزایای بیکاری، گواهینامه‌های جعلی رانندگی را از طریق ID.me تأیید کند. در این مورد، مظنون از کلاه‌گیس‌های متنوعی برای گریز از سیستم تشخیص چهره استفاده کرد [156].

مطالعه موردی دیگر از حملات گریز در دنیای واقعی که توسط Apruzzese et al. گزارش شده است [17]، حمله‌ای به یک تشخیص‌دهنده تجاری صفحات وب فیشینگ است. تشخیص‌دهنده فیشینگ مبتنی بر ML، مجموعه‌ای از چندین مدل است که جنبه‌های مختلف تصویر را برای تعیین اینکه آیا یک تلاش فیشینگ هست تحلیل می‌کنند. ورودی‌هایی که توسط مدل نامطمئن علامت‌گذاری می‌شوند، برای بررسی به تحلیلگران امنیت ارجاع داده می‌شوند. نویسندگان از میان ۴۶۰۰ نمونه که توسط سیستم طبقه‌بندی تصویر ML نامطمئن علامت‌گذاری شده بودند، ۱۰۰ «نمونه‌های خصمانه» (adversarial examples) شناسایی کردند. نکته جالب اینکه تحلیل دستی این نمونه‌های خصمانه نشان داد که مهاجمان از حملات مبتنی بر بهینه‌سازی استفاده نمی‌کنند، بلکه از روش‌های نسبتاً ساده‌ای برای گریز بهره می‌گیرند؛ مانند برش تصویر، ماسک‌گذاری یا تکنیک‌های تار کردن.

نمونه‌های دیگر حملات گریز که پژوهشگران در زمینه طبقه‌بندی بدافزار نشان داده‌اند، در پایگاه دانش MITRE Adversarial Threat Landscape for Artificial-Intelligence Systems (ATLAS) فهرست‌بندی شده‌اند [248]. شرکت Palo Alto Networks حملات گریز را علیه یک تشخیص‌دهنده یادگیری عمیق برای ترافیک فرماندهی و کنترل بدافزار و همچنین یک تشخیص‌دهنده «الگوریتم تولید دامنه» (Domain Generation Algorithm, DGA) بات‌نت گزارش کرده است. نمونه‌ای از یک حمله گریز فراگیر علیه مدل تشخیص بدافزار مبتنی بر هوش مصنوعی شرکت Cylance کشف شد. پژوهشگران همچنین با آموزش یک مدل ML سایه و استفاده از بینش‌های حاصل از آن برای حمله به سیستم واقعی، از سیستم محافظت از ایمیل شرکت ProofPoint عبور کردند. این موارد نمایشی از «آسیب‌پذیری‌ها» (Vulnerabilities) گریز به‌دست پژوهشگران هستند، اما به حملاتی در فضای واقعی منجر نشده‌اند.

استناد

محمدعلی کهن‌دژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C20-S11

شناسهٔ محتوا KDJ-AI-2026E1-P03-C20-S11-8F836BD6

پیوند مستقیم این بخش

۲.۲.۵. راهکارهای کاهشی

ترجمهٔ منبع

کاهش حملات گریز دشوار است، زیرا نمونه‌های خصمانه در معماری‌های گوناگون مدل‌های ML و دامنه‌های کاربردی متعدد به‌وفور یافت می‌شوند. از توضیح‌های ممکن برای وجود نمونه‌های خصمانه این است که مدل‌های ML در حوزه بینایی کامپیوتر بر ویژگی‌های غیر استوار (non-robust) تکیه می‌کنند که با ادراک انسانی هم‌راستا نیستند [174]. در سال‌های اخیر، بسیاری از راهکارهای کاهشی پیشنهادشده در برابر نمونه‌های خصمانه در مواجهه با حملات قوی‌تر ناکارآمد بوده‌اند. افزون بر این، چندین مقاله ارزیابی‌های گسترده‌ای انجام داده و شمار زیادی از راهکارهای پیشنهادی را شکست داده‌اند:

  • Carlini و Wagner نشان دادند چگونه می‌توان از ۱۰ روش برای تشخیص نمونه‌های خصمانه عبور کرد و چندین رهنمود برای ارزیابی دفاع‌ها توصیف نمودند [64]. کارهای اخیر نشان می‌دهد که تشخیص نمونه‌های خصمانه به‌اندازه ساختن یک دفاع دشوار است [373]. بنابراین، این مسیر برای کاهش نمونه‌های خصمانه به همان اندازه طراحی دفاع‌ها چالش‌برانگیز است.
  • حمله Obfuscated Gradients [20] به‌طور خاص برای شکست دادن چندین دفاع پیشنهادی طراحی شد که برای محافظت در برابر حملات مبتنی بر بهینه‌سازی، بر پوشاندن گرادیان‌ها تکیه می‌کنند. این حمله بر یک تکنیک جدید به نام Backward Pass Differentiable Approximation تکیه دارد که گرادیان را در طول گذر رو به عقبِ پس‌انتشار تقریب می‌زند و نشان داده شد که از چندین دفاع پیشنهادی مبتنی بر پوشاندن گرادیان عبور می‌کند.
  • Tramèr و همکاران [375] روش‌شناسی‌ای برای طراحی حملات سازگارشونده در برابر دفاع‌های پیشنهادی توصیف کردند و ۱۳ دفاع موجود را دور زدند. آنان طرفدار طراحی حملات سازگارشونده برای آزمودن دفاع‌های تازه‌پیشنهادشده‌اند، نه صرفاً آزمودن دفاع‌ها در برابر حملات مشهور.

از میان گستره وسیع دفاع‌های پیشنهادی در برابر حملات گریز خصمانه، سه کلاس اصلی تاب‌آور از کار درآمده‌اند و پتانسیل فراهم‌کردن راهکار کاهشی در برابر حملات گریز را دارند:

  1. آموزش خصمانه (Adversarial training): که توسط Goodfellow و همکاران [144] معرفی و توسط Madry و همکاران [232] توسعه یافت، یک روش عمومی است که داده‌های آموزش را با نمونه‌های خصمانه‌ای که به‌صورت تکراری در طول آموزش با برچسب‌های صحیح آن‌ها تولید می‌شوند، غنی می‌کند. هرچه حملات خصمانه برای تولید نمونه‌های خصمانه قوی‌تر باشند، مدل آموزش‌دیده تاب‌آورتر می‌شود. آموزش خصمانه به مدل‌هایی با بار معنایی بیشتری نسبت به مدل‌های استاندارد می‌انجامد [379]، اما این مزیت معمولاً به بهای کاهش دقت مدل روی داده‌های پاک به‌دست می‌آید. افزون بر این، آموزش خصمانه به دلیل تولید تکراری نمونه‌های خصمانه در طول آموزش، پرهزینه است.
  1. هموارسازی تصادفی (Randomized smoothing): که توسط Lecuyer و همکاران [207] پیشنهاد و توسط Cohen و همکاران [94] بهبود یافت، روشی است که هر طبقه‌بند را با تولید محتمل‌ترین پیش‌بینی‌ها زیر اعوجاج نوفه گاوسی، به یک طبقه‌بند هموارِ با استواریِ اثبات‌پذیر تبدیل می‌کند. این روش به استواریِ اثبات‌پذیر برای حملات گریز __ 2 می‌انجامد، حتی برای طبقه‌بندهای آموزش‌دیده روی مجموعه‌داده‌های بزرگ‌مقیاس مانند ImageNet. هموارسازی تصادفی معمولاً پیش‌بینی گواهی‌شده را تنها برای زیرمجموعه‌ای از نمونه‌های آزمون فراهم می‌کند که تعداد دقیق آن به عواملی مانند اندازه اعوجاج‌های بالقوه یا ویژگی‌های داده‌های آموزش و مدل بستگی دارد. نتایج اخیر با ترکیب یک مدل احتمالاتی انتشار حذف‌نوفه از پیش آموزش‌دیده و یک طبقه‌بند استاندارد با دقت بالا، مفهوم استواریِ خصمانه گواهی‌شده را به اعوجاج‌های محدودشده به نرم __ 2 تعمیم داده‌اند [62]. Li و همکاران [211] یک رده‌شناسی برای راستی‌آزمایی استواری و آموزش الگوریتم‌های نماینده توسعه دادند. آنان همچنین ویژگی‌ها، قوت‌ها، محدودیت‌ها و پیوندهای بنیادین میان این رویکردها را، همراه با موانع نظری پیش‌روی این حوزه، آشکار ساختند.
  1. راستی‌آزمایی صوری (Formal verification): روش دیگر برای گواهی‌کردن استواریِ خصمانه یک شبکه عصبی بر تکنیک‌هایی از FORMAL METHODS متکی است. Reluplex از حل‌کننده‌های ارضاپذیری پیمانه‌ای نظریه‌ها (SMT) برای راستی‌آزمایی استواریِ شبکه‌های عصبی پیش‌خور کوچک استفاده می‌کند [191]. AI۲ نخستین روش راستی‌آزمایی قابل‌کاربرد بر شبکه‌های عصبی کانولوشنی با استفاده از تکنیک‌های تفسیر انتزاعی است [136]. این روش‌ها در سیستم‌های راستی‌آزمایی پسین مانند DeepPoly [346]، ReluVal [394] و تصاویر هندسی سریع (Fast Geometric Projections, FGP) [131] تعمیم یافته و به شبکه‌های بزرگ‌تر مقیاس‌پذیر شده‌اند. تکنیک‌های راستی‌آزمایی صوری پتانسیل چشمگیری برای گواهی‌کردن استواریِ شبکه‌های عصبی دارند، اما با محدودیت‌های نبود مقیاس‌پذیری، هزینه محاسباتی، و محدودیت در نوع عملیات جبری پشتیبانی‌شده مانند جمع و ضرب و غیره روبه‌رو هستند.

همه این راهکارهای کاهشی پیشنهادی، موازنه‌های ذاتی میان استواری و دقت را نشان می‌دهند و هزینه‌های محاسباتی بیشتری در طول آموزش به همراه دارند. بنابراین، طراحی مدل‌های ML که در برابر گریز مقاومت کنند و در عین حال دقت را حفظ نمایند، همچنان یک مسئله باز است. ر.ک. بخش 4.1.1 برای بحث بیشتر درباره این موازنه‌ها.

استناد

محمدعلی کهن‌دژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C20-S12

شناسهٔ محتوا KDJ-AI-2026E1-P03-C20-S12-EC9735A3

پیوند مستقیم این بخش

۲.۳. حملات و کاهش‌های مسموم‌سازی

ترجمهٔ منبع

حملات مسموم‌سازی به‌طور کلی به‌عنوان حملات خصمانه در مرحله آموزش الگوریتم یادگیری ماشین تعریف می‌شوند. نخستین حمله مسموم‌سازی شناخته‌شده برای تولید امضای کرم در سال ۲۰۰۶ توسعه یافت [291]. از آن زمان، حملات مسموم‌سازی در چندین حوزه کاربردی به‌طور گسترده مطالعه شده‌اند: امنیت رایانه‌ای (برای تشخیص هرزنامه [269]، تشخیص نفوذ شبکه [384]، پیش‌بینی آسیب‌پذیری [318]، طبقه‌بندی بدافزار [329, 412])، بینایی رایانه‌ای [137, 148, 330]، پردازش زبان طبیعی (NLP) [82, 213, 388]، و داده‌های جدولی در حوزه‌های سلامت و امور مالی [179]. به‌تازگی، حملات مسموم‌سازی در کاربردهای صنعتی نیز توجه بیشتری جلب کرده‌اند [199]. حتی می‌توان این حملات را در مقیاس بزرگ هماهنگ کرد، به‌گونه‌ای که مهاجمی با منابع مالی محدود بتواند بخشی از مجموعه‌داده‌های عمومی مورد استفاده برای آموزش مدل را کنترل کند [57].

حملات مسموم‌سازی قدرتمند هستند و می‌توانند نقض دسترس‌پذیری یا یکپارچگی ایجاد کنند. حملات مسموم‌سازی دسترس‌پذیری معمولاً باعث افت بی‌هدف و گزینش‌ناپذیر عملکرد مدل یادگیری ماشین روی همه نمونه‌ها می‌شوند، درحالی‌که حملات مسموم‌سازی هدفمند و حملات مسموم‌سازی درِ پشتی، نقض یکپارچگی را بر روی مجموعه کوچکی از نمونه‌های هدف ایجاد می‌کنند. حملات مسموم‌سازی از طیف گسترده‌ای از قابلیت‌های خصمانه (مثلاً مسموم‌سازی داده، مسموم‌سازی مدل، کنترل برچسب‌ها، کنترل کد منبع، و کنترل داده‌های آزمون) بهره می‌گیرند و به چند زیرمجموعه از حملات مسموم‌سازی منجر می‌شوند. این حملات در شرایط جعبه‌سفید [40, 179, 412]، جعبه‌خاکستری [179]، و جعبه‌سیاه [39] توسعه یافته‌اند.

این بخش، حملات مسموم‌سازی دسترس‌پذیری، مسموم‌سازی هدفمند، مسموم‌سازی درِ پشتی، و مسموم‌سازی مدل را بر اساس هدف خصمانه آن‌ها طبقه‌بندی می‌کند. برای هر رده از حملات مسموم‌سازی، تکنیک‌های اجرای حمله، کاهش‌های موجود، و محدودیت‌های آن‌ها نیز بحث می‌شود. طبقه‌بندی حملات مسموم‌سازی در این سند از چارچوب توسعه‌یافته توسط Cinà et al. [91] الهام گرفته شده که ارجاع‌های بیشتری به حملات و کاهش‌های مسموم‌سازی را در بر می‌گیرد.

استناد

محمدعلی کهن‌دژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C20-S13

شناسهٔ محتوا KDJ-AI-2026E1-P03-C20-S13-E6E1357D

پیوند مستقیم این بخش