رفتن به محتوای اصلی
کهن‌دژکتاب مرجع هوش مصنوعی
منابعاعتبارسنجی
فهرست این فصلبخش ۳، فصل ۲۰ — صفحهٔ ۴ از ۴

بخش ۳، فصل ۲۰ — صفحهٔ ۴ از ۴

رده‌بندی هوش مصنوعی پیش‌بین (Predictive AI, PredAI)

متن اصلی فارسی با منشأ، شناسه و پیوند استناد پایدار.

۲.۴. حملات و اقدامات کاهنده حریم خصوصی

ترجمهٔ منبع

[ NISTAML.03 ]

کار پیشگامانهٔ Dinur و Nissim [110] حملات «بازسازی داده» (Data Reconstruction) را معرفی کرد؛ این حملات در پی آن هستند که با دسترسی به یک مدل آموزش‌دیده، اطلاعات خصوصی مربوط به یک رکورد کاربر فردی یا سایر داده‌های ورودی حساس را مهندسی معکوس کنند. اخیراً حملات بازسازی داده برای طبقه‌بندهای شبکه عصبی دودویی و چندکلاسه طراحی شده‌اند [50، 152]. با «حملهٔ استنتاج عضویت» (Membership-Inference Attack)، مهاجم می‌تواند تعیین کند که آیا یک رکورد خاص در مجموعه‌دادهٔ استفاده‌شده برای آموزش یک مدل ML گنجانده شده است یا خیر. حملات استنتاج عضویت نخستین‌بار توسط Homer et al. [162] برای داده‌های ژنومی معرفی شدند. ادبیات اخیر بر حملات عضویت علیه مدل‌های ML عمدتاً در حالت‌های جعبه‌سیاه متمرکز است که در آن‌ها مهاجمان دسترسی پرس‌وجو به یک مدل ML آموزش‌دیده دارند [54، 342، 422]. حملات استنتاج ویژگی [19، 74، 134، 233، 361، 437] با هدف استخراج اطلاعات سراسری دربارهٔ یک مجموعه‌دادهٔ آموزشی طراحی می‌شوند؛ مانند نسبت نمونه‌های آموزشی دارای یک ویژگی حساس معین. نقض حریم خصوصی دیگری که در MLaaS رخ می‌دهد، حملات «استخراج مدل» (Model Extraction) است؛ این حملات به‌گونه‌ای طراحی شده‌اند که اطلاعاتی دربارهٔ یک مدل ML مانند معماری یا پارامترهای مدل۳ را استخراج کنند [58، 70، 177، 376].

این بخش به بحث دربارهٔ حملات حریم خصوصی مرتبط با بازسازی داده، به‌خاطرسپاری داده‌های آموزشی، «استنتاج عضویت» (Membership Inference)، استنتاج ویژگی و استخراج مدل می‌پردازد و همچنین راهکارهای کاهش برخی از این حملات و مسائل باز در طراحی راهبردهای عمومی کاهش را بررسی می‌کند.

استناد

محمدعلی کهن‌دژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C20-S19

شناسهٔ محتوا KDJ-AI-2026E1-P03-C20-S19-62C19D6D

پیوند مستقیم این بخش

۲.۴.۱. Data Reconstruction

ترجمهٔ منبع

[ NISTAML.032 ]

حمله‌های بازسازی داده‌ها توانایی بازیابی داده‌های یک فرد از اطلاعات تجمعی منتشرشده را دارند. Dinur و Nissim [110] نخستین کسانی بودند که حمله‌های بازسازی را معرفی کردند که داده‌های کاربر را از آمارهای خطی بازیابی می‌کنند. حمله اولیه آن‌ها برای بازسازی به تعداد نمایی پرس‌وجو نیاز داشت، اما کارهای بعدی نشان داده‌اند که چگونه می‌توان بازسازی را با تعدادی چندجمله‌ای از پرس‌وجوها انجام داد [116]. مروری بر حمله‌های حریم خصوصی، از جمله حمله‌های بازسازی، توسط Dwork و همکاران [114] ارائه شده است. اخیراً، U.S. Census Bureau مطالعه گسترده‌ای درباره ریسک حمله‌های بازسازی داده‌ها بر داده‌های سرشماری انجام داد [135] که انگیزه‌بخش به‌کارگیری «حریم خصوصی تفاضلی» (differential privacy) در انتشار ده‌ساله سرشماری ایالات متحده در سال ۲۰۲۰ بود.

در زمینه طبقه‌بند‌های ML، Fredrickson و همکاران [130] حمله‌های «وارون‌سازی مدل» (Model Inversion) را معرفی کردند که بازنمایاننده‌های کلاس را از داده‌های آموزشی یک مدل ML بازسازی می‌کنند. هرچند وارون‌سازی مدل تصاویری از نظر معنایی مشابه با تصاویر موجود در مجموعه آموزشی تولید می‌کند، نمی‌تواند مستقیماً داده‌های آموزشی مدل را بازسازی کند. اخیراً، Balle و همکاران [26] شبکه‌ای بازساز آموزش دادند که می‌تواند یک نمونه داده را از یک مدل شبکه عصبی بازیابی کند، با این فرض که مهاجمی قدرتمند درباره همه نمونه‌های آموزشی دیگر اطلاعات دارد. Haim و همکاران [152] نشان دادند که چگونه می‌توان با دسترسی به پارامترهای مدل، داده‌های آموزشی یک طبقه‌بند شبکه عصبی دودویی را با بهره‌گیری از بینش‌های نظری درباره سوگیری ضمنی در شبکه‌های عصبی بازسازی کرد. این کار اخیراً برای بازسازی نمونه‌های آموزشی طبقه‌بند‌های پرسپترون چندلایه چندکلاسه تعمیم یافته است [50]. استنتاج ویژگی حمله حریم خصوصی مرتبط دیگری است که در آن مهاجم یک ویژگی حساس مجموعه آموزشی را استخراج می‌کند، با فرض داشتن دانش جزئی درباره سایر ویژگی‌های داده‌های آموزشی [184].

توانایی بازسازی نمونه‌های آموزشی تا حدی با گرایش شبکه‌های عصبی به حفظ‌کردن داده‌های آموزشی خود توضیح داده می‌شود. Zhang و همکاران [431] بحث کردند که شبکه‌های عصبی چگونه می‌توانند مجموعه‌داده‌های تصادفی‌گزینش‌شده را حفظ کنند. Feldman [126] نشان داد که حفظ‌کردن برچسب‌های آموزشی برای دستیابی به خطای تعمیم تقریباً بهینه در ML لازم است. Brown و همکاران [48] دو وظیفه یادگیری مبتنی بر پیش‌بینی نماد بعدی و برچسب‌گذاری خوشه ساختند که در آن‌ها حفظ‌کردن برای یادگیری با دقت بالا الزامی است. Feldman و Zhang مزیت حفظ‌کردن برای تعمیم را به‌صورت تجربی با استفاده از یک روش برآورد تأثیر ارزیابی کردند [127]. حمله‌های بازسازی داده‌ها و ارتباط آن‌ها با حفظ‌کردن در «هوش مصنوعی مولد» (Generative AI, GAI) در بخش 3.3.2 بحث شده‌اند.

استناد

محمدعلی کهن‌دژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C20-S20

شناسهٔ محتوا KDJ-AI-2026E1-P03-C20-S20-066E9C84

پیوند مستقیم این بخش

۲.۴.۲. استنتاج عضویت

ترجمهٔ منبع

[ NISTAML.033 ]

حملات «استنتاج عضویت» (membership inference) ممکن است همانند حملات بازسازی یا حفظ‌کردن، اطلاعات خصوصی مربوط به یک فرد را افشا کنند و هنگام انتشار اطلاعات تجمیعی یا مدل‌های ML آموزش‌دیده روی داده‌های کاربران، نگرانی جدی محسوب می‌شوند. در برخی شرایط، صرفِ تعیین اینکه یک فرد بخشی از مجموعه آموزش است، خود پیامدهای حریم خصوصی دارد؛ برای مثال در یک مطالعه پزشکی روی بیماران مبتلا به یک بیماری نادر. علاوه بر این، استنتاج عضویت می‌تواند به‌عنوان یک بلوک سازنده برای اجرای حملات استخراج داده‌ها به کار رود [59, 63].

در استنتاج عضویت، هدف مهاجم تعیین این است که آیا یک رکورد یا نمونه داده خاص بخشی از مجموعه داده آموزشی استفاده‌شده برای الگوریتم آماری یا ML بوده است یا خیر. این حملات توسط Homer et al. [162] برای محاسبات آماری روی داده‌های ژنومی تحت عنوان «حملات ردیابی» (tracing attacks) معرفی شدند. حملات ردیابی مقاوم در شرایطی تحلیل شده‌اند که یک مهاجم به اطلاعات آماری نویزی درباره مجموعه داده دسترسی پیدا می‌کند [115]. در پنج سال اخیر، ادبیات پژوهشی برای حملات علیه مدل‌های ML از اصطلاح استنتاج عضویت استفاده کرده است. بیشتر حملات موجود در ادبیات علیه شبکه‌های عصبی عمیق مورد استفاده در طبقه‌بندی انجام شده‌اند [54, 89, 208, 342, 421, 422]. مشابه سایر حملات در AML، استنتاج عضویت می‌تواند در تنظیمات جعبه‌سفید انجام شود [208, 264, 317]؛ در این تنظیمات مهاجمان از معماری و پارامترهای مدل آگاهی دارند، اما بیشتر حملات برای تنظیمات جعبه‌سیاه توسعه یافته‌اند که در آن‌ها مهاجم پرس‌وجوهایی به مدل ML آموزش‌دیده ارسال می‌کند [54, 89, 342, 421, 422].

موفقیت مهاجم در استنتاج عضویت به‌صورت رسمی با استفاده از یک بازی حریم خصوصی با الهام از رمزنگاری تعریف شده است؛ در این بازی، مهاجم با یک «چلنجر» (challenger) تعامل می‌کند و باید تعیین کند که آیا یک نمونه هدف در آموزش مدل ML پرس‌وجوشده به کار رفته است یا خیر [183, 321, 422]. در زمینه تکنیک‌های اجرای حملات استنتاج عضویت، حمله مبتنی بر خطای Yeom et al. [422] یکی از کارآمدترین و پرکاربردترین روش‌ها است. این حمله با استفاده از این دانش که مدل ML خطا را روی نمونه‌های آموزشی به کمینه می‌رساند، تعیین می‌کند که یک نمونه هدف در صورت کمتر بودن خطای آن از یک آستانه ثابت (که به‌عنوان میانگین خطای نمونه‌های آموزشی انتخاب می‌شود) بخشی از مجموعه آموزش است. Sablayrolles et al. [317] حمله مبتنی بر خطا را با مقیاس‌بندی خطا از طریق یک آستانه برای هر نمونه، پالایش کردند. تکنیک پرکاربرد دیگر که توسط Shokri et al. [342] معرفی شد، «مدل‌های سایه» (shadow models) است که یک طبقه‌بند فرا روی نمونه‌های درون و برون مجموعه آموزش آموزش می‌بیند؛ این نمونه‌ها از طریق آموزش هزاران مدل ML سایه روی همان وظیفه مدل اصلی به دست می‌آیند. این تکنیک به‌طور کلی پرهزینه است و اگرچه ممکن است بتواند نسبت به حمله ساده مبتنی بر خطا بهبود حاصل کند، هزینه محاسباتی آن بالاست و دسترسی به نمونه‌های زیادی از توزیع برای آموزش مدل‌های سایه لازم دارد. این دو تکنیک از نظر «پیچیدگی» (Complexity) در دو انتهای طیف قرار دارند، اما از نظر دقت در نرخ‌های مثبت کاذب پایین عملکردی مشابه دارند [54].

روشی میانی که از نظر معیار «سطح زیر منحنی» (AREA UNDER THE CURVE, AUC) عملکرد خوبی به دست می‌آورد، حمله LiRA توسط Carlini et al. [54] است که تعداد کمتری مدل سایه آموزش می‌دهد تا توزیع logitهای مدل را روی نمونه‌های درون و برون مجموعه آموزش بیاموزد. با استفاده از این فرض که توزیع‌های logit مدل گاوسی هستند، LiRA با برآورد میانگین و انحراف معیار توزیع‌های گاوسی، یک آزمون فرض برای استنتاج عضویت انجام می‌دهد. Ye et al. [421] حمله‌ای مشابه طراحی کردند که یک آزمون فرض یک‌طرفه انجام می‌دهد؛ این حمله هیچ فرضی درباره توزیع خطا نمی‌کند اما عملکردی اندکی پایین‌تر از LiRA دارد. به‌تازگی Lopez et al. [225] حمله استنتاج عضویت کارآمدتری پیشنهاد کردند که نیازمند آموزش یک مدل واحد برای پیش‌بینی کردن چارک‌های توزیع امتیاز اطمینان مدلِ تحت حمله است. حملات استنتاج عضویت همچنین تحت «مدل تهدید» (Threat Model) سخت‌گیرانه‌ترِ فقط-برچسب طراحی شده‌اند که در آن مهاجم تنها به برچسب‌های پیش‌بینی‌شده نمونه‌های پرس‌وجوشده دسترسی دارد [89].

چند کتابخانه عمومی حریم خصوصی وجود دارد که پیاده‌سازی حملات استنتاج عضویت را ارائه می‌دهند: کتابخانه TensorFlow Privacy [350] و ML Privacy Meter [259].

استناد

محمدعلی کهن‌دژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C20-S21

شناسهٔ محتوا KDJ-AI-2026E1-P03-C20-S21-7688BCF1

پیوند مستقیم این بخش

۲.۴.۳. Property Inference

ترجمهٔ منبع

[ NISTAML.034 ]

در حملات استنتاج ویژگی (که «استنتاج توزیع» نیز نامیده می‌شود)، مهاجم می‌کوشد با تعامل با یک مدل ML، اطلاعاتی سراسری درباره توزیع داده‌های آموزشی به دست آورد. برای مثال، مهاجم می‌تواند نسبت مجموعه آموزشی دارای یک ویژگی حساس مشخص (مانند اطلاعات جمعیت‌شناختی) را تعیین کند؛ اطلاعاتی که ممکن است اسرار بالقوه‌ای درباره مجموعه آموزشی را آشکار سازد که قرار نبوده منتشر شود.

حملات استنتاج ویژگی توسط Ateniese و همکاران [19] معرفی شدند و به‌صورت یک بازی تمایزبخشی میان مهاجم و چالش‌گر که دو مدل با نسبت‌های متفاوتی از داده‌های حساس آموزش می‌دهد، صورت‌بندی شدند [361]. حملات استنتاج ویژگی در تنظیمات جعبه‌سفید طراحی شده‌اند که در آن‌ها مهاجم به کل مدل ML دسترسی دارد [19، 134، 361] و نیز در تنظیمات جعبه‌سیاه که در آن‌ها مهاجم به مدل پرس‌وجو ارسال می‌کند و برچسب‌های پیش‌بینی‌شده [233] یا احتمال‌های کلاس [74، 437] را دریافت می‌کند. این حملات برای مدل‌های HIDDEN MARKOV MODEL، SUPPORT VECTOR MACHINES [19]، FEEDFORWARD NEURAL NETWORKS [134، 233، 437]، CONVOLUTIONAL NEURAL NETWORKS [361]، FEDERATED LEARNING [240]، «شبکه‌های مولد رقابتی» (Generative Adversarial Networks, GANs) [443] و GRAPH NEURAL NETWORK [442] نشان داده شده‌اند. Mahloujifar و همکاران [233] و Chaudhauri و همکاران [74] نشان دادند که مسموم‌سازی (Poisoning) ویژگی موردنظر می‌تواند به طراحی یک آزمون تمایزبخشی مؤثرتر برای استنتاج ویژگی کمک کند. افزون بر این، Chaudhauri و همکاران [74] یک حمله کارآمد برآورد اندازه ویژگی طراحی کردند که نسبت دقیق جمعیت موردنظر را بازیابی می‌کند.

رابطه میان حملات گوناگون استنتاج از مجموعه آموزشی، مانند «استنتاج عضویت» (membership inference)، استنتاج صفت (attribute inference) و استنتاج ویژگی (property inference)، توسط Salem و همکاران [321] در چارچوب تعریفی یکپارچه‌ای بررسی شده است.

استناد

محمدعلی کهن‌دژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C20-S22

شناسهٔ محتوا KDJ-AI-2026E1-P03-C20-S22-A9DA6B54

پیوند مستقیم این بخش

۲.۴.۴. «استخراج مدل» (Model Extraction)

ترجمهٔ منبع

[ NISTAML.031 ]

در سناریوهای MLaaS، ارائه‌دهندگان ابری معمولاً مدل‌های بزرگ ML را با استفاده از داده‌های اختصاصی آموزش می‌دهند و مایل‌اند معماری و پارامترهای مدل محرمانه باقی بماند. هدف مهاجمی که حمله «استخراج مدل» (Model Extraction) را انجام می‌دهد، استخراج اطلاعات مربوط به معماری و پارامترهای مدل از طریق ارسال پرس‌وجو به مدل ML آموزش‌دیده توسط ارائه‌دهنده MLaaS است. نخستین حملات سرقت مدل توسط Tramer و همکاران [376] روی چندین سرویس آنلاین ML برای مدل‌های مختلف ML، شامل رگرسیون لجستیک، درخت‌های تصمیم و شبکه‌های عصبی نشان داده شد. با این حال، Jagielski و همکاران [177] نشان داده‌اند که استخراج دقیق مدل‌های ML ناممکن است. در عوض، می‌توان مدلی معادل از نظر عملکردی بازسازی کرد که با مدل اصلی متفاوت است اما در وظیفه پیش‌بینی عملکردی مشابه دارد. Jagielski و همکاران [177] نشان داده‌اند که حتی وظیفه ضعیف‌ترِ استخراج مدل‌های معادل از نظر عملکردی نیز از نظر محاسباتی بسیار پرهزینه (NP-hard) است.

چندین تکنیک برای اجرای حملات استخراج مدل در ادبیات موضوع معرفی شده است. روش نخست، استخراج مستقیم مبتنی بر صورت‌بندی ریاضی عملیات انجام‌شده در شبکه‌های عصبی عمیق است که به مهاجم امکان می‌دهد وزن‌های مدل را به‌صورت جبری محاسبه کند [58, 177, 376]. تکنیک دوم، استفاده از روش‌های یادگیری برای استخراج است. برای مثال، یادگیری فعال [70] می‌تواند پرس‌وجوها به مدل ML را برای استخراج کارآمدتر وزن‌های مدل هدایت کند، و یادگیری تقویتی می‌تواند یک راهبرد تطبیقی آموزش دهد که تعداد پرس‌وجوها را کاهش دهد [280]. تکنیک سوم از اطلاعات «کانال جانبی» (Side Channel) برای استخراج مدل استفاده می‌کند. Batina و همکاران [29] از کانال‌های جانبی الکترومغناطیسی برای بازیابی مدل‌های ساده شبکه عصبی استفاده کردند، در حالی که Rakin و همکاران [303] نشان دادند چگونه می‌توان از «حمله ROWHAMMER» (Rowhammer Attack) برای استخراج مدل معماری‌های پیچیده‌تر شبکه‌های عصبی کانولوشنی استفاده کرد.

neural network architectures.

«استخراج مدل» (Model Extraction) اغلب هدف نهایی نیست، بلکه گامی به‌سوی حملات دیگر است. با آشکار شدن وزن‌ها و معماری مدل، مهاجمان می‌توانند حملات قدرتمندتری را که در حالت‌های جعبه‌سفید یا جعبه‌خاکستری متداول هستند، آغاز کنند. بنابراین، جلوگیری از استخراج مدل می‌تواند حملات بعدی را که به دانستن معماری و وزن‌های مدل از سوی مهاجم وابسته‌اند، کاهش دهد.

استناد

محمدعلی کهن‌دژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C20-S23

شناسهٔ محتوا KDJ-AI-2026E1-P03-C20-S23-F1E441C4

پیوند مستقیم این بخش

۲.۴.۵. اقدامات کاهشی

ترجمهٔ منبع

کشف حملات بازسازی در برابر اطلاعات تجمعی، انگیزهای برای تعریف دقیق «حریم خصوصی تفاضلی» (differential privacy, DP) [112، 113] شد؛ تعریفی بسیار قوی از «حریم خصوصی» (Privacy) که تضمین میکند میزان اطلاعاتی که مهاجم با دسترسی به خروجی الگوریتم درباره هر رکورد فردی در مجموعهداده به دست میآورد، محدود باشد. تعریف اصلی و خالص DP دارای یک پارامتر حریم خصوصی ε (یعنی بودجه حریم خصوصی) است که احتمال این را محدود میکند که مهاجمِ دارای دسترسی به خروجی الگوریتم بتواند تشخیص دهد آیا یک رکورد خاص در مجموعهداده گنجانده شده است یا خیر. DP به مفاهیم DP تقریبی گسترش یافته است که پارامتر دومی به نام δ دارد و بهصورت احتمال افشای تصادفی اطلاعات در کنار ε تفسیر میشود، و همچنین DP رنی (Rènyi DP) [246].

DP به دلیل چند ویژگی (properties) سودمند بهطور گسترده پذیرفته شده است: حریم خصوصی گروهی (یعنی تعمیم تعریف به دو مجموعهداده که در k رکورد با هم تفاوت دارند)، پسپردازش (یعنی حفظ حریم خصوصی حتی پس از پردازش خروجی)، و ترکیبپذیری (یعنی ترکیب حریم خصوصی در صورت انجام چند محاسبه روی مجموعهداده). سازوکارهای (mechanisms) DP برای محاسبات آماری شامل سازوکار گاوسی [113]، سازوکار لاپلاس [113] و سازوکار نمایی [238] هستند. پرکاربردترین الگوریتم DP برای آموزش مدلهای ML، الگوریتم DP-SGD [1] است و بهبودهای اخیر شامل DP-FTRL [189] و تجزیه ماتریسی DP [105] میشوند.

بنا به تعریف، DP کاهشی در برابر حملات بازسازی داده و «استنتاج عضویت» (membership inference) فراهم میکند. در واقع، تعریف DP بلافاصله یک کران بالا بر موفقیت حریف در اجرای حمله استنتاج عضویت به دست میدهد. Thudi و همکاران [369] کرانهای دقیقی بر موفقیت استنتاج عضویت استخراج کردهاند. با این حال، DP تضمینی در برابر حملات «استخراج مدل» (Model Extraction) فراهم نمیکند، زیرا این روش برای حفاظت از دادههای آموزشی طراحی شده است، نه مدل. چندین مقاله نتایج منفی پس از استفاده از حریم خصوصی تفاضلی برای محافظت در برابر حملات استنتاج ویژگی گزارش کردهاند؛ حملاتی که هدف آنها استخراج ویژگیهای زیرمجموعههای جمعیتی در مجموعه آموزشی است [74، 233].

یکی از چالشهای اصلی استفاده از DP در عمل، تنظیم پارامترهای حریم خصوصی برای دستیابی به مصالحهای میان سطح حریم خصوصی و کارایی بهدستآمده است که معمولاً بر حسب دقت برای مدلهای ML سنجیده میشود. تحلیل الگوریتمهای حفظ حریم خصوصی (مانند DP-SGD) اغلب حالت بدترین حالت است و دقیق نیست، و انتخاب پارامترهای حریم خصوصی صرفاً بر پایه تحلیل نظری به از دست رفتن کارایی میانجامد. بنابراین، در عمل اغلب از پارامترهای حریم خصوصی بزرگ استفاده میشود (برای مثال، انتشار سرشماری ۲۰۲۰ ایالات متحده از ε = 19.61 استفاده کرد)، و تخمین حریم خصوصی دقیق حاصل در عمل دشوار است. Jagielski و همکاران [181] «ممیزی حریم خصوصی» (privacy auditing) را با هدف سنجش تجربی تضمینهای واقعی حریم خصوصی یک الگوریتم و تعیین کرانهای پایین حریم خصوصی از طریق اجرای حملات حریم خصوصی معرفی کردند. بسیاری از فنون ممیزی حریم خصوصی بر پایه درج «قناریها» (canaries) — نمونههای مصنوعی و بهآسانی قابلشناساییِ «خارج از توزیع» (OUT-OF-DISTRIBUTION, OOD) — در مجموعه آموزشی و سپس سنجش حضور قناریها در خروجی مدل استوارند. ممیزی همچنین میتواند با حملات استنتاج عضویت انجام شود [183، 427]، اما درج عمدی قناریهای قوی ممکن است برآوردهای بهتری از افشای حریم خصوصی به دست دهد [181، 265]. پیشرفتهای اخیر در ممیزی حریم خصوصی شامل کرانهای دقیقتر برای سازوکار گاوسی [263] و روشهای آماری دقیقی است که استفاده از قناریهای متعدد را برای کاهش پیچیدگی (Complexity) نمونهای ممیزی ممکن میسازند [297]. افزون بر این، دو روش کارآمد برای ممیزی حریم خصوصی با آموزش یک مدل واحد پیشنهاد شده است: Steinke و همکاران [355] از قناریهای تصادفی متعدد دادهای بدون تحمیل هزینه حریم خصوصی گروهی استفاده کردند؛ و Andrew و همکاران [10] از قناریهای تصادفی متعدد سرویسگیرنده و آمارههای آزمون شباهت کسینوسی برای ممیزی یادگیری فدرِیتِ خصوصی در سطح کاربر بهره گرفتند.

حریم خصوصی تفاضلی مفهوم دقیقی از حریم خصوصی فراهم میکند و در برابر حملات استنتاج عضویت و بازسازی داده محافظت میکند. برای دستیابی به بهترین توازن میان حریم خصوصی و کارایی، توصیه میشود ممیزی تجربی حریم خصوصی برای مکمل تحلیل نظریِ الگوریتمهای آموزشِ خصوصی به کار رود.

فنون کاهشی دیگری نیز در برابر استخراج مدل وجود دارد، مانند محدودسازی پرسوجوهای کاربران به مدل، شناسایی پرسوجوهای مشکوک به مدل، یا ایجاد معماریهای مقاومتر برای جلوگیری از حملات کانال جانبی. با این حال، مهاجمان دارای انگیزه و برخوردار از منابع کافی میتوانند از این فنون عبور کنند و باید با احتیاط از آنها استفاده شود. راهنماهای عملی برای ایمنسازی استقرارهای ML در دسترس است [69، 274]. رویکردی کاملاً متفاوت برای کاهش بالقوه‌ی افشای حریم خصوصی دادههای کاربر، انجام «فرایادگیری ماشینی» (Machine Unlearning) است؛ فنی که به کاربر امکان میدهد حذف دادههای خود را از یک مدل ML آموزشدیده درخواست کند. فنون موجود برای فرایادگیری ماشینی یا دقیق هستند (یعنی آموزش دوباره مدل از ابتدا یا از یک نقطه بازرسی معیّن) [45، 52] یا تقریبی (یعنی بهروزرسانی پارامترهای مدل برای حذف تأثیر رکوردهای فرایادگرفتهشده) [139، 175، 268]. این فنون مصالحههای متفاوتی میان محاسبات و تضمینهای حریم خصوصی ارائه میدهند و روشهای دقیق فرایادگیری، با هزینه محاسباتی بیشتر، حریم خصوصی قویتری فراهم میکنند.

استناد

محمدعلی کهن‌دژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C20-S24

شناسهٔ محتوا KDJ-AI-2026E1-P03-C20-S24-A5DAF444

پیوند مستقیم این بخش