فهرست این فصلبخش ۳، فصل ۲۰ — صفحهٔ ۴ از ۴
بخش ۳، فصل ۲۰ — صفحهٔ ۴ از ۴
ردهبندی هوش مصنوعی پیشبین (Predictive AI, PredAI)
متن اصلی فارسی با منشأ، شناسه و پیوند استناد پایدار.
۲.۴. حملات و اقدامات کاهنده حریم خصوصی
[ NISTAML.03 ]
کار پیشگامانهٔ Dinur و Nissim [110] حملات «بازسازی داده» (Data Reconstruction) را معرفی کرد؛ این حملات در پی آن هستند که با دسترسی به یک مدل آموزشدیده، اطلاعات خصوصی مربوط به یک رکورد کاربر فردی یا سایر دادههای ورودی حساس را مهندسی معکوس کنند. اخیراً حملات بازسازی داده برای طبقهبندهای شبکه عصبی دودویی و چندکلاسه طراحی شدهاند [50، 152]. با «حملهٔ استنتاج عضویت» (Membership-Inference Attack)، مهاجم میتواند تعیین کند که آیا یک رکورد خاص در مجموعهدادهٔ استفادهشده برای آموزش یک مدل ML گنجانده شده است یا خیر. حملات استنتاج عضویت نخستینبار توسط Homer et al. [162] برای دادههای ژنومی معرفی شدند. ادبیات اخیر بر حملات عضویت علیه مدلهای ML عمدتاً در حالتهای جعبهسیاه متمرکز است که در آنها مهاجمان دسترسی پرسوجو به یک مدل ML آموزشدیده دارند [54، 342، 422]. حملات استنتاج ویژگی [19، 74، 134، 233، 361، 437] با هدف استخراج اطلاعات سراسری دربارهٔ یک مجموعهدادهٔ آموزشی طراحی میشوند؛ مانند نسبت نمونههای آموزشی دارای یک ویژگی حساس معین. نقض حریم خصوصی دیگری که در MLaaS رخ میدهد، حملات «استخراج مدل» (Model Extraction) است؛ این حملات بهگونهای طراحی شدهاند که اطلاعاتی دربارهٔ یک مدل ML مانند معماری یا پارامترهای مدل۳ را استخراج کنند [58، 70، 177، 376].
این بخش به بحث دربارهٔ حملات حریم خصوصی مرتبط با بازسازی داده، بهخاطرسپاری دادههای آموزشی، «استنتاج عضویت» (Membership Inference)، استنتاج ویژگی و استخراج مدل میپردازد و همچنین راهکارهای کاهش برخی از این حملات و مسائل باز در طراحی راهبردهای عمومی کاهش را بررسی میکند.
استناد
محمدعلی کهندژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C20-S19
شناسهٔ محتوا KDJ-AI-2026E1-P03-C20-S19-62C19D6D
۲.۴.۱. Data Reconstruction
[ NISTAML.032 ]
حملههای بازسازی دادهها توانایی بازیابی دادههای یک فرد از اطلاعات تجمعی منتشرشده را دارند. Dinur و Nissim [110] نخستین کسانی بودند که حملههای بازسازی را معرفی کردند که دادههای کاربر را از آمارهای خطی بازیابی میکنند. حمله اولیه آنها برای بازسازی به تعداد نمایی پرسوجو نیاز داشت، اما کارهای بعدی نشان دادهاند که چگونه میتوان بازسازی را با تعدادی چندجملهای از پرسوجوها انجام داد [116]. مروری بر حملههای حریم خصوصی، از جمله حملههای بازسازی، توسط Dwork و همکاران [114] ارائه شده است. اخیراً، U.S. Census Bureau مطالعه گستردهای درباره ریسک حملههای بازسازی دادهها بر دادههای سرشماری انجام داد [135] که انگیزهبخش بهکارگیری «حریم خصوصی تفاضلی» (differential privacy) در انتشار دهساله سرشماری ایالات متحده در سال ۲۰۲۰ بود.
در زمینه طبقهبندهای ML، Fredrickson و همکاران [130] حملههای «وارونسازی مدل» (Model Inversion) را معرفی کردند که بازنمایانندههای کلاس را از دادههای آموزشی یک مدل ML بازسازی میکنند. هرچند وارونسازی مدل تصاویری از نظر معنایی مشابه با تصاویر موجود در مجموعه آموزشی تولید میکند، نمیتواند مستقیماً دادههای آموزشی مدل را بازسازی کند. اخیراً، Balle و همکاران [26] شبکهای بازساز آموزش دادند که میتواند یک نمونه داده را از یک مدل شبکه عصبی بازیابی کند، با این فرض که مهاجمی قدرتمند درباره همه نمونههای آموزشی دیگر اطلاعات دارد. Haim و همکاران [152] نشان دادند که چگونه میتوان با دسترسی به پارامترهای مدل، دادههای آموزشی یک طبقهبند شبکه عصبی دودویی را با بهرهگیری از بینشهای نظری درباره سوگیری ضمنی در شبکههای عصبی بازسازی کرد. این کار اخیراً برای بازسازی نمونههای آموزشی طبقهبندهای پرسپترون چندلایه چندکلاسه تعمیم یافته است [50]. استنتاج ویژگی حمله حریم خصوصی مرتبط دیگری است که در آن مهاجم یک ویژگی حساس مجموعه آموزشی را استخراج میکند، با فرض داشتن دانش جزئی درباره سایر ویژگیهای دادههای آموزشی [184].
توانایی بازسازی نمونههای آموزشی تا حدی با گرایش شبکههای عصبی به حفظکردن دادههای آموزشی خود توضیح داده میشود. Zhang و همکاران [431] بحث کردند که شبکههای عصبی چگونه میتوانند مجموعهدادههای تصادفیگزینششده را حفظ کنند. Feldman [126] نشان داد که حفظکردن برچسبهای آموزشی برای دستیابی به خطای تعمیم تقریباً بهینه در ML لازم است. Brown و همکاران [48] دو وظیفه یادگیری مبتنی بر پیشبینی نماد بعدی و برچسبگذاری خوشه ساختند که در آنها حفظکردن برای یادگیری با دقت بالا الزامی است. Feldman و Zhang مزیت حفظکردن برای تعمیم را بهصورت تجربی با استفاده از یک روش برآورد تأثیر ارزیابی کردند [127]. حملههای بازسازی دادهها و ارتباط آنها با حفظکردن در «هوش مصنوعی مولد» (Generative AI, GAI) در بخش 3.3.2 بحث شدهاند.
استناد
محمدعلی کهندژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C20-S20
شناسهٔ محتوا KDJ-AI-2026E1-P03-C20-S20-066E9C84
۲.۴.۲. استنتاج عضویت
[ NISTAML.033 ]
حملات «استنتاج عضویت» (membership inference) ممکن است همانند حملات بازسازی یا حفظکردن، اطلاعات خصوصی مربوط به یک فرد را افشا کنند و هنگام انتشار اطلاعات تجمیعی یا مدلهای ML آموزشدیده روی دادههای کاربران، نگرانی جدی محسوب میشوند. در برخی شرایط، صرفِ تعیین اینکه یک فرد بخشی از مجموعه آموزش است، خود پیامدهای حریم خصوصی دارد؛ برای مثال در یک مطالعه پزشکی روی بیماران مبتلا به یک بیماری نادر. علاوه بر این، استنتاج عضویت میتواند بهعنوان یک بلوک سازنده برای اجرای حملات استخراج دادهها به کار رود [59, 63].
در استنتاج عضویت، هدف مهاجم تعیین این است که آیا یک رکورد یا نمونه داده خاص بخشی از مجموعه داده آموزشی استفادهشده برای الگوریتم آماری یا ML بوده است یا خیر. این حملات توسط Homer et al. [162] برای محاسبات آماری روی دادههای ژنومی تحت عنوان «حملات ردیابی» (tracing attacks) معرفی شدند. حملات ردیابی مقاوم در شرایطی تحلیل شدهاند که یک مهاجم به اطلاعات آماری نویزی درباره مجموعه داده دسترسی پیدا میکند [115]. در پنج سال اخیر، ادبیات پژوهشی برای حملات علیه مدلهای ML از اصطلاح استنتاج عضویت استفاده کرده است. بیشتر حملات موجود در ادبیات علیه شبکههای عصبی عمیق مورد استفاده در طبقهبندی انجام شدهاند [54, 89, 208, 342, 421, 422]. مشابه سایر حملات در AML، استنتاج عضویت میتواند در تنظیمات جعبهسفید انجام شود [208, 264, 317]؛ در این تنظیمات مهاجمان از معماری و پارامترهای مدل آگاهی دارند، اما بیشتر حملات برای تنظیمات جعبهسیاه توسعه یافتهاند که در آنها مهاجم پرسوجوهایی به مدل ML آموزشدیده ارسال میکند [54, 89, 342, 421, 422].
موفقیت مهاجم در استنتاج عضویت بهصورت رسمی با استفاده از یک بازی حریم خصوصی با الهام از رمزنگاری تعریف شده است؛ در این بازی، مهاجم با یک «چلنجر» (challenger) تعامل میکند و باید تعیین کند که آیا یک نمونه هدف در آموزش مدل ML پرسوجوشده به کار رفته است یا خیر [183, 321, 422]. در زمینه تکنیکهای اجرای حملات استنتاج عضویت، حمله مبتنی بر خطای Yeom et al. [422] یکی از کارآمدترین و پرکاربردترین روشها است. این حمله با استفاده از این دانش که مدل ML خطا را روی نمونههای آموزشی به کمینه میرساند، تعیین میکند که یک نمونه هدف در صورت کمتر بودن خطای آن از یک آستانه ثابت (که بهعنوان میانگین خطای نمونههای آموزشی انتخاب میشود) بخشی از مجموعه آموزش است. Sablayrolles et al. [317] حمله مبتنی بر خطا را با مقیاسبندی خطا از طریق یک آستانه برای هر نمونه، پالایش کردند. تکنیک پرکاربرد دیگر که توسط Shokri et al. [342] معرفی شد، «مدلهای سایه» (shadow models) است که یک طبقهبند فرا روی نمونههای درون و برون مجموعه آموزش آموزش میبیند؛ این نمونهها از طریق آموزش هزاران مدل ML سایه روی همان وظیفه مدل اصلی به دست میآیند. این تکنیک بهطور کلی پرهزینه است و اگرچه ممکن است بتواند نسبت به حمله ساده مبتنی بر خطا بهبود حاصل کند، هزینه محاسباتی آن بالاست و دسترسی به نمونههای زیادی از توزیع برای آموزش مدلهای سایه لازم دارد. این دو تکنیک از نظر «پیچیدگی» (Complexity) در دو انتهای طیف قرار دارند، اما از نظر دقت در نرخهای مثبت کاذب پایین عملکردی مشابه دارند [54].
روشی میانی که از نظر معیار «سطح زیر منحنی» (AREA UNDER THE CURVE, AUC) عملکرد خوبی به دست میآورد، حمله LiRA توسط Carlini et al. [54] است که تعداد کمتری مدل سایه آموزش میدهد تا توزیع logitهای مدل را روی نمونههای درون و برون مجموعه آموزش بیاموزد. با استفاده از این فرض که توزیعهای logit مدل گاوسی هستند، LiRA با برآورد میانگین و انحراف معیار توزیعهای گاوسی، یک آزمون فرض برای استنتاج عضویت انجام میدهد. Ye et al. [421] حملهای مشابه طراحی کردند که یک آزمون فرض یکطرفه انجام میدهد؛ این حمله هیچ فرضی درباره توزیع خطا نمیکند اما عملکردی اندکی پایینتر از LiRA دارد. بهتازگی Lopez et al. [225] حمله استنتاج عضویت کارآمدتری پیشنهاد کردند که نیازمند آموزش یک مدل واحد برای پیشبینی کردن چارکهای توزیع امتیاز اطمینان مدلِ تحت حمله است. حملات استنتاج عضویت همچنین تحت «مدل تهدید» (Threat Model) سختگیرانهترِ فقط-برچسب طراحی شدهاند که در آن مهاجم تنها به برچسبهای پیشبینیشده نمونههای پرسوجوشده دسترسی دارد [89].
چند کتابخانه عمومی حریم خصوصی وجود دارد که پیادهسازی حملات استنتاج عضویت را ارائه میدهند: کتابخانه TensorFlow Privacy [350] و ML Privacy Meter [259].
استناد
محمدعلی کهندژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C20-S21
شناسهٔ محتوا KDJ-AI-2026E1-P03-C20-S21-7688BCF1
۲.۴.۳. Property Inference
[ NISTAML.034 ]
در حملات استنتاج ویژگی (که «استنتاج توزیع» نیز نامیده میشود)، مهاجم میکوشد با تعامل با یک مدل ML، اطلاعاتی سراسری درباره توزیع دادههای آموزشی به دست آورد. برای مثال، مهاجم میتواند نسبت مجموعه آموزشی دارای یک ویژگی حساس مشخص (مانند اطلاعات جمعیتشناختی) را تعیین کند؛ اطلاعاتی که ممکن است اسرار بالقوهای درباره مجموعه آموزشی را آشکار سازد که قرار نبوده منتشر شود.
حملات استنتاج ویژگی توسط Ateniese و همکاران [19] معرفی شدند و بهصورت یک بازی تمایزبخشی میان مهاجم و چالشگر که دو مدل با نسبتهای متفاوتی از دادههای حساس آموزش میدهد، صورتبندی شدند [361]. حملات استنتاج ویژگی در تنظیمات جعبهسفید طراحی شدهاند که در آنها مهاجم به کل مدل ML دسترسی دارد [19، 134، 361] و نیز در تنظیمات جعبهسیاه که در آنها مهاجم به مدل پرسوجو ارسال میکند و برچسبهای پیشبینیشده [233] یا احتمالهای کلاس [74، 437] را دریافت میکند. این حملات برای مدلهای HIDDEN MARKOV MODEL، SUPPORT VECTOR MACHINES [19]، FEEDFORWARD NEURAL NETWORKS [134، 233، 437]، CONVOLUTIONAL NEURAL NETWORKS [361]، FEDERATED LEARNING [240]، «شبکههای مولد رقابتی» (Generative Adversarial Networks, GANs) [443] و GRAPH NEURAL NETWORK [442] نشان داده شدهاند. Mahloujifar و همکاران [233] و Chaudhauri و همکاران [74] نشان دادند که مسمومسازی (Poisoning) ویژگی موردنظر میتواند به طراحی یک آزمون تمایزبخشی مؤثرتر برای استنتاج ویژگی کمک کند. افزون بر این، Chaudhauri و همکاران [74] یک حمله کارآمد برآورد اندازه ویژگی طراحی کردند که نسبت دقیق جمعیت موردنظر را بازیابی میکند.
رابطه میان حملات گوناگون استنتاج از مجموعه آموزشی، مانند «استنتاج عضویت» (membership inference)، استنتاج صفت (attribute inference) و استنتاج ویژگی (property inference)، توسط Salem و همکاران [321] در چارچوب تعریفی یکپارچهای بررسی شده است.
استناد
محمدعلی کهندژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C20-S22
شناسهٔ محتوا KDJ-AI-2026E1-P03-C20-S22-A9DA6B54
۲.۴.۴. «استخراج مدل» (Model Extraction)
[ NISTAML.031 ]
در سناریوهای MLaaS، ارائهدهندگان ابری معمولاً مدلهای بزرگ ML را با استفاده از دادههای اختصاصی آموزش میدهند و مایلاند معماری و پارامترهای مدل محرمانه باقی بماند. هدف مهاجمی که حمله «استخراج مدل» (Model Extraction) را انجام میدهد، استخراج اطلاعات مربوط به معماری و پارامترهای مدل از طریق ارسال پرسوجو به مدل ML آموزشدیده توسط ارائهدهنده MLaaS است. نخستین حملات سرقت مدل توسط Tramer و همکاران [376] روی چندین سرویس آنلاین ML برای مدلهای مختلف ML، شامل رگرسیون لجستیک، درختهای تصمیم و شبکههای عصبی نشان داده شد. با این حال، Jagielski و همکاران [177] نشان دادهاند که استخراج دقیق مدلهای ML ناممکن است. در عوض، میتوان مدلی معادل از نظر عملکردی بازسازی کرد که با مدل اصلی متفاوت است اما در وظیفه پیشبینی عملکردی مشابه دارد. Jagielski و همکاران [177] نشان دادهاند که حتی وظیفه ضعیفترِ استخراج مدلهای معادل از نظر عملکردی نیز از نظر محاسباتی بسیار پرهزینه (NP-hard) است.
چندین تکنیک برای اجرای حملات استخراج مدل در ادبیات موضوع معرفی شده است. روش نخست، استخراج مستقیم مبتنی بر صورتبندی ریاضی عملیات انجامشده در شبکههای عصبی عمیق است که به مهاجم امکان میدهد وزنهای مدل را بهصورت جبری محاسبه کند [58, 177, 376]. تکنیک دوم، استفاده از روشهای یادگیری برای استخراج است. برای مثال، یادگیری فعال [70] میتواند پرسوجوها به مدل ML را برای استخراج کارآمدتر وزنهای مدل هدایت کند، و یادگیری تقویتی میتواند یک راهبرد تطبیقی آموزش دهد که تعداد پرسوجوها را کاهش دهد [280]. تکنیک سوم از اطلاعات «کانال جانبی» (Side Channel) برای استخراج مدل استفاده میکند. Batina و همکاران [29] از کانالهای جانبی الکترومغناطیسی برای بازیابی مدلهای ساده شبکه عصبی استفاده کردند، در حالی که Rakin و همکاران [303] نشان دادند چگونه میتوان از «حمله ROWHAMMER» (Rowhammer Attack) برای استخراج مدل معماریهای پیچیدهتر شبکههای عصبی کانولوشنی استفاده کرد.
neural network architectures.
«استخراج مدل» (Model Extraction) اغلب هدف نهایی نیست، بلکه گامی بهسوی حملات دیگر است. با آشکار شدن وزنها و معماری مدل، مهاجمان میتوانند حملات قدرتمندتری را که در حالتهای جعبهسفید یا جعبهخاکستری متداول هستند، آغاز کنند. بنابراین، جلوگیری از استخراج مدل میتواند حملات بعدی را که به دانستن معماری و وزنهای مدل از سوی مهاجم وابستهاند، کاهش دهد.
استناد
محمدعلی کهندژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C20-S23
شناسهٔ محتوا KDJ-AI-2026E1-P03-C20-S23-F1E441C4
۲.۴.۵. اقدامات کاهشی
کشف حملات بازسازی در برابر اطلاعات تجمعی، انگیزهای برای تعریف دقیق «حریم خصوصی تفاضلی» (differential privacy, DP) [112، 113] شد؛ تعریفی بسیار قوی از «حریم خصوصی» (Privacy) که تضمین میکند میزان اطلاعاتی که مهاجم با دسترسی به خروجی الگوریتم درباره هر رکورد فردی در مجموعهداده به دست میآورد، محدود باشد. تعریف اصلی و خالص DP دارای یک پارامتر حریم خصوصی ε (یعنی بودجه حریم خصوصی) است که احتمال این را محدود میکند که مهاجمِ دارای دسترسی به خروجی الگوریتم بتواند تشخیص دهد آیا یک رکورد خاص در مجموعهداده گنجانده شده است یا خیر. DP به مفاهیم DP تقریبی گسترش یافته است که پارامتر دومی به نام δ دارد و بهصورت احتمال افشای تصادفی اطلاعات در کنار ε تفسیر میشود، و همچنین DP رنی (Rènyi DP) [246].
DP به دلیل چند ویژگی (properties) سودمند بهطور گسترده پذیرفته شده است: حریم خصوصی گروهی (یعنی تعمیم تعریف به دو مجموعهداده که در k رکورد با هم تفاوت دارند)، پسپردازش (یعنی حفظ حریم خصوصی حتی پس از پردازش خروجی)، و ترکیبپذیری (یعنی ترکیب حریم خصوصی در صورت انجام چند محاسبه روی مجموعهداده). سازوکارهای (mechanisms) DP برای محاسبات آماری شامل سازوکار گاوسی [113]، سازوکار لاپلاس [113] و سازوکار نمایی [238] هستند. پرکاربردترین الگوریتم DP برای آموزش مدلهای ML، الگوریتم DP-SGD [1] است و بهبودهای اخیر شامل DP-FTRL [189] و تجزیه ماتریسی DP [105] میشوند.
بنا به تعریف، DP کاهشی در برابر حملات بازسازی داده و «استنتاج عضویت» (membership inference) فراهم میکند. در واقع، تعریف DP بلافاصله یک کران بالا بر موفقیت حریف در اجرای حمله استنتاج عضویت به دست میدهد. Thudi و همکاران [369] کرانهای دقیقی بر موفقیت استنتاج عضویت استخراج کردهاند. با این حال، DP تضمینی در برابر حملات «استخراج مدل» (Model Extraction) فراهم نمیکند، زیرا این روش برای حفاظت از دادههای آموزشی طراحی شده است، نه مدل. چندین مقاله نتایج منفی پس از استفاده از حریم خصوصی تفاضلی برای محافظت در برابر حملات استنتاج ویژگی گزارش کردهاند؛ حملاتی که هدف آنها استخراج ویژگیهای زیرمجموعههای جمعیتی در مجموعه آموزشی است [74، 233].
یکی از چالشهای اصلی استفاده از DP در عمل، تنظیم پارامترهای حریم خصوصی برای دستیابی به مصالحهای میان سطح حریم خصوصی و کارایی بهدستآمده است که معمولاً بر حسب دقت برای مدلهای ML سنجیده میشود. تحلیل الگوریتمهای حفظ حریم خصوصی (مانند DP-SGD) اغلب حالت بدترین حالت است و دقیق نیست، و انتخاب پارامترهای حریم خصوصی صرفاً بر پایه تحلیل نظری به از دست رفتن کارایی میانجامد. بنابراین، در عمل اغلب از پارامترهای حریم خصوصی بزرگ استفاده میشود (برای مثال، انتشار سرشماری ۲۰۲۰ ایالات متحده از ε = 19.61 استفاده کرد)، و تخمین حریم خصوصی دقیق حاصل در عمل دشوار است. Jagielski و همکاران [181] «ممیزی حریم خصوصی» (privacy auditing) را با هدف سنجش تجربی تضمینهای واقعی حریم خصوصی یک الگوریتم و تعیین کرانهای پایین حریم خصوصی از طریق اجرای حملات حریم خصوصی معرفی کردند. بسیاری از فنون ممیزی حریم خصوصی بر پایه درج «قناریها» (canaries) — نمونههای مصنوعی و بهآسانی قابلشناساییِ «خارج از توزیع» (OUT-OF-DISTRIBUTION, OOD) — در مجموعه آموزشی و سپس سنجش حضور قناریها در خروجی مدل استوارند. ممیزی همچنین میتواند با حملات استنتاج عضویت انجام شود [183، 427]، اما درج عمدی قناریهای قوی ممکن است برآوردهای بهتری از افشای حریم خصوصی به دست دهد [181، 265]. پیشرفتهای اخیر در ممیزی حریم خصوصی شامل کرانهای دقیقتر برای سازوکار گاوسی [263] و روشهای آماری دقیقی است که استفاده از قناریهای متعدد را برای کاهش پیچیدگی (Complexity) نمونهای ممیزی ممکن میسازند [297]. افزون بر این، دو روش کارآمد برای ممیزی حریم خصوصی با آموزش یک مدل واحد پیشنهاد شده است: Steinke و همکاران [355] از قناریهای تصادفی متعدد دادهای بدون تحمیل هزینه حریم خصوصی گروهی استفاده کردند؛ و Andrew و همکاران [10] از قناریهای تصادفی متعدد سرویسگیرنده و آمارههای آزمون شباهت کسینوسی برای ممیزی یادگیری فدرِیتِ خصوصی در سطح کاربر بهره گرفتند.
حریم خصوصی تفاضلی مفهوم دقیقی از حریم خصوصی فراهم میکند و در برابر حملات استنتاج عضویت و بازسازی داده محافظت میکند. برای دستیابی به بهترین توازن میان حریم خصوصی و کارایی، توصیه میشود ممیزی تجربی حریم خصوصی برای مکمل تحلیل نظریِ الگوریتمهای آموزشِ خصوصی به کار رود.
فنون کاهشی دیگری نیز در برابر استخراج مدل وجود دارد، مانند محدودسازی پرسوجوهای کاربران به مدل، شناسایی پرسوجوهای مشکوک به مدل، یا ایجاد معماریهای مقاومتر برای جلوگیری از حملات کانال جانبی. با این حال، مهاجمان دارای انگیزه و برخوردار از منابع کافی میتوانند از این فنون عبور کنند و باید با احتیاط از آنها استفاده شود. راهنماهای عملی برای ایمنسازی استقرارهای ML در دسترس است [69، 274]. رویکردی کاملاً متفاوت برای کاهش بالقوهی افشای حریم خصوصی دادههای کاربر، انجام «فرایادگیری ماشینی» (Machine Unlearning) است؛ فنی که به کاربر امکان میدهد حذف دادههای خود را از یک مدل ML آموزشدیده درخواست کند. فنون موجود برای فرایادگیری ماشینی یا دقیق هستند (یعنی آموزش دوباره مدل از ابتدا یا از یک نقطه بازرسی معیّن) [45، 52] یا تقریبی (یعنی بهروزرسانی پارامترهای مدل برای حذف تأثیر رکوردهای فرایادگرفتهشده) [139، 175، 268]. این فنون مصالحههای متفاوتی میان محاسبات و تضمینهای حریم خصوصی ارائه میدهند و روشهای دقیق فرایادگیری، با هزینه محاسباتی بیشتر، حریم خصوصی قویتری فراهم میکنند.
استناد
محمدعلی کهندژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C20-S24
شناسهٔ محتوا KDJ-AI-2026E1-P03-C20-S24-A5DAF444