فهرست این فصلبخش ۳، فصل ۱۷
بخش ۳، فصل ۱۷
راهنمای مطالعهٔ بخش سوم: امنیت هوش مصنوعی و مدلهای بنیادین
متن اصلی فارسی با منشأ، شناسه و پیوند استناد پایدار.
قلمرو بخش و سند پایهٔ آن
بخش سوم کتاب به امنیت سیستمهای هوش مصنوعی و مدلهای بنیادین اختصاص دارد و بر پایهٔ سه سند NIST بنا شده است. حجیمترین و اصلیترین آنها گزارش «NIST AI 100-2e2025» با عنوان «یادگیری ماشین خصمانه: یک طبقهبندی و واژگان برای حملات و اقدامات کاهنده» است. این سند در سری گزارشهای «هوش مصنوعی قابلاعتماد و مسئولانه» NIST جای دارد، ماهیتی ردهشناسانه و اصطلاحشناختی دارد و در وضعیت نسخهٔ نهایی (Final) در مارس ۲۰۲۵ (اسفند ۱۴۰۳ تا فروردین ۱۴۰۴) منتشر شده است. دو سند دیگرِ این بخش عبارتاند از «NIST AI 800-1 (IPD)» — دربارهٔ مدیریت ریسک سوءاستفاده از مدلهای بنیادین دوکاربردی (Dual-Use Foundation Models)، در وضعیت پیشنویس عمومی (Initial Public Draft) — و «NIST SP 800-218A» — دربارهٔ رویههای امن توسعهٔ نرمافزار (SSDF) ویژهٔ توسعهٔ مدلهای هوش مصنوعی، در وضعیت نهایی (Final).
محتوای NIST AI 100-2e2025 (که بخش عمدهٔ این بخش از کتاب را تشکیل میدهد) سه لایه دارد:
- فصل آغازین، خلاصهٔ اجرایی و چکیدهٔ گزارش است و توضیح میدهد چرا ماهیت آماری و دادهمحورِ سیستمهای یادگیری ماشین (ML)، بردارهای حملهای فراتر از تهدیدهای نرمافزار سنتی پیشِ روی سازمانها میگذارد.
- فصل دوم، طبقهبندی حملات یادگیری ماشین خصمانه (AML) بر سیستمهای پیشبین (PredAI) را بر پایهٔ سه محور ارائه میکند: اهداف مهاجم (فروپاشی دسترسپذیری، نقض صحت و بهخطرافتادن حریم خصوصی)، قابلیتها و دانش مهاجم. سپس خانوادههای اصلی حمله — گریز (Evasion)، مسمومسازی (Poisoning)، حملات حریم خصوصی و استخراج مدل — بههمراه اقدامات کاهندهٔ آنها بررسی میشوند.
- فصل سوم، حملات ویژهٔ سیستمهای مولد (GenAI) را پوشش میدهد؛ از مسمومسازی داده در مقیاس وب و مدلهای پایهٔ توسعهیافته نزد اشخاص ثالث، تا حملات مستقیم بهواسطهٔ دستور (Prompt Injection) و چالشهای زنجیرهٔ تأمین.
پس از این سه فصل، دو فصل مستقل دیگر میآیند که هر یک ترجمهٔ سند جداگانهای هستند: فصل «مدیریت ریسک سوءاستفاده برای مدلهای بنیادین دوکاربردی» (بر پایهٔ NIST AI 800-1 IPD) و فصل «رویههای امن توسعهٔ نرمافزار برای هوش مصنوعی مولد و مدلهای بنیادین دوکاربردی» (بر پایهٔ NIST SP 800-218A، شامل نمایهٔ اجتماعی SSDF ویژهٔ توسعهٔ مدل هوش مصنوعی).
نکتهٔ روششناختی: گزارش NIST AI 100-2e2025 ماهیتی توصیفی و واژگانی دارد، نه تجویزی؛ یعنی چارچوبی مشترک برای نامگذاری و تحلیل حملات فراهم میکند. NIST SP 800-218A در مقابل تجویزی است (رویهها و وظایف مشخص). نگاشت این مفاهیم به کنترلها، سناریوها و چکلیستهای اجرایی، در لایهٔ تدوینگر انجام شده و صریحاً از متن ترجمهشدهٔ NIST متمایز است.
استناد
محمدعلی کهندژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C17-S01
شناسهٔ محتوا KDJ-AI-2026E1-P03-C17-S01-B0F84ACA
پیشنیازها و ترتیب پیشنهادی مطالعه
پیشنیاز این بخش، آشنایی کلی با مفاهیم پایهٔ یادگیری ماشین (مرحلهٔ آموزش و مرحلهٔ استقرار، یادگیری با نظارت) و چارچوب مدیریت ریسک هوش مصنوعی است که در بخشهای پیشین کتاب معرفی شده است؛ با این حال، خوانندهٔ مدیریتی نیز بدون پیشزمینهٔ فنی عمیق میتواند پیام اصلی فصلها را دنبال کند.
ترتیب پیشنهادی زیر، پیشنهاد لایهٔ تدوینگر است، نه الزامِ سند NIST:
- با خلاصهٔ اجرایی و چکیده آغاز کنید تا تصویر کلان ردهشناسی و انگیزهٔ گزارش را به دست آورید.
- سپس محورهای طبقهبندی حملات PredAI را بخوانید: مراحل یادگیری، اهداف مهاجم، قابلیتها و دانش مهاجم. این محورها زبان مشترک تمام بحثهای بعدیاند.
- خانوادههای حمله را به ترتیب مرور کنید: نخست حملات گریز و مسمومسازی، سپس حملات حریم خصوصی (بازسازی داده، استنتاج عضویت، استنتاج ویژگی) و در پایان استخراج مدل.
- فصل GenAI را مطالعه کنید و بر مسمومسازی داده در مقیاس وب، ریسک مدلهای پایهٔ شخص ثالث، زنجیرهٔ تأمین و حملات تزریق دستور تمرکز کنید.
- سپس فصل «مدیریت ریسک سوءاستفاده برای مدلهای بنیادین دوکاربردی» (NIST AI 800-1 IPD) را بخوانید تا با ریسکهای استقرار و سوءاستفاده از مدلهای بنیادین آشنا شوید.
- در پایان، فصل «رویههای امن توسعهٔ نرمافزار» (NIST SP 800-218A) را مرور کنید؛ این فصل برای تیم فنی و توسعهدهندگان مدل کاربردیترین بخش است.
اگر زمان مطالعه محدود است، در لایهٔ اجرایی این کتاب پیشنهاد میشود دستکم نمونههای «حملات در دنیای واقعی»، بحث اقدامات کاهشی در فصل PredAI و بخش زنجیرهٔ تأمین در فصل GenAI را بخوانید؛ این مباحث بیشترین کاربرد را در ارزیابی وضعیت سازمان شما دارند.
استناد
محمدعلی کهندژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C17-S02
شناسهٔ محتوا KDJ-AI-2026E1-P03-C17-S02-FA32D05E
هر فصل برای کدام مخاطب مهمتر است؟
جدول زیر، در لایهٔ تدوینگر و بهعنوان یک پیشنهاد مطالعاتی، اهمیت نسبی موضوعات این بخش را برای چهار گروه مخاطب (مدیر، تیم فنی، حقوقی و انطباق، ممیزی) نشان میدهد:
| موضوع | مخاطب کلیدی | دلیل اهمیت |
|---|---|---|
| خلاصهٔ اجرایی و چکیده | همهٔ مخاطبان | تصویر کلان بردارهای تهدید ویژهٔ AI |
| طبقهبندی حملات PredAI (اهداف، قابلیت، دانش) | تیم فنی، ممیزی | زبان مشترک برای مدلسازی تهدید |
| حملات گریز و مسمومسازی | تیم فنی | طراحی آزمون آسیبپذیری و کنترل دادهٔ آموزشی |
| حملات حریم خصوصی و استخراج مدل | حقوقی و انطباق، تیم فنی | پیوند مستقیم با دادههای اشخاص و دارایی فناوری |
| اقدامات کاهشی و حریم خصوصی تفاضلی | تیم فنی | انتخاب کنترلهای فنی کاهندهٔ ریسک |
| حملات GenAI، زنجیرهٔ تأمین و تزریق دستور | مدیر، تیم فنی | ریسک مدلهای پایهٔ ثالث در معماریهای LLM |
| مدیریت ریسک سوءاستفاده (NIST AI 800-1 IPD) | مدیر، حقوقی و انطباق | تصمیم استقرار و آستانههای ریسک سوءاستفاده |
| رویههای امن توسعهٔ نرمافزار (NIST SP 800-218A) | تیم فنی، ممیزی | نمایهٔ اجتماعی SSDF برای توسعهٔ مدل هوش مصنوعی |
به مخاطب حقوقی و انطباق تأکید میکنیم که مطالعهٔ حملات حریم خصوصی، درک ریسکهای ناشی از انتشار مدل یا آمارِ بهدستآمده از دادههای اشخاص را عمیقتر میکند؛ ممکن است بسته به صنعت و مقررات حاکم، الزامات دیگری نیز اعمال شود.
استناد
محمدعلی کهندژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C17-S03
شناسهٔ محتوا KDJ-AI-2026E1-P03-C17-S03-82429293