رفتن به محتوای اصلی
کهن‌دژکتاب مرجع هوش مصنوعی
منابعاعتبارسنجی
فهرست این فصلبخش ۳، فصل ۱۷

بخش ۳، فصل ۱۷

راهنمای مطالعهٔ بخش سوم: امنیت هوش مصنوعی و مدل‌های بنیادین

متن اصلی فارسی با منشأ، شناسه و پیوند استناد پایدار.

قلمرو بخش و سند پایهٔ آن

جمع‌بندی تدوینگر

بخش سوم کتاب به امنیت سیستم‌های هوش مصنوعی و مدل‌های بنیادین اختصاص دارد و بر پایهٔ سه سند NIST بنا شده است. حجیم‌ترین و اصلی‌ترین آن‌ها گزارش «NIST AI 100-2e2025» با عنوان «یادگیری ماشین خصمانه: یک طبقه‌بندی و واژگان برای حملات و اقدامات کاهنده» است. این سند در سری گزارش‌های «هوش مصنوعی قابل‌اعتماد و مسئولانه» NIST جای دارد، ماهیتی رده‌شناسانه و اصطلاح‌شناختی دارد و در وضعیت نسخهٔ نهایی (Final) در مارس ۲۰۲۵ (اسفند ۱۴۰۳ تا فروردین ۱۴۰۴) منتشر شده است. دو سند دیگرِ این بخش عبارت‌اند از «NIST AI 800-1 (IPD)» — دربارهٔ مدیریت ریسک سوءاستفاده از مدل‌های بنیادین دوکاربردی (Dual-Use Foundation Models)، در وضعیت پیش‌نویس عمومی (Initial Public Draft) — و «NIST SP 800-218A» — دربارهٔ رویه‌های امن توسعهٔ نرم‌افزار (SSDF) ویژهٔ توسعهٔ مدل‌های هوش مصنوعی، در وضعیت نهایی (Final).

محتوای NIST AI 100-2e2025 (که بخش عمدهٔ این بخش از کتاب را تشکیل می‌دهد) سه لایه دارد:

  • فصل آغازین، خلاصهٔ اجرایی و چکیدهٔ گزارش است و توضیح می‌دهد چرا ماهیت آماری و داده‌محورِ سیستم‌های یادگیری ماشین (ML)، بردارهای حمله‌ای فراتر از تهدیدهای نرم‌افزار سنتی پیشِ روی سازمان‌ها می‌گذارد.
  • فصل دوم، طبقه‌بندی حملات یادگیری ماشین خصمانه (AML) بر سیستم‌های پیش‌بین (PredAI) را بر پایهٔ سه محور ارائه می‌کند: اهداف مهاجم (فروپاشی دسترس‌پذیری، نقض صحت و به‌خطرافتادن حریم خصوصی)، قابلیت‌ها و دانش مهاجم. سپس خانواده‌های اصلی حمله — گریز (Evasion)، مسموم‌سازی (Poisoning)، حملات حریم خصوصی و استخراج مدل — به‌همراه اقدامات کاهندهٔ آن‌ها بررسی می‌شوند.
  • فصل سوم، حملات ویژهٔ سیستم‌های مولد (GenAI) را پوشش می‌دهد؛ از مسموم‌سازی داده در مقیاس وب و مدل‌های پایهٔ توسعه‌یافته نزد اشخاص ثالث، تا حملات مستقیم به‌واسطهٔ دستور (Prompt Injection) و چالش‌های زنجیرهٔ تأمین.

پس از این سه فصل، دو فصل مستقل دیگر می‌آیند که هر یک ترجمهٔ سند جداگانه‌ای هستند: فصل «مدیریت ریسک سوءاستفاده برای مدل‌های بنیادین دوکاربردی» (بر پایهٔ NIST AI 800-1 IPD) و فصل «رویه‌های امن توسعهٔ نرم‌افزار برای هوش مصنوعی مولد و مدل‌های بنیادین دوکاربردی» (بر پایهٔ NIST SP 800-218A، شامل نمایهٔ اجتماعی SSDF ویژهٔ توسعهٔ مدل هوش مصنوعی).

نکتهٔ روش‌شناختی: گزارش NIST AI 100-2e2025 ماهیتی توصیفی و واژگانی دارد، نه تجویزی؛ یعنی چارچوبی مشترک برای نام‌گذاری و تحلیل حملات فراهم می‌کند. NIST SP 800-218A در مقابل تجویزی است (رویه‌ها و وظایف مشخص). نگاشت این مفاهیم به کنترل‌ها، سناریوها و چک‌لیست‌های اجرایی، در لایهٔ تدوینگر انجام شده و صریحاً از متن ترجمه‌شدهٔ NIST متمایز است.

استناد

محمدعلی کهن‌دژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C17-S01

شناسهٔ محتوا KDJ-AI-2026E1-P03-C17-S01-B0F84ACA

پیوند مستقیم این بخش

پیش‌نیازها و ترتیب پیشنهادی مطالعه

جمع‌بندی تدوینگر

پیش‌نیاز این بخش، آشنایی کلی با مفاهیم پایهٔ یادگیری ماشین (مرحلهٔ آموزش و مرحلهٔ استقرار، یادگیری با نظارت) و چارچوب مدیریت ریسک هوش مصنوعی است که در بخش‌های پیشین کتاب معرفی شده است؛ با این حال، خوانندهٔ مدیریتی نیز بدون پیش‌زمینهٔ فنی عمیق می‌تواند پیام اصلی فصل‌ها را دنبال کند.

ترتیب پیشنهادی زیر، پیشنهاد لایهٔ تدوینگر است، نه الزامِ سند NIST:

  • با خلاصهٔ اجرایی و چکیده آغاز کنید تا تصویر کلان رده‌شناسی و انگیزهٔ گزارش را به دست آورید.
  • سپس محورهای طبقه‌بندی حملات PredAI را بخوانید: مراحل یادگیری، اهداف مهاجم، قابلیت‌ها و دانش مهاجم. این محورها زبان مشترک تمام بحث‌های بعدی‌اند.
  • خانواده‌های حمله را به ترتیب مرور کنید: نخست حملات گریز و مسموم‌سازی، سپس حملات حریم خصوصی (بازسازی داده، استنتاج عضویت، استنتاج ویژگی) و در پایان استخراج مدل.
  • فصل GenAI را مطالعه کنید و بر مسموم‌سازی داده در مقیاس وب، ریسک مدل‌های پایهٔ شخص ثالث، زنجیرهٔ تأمین و حملات تزریق دستور تمرکز کنید.
  • سپس فصل «مدیریت ریسک سوءاستفاده برای مدل‌های بنیادین دوکاربردی» (NIST AI 800-1 IPD) را بخوانید تا با ریسک‌های استقرار و سوءاستفاده از مدل‌های بنیادین آشنا شوید.
  • در پایان، فصل «رویه‌های امن توسعهٔ نرم‌افزار» (NIST SP 800-218A) را مرور کنید؛ این فصل برای تیم فنی و توسعه‌دهندگان مدل کاربردی‌ترین بخش است.

اگر زمان مطالعه محدود است، در لایهٔ اجرایی این کتاب پیشنهاد می‌شود دست‌کم نمونه‌های «حملات در دنیای واقعی»، بحث اقدامات کاهشی در فصل PredAI و بخش زنجیرهٔ تأمین در فصل GenAI را بخوانید؛ این مباحث بیشترین کاربرد را در ارزیابی وضعیت سازمان شما دارند.

استناد

محمدعلی کهن‌دژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C17-S02

شناسهٔ محتوا KDJ-AI-2026E1-P03-C17-S02-FA32D05E

پیوند مستقیم این بخش

هر فصل برای کدام مخاطب مهم‌تر است؟

جمع‌بندی تدوینگر

جدول زیر، در لایهٔ تدوینگر و به‌عنوان یک پیشنهاد مطالعاتی، اهمیت نسبی موضوعات این بخش را برای چهار گروه مخاطب (مدیر، تیم فنی، حقوقی و انطباق، ممیزی) نشان می‌دهد:

موضوعمخاطب کلیدیدلیل اهمیت
خلاصهٔ اجرایی و چکیدههمهٔ مخاطبانتصویر کلان بردارهای تهدید ویژهٔ AI
طبقه‌بندی حملات PredAI (اهداف، قابلیت، دانش)تیم فنی، ممیزیزبان مشترک برای مدل‌سازی تهدید
حملات گریز و مسموم‌سازیتیم فنیطراحی آزمون آسیب‌پذیری و کنترل دادهٔ آموزشی
حملات حریم خصوصی و استخراج مدلحقوقی و انطباق، تیم فنیپیوند مستقیم با داده‌های اشخاص و دارایی فناوری
اقدامات کاهشی و حریم خصوصی تفاضلیتیم فنیانتخاب کنترل‌های فنی کاهندهٔ ریسک
حملات GenAI، زنجیرهٔ تأمین و تزریق دستورمدیر، تیم فنیریسک مدل‌های پایهٔ ثالث در معماری‌های LLM
مدیریت ریسک سوءاستفاده (NIST AI 800-1 IPD)مدیر، حقوقی و انطباقتصمیم استقرار و آستانه‌های ریسک سوءاستفاده
رویه‌های امن توسعهٔ نرم‌افزار (NIST SP 800-218A)تیم فنی، ممیزینمایهٔ اجتماعی SSDF برای توسعهٔ مدل هوش مصنوعی

به مخاطب حقوقی و انطباق تأکید می‌کنیم که مطالعهٔ حملات حریم خصوصی، درک ریسک‌های ناشی از انتشار مدل یا آمارِ به‌دست‌آمده از داده‌های اشخاص را عمیق‌تر می‌کند؛ ممکن است بسته به صنعت و مقررات حاکم، الزامات دیگری نیز اعمال شود.

استناد

محمدعلی کهن‌دژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P03-C17-S03

شناسهٔ محتوا KDJ-AI-2026E1-P03-C17-S03-82429293

پیوند مستقیم این بخش