فهرست این فصلبخش ۵، فصل ۳۸ — صفحهٔ ۷ از ۱۲
بخش ۵، فصل ۳۸ — صفحهٔ ۷ از ۱۲
کاهش خطرهای ناشی از محتوای مصنوعی
متن اصلی فارسی با منشأ، شناسه و پیوند استناد پایدار.
۵.۱.۳.۱. چالشها و محدودیتهای پالایش خروجی تصویر
- چالشها و محدودیتهای پالایش خروجی تصویر مشابه روشهای دیگری است که پس از آموزش مدلهای GAI اعمال میشوند؛ این روشها نمیتوانند بهطور کامل از خروجیهای محتوای مصنوعی CSAM و NCII مضر جلوگیری کنند، اگر دادههای آموزشی حاوی این محتوای مضر باشند. اثربخشی پالایههای خروجی تصویر به دادههای آموزشی آنها و میزان پوشش گستره وسیعی از محتوای جنسی وابسته است. مشابه سایر طبقهبندها، این طبقهبندها ممکن است در مسدودسازی محتوا محافظهکار یا بسیار آسانگیر باشند، و تعیین آستانههای پالایه و سطوح اطمینان برای محتوایی که در ناحیه خاکستری قرار دارد، میتواند ذهنی باشد یا صرفاً ممکن است در سیاستهای داخلی یک سازمان بهعنوان نقضآمیز پوشش داده نشود، چالشبرانگیز است. این طبقهبندها همچنین میتوانند بر اساس سوءاستفاده واقعی از ابزارها توسط کنشگران مخرب آگاه شوند و برای اثربخش بودن، توصیه میشود
- بهطور مستمر بهروزرسانی شوند تا موارد سوءاستفاده تجربی را منعکس کنند. این یکی دیگر از چالشهای عمده اجراست، از آن رو که شکلهای جدید سوءاستفاده ممکن است بهسختی تشخیص داده شوند، اگر طبقهبندها برای تشخیص محتوای سوءاستفاده نوظهور طراحی نشده باشند. پالایش خروجی تصویر ممکن است برای محتوایی که برهنگی روشن و آشکار دارد، با توجه به وجود طبقهبندهای برهنگی، مؤثرتر باشد، اما برای تصویرسازیهای جنسی مضر دیدهنشده یا محتوایی که در ناحیه خاکستری قرار دارد، کمککنندهتر نباشد. در نهایت، در اختیار داشتن مجموعهداده آموزشی حاوی محتوای صریح، خود میتواند برای پژوهشگران صنعت و دانشگاه یک ریسک باشد.
5.1.4. درهمسازی CSAM و NCII مصنوعی تأییدشده
- درهمسازی CSAM و NCII مصنوعی پس از ایجاد آنها و سپس اشتراکگذاری مناسب این درهمسازها با پلتفرمها، جامعه مدنی و مجریان قانون، در حد مناسب، میتواند به رهگیری انتشار آنها در سراسر اینترنت و مهار گسترش بیشتر کمک کند.
- درهمسازهای رمزنگارانه از «اثر موج» استفاده میکنند که بر این اساس است که حتی تغییری اندک در دادههای ورودی، درهمساز رمزنگارانهای کاملاً متفاوت تولید میکند. وقتی یک حرف در یک سند نوشتاری یا یک پیکسل در یک تصویر تغییر کند، درهمساز رمزنگارانه جدید شبیه درهمساز اصلی نخواهد بود. برای مثال، اگر یک تصویر CSAM بهصورت رمزنگارانه درهمسازی شود و همان تصویر در پلتفرم شبکه اجتماعی شرکتکننده در پایگاهداده اشتراک درهمساز حاوی تصویر اصلی منتشر شود، آن پلتفرم باید بتواند تطابق را شناسایی کند.
- درهمسازی رمزنگارانه در حال حاضر توسط ارائهدهندگان خدمات و پلتفرمها برای جلوگیری از بازتوزیع محتوای CSAM و NCII مصنوعی، بهمنظور شناسایی تطابقهای دقیق محتوای فجیع، به کار میرود. با این حال، این روش در برابر هک و حملات خصمانه مصونیت ندارد.
الگوریتمهای درهمسازی ادراکی برای پروندههای ورودی مشابه از دید انسانها، درهمسازهای مشابهی تولید میکنند؛ مقدار درهمساز وابسته به محتواست و اگر محتوا بهطور چشمگیر تغییر نکند، تقریباً یکسان باقی میماند؛ مثلاً وقتی تغییراتی در فشردهسازی، روشنایی، جهتگیری یا رنگ اعمال شود. هدف این است که فاصله و شباهت درهمسازهای ادراکی برای تقریب میزان شباهت میان پروندههای ورودی استفاده شود. هنوز این احتمال وجود دارد که درهمسازهای ادراکی مثبت کاذب و منفی کاذب تولید کنند؛ به این معنا که پروندههای ورودی متفاوت ممکن است درهمسازهای یکسان یا قابل مقایسه داشته باشند، در حالی که پروندههای ورودی مشابه ممکن است درهمسازهای متفاوتی داشته باشند.
پژوهشها نشان میدهند که درهمسازی ادراکی میتواند در قالبهای چندرسانهای مزایای بیشتری داشته باشد، از آن رو که تطابق درهمساز را بر اساس شباهت تولید میکند و تفاوتهای قالب و کیفیت را تحمل میکند. برای مثال، اگر یک تصویر CSAM مصنوعی تأییدشده با یک پالایه رنگ ویرایش شود و در یک پلتفرم منتشر گردد، تطابق درهمساز آن با محتوای اصلی حفظ خواهد شد.
اگر کارشناسان ایمنی در شرکتهای هوش مصنوعی بتوانند این اشکال محتوای مصنوعی را بررسی و تصاویر را بهعنوان CSAM و NCII شناسایی کنند (هرچند خود طبقهبندی تصاویر ممکن است چالشی حقوقی و سیاستی باشد)، این محتوا میتواند درهمسازی شود (هم با درهمسازهای رمزنگارانه و هم ادراکی) و در پایگاهدادههای مشترک
- مربوط به CSAM و NCII شناختهشده ذخیره شود تا سایر نهادها بتوانند آن را شناسایی کنند. این کار امکان تشخیص و کاهش این محتوا را در پلتفرمها و وبسایتهای مختلف فراهم میکند. این راهحل ممکن است نتواند از آسیبهای CSAM و NCII مصنوعی جلوگیری کند، اما میتواند شدت و پیامد این آسیبها را با مانعتراشی در برابر انتشار این محتوا و کاهش مواجهه بیشتر افرادی که بدون رضایت آنها به تصویر کشیده شدهاند، کاهش دهد.
- 5.1.4.1. چالشها و محدودیتهای درهمسازی CSAM و NCII مصنوعی تأییدشده
- درهمسازی CSAM و NCII تأییدشده با چالشهای هماهنگی، سیاستی و فنی روبهروست.
هماهنگی میان سازمانها برای اشتراکگذاری امن و اثربخش این محتوا میتواند دشوار باشد. هنجارها و قوانین تثبیتشدهای درباره گزارش CSAM وجود دارد و نیز سازمانهای تثبیتشدهای که این کار را انجام میدهند، مانند National Center on Missing and Exploited Children (NCMEC)، که ثبت درهمساز برای CSAM مصنوعی گزارششده را نیز آغاز کرده است. با این حال، تلاشهای مربوط به CSAM و NCII مصنوعی هنوز در مراحل اولیه است و میتواند میان توسعهدهندگان هوش مصنوعی، پلتفرمهای شبکههای اجتماعی، پلتفرمهای پیامرسانی و سایر ارائهدهندگان اینترنت بهشکل بهتری هماهنگ و استاندارد شود تا بتوان انتشار این محتوا را رهگیری و آن را بهشکل مؤثر و پیشگیرانه به مجریان قانون گزارش کرد.
چالشهای سیاستیِ درک بافت نیز بر درهمسازی CSAM و NCII مصنوعی اعمال میشود. تصویرسازی صریح از صغیر در تصاویر جرم جنایی است و CSAM مصنوعی میتواند بازنمایی بصری رفتار جنسی صریح درگیرکننده یک صغیر باشد که با استفاده از فناوریهای GAI تسهیل شده است. با این حال، در حال حاضر هیچ سیستم طبقهبندی یکپارچهای برای محتوای مصنوعی وجود ندارد که روشن کند یک تصویر اصیل چگونه ممکن است با هوش مصنوعی تغییر یافته باشد، آیا تصویر کاملاً مصنوعی است، آیا تصویر یک صغیر را نشان میدهد و چه نوع رفتار صریحی در تصویر نمایش داده شده است. مسئله کلیدی دیگر، تعیین این است که آیا تصویری که بارگذاری و با هوش مصنوعی تغییر یافته، NCII بوده است یا خیر. داوری درباره رضایت برای ابزارهای GAI پرکاربرد دشوار است، مگر آنکه خود ابزار مخرب باشد و بر روی تصاویر اصیل افراد آموزش دیده باشد، و رضایت در پلتفرمهای شبکههای اجتماعی نیز بهسختی قابل تشخیص است. رضایت همچنین ممکن است به بافتهای خاصی محدود باشد؛ برای مثال، ممکن است رضایتی برای استفاده از تصویر یک فرد جهت ایجاد تصویر جدید GAI وجود داشته باشد، اما نه برای توزیع آن تصویر. افزون بر این، حتی اگر این نواحی خاکستری سیاستی در سراسر صنعت و جامعه مدنی استاندارد شوند و از طریق مقررات و اقدامات حقوقی شفاف گردند، بررسی و درهمسازی این محتوا همچنان باید در مقیاس بزرگ انجام شود. در زمان حاضر، بررسی انسانی همچنان برای برچسبگذاری دقیق الزامی است که این امر همچنین بر سلامت روان بازبینانی که این محتوا را بررسی میکنند فشار وارد میکند. این ملاحظات سیاستی برای درک اهمیت دارند، زیرا برچسبگذاری و تعیین سطوح شدت برای محتوای درهمسازیشده کار سادهای نیست.
در نهایت، اشاره به این نکته مهم است که درهمسازی—هم ادراکی و هم رمزنگارانه—و آسیبپذیریهای آن محدودیتهای فنی دارد. درهمسازی میتواند مسائل استواری مانند برخورد درهمسازها (hash collisions) داشته باشد و هرچند میتواند تدبیر امنیتی سودمندی باشد، همچنین ممکن است مورد حمله و دستکاری قرار گیرد. تغییرات مخرب درهمسازها، بهویژه درهمسازهای ادراکی، نگرانیبرانگیز است، زیرا تغییرات مخرب بدون آنکه از اعوجاج مشروع متمایز شوند، ممکناند. عوامل مخرب میتوانند تصویری را به شکلی تغییر دهند که از اعوجاجهای مشروع یا بیخطر (مانند فشردهسازی) قابل تمایز نباشد و بدینسان یکپارچگی رهگیری تصویر اصلی را تحت تأثیر قرار دهند. درهمسازی ادراکی میتواند امکان نشت قابلتوجه داده را فراهم کند. همان ویژگیهایی که این فن را استوار میکنند، میتوانند امکان استنباط اطلاعات درباره محتوای زیربنایی از درهمساز آن محتوا را فراهم آورند و ریسکهای جدی حریم خصوصی ایجاد کنند.
در نهایت، پایگاهدادههای میزبان درهمسازها بهتر است بهدرستی امن شوند. الگوریتمهای اشتراک درهمسازِ با امنیت ناکافی میتوانند امکان بهرهبرداری بیشتر را فراهم کنند، که در صورت وجود CSAM تأییدشده یا سایر محتوای حساس در پایگاهدادههای اشتراک درهمساز، میتواند به قربانیان آسیب برساند.
- 5.1.5. فنون رهگیری دادههای اصالت و منشأ برای CSAM و NCII مصنوعی
- فنون رهگیری دادههای اصالت و منشأ برای محتوای مصنوعی، مانند واترمارک دیجیتال و ضبط فراداده، میتوانند برای کاهش آسیبهای CSAM و NCII مصنوعی به کار روند. این فنون میتوانند کنشگران مخرب را از استفاده از ابزارهایی که همه محتوای مصنوعی، از جمله CSAM و NCII مصنوعی را بهعنوان تولیدشده با AI5 افشا میکنند، بازدارند.
- کنشگران مخربی که CSAM و NCII مصنوعی میسازند، ممکن است ابزارها را برای بهرهبرداری کمتر جذاب بیابند، اگر آن ابزارها شامل اطلاعات اصالت و منشأ درباره منشأ یک تصویر باشند یا واترمارکی داشته باشند که نشان دهد تصویر با هوش مصنوعی تولید شده است؛ چرا که این امر میتواند بهسرعت به رد هر ادعایی مبنی بر اصیل بودن تصاویر CSAM و NCII مصنوعی کمک کند. بیشتر کنشگران مخربی که این محتوا را در اینترنت تولید میکنند، از ابزارهای متنباز استفاده میکنند یا حتی میتوانند مدلهای کوچکتر خود را بر اساس کد متنباز موجود بسازند، از آن رو که بهآسانی میتوانند حفاظها را حذف کنند. پیادهسازی رویکردهای رهگیری دادههای اصالت و منشأ که از واترمارکهای استوار و/یا فراداده امن و امضاشده با رمزنگاری بهره میگیرند، میتواند موانعی برای کنشگران مخربی که بهدنبال تولید سریع و حتی کسب درآمد از CSAM و NCII مصنوعی هستند، ایجاد کند. این روش ممکن است میزان CSAM و NCII مصنوعی ایجادشده با ابزارهایی که فنون رهگیری دادههای اصالت و منشأ را شامل میشوند را کاهش دهد، هرچند برای پشتیبانی از این ادعا به پژوهش بیشتری نیاز است.
تعیین مستقیم CSAM و NCII مصنوعی بهعنوان تولیدشده با هوش مصنوعی از طریق برچسبهای اصالت و منشأ میتواند شناسایی روان این محتوا را برای متخصصانی که این آسیبها را رهگیری میکنند ممکن سازد. منفعت شناسایی روان بهاحتمال زیاد زمانی اعمال میشود که محتوا توسط کنشگرانی کمتر ماهر تولید و منتشر شده باشد؛ کنشگرانی که بهطور راهبردی از ابزارهای فاقد فنون رهگیری دادههای اصالت و منشأ استفاده نمیکنند، یا کنشگرانی که از روشهای حذف واترمارک یا فراداده آگاه نیستند. محتوای مضر ایجادشده توسط ابزارهای GAI که از فنون رهگیری دادههای اصالت و منشأ—مانند واترمارک دیجیتال و ضبط فراداده—استفاده میکنند، در یک اکوسیستم میانکارپذیر، زمانی که ارائهدهندگان محتوا و پلتفرمهای گوناگون بتوانند واترمارکها را تشخیص دهند و/یا فراداده را حفظ کنند، میتواند بهآسانیتر شناسایی شود.
استناد
محمدعلی کهندژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P05-C38-S26
شناسهٔ محتوا KDJ-AI-2026E1-P05-C38-S26-F7DA881B
۵.۱.۵.۱. چالشها و محدودیتهای تکنیکهای رهگیری دادههای اصالت و منشأ برای CSAM مصنوعی و NCII
NCII
چالشها و محدودیتهای تکنیکهای رهگیری دادههای اصالت و منشأ برای CSAM مصنوعی و NCII شامل عدمقطعیتهای مربوط به اثربخشی، مسائل استواری، و امکان سوءاستفادهی خصمانه است.
پژوهش و شواهد کافی دربارهی اینکه آیا برچسبهای منشأ در کاهش آسیبهای ناشی از CSAM مصنوعی و NCII اثربخش هستند یا نه و چگونه، وجود ندارد. بازماندگان و قربانیانی که تصاویرشان بدون رضایت آنها از طریق AI تغییر یافته است، صرفنظر از اینکه محتوا برچسبهای آشکار و فرادادهی پیوستشده داشته باشد یا خیر، آسیب، تحقیر و تنزل را تجربه میکنند.
مسائل استواری تکنیکهای رهگیری دادههای اصالت و منشأ نیز موضوع نگرانکنندهای است. همانطور که در بخشهای پیشین اشاره شد، حتی استوارترین چارچوبها برای ضبط فراداده و واترمارک دیجیتال میتوانند در برابر دستکاری و تغییر آسیبپذیر باشند. واترمارکهای پنهان و آشکار را میتوان از محتوای دیجیتال حذف کرد و فرادادهی تعبیهشده نیز ممکن است بتواند برچیده شود. تمام مسائل منشأ که در این گزارش بحث شده است، بر کاربرد آن برای CSAM مصنوعی و NCII نیز صدق میکند. با توجه به سطح حساسیت و آسیب در این نوع محتوا، استواری میتواند بر شناسایی گستردهی این محتوا توسط متخصصان، و نیز قربانیان این آسیبها، اثر بگذارد.
در نهایت، مسائل استواری میتوانند زمینههایی برای سوءاستفادهی خصمانه از رهگیری دادههای اصالت و منشأ فراهم کنند. پژوهشهای اولیه نشان میدهند که کنشگران مخرب چگونه میتوانند واترمارکها و فرادادهها را از CSAM مصنوعی و NCII حذف کنند. در آن صورت، ممکن است بتوانند منافع برچسبهای روی این محتوا را تضعیف کنند. افزون بر این، بخش مربوط به
- فرادادهی تعبیهشده نشان میدهد که حملات خصمانه چگونه میتوانند بر فرادادهای که هم بدونامضا و هم امضاشده است انجام شوند؛ رمزنگاری تضمین کاملی در برابر حملات خصمانه فراهم نمیکند.
استناد
محمدعلی کهندژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P05-C38-S27
شناسهٔ محتوا KDJ-AI-2026E1-P05-C38-S27-8EA72266
۵.۱.۶. تیم قرمز (Red-Teaming) و آزمون برای CSAM و NCII
تیم قرمز و آزمون برای محتوای مصنوعی CSAM و NCII پیش از استقرار مدلهای GAI ممکن است بتواند ضمانتهای بیشتری فراهم کند. مطابق تعریف مندرج در فرمان اجرایی EO 14110 درباره توسعه و کاربرد ایمن، امن و قابلاعتماد هوش مصنوعی، تیم قرمز به «تلاشی ساختیافته برای آزمون بهمنظور یافتن نقصها و آسیبپذیریها در یک سامانه هوش مصنوعی، اغلب در محیطی کنترلشده و با همکاری توسعهدهندگان هوش مصنوعی» اشاره دارد. تیم قرمز نوعی محدود از روش ارزیابی است. در حال حاضر، تیم قرمز استانداردشده برای مدلهای GAI وجود ندارد، زیرا این حوزه تازه در حال شکلگیری است. با این حال، میتوان از سطح پایهای از تیم قرمز—مانند واردکردن انواع پرامپتهای خصمانه برای تولید محتوای مصنوعی CSAM و NCII—استفاده کرد. با جستوجوی اینترنت و سیستمهای داخلی برای یافتن پرامپتهای شناختهشدهای که برای تولید یا تلاش برای تولید محتوای مصنوعی CSAM و NCII بهکار رفتهاند، توسعهدهندگان مدلهای هوش مصنوعی میتوانند ارزیابیهای اولیهای از تمایل مدل به تولید این محتوا بهدست آورند. یک پروتکل تثبیتشده و یکسان تیم قرمز یا رهنمودهایی برای محتوای مصنوعی CSAM و NCII ممکن است بتواند اندازهگیری آینده این محتوا را تسهیل کند.
استناد
محمدعلی کهندژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P05-C38-S28
شناسهٔ محتوا KDJ-AI-2026E1-P05-C38-S28-CA825B4D
۵.۱.۶.۱. چالشها و محدودیتهای تیم قرمز و آزمون برای CSAM و NCII
تیم قرمز و آزمون نمیتوانند بهطور مؤثر جبرانکننده مسائل موجود در دادههای آموزشی باشند. این روشها همچنین وابسته به چگونگی انجام آزمون هستند و ازاینرو به سمت آزمون «آسیبپذیریها» (Vulnerabilities) شناختهشده در یک «سامانه هوش مصنوعی» (AI system) سوگیری دارند. همانطور که در سراسر این بخش اشاره شد، مجموعهدادههای آموزشی فاقد دادههای CSAM و NCII میتوانند به کاهش تولید این محتوا کمک کنند. حافظهای امنیتی تکمیلی که پس از اجرای اولیه آموزش اعمال میشوند، ممکن است در صورتی که خود دادهها آلوده باشند، کافی نباشند. در نهایت، با کاویدن مدل با پرامپتهایی که از پیش مضر و/یا قادر به تولید CSAM یا NCII مصنوعی شناخته شدهاند، ممکن است توسعهدهنده پوششی برای پرامپتهای خصمانه جدیدی که میتوانند از حفاظهای مدل عبور کنند نداشته باشد.
فرصتهایی برای توسعه بیشتر: برای طراحی راهبردهای مؤثر تیم قرمز بهمنظور شناسایی خروجیهای CSAM و NCII مصنوعی، تعیین اثربخشی تکنیکهای رهگیری «دادههای اصالت و منشأ» (Provenance data) بر این محتوا در کاهش «آسیب» (Harm)، طراحی طبقهبندها و صافیها برای حذف CSAM و NCII از دادههای آموزشی و نیز در سطوح ورودی و خروجی مدل، و ایجاد هماهنگی میان جامعه مدنی، صنعت، مجریان قانون و دیگر نهادهای مرتبط بهمنظور هشگذاری CSAM و NCII مصنوعی، به پژوهش و توسعه بیشتری نیاز است. پژوهش بیشتر همچنین برای بررسی امکانپذیری هشگذاری ادراکیِ حافظ حریم خصوصی مورد نیاز است.
- بهکارگیری مفاهیم در چرخه عمر «چارچوب مدیریت ریسک هوش مصنوعی» (AI Risk Management Framework, RMF) NIST
- «چارچوب مدیریت ریسک هوش مصنوعی» (AI RMF) NIST بیان میکند که «سنجش ریسک در مرحله پیشین چرخه عمر هوش مصنوعی ممکن است نتایج متفاوتی نسبت به سنجش ریسک در مرحله پسین به دست دهد؛ برخی «ریسکها» (Risks) ممکن است در
- مقطعی از زمان نهفته باشند و با سازگاری و تکامل سامانههای هوش مصنوعی افزایش یابند.» «کنشگران هوش مصنوعی» (AI actors) مختلف (هم کنشگرانی که مدلهای هوش مصنوعی را میسازند و/یا بهکار میگیرند) اغلب دیدگاههای ریسکی متفاوتی خواهند داشت و ممکن است
- تکنیکهای خاصی از رهگیری دادههای اصالت و منشأ یا «آشکارسازی محتوای مصنوعی» (Synthetic content detection) را بسته به مورد کاربرد، محصول و اهداف سازمانی سودمندتر بیابند.
تصویر در نسخهٔ PDF Figure 2. AI actors across AI lifecycle stages. From NIST AI 100-1 AI RMF 1.0
شکل ۲. کنشگران هوش مصنوعی در مراحل چرخه عمر هوش مصنوعی. برگرفته از NIST AI 100-1 AI RMF 1.0
داده و ورودی: گردآوری و پردازش دادهها: گردآوری و پالایش مسئولانه دادههای آموزشی میتواند به کاهش و/یا پیشگیری از آسیبهای خروجیهای CSAM و NCII مصنوعی در این فاز کمک کند. تکنیکهای رهگیری دادههای اصالت و منشأ مانند «واترمارکگذاری» (Watermarking) و «فراداده» (metadata) میتوانند به دادههای آموزشی افزوده شوند تا
- منشأ «مجموعهدادهها» (Datasets) بهکاررفته در آموزش حفظ شود. در این فاز، دادهها و ورودیهای مورد نیاز برای طراحی مدلهای تشخیص جهت طبقهبندی «محتوای مصنوعی» (Synthetic Content) نیز قابل گردآوری هستند.
- مدل هوش مصنوعی: ساخت و استفاده از مدل، تأیید و اعتبارسنجی: در فازهای ساخت و استفاده، و تأیید و اعتبارسنجی، تکنیکهای رهگیری دادههای اصالت و منشأ مانند فراداده یا واترمارکگذاری میتوانند بهطور پیشگیرانه در زمان تولید به خروجیهای مدل افزوده شوند. برای اعمال ایمن این رویکردهای منشأ، میتوان آنها را در کاربردشان از طریق امضای دیجیتال یا انواع دیگر توابع هش، بهصورت رمزنگارانه راستیآزمایی و «احراز هویتشده» (authenticated) کرد.
- همچنین، مدل نهایی را میتوان با واترمارکگذاری وزنها یا پارامترهای مدل محافظت کرد. اثربخشی تکنیکهای رهگیری دادههای اصالت و منشأ، مانند
- دقت در تشخیص واترمارکگذاری یا شناسایی صحیح محتوای دستکاریشده و مصنوعی، پیش از «استقرار» (Deployment) باید راستیآزمایی شود. سازوکارهای کاهشی که از ایجاد CSAM
- و NCII مصنوعی جلوگیری میکنند (همانطور که در بخشهای پیشین بحث شد) ممکن است بهطور پیشگیرانه در فاز ساخت مدل اعمال شوند.
- وظیفه و خروجی: استقرار و استفاده: برقراری سازوکارهایی برای گردآوری مجموعه متنوعی از بازخورد کاربران
- —بهویژه در موارد مثبت کاذب (مثلاً افشای محتوایی بهعنوان تولیدشده توسط هوش مصنوعی درحالیکه در واقع
- توسط انسان تولید شده است) یا منفی کاذب (مثلاً از دست دادن افشای محتوای تولیدشده توسط هوش مصنوعی)— از تلاشهای احراز اصالت محتوا و آشکارسازی محتوای مصنوعی پشتیبانی میکند. اندازهگیریها و «سنجهها» (Metrics) بهکاررفته بهشدت به مورد کاربرد، بافت، سامانههای در حال آزمون و کاربرد وابسته هستند.
- بافت کاربرد: بهرهبرداری و پایش: اثر گستردهتر رویکردهای «شفافیت محتوای دیجیتال» (Digital Content Transparency) را میتوان در فاز بهرهبرداری و پایش چرخه عمر هوش مصنوعی، با توجه به اهداف، الزامات حقوقی و مقرراتی و ملاحظات اخلاقی بررسی کرد.
- انسانها و سیاره: استفادهکننده یا متأثر: با اشتراکگذاری نتایج TEVV انجامشده در سراسر چرخه عمر هوش مصنوعی با کنشگران نماینده گوناگون مانند توسعهدهندگان هوش مصنوعی، نهادهای جامعه مدنی و کاربران نهایی،
- میتوان به کاهشهای مؤثر آسیبهای بالقوه دست یافت. تمرکز بر حقوق دیجیتال برای همه و
- «ایمنی» (Safety) از طریق طراحی در این فاز پایانی همچنان اهمیت دارد و پر کردن شکافهایی که گروهها ممکن است در آنها از دسترسی به
- حقوق دیجیتال بشری خود یعنی شفافیت محتوای دیجیتال محروم شوند—از طریق عواملی مانند نبود دسترسی به اینترنت
- یا منابع سواد اطلاعاتی برای درک برچسبهای محتوا، یا در نتیجه استفاده مخرب یا
- ناخواسته از تکنیکهای رهگیری دادههای اصالت و منشأ که بهصورت منفی بر حریم خصوصی کاربران اثر بگذارد—برای کنشگران هوش مصنوعی در سراسر چرخه عمر محتوا باید مورد توجه قرار گیرد.
تصویر در نسخهٔ PDF Figure 3. Digital content transparency approaches, across the AI lifecycle described in NIST AI RMF
شکل ۳. رویکردهای شفافیت محتوای دیجیتال در سراسر چرخه عمر هوش مصنوعی توصیفشده در NIST AI RMF
استناد
محمدعلی کهندژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P05-C38-S29
شناسهٔ محتوا KDJ-AI-2026E1-P05-C38-S29-393A2AD0