رفتن به محتوای اصلی
کهن‌دژکتاب مرجع هوش مصنوعی
منابعاعتبارسنجی
فهرست این فصلبخش ۵، فصل ۳۸ — صفحهٔ ۵ از ۱۲

بخش ۵، فصل ۳۸ — صفحهٔ ۵ از ۱۲

کاهش خطرهای ناشی از محتوای مصنوعی

متن اصلی فارسی با منشأ، شناسه و پیوند استناد پایدار.

۳.۱.۴.۴. آشکارسازی متن مصنوعی

ترجمهٔ منبع

پیشرفت قابلیت‌های «مدل زبانی بزرگ» (Large Language Model, LLM) این موضوع را برای انسان‌ها دشوار ساخته است که متن تولیدشده توسط AI را از متن نوشته‌شده به‌دست انسان تشخیص دهند؛ این امر بر ضرورت «شفافیت» (Transparency) درباره استفاده از مدل‌های زبانی بزرگ در زمینه‌های گوناگون تأکید می‌کند. مدل‌های زبانی بزرگ به‌واسطه تولید خروجی‌های نادرست یا غلط شناخته شده‌اند که «توهم» یا «دروغ‌بافی» نامیده شده‌اند و همچنین می‌توان از آن‌ها برای تولید اطلاعات نادرست و/یا گمراه‌کننده در مقیاس بزرگ استفاده کرد. به همین دلایل، توانایی تشخیص محتوای تولیدشده توسط مدل‌های زبانی بزرگ برای افزایش «شفافیت محتوای دیجیتال» (Digital Content Transparency) اهمیت دارد.

آشکارسازهای متن مصنوعی از پارامترهایی بر پایه ویژگی‌های متنی مانند زبان، ساختار، پیچیدگی پیش‌بینی و تکان‌سنجی استفاده می‌کنند. پیچیدگی پیش‌بینی می‌سنجد که مدل تا چه اندازه می‌تواند کلمه بعدی را در یک دنباله از کلمات پیش‌بینی کند. تکان‌سنجی میزان قابل‌پیش‌بینی بودن یک قطعه محتوا را از طریق یکنواختی طول و ساختار جمله‌ها می‌سنجد. برخی آشکارسازها بر «مدل‌های زبانی» (Language Model, LM) مشابه آن‌هایی که در ابزارهای نگارش AI به کار می‌روند تکیه می‌کنند تا

  • قابلیت پیش‌بینی و الگوهای زبانی متن را ارزیابی کنند. از این آشکارسازهای محتوا
  • توسط برخی مربیان برای بررسی نوشته‌های دانشجویان،
  • توسط کسب‌وکارها برای اطمینان از اصالت محتوای منتشرشده،
  • و توسط افراد برای راستی‌آزمایی «اصالت» (authenticity) متن در اینترنت استفاده می‌شود. برخی آشکارسازهای دیگر بر
  • ناسازگاری‌های واقعی (برای نمونه، پایگاه‌داده راستی‌آزمایی واقعیت و مدل‌های استدلال) و تحلیل «فراداده» (metadata) (برای نمونه،
  • آشکارسازی ناهنجاری‌ها در فراداده محتوا مانند مهرهای زمانی، موقعیت مکانی و اطلاعات نویسنده) تکیه می‌کنند. باید توجه داشت که
  • اثربخشی بسیاری از ابزارهای تشخیصی از این دست محل بحث است.
  • فنون آشکارسازی متن مصنوعی
  • فنونی که در پیوست D نشان داده شده‌اند را می‌توان در رده‌های زیر طبقه‌بندی کرد:
آشکارسازهای «واترمارک‌گذاری» (Watermarking)دو جزء دارند: تعبیه و آشکارسازی. تعبیه، متنی با واترمارک (مانند یک سیگنال یا الگوی پنهان) را در خروجی مدل‌های زبانی بزرگ درج می‌کند که به «رهگیری» (tracking) «داده‌های اصالت و منشأ» (Provenance data) کمک می‌کند، در حالی که آشکارسازی، واترمارک را از متن تولیدشده توسط AI شناسایی می‌کند.
آشکارسازهای صفر-شاتمتن تولیدشده توسط AI را بدون نیاز به آموزش قبلی روی داده‌های برچسب‌خورده یا نمونه‌های تنظیم دقیق آشکار می‌سازند. این فن از ویژگی‌ها و آماره‌های متمایز (مانند تحلیل‌های دستوری، تراکم واژگان، ویژگی‌های ساختاری، طول مؤلفه‌ها و ناسازگاری‌ها) به‌عنوان شاخص‌های کلیدی در تمایز میان متن تولیدشده توسط AI و متن تولیدشده توسط انسان بهره می‌گیرد.
آشکارسازهای مبتنی بر تنظیم دقیق مدل زبانیاز روش «مدل زبانی» (Language Model, LM) تنظیم‌شده دقیق در آشکارسازی متن تولیدشده توسط مدل‌های زبانی بزرگ استفاده می‌کنند. این کار شامل گرفتن یک مدل زبانی پیش‌آموزش‌دیده و تطبیق آن با مجموعه‌داده یا وظیفه مشخص مورد نظر است. این روش اجزای فرعی مشخصی از مدل را با یک تابع هزینه به‌منظور آشکارسازی خطاها یا ناسازگاری‌ها در متن بهینه می‌سازد. بیشتر رویکردها برای فرایندهای آموزش نظارت‌شده به نمونه‌های جفتی نیاز دارند.
مدل‌های زبانی بزرگ به‌عنوان آشکارسازاز تنظیم دستورالعملی (Instruction Tuning) مدل‌های زبانی بزرگ برای آشکارسازی متن سند و جمله استفاده می‌کنند و به مدل‌های زبانی بزرگ امکان می‌دهند با بهره‌گیری از دانش پیش‌آموزش خود، متن تولیدشده را آشکار کنند. این روش شامل بررسی متقابل یک مدل زبانی بزرگ با مدل زبانی بزرگ دیگر برای تمایز متن تولیدشده توسط خودشان یا سایر مدل‌های زبانی بزرگ است و از روانی متن و خطاهای موجود در آن بهره می‌گیرد.
آشکارسازهای یادگیری خصمانهمتن تولیدشده توسط انسان و متن تولیدشده توسط مدل‌های زبانی بزرگ را با در معرض قرار دادن آن‌ها به «نمونه‌های خصمانه» (adversarial examples) از یکدیگر متمایز می‌سازند و از این راه دقت خود را بهبود می‌بخشند. این کار شامل پیکربندی یک مدل حمله در کنار یک مدل آشکارسازی است، به‌گونه‌ای که رویارویی تکراری میان این دو به آشکارسازی تقویت‌شده می‌انجامد.
آشکارسازهای با کمک انساناز هر دو قابلیت تمیز انسان و ماشین برای تمایز کارآمد میان متن تولیدشده توسط انسان و متن تولیدشده توسط مدل‌های زبانی بزرگ استفاده می‌کنند؛ به‌گونه‌ای که از دانش پیشین و مهارت‌های تحلیلی انسان بهره می‌گیرند و همزمان از رفتار «مدل» (model's) می‌آموزند.
  • عملکرد آشکارسازی متن مصنوعی
  • برای سنجش عملکرد آشکارسازهای متن مصنوعی، بسته به کاربرد آن‌ها در سناریوهای مختلف، از سنجه‌های گوناگونی استفاده می‌شود. عملکرد آشکارسازی بسته به روش‌ها و مجموعه‌داده‌های
  • به‌کاررفته متغیر است. فناوری واترمارک‌گذاری در سال‌های اخیر پیشرفت چشمگیری داشته است و اکنون می‌تواند به‌طور مکرر متن تولیدشده توسط مدل‌های زبانی را برچسب‌گذاری و شناسایی کند. آشکارسازهای صفر-شات می‌توانند دقت آشکارسازی را افزایش دهند،
  • و برخی آشکارسازهای مبتنی بر مدل زبانی بزرگ قادر به نمایش عملکرد آشکارسازی برتر، «استواری» (Robustness) و «تاب‌آوری» (Resilience) در برابر حملات گوناگون هستند. مدل‌های زبانیِ تنظیم دقیق‌شده اغلب مستعد بیش‌برازش روی داده‌های آموزشی خود یا توزیع آموزشی مدل مبدأ هستند که به افت عملکرد هنگام مواجهه با داده‌های خارج از «دامنه» (domain) یا دیده‌نشده می‌انجامد. افزون بر این، آشکارسازهای مبتنی بر مدل زبانی در پردازش داده‌های تولیدشده توسط مدل‌های متفاوت محدودیت دارند، زیرا این آشکارسازها روی مجموعه‌داده‌های مشخصی برای یک وظیفه معین تنظیم دقیق شده‌اند.
  • برچسب‌گذاران با کمک انسان می‌توانند عملکرد خود را در گذر زمان بهبود بخشند، اما در پردازش حجم بالای داده‌ها محدودیت دارند.

در مجموع، عملکرد آشکارسازی با حملات گوناگونی مانند حملات بازنویسی، حملات خصمانه و حملات پرامپت، و همچنین به‌دلیل ابهام داده‌ها، به‌طور چشمگیری کاهش می‌یابد. اگرچه برخی پژوهش‌های اولیه نشان داده‌اند که روش‌های آشکارسازی مبتنی بر بازیابی «ممکن است بتواند» (could) استواری آشکارسازی متن تولیدشده توسط AI را در برابر حملات بازنویسی افزایش دهد، برای دفاع در برابر انواع مختلف حملات، پژوهش بیشتری مورد نیاز است. علاوه بر این، انجام مطالعات معیار در سناریوهای آزمونی متنوع ضروری است. آزمون و ارزیابی دقیق می‌تواند به درک بهتر قابلیت‌ها و محدودیت‌های آشکارسازها کمک کند و در توسعه راهبردهای مؤثرتر برای شناسایی متن تولیدشده توسط مدل‌های زبانی بزرگ سودمند باشد. روش‌های موجود آشکارسازی متن همچنان در حال تکامل هستند و برای هم‌راستاسازی ادعاهای عملکرد بالا با استواری، «قابلیت اطمینان» (Reliability) و «تعمیم‌پذیری» (generalizability) واقعی، به ارزیابی و بهبود بیشتری نیاز دارند.

مسائل تکمیلی برای توجه

استواری و کیفیت آشکارسازی: استواری و کیفیت آشکارسازی از مسائل کنونی در آشکارسازی متن مصنوعی هستند. بیشتر آشکارسازها برای متن‌های انگلیسی طراحی شده‌اند و بهینه‌سازی عملکرد آن‌ها در زبان‌های گوناگون مورد نیاز است. عملکرد آشکارسازها در سناریوهای واقعی کاهش می‌یابد که بر ضرورت بهبود استواری آن‌ها برای کاربردهای عملی تأکید می‌کند. کیفیت متن تولیدشده توسط مدل‌های زبانی بزرگ نیز تحت تأثیر «پیچیدگی» (Complexity) یا یادگیری پرامپت‌های به‌کاررفته قرار دارد و این می‌تواند آشکارسازی دقیق متن‌های تولیدشده از طریق پرامپت‌های پیچیده را برای آشکارسازها دشوار سازد. این موضوع همچنین اندازه‌گیری عملکرد آشکارساز را برای ارزیابان چالش‌برانگیز می‌کند.

برخی آشکارسازها متن تولیدشده توسط AI را با تحلیل پارامترهایی مانند وقوع واژه، جایگاه، «بسامد» (frequency) و سبک شناسایی می‌کنند. با این حال، ممکن است نتوانند میان انواع مختلف مدل‌های GAI تمایز قائل شوند. افزون بر این، دامنه و تنوع مجموعه‌داده‌های معیاری که می‌توان برای ارزیابی جامع فناوری‌های موجود آشکارسازی متن تولیدشده توسط AI به‌کار برد، محدود است؛ ر.ک. جزئیات در پیوست D.

کاربردهای پرریسک: از مسائل «اجتماعی‌ـ‌فناورانه» (Socio-technical) قابل توجه، استفاده از فنون نابالغ آشکارسازی متن در کاربردهای پرریسک است. این کاربردها می‌توانند شامل محیط‌های دانشگاهی یا آشکارسازی اطلاعات نادرست و نشر اکاذیب تولیدشده توسط AI باشند. هنگامی که آشکارسازها در محیط‌های دانشگاهی برای تأیید صداقت علمی نوشته‌ها به کار رفته‌اند، به‌دلیل فقدان دقت، دانشجویانی به‌ناروا متهم به تقلب با فناوری AI شده‌اند که آینده تحصیلی آن‌ها را در معرض خطر قرار داده است. مثبت‌های کاذب در آشکارسازهای متنی مبتنی بر AI به‌عنوان مشکل روشنی با پیامدهای خطرناک گزارش شده‌اند. به همین ترتیب، آشکارسازهای متنی می‌توانند برای تعیین مصنوعی بودن یا نبودن محتوا و همچنین برای تعیین اینکه آیا روایت‌های اطلاعات نادرست و/یا نشر اکاذیب ممکن است توسط AI تولید شده باشند، ابزارهایی نادقیق و ناکامل باشند. این مسئله به‌ویژه در زبان‌های غیرانگلیسی مشکل‌ساز است، زیرا بیشتر آشکارسازها برای کاربردهای زبان انگلیسی طراحی شده‌اند. پیچیدگی مدل‌های زبانی نیز

  • به‌سرعت در حال افزایش است و آشکارسازی را به چالشی بزرگ‌تر تبدیل می‌کند. افزون بر این، برخی پژوهش‌ها نشان می‌دهند که استفاده از برخی از این آشکارسازها در سناریوهای مختلف «ممکن است» (may) مناسب نباشد.
استناد

محمدعلی کهن‌دژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P05-C38-S15

شناسهٔ محتوا KDJ-AI-2026E1-P05-C38-S15-E24E1E1F

پیوند مستقیم این بخش

۳.۱.۴.۵. آشکارسازی صدای مصنوعی

ترجمهٔ منبع
  • با پیشرفت کیفیت تولید صدای مصنوعی، چالش‌ها و پیچیدگی‌های آشکارسازی نیز در حال افزایش است. دو نوع حوزه برای صدای مصنوعی وجود دارد: مبتنی بر تبدیل متن به گفتار (TTS)6 و مبتنی بر تقلید.
  • روش مبتنی بر TTS، متن را در زمان واقعی طی دو مرحله به گفتار طبیعی تبدیل می‌کند. نخست، صدای خامِ تمیز و ساختاریافته به همراه متنِ پیاده‌سازی‌شده‌ی آن گردآوری می‌شود. دوم، مدل TTS با استفاده از داده‌های گردآوری‌شده آموزش می‌بیند تا یک مدل تولید صدای مصنوعی ساخته شود.
  • روش مبتنی بر تقلید، گفتار منبع (صدای محرمانه) را به‌گونه‌ای تغییر می‌دهد که بدون تغییر محتوای زبانی، شبیه به گفتار دیگری (صدای هدف) به نظر برسد. هدف اصلی آن، صدای محرمانه است. برای بازتولید ویژگی‌های یک صدای خاص، ممکن است سبک، آهنگ یا تکیه‌ی سیگنال گفتاری تنظیم شود. این امر می‌تواند برای کاربردهایی نظیر جعل صدا مفید باشد.
  • علاوه بر روش‌های سنتی تولید صدا، برخی از فنون تولید، اثر انگشت صوتی و ناهماهنگی‌هایی را نشان می‌دهند که می‌توانند از طریق تحلیل دامنه بسامد روی طیف‌نگار (Spectrogram) ثبت شوند. «ضرایب سپسترال فرکانس مل» (Mel Frequency Cepstral Coefficients, MFCCs) معمولاً در فنون پردازش گفتار استفاده می‌شوند. نشان داده شده است که استفاده از MFCCها نسبت به خوراندن مستقیم سیگنال صوتی خام به مدل، نتایج بهتری برای «کارایی آشکارسازی صدای مصنوعی» (Synthetic Audio Detection Performance) به همراه دارد.

«فنون آشکارسازی صوت مصنوعی» (Synthetic Audio Detection Techniques)

  • فنون آشکارسازی را می‌توان به روش‌های یادگیری ماشین (ML) و یادگیری عمیق (DL) زیر تقسیم کرد. یادگیری عمیق زیرمجموعه‌ای از یادگیری ماشین در نظر گرفته می‌شود که از شبکه‌های عصبی چندلایه استفاده می‌کند تا ماشین‌ها بتوانند بازنمایی‌های پیچیده‌تری از داده‌ها را به شیوه‌ای انسان‌گونه بیاموزند:
آشکارسازهای MLشامل شناسایی الگوهای گفتاری یا تشخیص ناهنجاری‌ها در ویژگی‌هایی است که از ویژگی‌های گفتار طبیعی منحرف می‌شوند؛ مانند محتوای آکوستیک و طیفی، خطاهای تلفظ، بسامدهای فرمانت، تغییرات زیروبمی، و نویز و ناهماهنگی‌های پس‌زمینه. این روش به دلیل آموزش بیش‌ازحد و استخراج دستی ویژگی‌ها که نیازمند نیروی کار گسترده برای آماده‌سازی داده‌هاست، از نظر مقیاس‌پذیری با تعداد زیادی فایل صوتی محدودیت دارد.
آشکارسازهای DLاز ویژگی‌هایی مانند بسامدهای فرمانت، تغییرات زیروبمی و ظرافت‌های لحن برای شناسایی مغایرت‌هایی که یک صدای مصنوعی را متمایز می‌کند، بهره می‌برد. این روش می‌تواند از «فراداده» (metadata) و الگوهای نویز پس‌زمینه برای تمایز بین صداهای اصیل و مصنوعی استفاده کند و هنگام استفاده از الگوریتم‌های DL، نیازمند تبدیل‌های خاص (مثلاً ویژگی‌های صوتی مانند طیف‌نگارها) روی فایل‌های صوتی است.
  • ر.ک. جزئیات بیشتر درباره روش‌های آشکارسازی صدای مصنوعی و «مجموعه‌داده‌ها» (Datasets) در پیوست D.
  • کارایی آشکارسازی صدای مصنوعی
  • کارایی آشکارسازهای صدای مصنوعی بسته به روش‌های آشکارسازی خاص، نوع مجموعه‌داده‌ها و فنون پیش‌پردازش صوتی به‌کاررفته، متفاوت است.
  • سنجش‌های کارایی برای آشکارسازی صدای مصنوعی بر اساس سه معیار «نرخ برابری خطا» (Equal Error Rate, EER)، «تابع هزینه تصمیم» (Decision Cost Function, DCF) تاندم (t-DCF) و دقت انجام شده‌اند. EER نقطه‌ای است که در آن «نرخ مثبت کاذب» (False Positive Rate, FPR) و «نرخ کاذب منفی» (False Negative Rate, FNR) برابر هستند و t-DCF «قابلیت اطمینان» (Reliability) تصمیمات اتخاذشده توسط آشکارسازها را می‌سنجد. EER برای صوت از ۰.۴۳٪ تا ۴۲.۵٪، t-DCF از ۰.۰۰۸ تا ۰.۳۹ و دقت از ۵۰٪ تا ۹۹٪ متغیر است. روش‌های به‌کاررفته برای تولید داده‌های صدای مصنوعی می‌توانند بر کارایی روش‌های آشکارسازی تأثیر بگذارند. برای نمونه، یکی از روش‌هایی که در مقایسه با سایر روش‌ها هنگام اعمال بر مجموعه‌داده‌های مبتنی بر TTS نرخ خطای بسیار پایینی دارد، هنگام اعمال بر مجموعه‌داده‌های مبتنی بر تقلید، عملکرد ضعیفی دارد.

به‌طور کلی، روش‌های آشکارسازی مبتنی بر ML، توضیحات و تفسیرهای بهتری از نتایج آشکارسازی ارائه می‌دهند، در حالی که روش‌های آشکارسازی مبتنی بر DL مانند شبکه‌های عصبی پیچشی (CNN) نسبت به روش‌های مبتنی بر ML، از نظر مجموعه‌داده و نوع داده‌های مصنوعی، پایدارتر و سازگارتر در نظر گرفته می‌شوند.

مسائل اضافی برای ملاحظه

پوشش زبان‌های غیرانگلیسی: بیشتر پژوهش‌های کنونی بر توسعه روش‌های آشکارسازی برای شناسایی صداهای مصنوعی که به زبان انگلیسی صحبت می‌کنند، متمرکز است. یک مدل آشکارسازی که برای یک زبان خاص توسعه یافته است، ممکن است برای سایر زبان‌ها یا گویش‌ها عملکرد یکسانی نداشته باشد، به‌ویژه برای زبان‌ها یا گویش‌هایی که داده‌های موجود برای آن‌ها محدود است. اکثر روش‌های آشکارسازی صرفاً بر شناسایی صدای مصنوعی تمرکز دارند، بدون اینکه لهجه‌ها یا گویش‌ها را در نظر بگیرند. فقدان پوشش زبانی برای آشکارسازی صوت می‌تواند نابرابری‌ها را در سایر نقاط جهان مانند جنوب جهانی (Global South)، به‌ویژه در دوره‌های انتخاباتی افزایش دهد و می‌تواند منجر به تقویت دیپ‌فیک‌های صوتی زیان‌بار به زبان‌های غیرانگلیسی شود.

آشکارسازی در سناریوهای دنیای واقعی: به دلیل گستره وسیع فناوری‌های تولید گفتار مصنوعی، هنوز تشخیص برخی خانواده‌های ترک‌های صدای مصنوعی در موقعیت‌های مجموعه‌باز23 (Open-set) دشوار است. سناریوی مجموعه‌باز به آشکارسازی یک صدای مصنوعی اشاره دارد، حتی اگر با استفاده از مدلی تولید شده باشد که قبلاً دیده نشده است.

فرصت‌هایی برای توسعه بیشتر برای تمامی فنون آشکارسازی: آشکارسازهای موجود عمدتاً بر تمایز بین «محتوای مصنوعی» (Synthetic Content) و محتوای تولیدشده توسط انسان تأکید دارند. «تشخیص» (Detection) و توصیف قصد، مسئله‌ای مرتبط است که نیاز به پژوهش بیشتری دارد، زیرا تشخیص و توصیف قصدِ پشتِ محتوای دستکاری‌شده یا مصنوعی می‌تواند به‌شدت بر نظرات یا رفتارهای فردی تأثیر بگذارد و به‌طور گسترده بر فضاهای اطلاعات نادرست و اطلاعات گمراه‌کننده اثر بگذارد. اگرچه برنامه DARPA SemaFor پیشرفت‌هایی در پرداختن به این چالش داشته است، اما هنوز جای بهبود برای توسعه و پذیرش گسترده فناوری‌های تشخیص قصد معنایی وجود دارد. پژوهش‌های بیشتر همچنین بهتر است شامل بررسی چگونگی بهبود مؤثر کارایی آشکارسازی بر محتوای مصنوعی باشد که پس‌پردازش شده یا توسط نویز، انتقال، فشرده‌سازی خراب شده یا توسط یک پلتفرم رسانه اجتماعی متفاوت بازفرمت شده است. به‌طور خاص برای آشکارسازی صوت، پژوهش‌های آینده نیز بهتر است بررسی کنند که اگر ضبط‌های صوتی توسط نویز، کدگذاری یا مشکلات انتقال خراب شوند، و همچنین ضبط‌های صدای مصنوعی که در سایت‌های رسانه‌های اجتماعی منتشر شده یا به‌صورت زنده در تماس‌های تلفنی استفاده می‌شوند، چه اتفاقی می‌افتد. در نهایت، احتمالاً پژوهش‌های بیشتری برای ارزیابی اثربخشی فنون کمک‌گرفته از انسان برای یاری به تلاش‌های آشکارسازی، مانند تعیین اثربخشی برچسب‌های انسانی، مورد نیاز است.

  1. آزمون و ارزیابی «داده‌های اصالت و منشأ» (Provenance data) و فنون آشکارسازی محتوای مصنوعی
  • سنجش اثربخشی رهگیری داده‌های اصالت و منشأ و فنون آشکارسازی محتوای مصنوعی از طریق آزمون و ارزیابی می‌تواند مسائل مربوط به «شفافیت محتوای دیجیتال» (Digital Content Transparency) را شناسایی کند.
  • آزمون عبارت است از «فعالیتی که در آن یک سیستم یا مؤلفه تحت شرایط مشخص اجرا می‌شود، نتایج مشاهده یا ثبت می‌شوند و ارزیابی‌ای از جنبه‌ای از سیستم یا مؤلفه صورت می‌گیرد.»
  • ارزیابی عبارت است از (۱) «تعیین نظام‌مند میزانی که یک موجودیت معیارهای مشخص‌شده خود را برآورده می‌کند؛ (۲) اقدامی که ارزش چیزی را می‌سنجد.»

آزمون و ارزیابی فنون شفافیت دیجیتال که در این بخش توصیف شده‌اند، بر آزمون و ارزیابی رهگیری داده‌های اصالت و منشأ و فنون آشکارسازی محتوای مصنوعی تمرکز دارند. سنجش افت کیفیت از دقت خروجی سیستمِ یک سیستم (با استفاده از یک تابع زیان) در طول آموزش، یک رویه معمول است. بسیاری از توابع زیان و «سنجه‌ها» (Metrics) برای آموزش با سنجه‌ها و مدل‌های ارزیابی همپوشانی دارند. اگرچه بخش زیادی از آزمون و ارزیابی خودکار است، اما برخی آزمون‌ها شامل بررسی انسانی یا دستی نتایج هستند، به‌ویژه در زمینه‌هایی که تخصص موضوعی اهمیت دارد. ر.ک. پیوست E برای جزئیات بیشتر.

آزمون و ارزیابی فنون رهگیری داده‌های اصالت و منشأ

استناد

محمدعلی کهن‌دژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P05-C38-S16

شناسهٔ محتوا KDJ-AI-2026E1-P05-C38-S16-1D1B4776

پیوند مستقیم این بخش

۴.۱.۱. آزمون و ارزیابی روش‌های «واترمارک دیجیتال» (Digital Watermarking)

ترجمهٔ منبع

واترمارک‌های دیجیتال معمولاً از طریق حمله و سنجش «تاب‌آوری» (Resilience) آن‌ها آزمون می‌شوند. انواع مختلف حمله عبارت‌اند از: حملات حذف (یعنی حذف واترمارک بدون شکستن رمزنگاری یا «امنیت» (Security))؛ تحریف واترمارک‌ها برای فریب آشکارساز؛ شکستن تدابیر امنیتی برای حذف واترمارک؛ و جعل واترمارک‌ها.

روش‌های مختلف طراحی آزمایش و سنجش «استواری» (Robustness) واترمارک‌ها شامل آزمایش‌هایی است که مجموعه‌ای از حملات را اجرا می‌کنند و درصد حملاتی که واترمارک‌ها را از بین می‌برند یا درصد واترمارک‌هایی که آشکار نمی‌شوند را می‌سنجند. رویکرد دیگر، استفاده از «سنجه‌ها» (Metrics) کیفیت تصویر برای مقایسه شباهت تصاویر میان یک تصویر اصلی بدون واترمارک، یک تصویر واترمارک‌شده و یک تصویر واترمارک‌شدهٔ مورد حمله/تغییر یافته است. این رویکرد آزمایشی بررسی می‌کند که آیا تصاویر پس از یک تغییر خنثی (مانند بازفشرده‌سازی) مشابه باقی می‌مانند، اما در صورت حمله به واترمارک ناهمسان می‌شوند یا خیر. طرح آزمایشی دیگر از سنجه‌های فاصله تصویر برای مقایسه فاصله یا تفاوت میان تصاویر واترمارک‌شده با نسخه‌های تغییر یافتهٔ خنثی آن‌ها استفاده می‌کند، مشابه آزمایش‌های انگشت‌نگاری دیجیتال؛ سپس یک آستانه فاصله تعیین می‌شود تا مشخص گردد کدام تصاویر متفاوت تلقی می‌شوند.

سنجه‌های شباهت تصویر که بیشتر مختص «واترمارک‌گذاری» (Watermarking) هستند عبارت‌اند از: «ظرفیت (آبmark)» (Capacity) پنهان‌سازی (HC)، یعنی تعداد بیت‌هایی که می‌توان در یک تصویر پنهان کرد؛ نسبت سیگنال به نویز اوج (PSNR)؛ و «شاخص تشابه ساختاری» (Structural Similarity Index Measure, SSIM)؛ و گاهی از سنجه‌های عمومی شباهت تصویر و سنجه‌های فاصله تصویر (شامل نُرم L_2) استفاده می‌شود. سنجهٔ دیگری مرتبط با واترمارک‌گذاری، تعداد بیت در هر پیکسل تصویر است که تعیین می‌کند چه مقدار اطلاعات را می‌توان در تصویر درج کرد، به‌عنوان یک موازنه با امنیت واترمارک.

استناد

محمدعلی کهن‌دژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P05-C38-S17

شناسهٔ محتوا KDJ-AI-2026E1-P05-C38-S17-5E7A8BFC

پیوند مستقیم این بخش

۴.۱.۲. آزمون و ارزیابی روش‌های ضبط فراداده

ترجمهٔ منبع

یکی از راه‌های ضبط ایمن «فراداده» (metadata)، پیوستن آن به اثر انگشتی دیجیتال محتوای دیجیتال است؛ این اثر انگشتی دیجیتال معمولاً از طریق درهم‌سازی به‌دست می‌آید، چنان‌که پیش‌تر توضیح داده شد. مفهوم آن است که:

  • تصاویر مختلف بهتر است درهم‌سازی‌های متفاوتی داشته باشند (و برخورد رخ ندهد)، اما دو نسخه از یک تصویر یکسان بهتر است درهم‌سازی‌های یکسانی داشته باشند.
  • افزون بر این، کارهایی در زمینه آزمون و راستی‌آزمایی انسانی فراداده در جریان است. یکی از روش‌ها آن است که انسان‌ها «منشأ» (Provenance) را مستقیماً از نظر دقت بررسی کنند و زیرمجموعه‌ای از «داده‌های اصالت و منشأ» (Provenance data) را به‌صورت دستی راستی‌آزمایی نمایند. آزمون‌های آماری روی منشأ کل مجموعه‌داده‌های به‌کاررفته در آموزش می‌تواند مکمل راستی‌آزمایی انسانی باشد. برای مثال، یک پرس‌وجو می‌تواند تعیین کند چه کسری از هر نمونه داده ویژگی خاصی را دارد. نرم‌افزار تولیدکننده منشأ (یا نرم‌افزاری که به‌طور خودکار فراداده تولید می‌کند) را می‌توان از نظر درستی کارکردی آزمود؛ بدین صورت که بررسی شود پرس‌وجوهای خودکار مشخصی درباره فراداده اصالت و منشأ، نتایج مورد انتظار را بازمی‌گردانند.
  • منشأ را همچنین می‌توان با اجرای مدل‌های تولیدکننده منشأ روی یک کاربرد شناخته‌شده و بررسی دستی خروجی‌های تولیدشده ارزیابی کرد.

آزمون و ارزیابی روش‌های آشکارسازی محتوای مصنوعی

آزمون و ارزیابی آشکارسازهای «محتوای مصنوعی» (Synthetic Content) می‌تواند به اعتمادسازی نسبت به این سیستم‌ها کمک کند. رایج‌ترین راه سنجش و ارزیابی یک سیستم آشکارسازی محتوای مصنوعی (یا متمایزساز)، ساخت یک مجموعه‌ارزیابی با برچسب‌گذاری مناسب ورودی‌های انسانی‌ساخته (اصیل) (مانند تصاویر و ویدیوها) و ورودی‌های مصنوعی است. از آشکارساز پرسیده می‌شود تا تشخیص دهد کدام تصاویر مصنوعی‌اند؛ در این آزمایش، آشکارساز برای هر ورودی یک عدد حقیقی ارائه می‌دهد که نشان می‌دهد ورودی چه‌اندازه به‌احتمال زیاد مصنوعی است، به‌گونه‌ای که عدد بزرگ‌تر بیانگر مصنوعی‌بودن ورودی است. سپس، این خروجی همان آزمایش توضیح‌داده‌شده در ضمیمه E این گزارش را بازتاب می‌دهد و بر مبنای یک سنجه دقت نمره‌دهی می‌شود. برای وظایف «تشخیص» (Detection)، دو سنجه خاص، «سطح زیر منحنی مشخصه عملکرد گیرنده» (Area Under the Receiver Operator Curve, AUC) و «موازنه خطای آشکارسازی» (Detection Error Tradeoff, DET) هستند. این طرح آزمایشی را می‌توان برای آزمون همه انواع مختلف روش‌های آشکارسازی محتوای مصنوعی به‌کار برد.

استناد

محمدعلی کهن‌دژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P05-C38-S18

شناسهٔ محتوا KDJ-AI-2026E1-P05-C38-S18-F7D3C58C

پیوند مستقیم این بخش

۴.۲.۱. آزمون و ارزیابی تکنیک‌های تشخیص خودکار مبتنی بر محتوا

ترجمهٔ منبع

آزمون تشخیص مستلزم توجه دقیق به مجموعه‌داده‌های آموزش و ارزیابی است که در طراحی آزمون به کار می‌روند. مهم است که انواع و ارتباط محتوای اصیل و «محتوای مصنوعی» (Synthetic Content) مورد آزمون، و نیز منابع ورودی‌ها، متعادل باشند. سیستم‌ها باید از نظر عملکردشان در «تشخیص» (Detection) تصاویر هنگامی که تغییر اندازه داده می‌شوند و فشرده می‌شوند آزمون شوند. برای تصاویر، اندازهٔ تصاویر و همچنین اندازهٔ نواحی دست‌کاری‌شدهٔ تصویر، هنگام ساخت مجموعه‌داده‌های ارزیابی ملاحظات مهمی هستند.

هنگام طراحی این آزمایش‌های آزمون تشخیص، ملاحظات خاصی دربارهٔ نحوهٔ ساخت مجموعهٔ آموزش و مجموعهٔ ارزیابی (مجموعه‌ای از ورودی‌ها که از آشکارساز خواسته می‌شود تعیین کند کدام‌یک اصیل و کدام‌یک مصنوع هستند) توسط افرادی که آشکارسازهای محتوای مصنوعی را آزمون می‌کنند وجود دارد. این دغدغه‌ها شامل تعادل کلاس‌ها و تنوع موقعیت‌های مرتبط و مختلفی است که به زمینه وابسته‌اند، به‌گونه‌ای که مجموعه‌دادهٔ مورد استفاده بازنمایی متعادلی از موقعیت باشد. در نتیجه، مجموعه‌داده‌های ارزیابی اغلب به‌صورت سفارشی برای آزمایش‌های تشخیص ساخته می‌شوند، و ممکن است از چندین مجموعه‌دادهٔ ارزیابی برای ارزیابی یک آشکارساز استفاده شود. یکی از ملاحظات، آزمون آشکارسازها در شرایطی است که مجموعه‌های آموزش و آزمون از یک مجموعهٔ ورودی واحد باشند و در شرایطی که مجموعه‌های آموزش و آزمون از مجموعه‌های ورودی متفاوتی باشند. ملاحظهٔ دیگر، ساخت داده‌هایی است که آشکارسازهای تصویر را آزمون می‌کنند تا بررسی شود این آشکارسازها در برابر تصاویری که پس‌پردازش شده‌اند، مانند تغییر اندازه و فشرده‌سازی، مقاوم هستند. برای تصاویر، اندازهٔ تصاویر و همچنین اندازهٔ نواحی دست‌کاری‌شدهٔ تصویر ملاحظهٔ مهمی است که هنگام ساخت مجموعه‌داده‌های ارزیابی به کار می‌رود.

برای محتوای ویدئویی، آشکارسازها در موقعیت‌هایی آزمون شده‌اند که در آن‌ها قاب‌هایی به ویدئو درج، حذف یا تکثیر شده بودند. برای تشخیص کپی‌ـ‌چسباندن (اشیایی که درون قاب‌های مشخص کپی و چسبانده می‌شوند، یعنی جعل‌های درون‌قابی)، دقت آشکارسازهای مختلف از ۵۴٫۹٪ تا ۹۹٫۳٪ بسته به سیستم و «پیچیدگی» (Complexity) جعل متغیر بود. برای تشخیص جعل‌های بین‌قابی با درج، تکثیر و حذف قاب‌ها، دقت‌ها از ۵۷٫۹٪ تا ۹۹٫۳٪ بسته به سیستم، تعداد قاب‌های درج‌شده/حذف‌شده/تکثیرشده و پیچیدگی جعل متغیر بود. طراحی دیگر شامل ساخت مجموعه‌دادهٔ ارزیابی با تصاویری است که از حملات مشخصی برای فریب دادن آشکارساز تولید شده‌اند.

  • 4.2.2. آزمون و ارزیابی تکنیک‌های تشخیص «منشأ» (Provenance)
  • آشکارسازهای «واترمارک‌گذاری» (Watermarking) را می‌توان به شیوه‌ای مشابه آزمون آشکارسازهای «پس‌وقوع» (post-hoc) آزمون کرد: به یک آشکارساز واترمارک، تصاویر علامت‌گذاری‌شده و تصاویر فاقد علامت داده می‌شود و از آن خواسته می‌شود
  • واترمارک‌ها را تشخیص دهد. در ادامه نمونه‌ای از چنین آزمایشی برای آزمون آشکارساز واترمارک‌گذاری آمده است.
  • به‌طور خاص برای تشخیص واترمارک‌گذاری، به‌جای استفاده از سنجهٔ دقت، می‌توان آزمایش دیگری طراحی کرد که در آن به آشکارساز واترمارک مجموعه‌ای از ورودی‌ها داده می‌شود و از آن خواسته می‌شود واترمارک را بازیابی کند. سپس تصویر علامت‌گذاری‌شدهٔ به‌دست‌آمده بر مبنای همبستگی پیکسلی‌اش با واترمارک اصلی سنجیده می‌شود. در آزمایش دیگری که در آن واترمارک‌ها آماری هستند، تصاویر مصنوعی تولید می‌شوند و نرخ خطای بیت آشکارساز واترمارک اندازه‌گیری شده و با مقادیر بهینهٔ نظری مقایسه می‌شود.

یکی از راه‌های ارزیابی تکنیک‌های تشخیص «فراداده» (metadata) این است که رسانه‌ای اصیل با فرادادهٔ اصیل گرفته شود و سپس فرادادهٔ نادرستی به محتوای رسانه تزریق شود. سپس آشکارساز فراداده از این نظر آزمون می‌شود که آیا می‌تواند فرادادهٔ نادرست را شناسایی کند یا خیر.

استناد

محمدعلی کهن‌دژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P05-C38-S19

شناسهٔ محتوا KDJ-AI-2026E1-P05-C38-S19-C58CA62D

پیوند مستقیم این بخش