فهرست این فصلبخش ۵، فصل ۳۶ — صفحهٔ ۲ از ۵
بخش ۵، فصل ۳۶ — صفحهٔ ۲ از ۵
مطالعهٔ آزمایشی GenAI مؤسسه ملی استاندارد و فناوری آمریکا (2024): مرور و نتایج ارزیابی متن به متن
متن اصلی فارسی با منشأ، شناسه و پیوند استناد پایدار.
۴. زیرساخت ارزیابی
4.1.1. هدف و کارکرد در ارزیابی
سامانه مدیریت ارزیابی، کارکردها و اجزای کلیدی را فراهم میکند و از چرخهای پژوهشی–توسعهای که با ارزیابی خصمانه پیش برده میشود پشتیبانی میکند. این سامانه دسترسی به منابعِ عمومی، مدیریت محتوای عمومی و خصوصی، و مدیریت کامل چرخه ارزیابی شامل ثبتنام، دسترسی به ارسالها و دسترسی به نتایج ارزیابی را ممکن میسازد. افزون بر این، شرایط و الزامات در میان تکالیف چالشی و روشهای گوناگون متفاوتاند و از این رو به سازوکارهایی برای سازگاری مستمر با چالشهای ارزیابی نیاز است. در نهایت، سامانه به الزامات اصلی مانند دسترسپذیری، «امنیت» (Security) و کاربردپذیری، همراه با سایر الزامات مؤسسه ملی استاندارد و فناوری آمریکا (NIST) میپردازد. تفکیک کلی الزامات و ویژگیها در ادامه آمده است.
الزامات سامانه
- فراهم کردن یک سیستم مدیریت محتوا برای چرخه پژوهش و توسعه مبتنی بر ارزیابی، با بهرهگیری از رویکرد خصمانه
- «مدیریت» (Manage) و فراهم کردن دسترسی و کارکردهای مبتنی بر نقش
- رهگیری پیشرفت شرکتکنندگان
- مدیریت دسترسی شرکتکنندگان به اسناد و پروندهها
- مدیریت انتشار مجموعهدادهها و گردشکار مربوط به مجوزدهی
- ارتباط با پسانیهای گوناگون «امتیاز ایمنی ذاتی» (Score) و گردآوری نتایج امتیاز ایمنی ذاتی
- مدیریت انتشار نتایج و رندر گزارشها
- فراهم کردن فضایی برای درونسازی ریزسرویسهای تکمیلی مانند مصورسازی دادهها
ویژگیهای اصلی سامانه
- حسابهای کاربری با نقشهای گوناگون (شرکتکننده، رابط، مدیر، رابط مجوزها، پژوهشگر اصلی)
- مدیریت محتوای پویا (صفحه نخست، اعلانها، صفحات محتوای عمومی/خصوصی)
- مدیریت داراییهای پویا (داراییهای عمومی و خصوصی)
- مدیریت پویای ارسالها و پیکربندی حالت ارسال
- یکپارچهسازی خط لوله «امتیاز ایمنی ذاتی» (Score): به هر ارسال بهطور خودکار عملیات امتیاز ایمنی ذاتی اختصاص مییابد که توسط پسانی امتیاز ایمنی ذاتی پردازش میشود
- یکپارچهسازی خط لوله تجمیع: پسانی امتیاز ایمنی ذاتی قادر است عملیات امتیاز ایمنی ذاتی را خلاصه کند تا پیشرفت در طول زمان رهگیری شود یا یک جدول ردهبندی فراهم گردد
- تولید گزارشهای سفارشی در پسانی
- طراحی مبتنی بر اشیاء منطق کسبوکار (BL): اشیاء BL کارکردی را در خود جای میدهند که میتوان آن را برگزید و زنجیرهوار به کار گرفت تا از موارد استفاده پویا در بخشهای مختلف سیستم پشتیبانی شود
- ایجاد اشیاء سامانه (مانند Sites، Submissions، Licenses) که با استفاده از JSON schema پارامترپذیرند و با استفاده از منطق کسبوکار قابل تغییرند
4.1.2. مرور کلی معماری پلتفرم ارزیابی
تصویر در نسخهٔ PDF Figure 3. System architecture showing frontend and backend components. The backend components can be scaled dynamically to match demand using a cloud cluster.
تصویر ۳. معماری سیستم که اجزای frontend و backend را نشان میدهد. اجزای backend میتوانند با استفاده از یک خوشه ابری بهصورت پویا متناسب با تقاضا مقیاسپذیر شوند.
پلتفرم ارزیابی از یک سیستم frontend وباپلیکیشنِ رو به عموم و یک سیستم backend امتیازدهیِ کاملاً خودکار که بهصورت داخلی اداره میشود تشکیل شده است. برنامه frontend رو به عموم بیرون از فایروال مؤسسه ملی استاندارد و فناوری آمریکا (NIST) اجرا میشود و هیچ دسترسیای به زیرساخت داخلی NIST ندارد. علاوه بر این، یک نمونه مستقل از سرور تجسم داده R-shiny و همچنین یک نمونه پایگاهداده PostgreSQL وجود دارد که بهگونهای هماهنگ شدهاند تا تجسم زندهٔ دادههای امتیازدهی را در frontend فراهم کنند؛ بهطوری که بهمحض محاسبهٔ امتیازها در backend بهروزرسانی میشوند. backend امتیازدهی تفکیکشده است و در محدودهٔ NIST قرار دارد تا الزامات امنیت را برآورده سازد. بهدلیل این معماری سیستم، بخش امتیازدهی بهطور مداوم frontend را poll میکند تا وضعیت سراسری برنامه همگام باقی بماند.
4.1.3. فرایند ثبتنام و صدور مجوز
برای مشارکت در وظایف ارزیابی GenAI «مؤسسه ملی استاندارد و فناوری آمریکا» (NIST)، شرکتکنندگان در وبفرانتاند یک حساب کاربری ایجاد میکنند. برای این کار به یک حساب کاربری login.gov نیاز دارند. پس از ثبتنام، شرکتکنندگان پیش از آنکه بتوانند دادهها را دریافت کرده و نتایج را بارگذاری کنند، باید مراحل گردشکار زیر را تکمیل نمایند:
- ارائه اطلاعات شرکتکننده (مانند نام، کشور، وابستگی سازمانی و نوع وابستگی سازمانی)
- ایجاد یک تیم برای مقاصد صدور مجوز
- ثبتنام در مسیرهای ارزیابی موردنظر
- تکمیل توافقنامههای الزامی؛ تیم NIST GenAI این توافقنامهها را پیش از مرحله بعد بررسی میکند (ر.ک. بخش 4.3)
- دریافت مجموعه(های) داده ارزیابی و تولید خروجی سیستم
- ایجاد یک جایگاه سیستم (system slot) در داشبورد ارسال
4.1.4. فرایند ارسال
مشارکتکنندگان با استفاده از مجموعهداده ارزیابی بهدستآمده، خروجیهای سیستم را برای ارزیابی تولید میکنند. سپس ارسالها را میتوان از طریق داشبورد ارسال، مستقیماً روی بستر وب بارگذاری کرد؛ این داشبورد ماتریسی از فازهای وظیفه را در میان سیستمهای کاربران نمایش میدهد. در بستر وبِ بارگذاری مشارکتکننده در صورت نیاز پارامترهای تنظیمشده برای هر وظیفه ارزیابی را مشخص میکند. پس از بارگذاری یک ارسال، سیستم بهطور خودکار یک اجرای امتیازدهی پارامتریشده تولید میکند که متعاقباً توسط بکاند امتیازدهی برای پردازش دریافت میشود. پس از تکمیل امتیازدهی، نتایج به وباپلیکیشن بارگذاری شده و در داشبورد ارسال مشارکتکننده در دسترس قرار میگیرند.
4.1.5. Backend تحلیلگری داده
Backend امتیازدهی مسئول پردازش تمام ارسالهای سیستمها است. این سیستم فایل ارسال، اطلاعات اجرای امتیازدهی و «فراداده» (metadata) ارسال را واکشی میکند و سپس خروجی را با استفاده از یک خطلولهی خطی از مراحل پردازش، پردازش میکند. اگر ارسال با موفقیت امتیازدهی شود (یعنی همهی مراحل خطلوله موفق شوند)، امتیازها بر روی بستر ارزیابی بارگذاری میشوند تا شرکتکنندگان بتوانند آنها را مشاهده کنند. اگر یکی از مراحل با شکست مواجه شود، خطای تفصیلی در اختیار شرکتکننده قرار میگیرد که در داشبورد اپلیکیشن وب قابل مشاهده است.
علاوه بر کارنامههای ایستا برای هر ارسال، که تنها برای شرکتکنندگان در داشبوردشان در دسترس است، سیستم همچنین تحلیلگری دادهی بلادرنگ را در قالب یک جدول ردهبندی تعاملی و عمومی ارائه میکند. اپلیکیشن جدول ردهبندی دادههای خود را از پایگاهدادهی امتیازدهی دریافت میکند و بر روی یک نمونهی مجزای R-Posit Connect درون شبکهی ابر خصوصی مجازی سیستم میزبانی میشود. اپلیکیشن جدول ردهبندی با R-Shiny پیادهسازی شده است تا امکان کاوش تعاملی دادهها فراهم شود و برای هر خروجی سیستمی که با موفقیت امتیازدهی میشود، بهطور خودکار بهروزرسانی میگردد.
4.2. خطلولهی ارزیابی
4.2.1. مروری بر پیادهسازی
سیستم امتیازدهی بکاند پشت فایروال مؤسسه ملی استاندارد و فناوری آمریکا (NIST) عمل میکند. این سیستم از یک خوشه ابری (OpenStack یا AWS) استفاده میکند که امکان مقیاسپذیری پویای نمونهها را فراهم میآورد. بسته به پیکربندی، این سیستم از یک یا چند نمونه محاسباتی تشکیل شده است که دسترسی شبکهای یکطرفه به وبسرور فرانتاند دارند. برای هماهنگسازی محاسبات در میان نمونهها، از نرمافزاری داخلی به نام «IndusR» استفاده میکنیم. درون هر نمونه، IndusR امکان ایجاد مجموعهای از عاملهای مستقل را فراهم میکند که بهگونهای هماهنگ شدهاند تا هر ارسال را بهصورت مستقل پردازش کنند. علاوه بر مقیاسپذیری تعداد نمونههای محاسباتی، تعداد عاملهای IndusR نیز میتواند مقیاسپذیر شود تا بار کاری افزایشیافته در دورههای پرتقاضای ارزیابی را پوشش دهد. هر مجموعه از عاملها یک گردشکار امتیازدهی خطی را اجرا میکند که برای انجام گامهای مشخص در فاز هر تکلیف منفرد تعریف شده است و این تعریف با استفاده از یک فایل پیکربندی YAML انجام میشود. عاملها چرخه عمر کامل امتیازدهی خروجی سیستم را بهصورت خودکار با هماهنگسازی تکلیفها از طریق یک سیستم صف، مدیریت میکنند. هر ارسال با اجرای مجموعهای از گامهای خط لوله امتیازدهی پردازش میشود. هر گام امتیازدهی بهصورت یک اسکریپت در فضای کاربر بیان میشود که میتواند با هر زبان برنامهنویسی قابلدسترس بر روی نمونه پیادهسازی و بهکار گرفته شود. خط لوله پس از هر گام موفق ادامه مییابد یا در صورت شکست یک گام متوقف میشود.
تصویر در نسخهٔ PDF شکل ۴. سیستم امتیازدهی بکاند مجموعهای از عاملهای با عملکرد مستقل است. مجموعه عاملها و همچنین نمونههای میزبان میتوانند بهصورت پویا برای تطبیق با تقاضا مقیاسپذیر شوند.
شکل ۴. سیستم امتیازدهی بکاند مجموعهای از عاملهای با عملکرد مستقل است. مجموعه عاملها و همچنین نمونههای میزبان میتوانند بهصورت پویا برای تطبیق با تقاضا مقیاسپذیر شوند.
۴.۲.۲. فرایند امتیازدهی
هر خطلولهٔ امتیازدهی بهصورت جداگانه برای هر مرحله پیکربندی میشود، اما در میان تکالیف، گردشکار را میتوان بهصورت کلی به شرح زیر توصیف کرد:
- دریافت اجرای امتیازدهی، ارسالی و «فراداده» (metadata) از سمت کاربر
- راهاندازی کارِ امتیازدهی و پارامترهای امتیازدهی
- اعتبارسنجی وجود، نحو و معنای فایل ارسالی
- امتیازدهی ایمنی ذاتی به خروجی سیستم
- تولید گزارش کاربر
- درج امتیازهای ایمنی ذاتی در پایگاهدادهٔ امتیازدهی
- بارگذاری نتایج در سمت کاربر
4.2.3. اعتبارسنجی و آزمونِ Text-to-Text
هر اسکریپت اعتبارسنجی برای مسیرهای Generator و Discriminator، صحت و سازگاری ارسالهای خروجی سیستم را از طریق بررسی یکپارچگی ساختاری و انطباق قالب تضمین میکند.
اعتبارسنجی مسیر Generator
گامهای کلیدی اعتبارسنجی برای خروجیهای سیستم Generator عبارتاند از:
- اعتبارسنجی قالب XML: از xmllint برای بررسی خوشفرم بودن فایل ارسالی و مطابقت آن با طرح DTD استفاده میشود
- اعتبارسنجی شناسه موضوع (Topic ID): تضمین میکند که هر GeneratorTopicResult دارای ویژگی topic یکتا باشد و با موضوعهای از پیش تعریفشده در فایل مرجع .sgml مطابقت داشته باشد
- بررسی زمان سپریشده: تأیید میکند که ویژگی elapsedTime تنها حاوی مقادیر عددی باشد
- الزام شمارش واژهها: تضمین میکند که خلاصه هر موضوع:
- خالی نباشد
- از حداکثر سقف شمارش واژهها (۲۵۰ واژه) تجاوز نکند
- تشخیص موضوعهای مفقود: بررسی میکند که همه موضوعهای الزامی فایل مرجع .sgml در ارسال گنجانده شده باشند
اعتبارسنجی مسیر Discriminator
گامهای کلیدی اعتبارسنجی برای خروجیهای سیستم Discriminator عبارتاند از:
- بررسی یکپارچگی ستونها: تضمین میکند که همه ستونهای الزامی (DatasetID، TaskID، DiscriminatorID، TaskID، DiscriminatorID، ModelVersion، FileID، ConfidenceScore) حاضر و بهدرستی قالببندیشده باشند.
- تأیید TaskID: تأیید میکند که همه ردیفها به تکلیف «detection» تعلق دارند تا سازگاری حفظ شود.
- سازگاری نسخه مدل: بررسی میکند که تنها یک ModelVersion یکتا در ارسال وجود داشته باشد.
- تطبیق DatasetID: تضمین میکند که مقادیر DatasetID در ارسال با مقادیر فایل مرجع فهرست مطابقت داشته باشند.
- پوشش FileID: تأیید میکند که همه فایلهای ذکرشده در فهرست در ارسال لحاظ شده باشند.
- بازه امتیاز اطمینان: تضمین میکند که امتیازها مقادیر ممیز شناور معتبری بین ۰ و ۱ باشند.
- بررسی تغییرپذیری امتیازها: مواردی را تشخیص میدهد که در آنها همه امتیازهای تشخیص یکسان باشند؛ چنین وضعیتی ممکن است بیانگر اشکالی در پیشبینیهای مدل باشد.
- تشخیص ستون شاخص: هر ستون شاخص ناخواستهای که ممکن است درج شده باشد را علامتگذاری میکند.
آزمون سیستم امتیازدهی
برای اطمینان از قابلیت اطمینان و استواری سیستم امتیازدهیمان، چارچوب آزمون ساختیافتهای پیادهسازی کردیم که موارد زیر را دربر میگیرد:
- آزمون واحد برای امتیازدهنده: آزمونهای واحد خودکار برای اعتبارسنجی اجزای منفرد نرمافزار امتیازدهی توسعه دادیم تا صحت محاسبات و پایبندی به رفتار مورد انتظار تضمین شود.
- ارسالهای آزمونی: مجموعهای متنوع از ارسالهای آزمونی معتبر و نامعتبر تولید کردیم تا توانایی امتیازدهنده در مدیریت سناریوهای مختلف ورودی، از جمله موارد مرزی و قالبهای نادرست، ارزیابی شود.
- انجام بهروزرسانی و پالایش مستمر: بهروزرسانی منظم مجموعه آزمونها برای هماهنگی با تغییرات نرمافزار، بهگونهای که تغییرات در سیستم امتیازدهی یا بستر پیش از استقرار بهطور پیوسته اعتبارسنجی شوند.
با پالایش مستمر آزمونهایمان در کنار بهروزرسانیهای نرمافزار، دقت ارزیابی را حفظ میکنیم و مشکلات بالقوه را در مراحل اولیه توسعه شناسایی میکنیم.
4.2.4. نرمافزار امتیازدهی متن به متن
نرمافزار امتیازدهی مسیر مولد
نرمافزار امتیازدهی مسیر مولد مسئول ارزیابی کیفیت، تناسب محتوا و قابلیت اطمینان کلی خلاصههای تولیدشده توسط هوش مصنوعی است. این نرمافزار از یک خطلوله ساختاریافته پیروی میکند تا سازگاری و انصاف در ارزیابی تضمین شود و در عین حال مراحل لازم پیشپردازش، اعتبارسنجی و امتیازدهی را یکپارچه میسازد. اجزای کلیدی خطلوله امتیازدهی به شرح زیر است:
- تجزیه و تحلیل خروجیهای ارسالی سیستم: نرمافزار ابتدا اطلاعات لازم را از خروجیهای ارسالی سیستم پردازش و استخراج میکند. انتظار میرود خروجیها در قالبی از پیش تعریفشده ارائه شوند و تجزیهکننده ساختار صحیح را تضمین کرده و فیلدهای مرتبط مانند خلاصههای تولیدشده توسط سیستم، فراداده (metadata) و هرگونه اطلاعات تکمیلی ارائهشده توسط مشارکتکنندگان را استخراج میکند.
- پسپردازش فایلهای متنی خلاصه: پس از تجزیه، خروجی سیستم تحت پسپردازش قرار میگیرد تا قالب استاندارد شود و متن پاکسازی شود. این مرحله شامل حذف فاصلههای اضافی، نرمالسازی مشکلات کدگذاری و آمادهسازی خلاصهها برای اعتبارسنجی و امتیازدهی بعدی است.
- بررسی سلامت محتوا و پالایش سمّیت: برای تضمین تناسب محتوا، هر خلاصه تولیدشده از نظر محتوای بالقوه مضر یا سمّی تحلیل میشود. این کار با استفاده از موارد زیر انجام میشود:
- Detoxify: یک طبقهبند سمّیت مبتنی بر یادگیری عمیق (Deep Learning) که زبان مضر یا توهینآمیز را شناسایی میکند.
- Toxin: یک سازوکار پالایش تکمیلی برای بازبینی متقاطع و کاهش خطرهای (Risks) سمّیت.
خلاصههایی که از نظر سمّیت علامتگذاری میشوند، یا پالایش میشوند یا برای آنها هشداری صادر میشود تا مشارکتکنندگان از نگرانیهای احتمالی آگاه شوند.
- ارزیابی کیفیت در مقایسه با مقالات مبدأ: تابع اصلی امتیازدهی، کیفیت خلاصههای تولیدشده توسط هوش مصنوعی را با مقایسه آنها با مقالات مبدأ اصلی محاسبه میکند. روششناسی و سنجههای (Metrics) کیفیت مورد استفاده برای این مقایسه در بخش 6.2 تشریح شده است. این ارزیابیها بینشهایی درباره روانی، میزان اطلاعاترسانی، انسجام و سازگاری واقعی ارائه میدهند.
- اندازهگیری عملکرد آشکارساز پایه: برای فراهم کردن یک معیار مقایسهای، نرمافزار امتیازدهی عملکرد آشکارساز پایه NIST (مؤسسه ملی استاندارد و فناوری آمریکا) را نیز روی مولد ارائهشده محاسبه میکند. این شامل موارد زیر است:
- سطح زیر منحنی (AUC): توانایی طبقهبند را در تمایز میان خلاصههای تولیدشده توسط هوش مصنوعی و خلاصههای نوشتهشده توسط انسان میسنجد.
- امتیاز برایر: دقت پیشبینیهای احتمالاتی آشکارساز پایه را ارزیابی میکند.
این امتیازها روی G-leaderboard نمایش داده میشوند تا مشارکتکنندگان یک معیار مرجع در اختیار داشته باشند. جزئیات ویژگیهای مولد و سنجههای عملکرد در بخش 6 بحث شدهاند.
- بستهبندی خلاصهها برای مسیر متمایزکننده: مرحله نهایی شامل آمادهسازی خلاصههای تولیدشده برای استفاده در مسیر متمایزکننده است. خلاصههای پردازششده پیش از تحویل به مشارکتکنندگان مسیر متمایزکننده، ساختاربندی، قالببندی و بستهبندی میشوند تا اطمینان حاصل شود که بهدرستی برچسبگذاری شدهاند و مشخصات الزامی را برآورده میکنند.
نرمافزار امتیازدهی مسیر متمایزکننده
نرمافزار امتیازدهی مسیر متمایزکننده، اثربخشی سیستمهای تشخیص (Detection) متن تولیدشده توسط هوش مصنوعی را از طریق تحلیل امتیازهای تشخیص آنها و محاسبه سنجههای عملکرد ارزیابی میکند. فرایند امتیازدهی چندین ورودی را یکپارچه میکند و ارزیابیهای آماری تولید میکند تا دقت و قابلیت اطمینان هر خروجی ارسالی سنجیده شود.
- ورودیها و منابع داده: امتیازدهنده ورودیهای زیر را پردازش میکند:
- خلاصههای دستهبندیشده در سه گروه:
- خلاصههای نوشتهشده توسط انسان
- خلاصههای هوش مصنوعی تولیدشده توسط NIST
- خلاصههای تولیدشده توسط هوش مصنوعی از مشارکتکنندگان مسیر مولد (G-participants)
- فهرستی از امتیازهای تشخیص اختصاصیافته توسط سیستم متمایزکننده به هر خلاصه
- فایلهای نمایه و مرجع شامل برچسبهای حقیقت مبنا (ground-truth) و فراداده برای اعتبارسنجی نتایج امتیازدهی.
- محاسبه سطح زیر منحنی و امتیازهای برایر: برای هر خروجی ارسالی متمایزکننده، امتیازدهنده عملکرد تشخیص را با استفاده از سطح زیر منحنی و امتیاز برایر ارزیابی میکند.
- محاسبه زیرامتیاز برای خروجیهای ارسالی G: علاوه بر عملکرد کلی، امتیازدهنده برای هر خروجی ارسالی مجزای مولد، زیرامتیازهایی محاسبه میکند. این کار امکان تفکیک میزان توانایی سیستم متمایزکننده در شناسایی خلاصههای تولیدشده توسط هوش مصنوعی در میان سیستمهای مولد مختلف را فراهم میکند. این زیرامتیازها به ارزیابی تجمیعی عملکرد متمایزکننده کمک میکنند.
- تجسم و سنجههای عملکرد: برای ارائه تحلیل جامع عملکرد، نرمافزار امتیازدهی موارد زیر را تولید میکند:
- منحنی مشخصه عملکرد گیرنده (ROC Curve) – بازنمایی گرافیکی موازنه میان نرخ مثبتهای واقعی و مثبتهای کاذب. ر.ک. [14].
- منحنی موازنه خطای آشکارسازی (DET Curve) – تجسم دقیق عملکرد با تمرکز بر نرخهای خطا در تشخیص. ر.ک. [14].
این منحنیها روی پلتفرم نمایش داده میشوند تا به مشارکتکنندگان در ارزیابی اثربخشی سیستم خود در تمایز میان خلاصههای انسانی و تولیدشده توسط هوش مصنوعی کمک کنند. جزئیات سنجههای عملکرد متمایزکننده در بخش 6 بحث شده است.
4.2.5. مدلهای پایهٔ متنبهمتن
برای ایجاد یک معیار عملکردی برای هر دو مسیر مولد و تشخیصدهنده، مجموعهای از مدلهای پایه را با استفاده از سیستمهای شناختهشدهٔ هوش مصنوعی مولد (Generative AI) پیادهسازی کردیم.
این مدلهای پایه، خروجیهای مرجعی را برای اعتبارسنجی خط لولهٔ ارزیابی و همچنین ارزیابی اثربخشی سیستمهای مشارکتکننده فراهم میکنند.
خروجیهای پایهٔ مولد
برای تولید متن، از دو مدل زبانی بزرگمقیاس (Large Language Model، LLM) برای ارائهٔ خروجیهای پایه استفاده کردیم:
- GPT-3.5 Turbo: یک مدل زبانی بزرگ (LLM) پرکاربرد [31] که برای کارایی و سرعت بهینهشده است و بهعنوان معیاری قوی برای خلاصههای تولیدشده توسط هوش مصنوعی عمل میکند.
- GPT-4: مدل پیشرفتهتری [20] با درک بافتی بهبودیافته و انسجام بیشتر، که مبنای مقایسهای باکیفیتتر فراهم میآورد.
این مدلها برای تولید خلاصهها بر اساس همان ورودیهای سیستمهای مشارکتکننده بهکار رفتند و امکان مقایسهٔ مستقیم کیفیت خروجی، روانی و غنای اطلاعاتی را فراهم کردند.
خروجیهای پایهٔ تشخیصدهنده
برای تشخیص (Detection) متن تولیدشده توسط هوش مصنوعی، دو مدل پایه انتخاب کردیم که برای ارزیابی این موضوع طراحی شدهاند که آیا متن دادهشده توسط انسان نوشته شده است یا توسط ماشین تولید شده است:
- RADAR-Vicuna-7B: یک مدل تنظیمشدهٔ دقیق Vicuna [10] که برای تشخیص اصالت (authenticity) متن طراحی شده و از بازنماییهای مبتنی بر ترنسفورمر برای طبقهبندی استفاده میکند.
- RoBERTa-base-openai-detector: یک طبقهبند مبتنی بر RoBERTa [18] که بهطور خاص برای شناسایی محتوای تولیدشده توسط هوش مصنوعی آموزش دیده است و معیاری مستحکم برای ارزیابی عملکرد تشخیص فراهم میکند.
این مدلها برای امتیازدهی به خروجی سیستمها بهکار رفتند و اثربخشی آنها را در تمایز میان متنهای نوشتهشده توسط انسان و تولیدشده توسط هوش مصنوعی اندازهگیری کردند.
با ایجاد این مدلهای پایه، تضمین میکنیم که همهٔ سیستمهای ارسالی با خروجیهای مرجع ارزیابی میشوند و نقطهٔ مقایسهای روشن برای عملکرد مولد و تشخیصی فراهم میآید. خروجی پایهٔ مولد همچنین دادههایی برای ارزیابی تشخیصدهندهها در دور ۱ فراهم میکند.
4.3. الزامات اداری و مقرراتی
ارزیابیهای انجامشده در مؤسسه ملی استاندارد و فناوری آمریکا (NIST) مستلزم چندین الزام اداری و مقرراتی است تا فرایندی روان، امن و منطبق با قانون تضمین شود؛ فرایندی که در آن نقشها و مسئولیتهای هر دو طرف، یعنی NIST و شرکتکنندگان، بهروشنی تعریف شده و برای همگان قابل فهم باشد. الزامات لازم در بستر GenAI بهاختصار در ادامه توصیف شده است. تیم GenAI مستنداتِ رویههای برتر داخلی را تدوین کرده است تا انجام این الزامات را در آینده تسهیل کند.
4.3.1. ثبتنام
برای مشارکت در ارزیابی GenAI، مشارکتکننده بهتر است در وبسایت GenAI (https://ai-challenges.nist.gov/genai) ثبتنام کرده و یک پروفایل ایجاد کند. بهتر است از یک نشانی ایمیل login.gov استفاده شود. هنگام ثبتنام، مشارکتکننده نام، کشور، وابستگی سازمانی و نوع وابستگی سازمانی خود را ارائه میدهد؛ سپس یک تیم ایجاد میکند یا به تیمی موجود میپیوندد و سپس برای کار(های) موردنظر ثبتنام میکند.
ثبتنام مشارکتکنندهای که خارج از آمریکا است میتواند پیش از صدور تأیید مشارکت، مشمول مراحل بررسیِ تکمیلی شود.
4.3.2. توافقنامههای استفاده از دادهها
برای هر دو مسیر Generator و Discriminator، مؤسسه ملی استاندارد و فناوری آمریکا (NIST) دادههایی را فراهم میکند که شرکتکنندگان آنها را پردازش میکنند. قواعد حاکم بر استفاده مجاز از این دادهها در یک توافقنامه استفاده از دادهها (DUA) تعیین شده است که شرکتکنندگان باید آن را پیش از اعطای اجازه مشارکت تکمیل و بازگردانند. توافقنامه استفاده از دادههای GenAI با هماهنگی «دفتر مشاور ارشد حقوقی» (Office of Chief Counsel, OCC) مؤسسه ملی استاندارد و فناوری آمریکا تدوین شد.
4.3.3. توافقنامه انتقال داده برای تولیدکنندهها
ساختار ارزیابی پیشبینی کرده است که خروجیهای ارائهشده توسط شرکتکنندگانِ بخش تولیدکننده (Generator) بهعنوان مواد ارزیابی در مراحل بعدی برای شرکتکنندگانِ بخش متمایزکننده (Discriminator) مورد استفاده قرار گیرد. به همین دلیل، از «توافقنامه انتقال داده» (Data Transfer Agreement, DTA) میان مؤسسه ملی استاندارد و فناوری آمریکا (NIST) و تولیدکنندهای که دادهها را به NIST ارائه میکند استفاده میشود. فرایندی از این دست طراحی شده و در هماهنگی با دفتر شراکتهای فناوریِ NIST (TPO، https://www.nist.gov/tpo) تکمیل میگردد. تکمیل توافقنامه انتقال داده توسط شرکتکنندهٔ تولیدکننده و نیز NIST برای مشارکت در بخش تولیدکننده الزامی است.
4.3.4. تعیین تکلیف پژوهش بر روی افراد انسانی
کل پروتکل مطالعه مقدماتی GenAI با عنوان «Generative AI Challenge» و با شماره اختصاصیافته ITL-2023-0644 به دفتر حمایت از پژوهشهای مؤسسه ملی استاندارد و فناوری آمریکا (NIST) (RPO، https://www.nist.gov/adlp/research-protections-office) ارائه شد. برای این پروتکل، تعیین تکلیف «پژوهش معاف بر روی افراد انسانی» صادر شد.
4.3.5. تأییدیههای استفاده از نرمافزار
هر نرمافزار یا ابزار غیرمتعلق به NIST که توسط مؤسسه ملی استاندارد و فناوری آمریکا (NIST) برای تولید دادههای ارزیابی استفاده میشود، بهتر است یا قبلاً تأیید شده و در NIST در دسترس باشد، یا از یک فرایند تأیید عبور کند که شامل موارد زیر است:
- بررسی شرایط خدمات یا مجوز نرمافزار، و الزام احتمالی انعقاد یک ضمیمهٔ شرایط خدمات که ارائهدهنده پس از مذاکره با آن موافقت میکند. این فرایند با هماهنگی کارشناسان حقوقی دفتر مشاورهٔ حقوقی (OCC) انجام میشود.
- تأیید امنیت فناوری اطلاعات برای استفاده از «خدمات اینترنتی کمریسک» (Low-Risk Internet Service, LRIS) در مورد کاربرد GenAI. این فرایند با هماهنگی دفتر مدیریت سیستمهای اطلاعاتی (OISM, https://www.nist.gov/oism) انجام میشود.
استناد
محمدعلی کهندژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P05-C36-S05
شناسهٔ محتوا KDJ-AI-2026E1-P05-C36-S05-901DA9A2
۵. وظایف
هدف اصلی ارزیابیهای آزمایشی GenAI، درک رفتار سیستم برای تشخیص محتوای تولیدشده توسط AI در مقابل محتوای تولیدشده توسط انسان است. این موضوع شامل ویژگیهای محتوای تولیدشده توسط AI غیرقابلتشخیص، تفاوتهای محتوای انسانی با محتوای AI، و چگونگی ارائه راهنمایی توسط نتایج این وظیفه به کاربران نهایی برای کمک به تمایز میان این دو نوع محتوایی است که بهطور منظم با آنها مواجه میشوند. این ارزیابی آزمایشی به تمایز میان محتوای معنایی «واقعی» و «غیرواقعی» نمیپردازد؛ با این حال، این موضوع همچنان یک موضوع بالقوه موردعلاقه برای مسائل چالشی در آینده (Future) بهشمار میرود.
5.1. مولدهای متنبهمتن (T2T-G)
تیمهای مشارکتکننده در وظیفه مولدهای متنبهمتن (T2T-G) مجموعه دستورالعملهای زیر را برای وظیفه خود دریافت کردند:
با دریافت یک موضوع و مجموعهای شامل حدود ۲۵ سند مرتبط بهعنوان ورودی، از میان اسناد، یک خروجی خلاصه کوتاه، منسجم و روان بسازید که نیاز اطلاعاتی بیانشده در صورتِ موضوع را پاسخ دهد. ارزیابان انسانی مؤسسه ملی استاندارد و فناوری آمریکا (NIST) موضوعات مورد علاقه را تدوین کردند. هر ارزیاب یک موضوع ایجاد کرد و مجموعهای از ۲۵ سند مرتبط با آن موضوع را برگزید. اسناد مجموعهداده آزمون از پیکرهای متشکل از مقالات متعدد خبرگزاریها در وبسایت https://duc.nist.gov/ گردآوری شده بودند. شرکتکنندگانِ G بهتر است فرض کنند مخاطب هدف خلاصه، یک تحلیلگر ناظر اطلاعات است که برای تصمیمگیری به این خلاصه نیاز دارد.
- تمام پردازش اسناد و تولید خلاصهها بهتر است بهصورت خودکار باشد.
- خلاصه نمیتواند از ۲۵۰ واژه (توکنهای جداشده با فاصله سفید) طولانیتر باشد. ارسالهایی با خلاصههای طولانیتر از ۲۵۰ واژه توسط G-validator پذیرفته نخواهد شد.
- برای ساخت خلاصه کوتاهتر امتیازی داده نخواهد شد.
- هیچ قالببندی خاصی جز قالب خطی (یعنی متن ساده) مجاز نیست. در دادههای آزمون برای تیمهای مولد حدود ۴۵ موضوع وجود خواهد داشت. این مجموعه خلاصهها از تمامی تیمهای مولد، بهعنوان دادههای آزمون برای تیمهای متمایزکننده عمل خواهد کرد که تشخیص میدهند محتوای نوشتهشده، انسانیساخته است یا هوش مصنوعیساخته. خروجی خلاصه از طریق تعیین میزان سهولت یا دشواری تمایز میان خلاصههای هوش مصنوعیساخته و خلاصههای انسانیساخته ارزیابی خواهد شد؛ یعنی هدف مولدها آن است که خلاصهای تولید کنند که از خلاصههای انسانیساخته قابلتمایز نباشد.
5.2. متمایزکنندهٔ متنبهمتن (T2T-D)
متمایزکنندهها مجموعهآزمونهایی شامل خلاصههای تولیدشده توسط هوش مصنوعی و خلاصههای تولیدشده توسط انسان را دریافت کردند، اما مقالههای منبع را دریافت نکردند. وظیفهٔ آنها این بود که تشخیص دهند آیا خلاصهٔ متنِ هدف با استفاده از «مدلهای زبانی بزرگ» (Large Language Models, LLMs) مانند ChatGPT تولید شده است یا توسط یک انسان نوشته شده است. برای هر آزمون T2T-D شامل یک خلاصهٔ منفرد، سیستمِ «تشخیص» (Detection) T2T-D بهتر است یک امتیاز تشخیص (عددی حقیقی بین ۰ و ۱) ارائه کند؛ اعداد بزرگتر نشان میدهند که بهاحتمال زیاد خلاصهٔ متن هدف با استفاده از مدلهای مبتنی بر LLM تولید شده است. «سنجهٔ» (Metric) اصلی برای سنجش عملکرد تشخیص، «سطح زیر منحنی مشخصهٔ عملکرد گیرنده (ROC-AUC)» است که در بخش 6 شرح داده شده است.
6. سنجههای عملکرد
6.1. سنجههای متمایزکننده
این بخش سنجههایی را توصیف میکند که برای سنجش عملکرد سیستم متمایزکننده به کار میروند.
استناد
محمدعلی کهندژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P05-C36-S06
شناسهٔ محتوا KDJ-AI-2026E1-P05-C36-S06-2D1D3E04