فهرست این فصلبخش ۴، فصل ۳۰ — صفحهٔ ۴ از ۶
بخش ۴، فصل ۳۰ — صفحهٔ ۴ از ۶
پایههای روانشناختی تبیینپذیری و تفسیرپذیری در هوش مصنوعی
متن اصلی فارسی با منشأ، شناسه و پیوند استناد پایدار.
۳. تعریفهای علوم کامپیوتر از تفسیرپذیری و تبیینپذیری
بحث پیشین بر این نکته تأکید میکند که «تفسیرپذیری» (interpretability) و «تبیینپذیری» (explainability) توابع کاربر، مورد استفاده و سایر عوامل بافتی هستند، به همان اندازه که توابع سیستم مورد استفاده نیز میباشند. با این حال، ویژگیهای روانسنجی (psychometric) کاربران عموماً تحت کنترل طراحان نیستند. در اینجا، آخرین وضعیت (state-of-the-art) الگوریتمهای هوش مصنوعی (AI) تبیینپذیر و اینکه سیستمها چگونه ممکن است برای ارتقای تفسیرپذیری و تبیینپذیری طراحی شوند را بررسی میکنیم.
3.1 مقایسهٔ بازنماییهای ذهنی با الگوهای کنونی یادگیری ماشین
در حالی که انسانها چندین «بازنمایی ذهنی» (mental representations) را بهصورت موازی میسازند، الگوریتمهای «یادگیری سطحی» هنگام بازنمایی یک مجموعهداده تنها یک مدل، یا توزیعی از مدلهای یک خانوادهٔ ریاضی واحد تولید میکنند — فرایندی تحتاللفظی. فراتر از یادگیری سطحی، چندین تکنیک «یادگیری ماشین» (Machine Learning, ML) وجود دارد که چندین بازنمایی تولید میکنند. برای مثال، یادگیری گروهی فرایندی است که در طی آن چندین مدل تولید و در نهایت برای شکلدادن به یک فرضیهٔ واحد تجمیع میشوند. با این حال، این مدلها از نظر سطح دقت با یکدیگر تفاوتی ندارند — آنها صرفاً خانوادههای متفاوتی از عملگرهای ریاضی را بر یک مجموعهٔ ویژگی واحد اعمال میکنند. در مقابل، الگوریتمهای یادگیری چندوظیفهای میکوشند انعطافپذیری بازنماییهای کُلیِ انسانی را با آموزش دادن یک مدل برای تولید بازنمایی مشترکی از چندین محرک از حوزههای مختلف بازسازی کنند و بدینترتیب «انتقال دور» را ممکن سازند. هنگامی که این کار موفقآمیز باشد، چنین مدلهایی ممکن است بازنماییهای انتزاعیتری بیاموزند که در ظاهر شبیه بازنماییهای کلی هستند؛ اما آنها همچنان تنها یک مدل واحد تولید میکنند. سرانجام، شبکههای عصبی عمیق چندین بازنمایی از یک مجموعهداده تولید میکنند؛ اما این کار را با استخراج بازنماییهای انتزاعی از بازنماییهای عینیتر انجام میدهند، در حالی که انسانها این بازنماییها را بهطور همزمان و موازی رمزگذاری میکنند؛ این بدان معناست که انسانها تفسیرهای سادهتر را از بازنماییهای تفصیلیتر استخراج نمیکنند [118].
3.2 پارادایمهای الگوریتمی طراحیشده برای ارتقای تفسیرپذیری و تبیینپذیری
مروری جامع و اخیر بر ادبیات رویکردهای محاسباتی به هوش مصنوعی تبیینپذیر (Explainable AI) خاطرنشان میکند که برای دانشمندان علوم رایانه، مفاهیم تفسیرپذیری (Interpretability) و تبیینپذیری (Explainability) «تنگاتنگ با هم مرتبطاند» [6]. این نویسندگان اظهار میدارند که «سیستمهای قابل تفسیر در صورتی قابل تبییناند که عملیات آنها توسط انسانها قابل درک باشد» (صص. 52140–52141؛ تأکید اضافه شده است). اگرچه تبیینپذیری و تفسیرپذیری گاهی در ادبیات علوم رایانه بهجای هم به کار میروند، این مرور دادههایی ارائه میدهد که از این ادعا پشتیبانی میکند که «در جامعه ML، اصطلاح ‘interpretable’ بیش از ‘explainable’ به کار میرود» (ص. 52141؛ ر.ک. همچنین [42])، بهویژه در مقایسه با کاربرد این اصطلاحات توسط عموم مردم. این یافته، همسو با تعاریف روانشناختی ارائهشده در بالا، میتواند نشاندهنده این باشد که تولیدکنندگان محصولات AI به دلیل برخورداری از دانش پیشزمینهای تخصصی، توانایی بیشتری در تفسیر خروجی این سیستمها دارند. در واقع، Bhatt و همکاران [11] فرض میکنند که این تمایز میتواند از تفاوت در اهداف طراحی این گروههای کاربر ناشی شود: توسعهدهندگان الگوریتم معمولاً بهدنبال تبیینها هستند تا بتوانند الگوریتمهای خود را اشکالزدایی یا به شیوهای دیگر بهبود دهند، و بنابراین ممکن است ابزارهای هوش مصنوعی تبیینپذیر را برای همین هدف توسعه دهند. بدین ترتیب، از نگاه دانشمندان علوم رایانه، تبیین عموماً نشان میدهد که یک سیستم محاسباتی چگونه به یک خروجی معین دست یافته یا آن را تولید کرده است. یک تبیین خوب اغلب علّی (causal) است و نسبت به پیادهسازی سیستم توجیه میشود — برای مثال، «الگوریتم به رد درخواست رواداری سوگیری دارد زیرا دادههای آموزشی نامتوازناند». این نوع تبیین برای اشکالزدایی این سیستمهای پیچیده بسیار سودمند است، اما فقط در صورتی که کاربر دانش پیشزمینهای و تخصص فنی مناسب برای این کار را داشته باشد.۱۶ برای مثال، تبیین ذکرشده در بالا، توسعهدهنده را به گردآوری دادههای متوازنتر و بازآموزی الگوریتم رهنمون میشود، اما برای کاربر نهایی اقدام فوریای پیشنهاد نمیکند، مگر شاید رهاکردن استفاده از الگوریتم.
3.2.1 اهمیت ویژگیهای محلی
بخش عمدهای از پژوهشها در حوزه «هوش مصنوعی توضیحپذیر» (Explainable Artificial Intelligence, XAI) میکوشد تا به توسعهدهندگان کمک کند ارتباطهای ساده، ازبردانسته و تحتاللفظی میان ورودیها و خروجیها را تعیین کنند تا بتوانند سازوکارهای بالقوه علّی را استنباط کنند. برای مثال، الگوی اهمیت ویژگیهای محلی (برای نمونه، [33, 87, 125]) میتواند رایجترین راه برای تعامل کارشناسان عمل با توضیحات فنی باشد. این رویکرد میخواهد نشان دهد که چگونه تغییرهای کوچک در ویژگیهای مشخص میتواند به تغییرهایی در خروجیهای مشخص مدل منجر شود.
«توضیحات مدلناوابسته محلی تفسیرپذیر» (Local Interpretable Model-agnostic Explanations, LIME). LIME [125] که یکی از الگوریتمهای پیشرو در استفاده از الگوی اهمیت ویژگیهای محلی است، هدفش آن است که «پیشبینیهای هر طبقهبند یا رگرسور را به شیوهای وفادار توضیح دهد، از راه تقریب محلی آن با یک مدل تفسیرپذیر... و با ارائه مصنوعهای متنی یا بصری که فهم کیفی رابطه میان مؤلفههای نمونه (مانند واژهها در متن یا وصلهها در تصویر) و پیشبینی مدل را ممکن میسازند.» LIME میتواند به توسعهدهندگان کمک کند بفهمند که چگونه تغییر در ویژگیهای منفرد ممکن است خروجی مدل را حول یک پیشبینی مشخص تغییر دهد. تا جایی که این بینشها تعمیمپذیر باشند و بر ویژگیهای معنادار استوار باشند، ممکن است به توسعهدهندگان در استنباط سازوکارهای علّی مدل کمک کنند؛ با این حال، این رویکردها ممکن است گمراهکننده شوند اگر درگیر همبستگیهای کاذب قرار گیرند. برای مثال، شکل ۵ خروجی LIME را نشان میدهد که روی پاراگرافی از متن اعمال شده که بهجای «مسیحیت»، در دسته «بیخدایی» طبقهبندی شده بود. این طبقهبند بهنظر میرسد بر ویژگیهای نویسنده (مانند این که خاستگاه او یک مؤسسه دانشگاهی است، چنانکه پسوند .edu در نشانی رایانامهاش نشان میدهد) و ویژگیهای سبکسنجی مشخص (مانند بهکارگیری واژههای «have» و «there») متمرکز است، نه واژههایی که ممکن است بیانگر محتوا باشند.
تصویر در نسخهٔ PDF شکل ۵. نمونهای از خروجی LIME که بر ویژگیهای متنی تأکید میکند و باعث شده یک پاراگراف مشخص بهجای مسیحیت، در دسته بیخدایی طبقهبندی شود. تصویر اصلی در این نشانی در دسترس است: https://github.com/marcotcr/lime/blob/master/doc/images/twoclass.png
شکل ۵. نمونهای از خروجی LIME که بر ویژگیهای متنی تأکید میکند و باعث شده یک پاراگراف مشخص بهجای مسیحیت، در دسته بیخدایی طبقهبندی شود. تصویر اصلی در این نشانی در دسترس است: https://github.com/marcotcr/lime/blob/master/doc/images/twoclass.png
LIME در این فرایند توجه کاربران را به ویژگیهای مشخصی جلب میکند که مدل برای انجام یک پیشبینی مشخص از آنها استفاده میکند و بدینسان یک خروجی مشخص را به بازنمایی سادهشدهای از مدلی که آن خروجی را تولید کرده است پیوند میزند. برای مثال، شکل ۶ نشان میدهد که یک طبقهبند که برای تشخیص تمایز میان گرگ و هاسکی طراحی شده، یک تصویر خاص را بر پایه وجود برف در پسزمینه طبقهبندی کرده است (و نه بر پایه ویژگیهای کالبدشناختی که در واقع این دو گونه را از یکدیگر متمایز میکند). یک دانشمند داده با دانش دامنهای مناسب میتوانست از این اطلاعات برای اصلاح یا بهطور کلی عیبیابیِ این طبقهبندی معیوب بهره گیرد.
بدینسان، این فرایند تا اندازهای به تعریف توضیحی که پیشتر ارائه شد شباهت دارد؛ اما تفاوتهای مهمی نیز وجود دارد. نخست، LIME به کاربر توضیحی از خودِ مدل نمیدهد، بلکه در اختیار کاربران مدلی سادهشده قرار میدهد که مدل پیچیدهتری را که الگوریتم میکوشد توضیح دهد تقریب میزند. در عمل، LIME توصیفِ علّی و پیچیدهی سازوکارهای درونی مدل را با توصیفی سادهتر از مدلی دیگر جایگزین میکند که نتایج آن تنها با مدل اصلی همبسته است. برای مثال، LIME هیچ اطلاعاتی درباره این که آیا طبقهبند گرگ در برابر هاسکی در شکل ۶ بر تصویرهایی که برف در پسزمینه ندارند پیشبینیهای دقیقی انجام خواهد داد یا نه، ارائه نمیکند.
شکل ۶. نمونهای از خروجی LIME که بر ویژگیهای ورودی تأکید میکند که برای یک طبقهبندی تصویری مشخص تشخیصی هستند. در این مورد، تصویری از یک هاسکی بهسبب وجود برف در پسزمینه، بهاشتباه بهعنوان گرگ طبقهبندی شده است. چنین اطلاعاتی ممکن است به توسعهدهندگان ابزار در عیبیابی طبقهبندهای بیشبرازشیافته کمک کند. این تصویر نخستینبار در [125] ارائه شده است.
نویسندگان LIME استدلال میکنند که این مدلهای سادهشده (مانند مدلهای رگرسیون با تعداد اندکی ضریب) ذاتاً تفسیرپذیرترند، زیرا «فهم کیفی میان متغیرهای ورودی و پاسخ را فراهم میکنند.» هرچند این هدف تا حد زیادی با تعریف «چکیدهفهم» در نظریه ردو-ردیابی (Fuzzy-Trace Theory) همخوان است، چکیدهفهمها، هنگامی که آموزشدیده باشند، بینش یک متخصص انسانی را درباره این که کدام ویژگیها بهاحتمال زیاد تعمیمپذیرند، در بر میگیرند. فنهایی مانند LIME میتوانند در تولید چنین بازنماییهایی به انسانها کمک کنند و در واقع، آزمایشهای مقدماتی بهنظر میرسد نشان میدهند که آزمودنیهای انسانی میتوانستند از این فنها برای حذف ویژگیهایی که با دقت پیشبینی تداخل داشتند استفاده کنند — یعنی میتوانستند طبقهبندی بهتری بسازند — و نمونه کوچکی از آزمودنیهای انسانی با تخصص در علم داده (و بهویژه آشنایی با مفهوم همبستگی کاذب) ممکن است بتواند از LIME برای استخراج توضیحات بهتر بهره گیرد.
SHapley Additive exPlanations (SHAP). خانواده مدلهای SHAP [87] همانند LIME از این پیشفرض آغاز میکند که «بهترین توضیح برای یک مدل ساده، خودِ آن مدل است» و در نتیجه میکوشد مدلهای پیچیده را با مدلهای سادهتر بازنمایی کند. از این رو، SHAP امتیازهای اهمیت را برای هر ویژگی بازمیگرداند که مشابه ضرایب رگرسیون هستند. برای یک پیشبینی معین، امتیازهای SHAP نشان میدهند که هر یک از این ویژگیها چه اندازه در آن پیشبینی نقش داشته است، همانگونه که در شکل ۷ نشان داده شده است.
از این دید، مدلهای SHAP بسیاری از نقاط قوت و ضعف مشترک با LIME را دارند،
شکل ۷. نمونهای از خروجی SHAP که مقدار پایهی مدل، سهمهای حاشیهای هر یک از ویژگیها، و پیشبینی نهایی را نشان میدهد. چنین رویکردی مشابه یک تفسیر گرافیکی از ضرایب رگرسیون خطی است. تصویر اصلی را میتوان در https://github.com/slundberg/shap یافت.
هرچند با قابلیت تعمیم به طبقهی وسیعتری از مدلهای یادگیری ماشین همراه است. این مدلها به معنای تحتاللفظیِ کلمه «کلمهبهکلمه» هستند؛ یعنی مجموعهای از قواعد (امتیازهای اهمیت ویژگیها) را بهدست میدهند که میتوان آنها را بهشیوهای مکانیکی بهکار گرفت تا توضیحی پسینی برای پیشبینی موردنظر تولید شود. با این حال، این مدلها سازوکارهای علّی را منتقل نمیکنند و هنگامی که مدل به خارج از همسایگی محلیِ یک پیشبینی مشخص اعمال میشود، در معرض خطای ناشناخته قرار میگیرند. افراد انسانی منفرد ــ مانند متخصصان آگاه ــ که تمایل و توانایی بررسی عمیق این یافتهها را داشته باشند، میتوانند از دانش پیشزمینهی خود برای تولید یک توضیح بهره بگیرند؛ اما SHAP اطلاعات کافی برای کمک به این متخصصان جهت تشخیص زمانی که مدل دیگر کاربرد ندارد، در اختیار نمیگذارد. در عمل، این فنها به کاربران انسانی محرکی میدهند که باید آن را توضیح دهند یا تفسیر کنند، حال آنکه مدلهای واقعاً «جعبهسیاه» حتی این محرک را نیز فراهم نمیکنند.
شبکههای عصبی توضیحپذیر (Explainable Neural Networks, XNNs). در حالی که SHAP و LIME میکوشند مدلهای پیچیده را با پارادایمی شبیه رگرسیون (یعنی یک تابع جمعی خطی) توضیح دهند، Explainable Neural Networks (XNNs) [144] از صورتبندی عمومیتری بر پایهی «مدل شاخص جمعی» [127] استفاده میکنند. در اینجا، الگوریتم میکوشد تابعی بازگرداند که توصیف میکند پیشبینیهای مدل چگونه با تغییر پارامترهای منفرد (و اخیراً زوجهای پارامتر [148]) تغییر میکنند. همانند LIME و SHAP، این مدلها میتوانند به دانشمندان دادهی دارای آموزش مناسب کمک کنند تا دریابند تغییر یک ویژگی مشخص چگونه ممکن است پیشبینی مدل را تغییر دهد، هرچند با ریسک استنباط همبستگیهای کاذب همراه است. این رویکردها بهویژه بر مدلهای شبکه عصبی عمیق اعمال شدهاند؛ در این مدلها یک شبکهی عصبی برای ارائهی بازنمایی سادهشده از شبکهی دیگر بهکار میرود و سپس در قالب جدولی مشابه تحلیل واریانس ارائه میشود که اثرهای اصلی و در برخی موارد برهمکنشهای دوعاملی را نشان میدهد [35].
با این حال، LIME نیز محدودیتهایی دارد: توضیحاتی که تحلیلگران ممکن است از بهکارگیری این ابزارها استخراج کنند، خود میتوانند مبتنی بر همبستگیهای کاذب باشند یا میتوانند اطمینان کاذبی نسبت به پیشبینیهای مدل در خارج از محدودهی همسایگی نزدیک نقطهدادهای که LIME میکوشد آن را توضیح دهد، پدید آورند۱۷. بدتر آنکه ممکن است این توضیحات گمراهکننده توسط مهاجمانی مهندسی شوند که در پی بهرهبرداری از تمایل انسانها به اسناد علّیت در جایی که علّیتی وجود ندارد، هستند [134].
نگاشت فعالسازی کلاس مبتنی بر گرادیان (Gradient-weighted Class Activation Mapping, Grad-CAM). Grad-CAM روشی است که برای توضیح مدلهای بینایی کامپیوتر که از معماریهای یادگیری عمیق (بهطور خاص، شبکههای عصبی کانولوشنی ــ معماری پیشرفتهی فعلی در بینایی کامپیوتر) استفاده میکنند، طراحی شده است. بهطور مشخص، Grad-CAM «از گرادیانهای هر مفهوم هدف (مثلاً «سگ» در یک شبکهی طبقهبندی یا دنبالهای از واژهها در یک شبکهی تولید زیرنویس تصویر) که به لایهی کانولوشنی نهایی جریان مییابند، برای تولید یک نگاشت موضعیسازی درشتدانه که نواحی مهم تصویر را برای پیشبینی مفهوم برجسته میکند، بهره میگیرد» [129]. Grad-CAM از معماری لایهای شبکههای عصبی کانولوشنی (CNNs) برای شناسایی نواحی از تصویر که بیشترین دلالت را دربارهی یک پیشبینی خاص دارند، استفاده میکند. برای مثال، شکل ۸ نشان میدهد که چگونه خروجی Grad-CAM میتواند توجه کاربر را به بخشی از تصویر جلب کند که دلالتگر پیشبینی مشخصی است که کاربر میخواهد آن را توضیح دهد. این نسخهای بصری از پارادایم اهمیت ویژگی است ــ که در آن ویژگیها مجموعههایی از پیکسلهای مشخص هستند ــ همراه با چند مورد از نقاط قوت و محدودیتهای متناظر با آن.
3.2.2 «مدلهای سادهتر ذاتاً تفسیرپذیری بیشتری دارند»
Rudin [128] تکنیکهایی را که در پی تولید توضیحهای ساده برای مدلهای پیچیده هستند، بهشدت نقد کرده و استدلال میکند که این تکنیکها میتوانند عملکرد درونی واقعی این مدلها را به شیوهای گمراهکننده برای تصمیمگیرندگان و تحلیلگران مبهم سازند. مدلهایی که از نظر موضعی دقیق (locally-accurate) هستند، اطلاعاتی درباره میزان آن دقت یا اینکه افت آن تدریجی است یا ناگهانی، ارائه نمیدهند. Rudin بهجای تلاش برای تقریب مدلهای پیچیدهتر با مدلهای سادهتر، استدلال میکند که بهتر است مستقیماً از مدلهای سادهتر استفاده شود، زیرا این مدلها «تفسیرپذیرتر» هستند (یعنی برای دانشمندان داده)، بهویژه هنگامی که ریسک بالا باشد. دلیل این رویکرد آن است که دستکم دانشمندان داده ممکن است عملکرد درونی مدل را درک کنند.
فهرستهای قاعدهای بیزی مقیاسپذیر. فهرستهای قاعدهای بیزی مقیاسپذیر (Scalable Bayesian Rule Lists) [147] نمونهای از تکنیکی هستند که هدفش پرهیز از پیچیدگی مدل است. برخلاف تکنیکهای برشمرده در بالا که در پی ارائه بازنماییهای پیوسته از مدلهای پیچیده هستند، فهرستهای قاعدهای بیزی مقیاسپذیر صراحتاً تلاش نمیکنند با «طبقهبندهای جعبهسیاه مانند شبکههای عصبی، ماشینهای بردار پشتیبان، تقویت گرادیان یا جنگلهای تصادفی رقابت کنند. این روش زمانی سودمند است که ابزارهای یادگیری ماشین بهعنوان یار تصمیم برای انسانها به کار روند؛ انسانهایی که برای اعتماد به مدل و اتخاذ تصمیمهای دادهمحور باید آن را درک کنند.» از این رو، SBRLها هدفشان دستیابی همزمان به دقت پیشبینی بالا و تبیینپذیری نیست؛ بلکه در پی ارائه مجموعهای از قواعد احتمالاتی سادهشده (عیناً) هستند که میتوان از آنها برای تقسیمبندی یک مجموعه داده استفاده کرد (ر.ک. به جدول ۲).
مدلهای افزایشی تعمیمیافته با برهمکنشهای زوجی. رویکردی که ممکن است نقد Rudin را پاسخ دهد، بر استفاده از مدلهای افزایشی تعمیمیافته با برهمکنشهای زوجی (GA²Ms) استوار است – ردهای از مدلها که «سهم یک ویژگی واحد در پیشبینی نهایی» را تنها به آن ویژگی وابسته میسازند [34]. مقصود از این مدلها آن است که هر ویژگی را از همه ویژگیهای دیگر تفکیک کنند تا بتوان آنها را مستقل از یکدیگر ارزیابی کرد. شکل ۹ خروجی یک GA²M را نشان میدهد که بر مجموعه دادهای اعمال شده است که ریسک بستری شدن ۳۰ روزه بیمارستانی برای ذاتالریه را پیشبینی میکند. مانند قبل، این مدلها
تصویر در نسخهٔ PDF Fig. 8. An example of output from Grad-CAM, indicating which pixels in an image are diagnostic of the predicted class (dog or cat). The original image may be found at [129]
شکل ۸. نمونهای از خروجی Grad-CAM که نشان میدهد کدام پیکسلها در یک تصویر نشانهگذارِ کلاس پیشبینیشده (سگ یا گربه) هستند. تصویر اصلی را میتوان در [129] یافت.
Table 2. Example of SBRL output, which seeks to explain whether a customer will leave the service provider. PP = Probability that the label is positive. Source: [147]
جدول ۲. نمونهای از خروجی SBRL که میکوشد توضیح دهد آیا مشتری ارائهدهنده خدمات را ترک خواهد کرد یا خیر. PP = احتمال مثبت بودن برچسب. منبع: [147]
| فهرست قواعد | PP | دقت آزمون |
|---|---|---|
| if ( Contract=One year&StreamingMovies=Yes ), | 0.20 | 0.81 |
| else if ( Contract=Two year ), | 0.032 | 0.98 |
| else if ( Contract=One year ), | 0.054 | 0.97 |
| else if ( tenure<1year&InternetService=Fiber optic ), | 0.70 | 0.72 |
| else if ( PaymentMethod=Electronic check & InternetService=Fiber optic ), | 0.48 | 0.45 |
| else ( TechSupport=No&OnlineSecurity=No ), | 0.42 | 0.64 |
| else ( default ), | 0.22 | 0.78 |
بنیاداً همبستگیاند و میتوانند به متخصصان دامنه در گزینش ویژگیها کمک کنند – برای نمونه، نویسندگان اشاره میکنند که ریسک بستری مجدد ناشی از ذاتالریه با آسم کاهش مییابد، نه افزایش؛ یافتهای خلاف شهود. این مدل آن یافته را آشکار میسازد. با این حال، متخصصان دامنه باید آنگاه آن یافته را پس از واقعه چنین توضیح دهند:
[ب]یمارانی که سابقه آسم داشتند و با ذاتالریه مراجعه کردند، معمولاً نهتنها به بیمارستان، بلکه مستقیماً به ICU (واحد مراقبت ویژه) بستری میشدند. خبر خوب این است که مراقبت تهاجمیای که بیماران آسمی مبتلا به ذاتالریه دریافت میکردند چنان مؤثر بود که ریسک مرگ آنان بر اثر ذاتالریه را در مقایسه با جمعیت عمومی کاهش میداد. خبر بد این است که چون پیشآگهی این بیماران بهتر از میانگین است، مدلهایی که بر این دادهها آموزش دیدهاند بهاشتباه میآموزند که آسم ریسک را کاهش میدهد، در حالی که در واقع افراد آسمی ریسک بسیار بالاتری دارند (اگر بستری نشوند) [34].
بحث بالا نشان میدهد که این دغدغهها بر تبیینپذیری – که هدف آن یاری رساندن به دانشمند داده برای درک چگونگی کارکرد یک مدل است – حاکماند، اما شاید کمتر بر تفسیرپذیری مصداق پیدا کنند؛ جایی که هدف بنیادین، کمک به تصمیمگیرنده برای پیوند دادن خروجی مدل به یک تمایز معنادار است که به او امکان میدهد ارزشها، اهداف و ترجیحات خود را برای انتخاب یک گزینه به کار گیرد. بهطور مشخص، توضیح ارائهشده در بالا شاید به کاربر در اشکالزدایی از مدل، یا حتی در تصمیمگیری درباره اعتماد یا عدم اعتماد به مدل کمک کند؛ اما ممکن است صراحتاً اطلاعات معناداری به کاربر ندهد که بتواند تصمیم نهایی او درباره درمان را روشن سازد.
ماشینهای گرادیانبوستینگ با قید یکنوایی ماشینهای گرادیانبوستینگ (Gradient-Boosting Machines) در پی بهکارگیری مجموعهای از «یادگیرندههای ضعیف» — یعنی مدلهایی با دقت پیشبینی پایین — هستند تا بهطور مشترک پیشبینیهای دقیقی ارائه کنند. این رویکرد به بهبود چشمگیر توانایی پیشبینی منجر میشود، اما به بهای پیچیدگی (Complexity) مدل. برای مقابله با این پیچیدگی، ماشینهای گرادیانبوستینگ با قید یکنوایی (Monotonically Constrained Gradient-Boosting Machines) قیدی را اعمال میکنند که بر اساس آن هر ویژگی معین در مدل باید رابطهای یکنوایی با خروجی داشته باشد. این امر از نظر نظری به افزایش تبیینپذیری (Explainability) میانجامد، زیرا این روابط یکنوا رابطهٔ میان ویژگیها و پیشبینیها را به جهتگیریهای کیفی روشن محدود میکنند — افزایش یک ویژگی باید بهطور پیوسته به افزایش یا کاهش
تصویر در نسخهٔ PDF شکل ۹. نمونهای از خروجی یک GA²M که نشان میدهد چندین ویژگی (محورهای افقی) چگونه با ریسک (Risk) نسبی بستری مجدد در اثر سینهپهلو در بازهٔ ۳۰ روز (محور عمودی) تغییر میکنند. برهمکنشهای زوجی در نقشههای حرارتی پایین شکل نشان داده شدهاند. تصویر اصلی در [34] آمده است.
شکل ۹. نمونهای از خروجی یک GA²M که نشان میدهد چندین ویژگی (محورهای افقی) چگونه با ریسک نسبی بستری مجدد در اثر سینهپهلو در بازهٔ ۳۰ روز (محور عمودی) تغییر میکنند. برهمکنشهای زوجی در نقشههای حرارتی پایین شکل نشان داده شدهاند. تصویر اصلی در [34] آمده است.
پیشبینی منجر شود. همانگونه که پیشتر گفته شد، این مدلها مفروض میگیرند که صورتهای تابعی سادهتر ذاتاً تبیینپذیرترند. با این حال، این مدلها، در شکل کنونیشان، ممکن است صرفاً شکلی از منظمسازی را بهکار گیرند که لزوماً بر دانش دامنه (domain) استوار نیست. یکنوایی ممکن است در برخی موارد — مانند منحنی دوز–پاسخ — مناسب باشد، اما در موارد دیگر — مانند مدلسازی موجها یا دیگر رفتارهای سینوسی — مناسب نباشد. برای تعیین اینکه آیا قیدهای یکنوایی یا هر قید دیگری مناسب هستند یا نه، به دانش دامنه نیاز است. در نبودِ آن دانش دامنه، بهکارگیری چنین قیدهایی ممکن است مدل را ساده کند، اما این سادهسازی ممکن است به شیوهای گمراهکننده صورت گیرد که به استنباط تبیینهای نادرست دامن بزند.
3.2.3 محدودیتهای مدلهای کنونی هوش مصنوعی توضیحپذیر
بهطور کلی، این فرض که مدلهای سادهشده بهطور ذاتی تفسیرپذیرند، مستلزم برخوردار بودن کاربران مدل از نوعی دانش دامنهای است – یعنی اینکه آنها تخصص کافی در علم داده داشته باشند تا بتوانند مدلهای خطی، درختهای تصمیم، فهرستهای قاعده و مانند آنها را درک کنند. افزون بر این، این مدلهای «تفسیرپذیر» ممکن است زمینهٔ کافی برای کاربران فراهم نکنند تا بتوانند ارزشها، اهداف و اصول خود را بهکار گرفته و به تصمیمگیری برسند. این تکنیکها بهمعنای واقعی کلمه «واژهبهواژه»اند، به این معنا که قاعدهای ارائه میدهند، اما هیچ بینشی دربارهٔ سازوکار واقعی الگوریتم به دست نمیدهند. آنها همبستگی ارائه میکنند، نه علیت؛ اما ممکن است در استنباط علیت به متخصصان حوزه یا دانشمندان داده کمک کنند. این تکنیکها میتوانند متخصصان دارای پیشینهٔ تخصصی مناسب را تشویق کنند که سازوکارهایی را که منجر به یک طبقهبندی خاص شدهاند، عمیقتر بررسی کنند، هرچند خودِ آن سازوکارها را صریح نمیسازند. بدین ترتیب، یک متخصص فنی شاید بتواند با بهرهگیری از دانش پیشینهای خود دربارهٔ نوع الگوریتم بهکاررفته، از این ابزارها علیت را استنباط کند. این امر ممکن است به آنها امکان دهد توضیحی بسازند، همانگونه که یک عضو هیئت منصفه یا خواننده میتواند از متنی منسجم، ساختاری هماهنگ استنباط کند. با این حال، در نهایت انسان است که توضیح را به خروجی مدل نسبت میدهد. تکنیکهای برشمردهٔ بالا بازنماییهای صریحی از سازوکارهای علّی ارائه نمیدهند و با ارزشها، اهداف یا ترجیحات کاربران تعامل ندارند؛ بلکه برای کارآمدی خود باید بر دانش پیشینهای انسانها تکیه کنند. از این رو، این مدلها انتظارات زیادی از بیننده دارند، از جمله دانش دامنهایِ احتمالاً قابلتوجه دربارهٔ معنای اصطلاحات فنی (مانند «هماتوکریت» در مثال تشخیص ذاتالریهٔ GA²M)، توانایی تمایز میان متغیرهای پیوسته و گسسته و غیره. بهطور مشابه، کاربران باید تخصص گستردهای در موضوع داشته باشند تا بتوانند برای مثال تشخیص دهند که بهتر است سابقهٔ قبلی آسم با ریسک پایینتر ذاتالریه مرتبط دانسته نشود. بنابراین، مدل بهخودیخود بهمعنایی که روانشناسان این اصطلاحات را درک میکنند، تفسیرپذیر یا توضیحپذیر نیست، اما ممکن است به کاربرانی که دانش پیشینهای مناسب و تمایل به بررسی دارند، کمک کند تا نتیجهگیریهای معنادارتر و دقیقتری به دست آورند.
از آنجا که این مدلها ذاتاً همبستگیاند، ممکن است در معرض همبستگیهای کاذب قرار گیرند. در واقع، از دیرباز در علوم اجتماعی [130] پذیرفته شده است که شناسایی ساختاری معنادار در دادهها (مثلاً در نتیجهٔ یک همبستگی یا رگرسیون) تنها گام نخست در نسبتدادن یک سازوکار علّی است و در غیاب یک سناریوی خلافواقع (مانند یک گروه کنترل آزمایشی)، نمیتوان برای ادعاهای علّی بر آن تکیه کرد. بدین ترتیب، رویکردهایی که مدلهای پیچیده را با کاهش آنها به مجموعهای از روابط یکنوا ساده میکنند، ممکن است کاربران را بهگونهای گمراه کنند که سازوکار علّیای را درون مدل نسبت دهند که وجود ندارد. این مشکل ویژهٔ سیستمهای محاسباتی نیست، بلکه ویژگی عامی از سیستمهای مهندسیشدهٔ پیچیده با اجزای متعدد در حال تعامل است [29]. بنابراین، پژوهشهای آینده در حوزهٔ هوش مصنوعی توضیحپذیر میتواند بهطور ثمربخشی بر این موضوع متمرکز شود که چگونه میتوان به دانشمندان داده و متخصصان دامنه کمک کرد تا ادعاهای علّی را بهطور دقیق نسبت دهند و در عین حال از استنباط مبتنی بر همبستگی کاذب پرهیز کنند.
3.2.4 رابطهای کاربری گرافیکیِ هدفمند
بهطور کلی، رویکردهای برشمرده در بالا میکوشند تبیینپذیری را با کمک به کاربران برای فهم اینکه چگونه تغییر یک ویژگی مشخص میتواند خروجی مدل را تغییر دهد، ارتقا دهند. هرچند نظریهپردازی میشود که این رویکردها زمانی تبیینپذیری را ارتقا میدهند که یک دانشمند داده بتواند از آنها برای استنباط سازوکارهای علّیِ نحوه کار الگوریتم بهره گیرد، این تکنیکها ممکن است برای برقراری تفسیرپذیری – یعنی معناداری در بستر برای کاربر نهایی – کارایی کمتری داشته باشند. در حالی که توسعهدهندگان باید بدانند سیستم چگونه کار میکند تا بتوانند نواقص پیادهسازی خود را شناسایی و رفع کنند، اعضای عموم مردم یا متخصصان حوزههای دیگر معمولاً فاقد آموزش فنی عمیق و تخصص دانشمندان رایانه هستند؛ و نباید انتظار داشت که چنین تخصصی پیدا کنند. برای مثال، یک وکیل مهاجرت ممکن است بخواهد پیامدهای حقوقی الگوریتم بررسی ویزا را بداند، یا یک تحلیلگر مالی ممکن است بخواهد پیامدهای مالی الگوریتم رتبهبندی اعتباری را بداند. این کاربران اغلب صرفاً فرض میکنند که الگوریتم بهدرستی پیادهسازی شده و دادههای آموزشی بهاندازه کافی نماینده بودهاند. سرانجام، متقاضیان شغل/ویزا/اعتبار طبعاً میخواهند بدانند با چه معیارهایی ارزیابی میشوند و آیا برای موقعیت مشخصی رقابتپذیر هستند یا خیر. این کاربران لازم است بدانند چرا یک سیستم نتیجهای تولید کرده است. یعنی آنها میکوشند خروجی مدل را چنان معنا کنند که بتوانند آن را در قالبهایی که برایشان معنادار است، در بستر قرار دهند.
در برخی موارد، «رابطهای کاربری گرافیکی» (Graphical User Interfaces, GUIs) مانند ابزار What-If شرکت Google ممکن است همراه با خروجی مدل به کار رود تا به کاربرانی که دانش عددی یا آماری محدودی دارند در «درک کلی مطلب» کمک کند. برای مثال، مجموعهای از پژوهشها در تصمیمگیری پزشکی، به تفاوتهای فردی در سواد نموداری (مانند [48]) و تکنیکهایی میپردازد که میتواند برای غلبه بر این تفاوتها و انتقال کلیت اطلاعات پیچیده پزشکی به کار رود [37, 37, 145]. با این حال، طراحان باید مراقب باشند که فرض نکنند یک قالب نموداری لزوماً تفسیرپذیرتر است. بلکه خروجی نموداری باید با نمایشهای مناسبِ نرخهای پایه، آستانهها و دیگر شاخصهای تمایزهای معنادار طبقهای، در بستر قرار گیرد؛ که در بسیاری از موارد ممکن است لازم باشد از خود کاربران پرسیده شود. سرانجام، تفسیرهای تولیدشده توسط ماشین تنها در صورتی میتوانند مؤثر باشند که برحسب دانش پسزمینه و اهداف در بستر قرار گیرند و با تفاوتهای فردی سازگار شوند.
3.2.5 مدلهای موضوعی منسجم
مدلهای موضوعی خانوادهای از الگوریتمهای استنتاج بیزی هستند که بهطور گسترده بر روی دادههای متنی برای بازیابی اطلاعات و خلاصهسازی اسناد به کار رفتهاند [13]. پرکاربردترین این الگوریتمها، «تخصیص دیریشله نهفته» (Latent Dirichlet Allocation, LDA) است [14] که موضوعهای نهفتهای را استنتاج میکند
تصویر در نسخهٔ PDF Fig. 10. A visualization of Latent Dirichlet Allocation output from [13]. Probabilistic topic models such as LDA map each word in a text corpus to a topic. The most frequent words in that topic are then presented to humans for interpretation.
شکل ۱۰. تجسمی از خروجی تخصیص دیریشله نهفته (LDA) برگرفته از [13]. مدلهای موضوعی احتمالاتی مانند LDA هر واژه در یک پیکره متنی را به یک موضوع نگاشت میکنند. سپس پرتکرارترین واژههای آن موضوع برای تفسیر به انسانها ارائه میشوند.
که فرض میشود محتوای معنایی مشترک میان اسناد متعدد را در بر میگیرند. در عمل، این موضوعها در واقع توزیع احتمالیای بر روی واژههای پیکره متنی هستند که مدل LDA بر روی آن آموزش دیده است. انسانها از مدلهای موضوعی به این صورت استفاده میکنند که واژههای برتر یا اسناد برتر هر موضوع معین را بررسی میکنند و سپس به آن موضوعها معنا نسبت میدهند [59]؛ تا آنجا که برخی حتی ادعا کردهاند مدلهای موضوعی اصل مطلب متن را بهطور صریح میسنجند [60]. با این حال، پژوهشهای جدیدتر نشان دادهاند که انسانها در تفسیر برخی خروجیهای مدلهای موضوعی دچار دشواری میشوند [36]، بهویژه هنگامی که با نحوه کارکرد الگوریتم آشنایی ندارند [83]. اگرچه دانشمندان رایانه برای بهبود انسجام خروجی مدلهای موضوعی (که فرض شده است تفسیرپذیری را افزایش میدهد) سنجشهایی توسعه دادهاند [81, 96]، خروجی حاصل بهطور صریح تفسیری برای کاربران انسانی فراهم نمیکند، بلکه صرفاً فهرستی از واژهها همراه با احتمالهای موضوعی مربوط است که انسانها باید آن را تفسیر کنند (ر.ک. شکل ۱۰). با این وجود، مدلهای موضوعی شاید در میان الگوریتمهای ML کمنظیر باشند، زیرا کاربرانشان کوشیدهاند تفسیرپذیری را بهطور صریح از طریق وظایفی که توسط انسانهای غیرمتخصص بدون آگاهی از نحوه کارکرد الگوریتم ارزیابی میشوند، در ساختار و خروجی آنها مهندسی کنند. پژوهشهای آینده باید بر ارزیابی این رویکرد و بهکارگیری احتمالی آن در دیگر پارادایمهای الگوریتمی متمرکز شوند.
استناد
محمدعلی کهندژ، راهنمای جامع حاکمیت، امنیت و مدیریت ریسک هوش مصنوعی، شناسه بخش: KDJ-AI-2026E1-P04-C30-S04
شناسهٔ محتوا KDJ-AI-2026E1-P04-C30-S04-1BD83495