سوگیری در هوش مصنوعی
جواب کوتاه
سوگیری یعنی هوش مصنوعی بهطور منظم به یه طرف کج بشه و به نفع یه گروه، نتیجهی ناعادلانه بده. منشا اصلیش معمولا دادهست: اگه یه گروه توی داده کم بوده یا نابرابریهای گذشته توش مونده، مدل همون رو یاد میگیره و تکرار میکنه. انتخابهای سازندهها و استفادهی نابجا هم اثر دارن. چون مردم ماشین رو بیطرف میدونن، این کجی کمتر دیده میشه؛ پس جوابها رو با این نگاه بخونید.
او دکتره
توی فارسی «او» نه مرده نه زن. حالا این دو تا جمله رو بدید به یه ابزار ترجمه:
ما چیزی دربارهی مرد یا زن بودن نگفتیم؛ ولی ترجمه یکی رو انتخاب کرد. چون توی متنهایی که ازشون یاد گرفته، «دکتر» بیشتر کنار «he» اومده و «پرستار» کنار «she». به این کج شدن میگن «سوگیری».
سوگیری یعنی چی
سوگیری یعنی یه کجی منظم و تکرارشونده، که به نفع یه گروه و به ضرر یه گروه دیگه تموم میشه. فرض کنید یه کیسه تیله دارید که بیشترش یه جوره. هر بار دست کنید، به احتمال زیاد همون جور درمیاد:
مدل هم همینه. اون چیزی رو که توی داده بیشتر دیده، بیشتر تکرار میکنه. داده رو توی درس داده دیدیم.
از کجا میاد
چهار راه اصلی:
- دادهیه گروه توش کم بوده، یا نابرابریهای گذشته توش مونده. منشا اصلی همینجاست.
- انتخاب سازندههاچی رو بسنجه، به چی اهمیت بده؛ اینها رو آدمها انتخاب کردن.
- محدودیت فنیگاهی خود ابزار نمیتونه یه چیز رو خوب ببینه یا بسنجه.
- استفادهی نابجابرای یه کار ساخته شده، ولی جای دیگه به کار رفته.
یه نمونهی نزدیک به خودمون: بیشتر دادهی مدلهای زبانی انگلیسیه، برای همین نگاه انگلیسیزبونها رو پررنگتر میکنن؛ اینو توی درس هوش مصنوعی و زبان فارسی دیدیم.
سه نمونهی واقعی
- غربال رزومه، ۲۰۱۵یه شرکت بزرگ ابزار هوشمند غربال رزومهش رو خاموش کرد، چون علیه زنها بود؛ رزومههایی که کلمهی «زنان» داشتن رو کنار میذاشت.
- تشخیص چهره، ۲۰۱۸یه پژوهش نشون داد خطای چند ابزار تشخیص چهره برای زنهای با پوست تیره تا ۳۵ درصد بود، و برای مردهای با پوست روشن کمتر از ۱ درصد.
- ترجمهترجمهی ماشینی گرایش زیادی داره که «مرد» رو پیشفرض بگیره؛ همون «او دکتره».
توی هر سه، ابزار همون کجیای رو تکرار کرد که توی داده یا طراحیش بود؛ و چون ماشین بود، اول کمتر کسی بهش شک کرد.
«ماشینه، پس بیطرفه»؟
خیلیها فکر میکنن چون یه ماشین تصمیم گرفته، حتما بیطرفه؛ حتی گاهی بیشتر از یه کارشناس بهش اعتماد میکنن. ولی ماشین همون دادهای رو تکرار میکنه که بهش دادن. بدتر اینکه گاهی یه حلقه درست میشه:
تصمیم کج، دادهی کجتری میسازه؛ مدل بعدی از همون یاد میگیره و کجتر میشه. برای همینه که توی تصمیمهای مهم دربارهی آدمها، مثل استخدام، آخرش یه آدم باید نگاه کنه و مسئولیتش رو بپذیره.
چی کار کنیم
شما که ازش استفاده میکنید:
- جزئیات رو خودتون بگید. اگه مهمه، بنویسید «دکتر، که یه خانمه»؛ نذارید مدل حدس بزنه.
- نگاههای دیگه رو هم بخواید. «این موضوع رو از نگاه یه آدم توی یه کشور دیگه، یا یه گروه دیگه، هم بگو.»
- به جوابهای یهطرفه شک کنید. مخصوصا دربارهی گروههای آدمها.
کسی که ابزار رو میسازه یا توی کارش به کار میبره:
- داده رو از گروههای مختلف جمع کنه، نه فقط یه گروه.
- ابزار رو روی گروههای مختلف جدا امتحان کنه؛ مثل امتحان با نمونههای واقعی توی درس مهندسی پرامپت.
- بنویسه داده از کجا اومده و ابزار برای چه کاریه، تا بقیه بدونن کجا ممکنه کجی بمونه.
جمعبندی. آنچه از این درس با خودتان میبرید.
- سوگیری: کجی منظم به یه طرف.
- منشا اصلی: دادهی یهطرفه.
- ماشین بیطرف نیست؛ همون دادهش رو تکرار میکنه.
- تصمیم کج، دادهی کجتر میسازه.
- جزئیات رو خودتون بگید و نگاههای دیگه رو هم بخواید.
خودتون رو بسنجید
۱۵ پرسش، هر بار تازه از میان ۳۰ پرسش این درس. آخرش فقط کارنامه رو میبینید: چند تا درست، چند تا نادرست.