سه نوع یادگیری: نظارتشده، بینظارت، تقویتی
جواب کوتاه
یادگیری ماشین سه جور اصلی داره، بسته به اینکه چه بازخوردی داره. نظارتشده: مثالها جواب درست دارن، مثل کارتهایی که جوابشون پشتشه؛ مدل یاد میگیره از ورودی به جواب برسه، یا یه دسته (دستهبندی) یا یه عدد (رگرسیون). بینظارت: هیچ جوابی نیست، مثل یه شیشه دکمهی قاطی؛ مدل خودش گروهها و الگوها رو پیدا میکنه. تقویتی: مدل یه کاری میکنه و جایزه یا جریمه میگیره، مثل سگی که با جایزه یاد میگیره بشینه؛ سعی میکنه جمع جایزهها رو بیشتر کنه.
سه صحنه
سه جور یاد گرفتن رو همهمون دیدیم. فرقشون اینه که چه کمکی بهت میرسه: جواب، هیچی، یا جایزه.
- بچهای که با کارتهای فلش درس میخونه: رو عکسه، پشت جواب.
- کسی که یه شیشه دکمهی قاطی رو، بی اینکه کسی بهش بگه چطور، دستهدسته میکنه.
- سگی که هر بار میشینه یه جایزه میگیره، و کمکم یاد میگیره بشینه.
یادگیری ماشین هم همین سه جور اصلی رو داره، بسته به اینکه چه بازخوردی به مدل میرسه.
با جواب: نظارتشده
توی یادگیری نظارتشده، هر مثال جواب درستش رو داره؛ انگار یه معلم بالای سرشه. مثل همون کارتها: عکس گربه، پشتش «گربه». مدل یاد میگیره از ورودی به جواب برسه، و بعد برای مثال تازه جواب رو حدس بزنه. بنگاهی درس اول هم همین بود: خونه، با قیمتش.
جوابش دو جور میتونه باشه:
- دستهبندی: جواب یکی از چند دستهست. «این ایمیل هرزنامهست یا نه؟» درس دستهبندی.
- رگرسیون: جواب یه عدده. «این خونه چند میارزه؟» درس رگرسیون خطی.
بیشتر کارهای یادگیری ماشین که دور و بر شما میبینید، از همین نوعن. ولی یه سختی داره: یکی باید جوابها رو بنویسه؛ به این کار میگن برچسب زدن.
بی جواب: بینظارت
توی یادگیری بینظارت، هیچ جوابی نیست. فقط دادهست. مدل خودش باید ساختارش رو پیدا کنه؛ مثل همون دکمهها: کسی نگفته «قرمزها اینور»، ولی خودت میبینی بعضیها ریزن و بعضیها درشت، و دستهشون میکنی.
دو تا کار اصلیش:
- خوشهبندی: چیزهای شبیه رو یه گروه کردن. مثلا یه فروشگاه مشتریهاش رو، از روی خریدشون، چند دسته میکنه، بی اینکه از قبل بدونه چه دستههایی هست. درس خوشهبندی.
- کاهش ابعاد: وقتی داده ستونهای خیلی زیادی داره، چند تا ستون مهمتر رو پیدا کردن که بشه دیدش. درس کاهش ابعاد.
با جایزه: تقویتی
توی یادگیری تقویتی، مدل یه کاری میکنه و بعد یه بازخورد میگیره: جایزه یا جریمه. کسی بهش نمیگه «جواب درست اینه»؛ فقط میفهمه کارش خوب بود یا بد. مثل سگ: نشست، جایزه گرفت؛ دفعهی بعد زودتر میشینه.
مدل سعی میکنه جمع جایزهها رو، توی کل راه، بیشتر کنه؛ نه فقط جایزهی همین الان. برای کارهایی به درد میخوره که باید پشت سر هم تصمیم گرفت، مثل بازی با یه حریف یا رانندگی. ایستگاه یادگیری تقویتی.
یه چیزی وسطش
گاهی چند تا مثال جواب دارن و کلی بیجوابن؛ چون نوشتن جواب گرونه. به این میگن نیمهنظارتی. پژوهشگرها دیدن که دادهی بیجواب، کنار یه کم دادهی جوابدار، دقت رو خیلی بهتر میکنه.
مثل کسی که ده تا کارت فلش جوابدار داره و صد تا عکس بیجواب؛ از همون ده تا یه حسی پیدا میکنه و با صد تای دیگه حسش رو محکمتر میکنه.
کدوم برای کدوم
| سوال شما | نوع |
|---|---|
| این ایمیل هرزنامهست؟ (و کلی ایمیل با جواب دارید) | نظارتشده، دستهبندی |
| این خونه چند میارزه؟ | نظارتشده، رگرسیون |
| مشتریهام چند جورن؟ | بینظارت، خوشهبندی |
| توی این بازی چه حرکتی بزنم که آخرش ببرم؟ | تقویتی |
هیچ روشی برای همهی مسئلهها خوب نیست؛ هر کدوم جای خودش رو داره. درس بعد، یادگیری ماشینی رو نشون میده که همین الان دور و بر شماست: یادگیری ماشین دور و بر شما.
جمعبندی. آنچه از این درس با خودتان میبرید.
- نظارتشده: مثال با جواب.
- دستهبندی یا رگرسیون.
- بینظارت: بی جواب، گروهها رو خودش پیدا میکنه.
- تقویتی: کار، جایزه، تکرار.
- نیمهنظارتی: کمی جواب، کلی بیجواب.
خودتون رو بسنجید
۱۵ پرسش، هر بار تازه از میان ۳۰ پرسش این درس. آخرش فقط کارنامه رو میبینید: چند تا درست، چند تا نادرست.