آموزشیادگیری ماشین

درس ۳۲ از ۹۹، هوش مصنوعی، حدود ۶ دقیقه خواندن

دسته‌بندی چیست

جواب کوتاه

دسته‌بندی یعنی مدل به جای یه عدد، یه دسته رو پیش‌بینی کنه؛ یعنی به جای «چقدر؟» می‌پرسه «کدوم؟». مثل کارگاهی که پرتقال‌ها رو یا توی جعبه‌ی صادراتی می‌ذاره یا آب‌میوه. اگه دو تا دسته باشه، بهش می‌گن دودویی؛ اگه سه تا یا بیشتر، چندکلاسه؛ و اگه یه چیز بتونه چند تا برچسب با هم داشته باشه، مثل عکسی که هم گربه داره هم سگ، چندبرچسبی. مدل معمولا برای هر دسته یه احتمال می‌ده و ما با یه مرز تصمیم می‌گیریم. مثل همیشه، از نمونه‌های برچسب‌دار یاد می‌گیره.

کارگاه پرتقال

یه کارگاه بسته‌بندی پرتقال رو در نظر بگیرید. پرتقال‌ها یکی‌یکی روی نوار میان، و یکی باید تصمیم بگیره هر کدوم بره توی جعبه‌ی صادراتی یا آب‌میوه:

قبلا این کار رو یه آدم با چشم می‌کرد: درشتیش، رنگش، لکه‌هاش. حالا یه دوربین بالای نوار هست و یه مدل تصمیم می‌گیره. سوال مدل این نیست که «این پرتقال چقدره؟»؛ سوالش اینه که «این پرتقال مال کدوم جعبه‌ست؟».

به این جور کار، که جوابش یه دسته‌ست نه یه عدد، می‌گن دسته‌بندی. بیشتر کارهای روزمره‌ی یادگیری ماشین همینه.

چقدر یا کدوم

توی ایستگاه قبل، مدل یه عدد پیش‌بینی می‌کرد؛ به اون می‌گن رگرسیون. فرقشون رو با چند تا مثال ببینید:

  • فردا چند تا بستنی؟ (چقدر) / این نامه هرزنامه‌ست یا نه؟ (کدوم)
  • این خونه چند؟ (چقدر) / این عکس گربه‌ست، سگه یا پرنده؟ (کدوم)
  • پیک کی می‌رسه؟ (چقدر) / این عدد دست‌نویس کدوم رقمه؟ (کدوم)

اگه جواب رو بشه روی یه خط‌کش گذاشت، رگرسیونه؛ اگه جواب یکی از چند جعبه‌ست، دسته‌بندی. توی درس سه نوع یادگیری هم این دو تا رو دیده بودیم.

سه جور

دسته‌بندی بسته به تعداد جعبه‌ها سه جور داره:

  • دودویی: دو تا جعبه. صادراتی یا آب‌میوه؛ هرزنامه یا نه؛ قطعه‌ی کارخونه سالمه یا نه. ساده‌ترین جور.
  • چندکلاسه: سه تا جعبه یا بیشتر، ولی هر چیز فقط توی یکی. پرتقال درشت، متوسط یا ریز؛ عکس موز، هلو، پرتقال یا سیب.
  • چندبرچسبی: هر چیز می‌تونه چند تا برچسب با هم بگیره. یه عکس ممکنه هم «گربه» داشته باشه هم «سگ» هم «آسمون».

احتمال هر جعبه

مدل معمولا قاطع نمی‌گه «صادراتی». می‌گه «احتمال صادراتی ۰٫۸، آب‌میوه ۰٫۲»؛ همون‌طور که توی درس احتمال دیدیم، جمعشون یک می‌شه.

بعد ما یه مرز می‌ذاریم: مثلا «اگه احتمال صادراتی بالای ۰٫۷ بود، بره صادراتی». اگه صادراتی گرون‌تر فروش می‌ره و نمی‌خوایم پرتقال بد توش بره، مرز رو بالاتر می‌بریم، مثلا ۰٫۹. این مرز رو آدم انتخاب می‌کنه، بسته به اینکه کدوم اشتباه گرون‌تره.

از کجا یاد می‌گیره

مثل همیشه از مثال. هزاران پرتقال که یه آدم کاربلد قبلا جعبه‌شون رو معلوم کرده: این صادراتی، این آب‌میوه. هر پرتقال چند تا ویژگی داره (قطر، رنگ، تعداد لکه) و یه برچسب (جعبه‌ش).

بعضی مدل‌ها یه قاعده از این مثال‌ها یاد می‌گیرن. بعضی‌ها هم پرتقال تازه رو با پرتقال‌های قبلی مقایسه می‌کنن و می‌گن «شبیه کدوم‌هاست، همون جعبه»؛ یعنی از فاصله و شباهت کمک می‌گیرن.

مدل‌هاش

توی این ایستگاه چند تا ابزار اصلی دسته‌بندی رو می‌بینیم: اول رگرسیون لجستیک، که با وجود اسمش یه دسته‌بنده؛ بعد مرز تصمیم؛ بعد تابع هزینه‌ی مخصوص دسته‌بندی؛ و آخر، چطور چند تا عدد رو به احتمال چند دسته تبدیل کنیم.

جمع‌بندی. آنچه از این درس با خودتان می‌برید.

  • دسته‌بندی: «کدوم؟»، نه «چقدر؟».
  • دو دسته: دودویی.
  • سه دسته یا بیشتر: چندکلاسه.
  • چند برچسب با هم: چندبرچسبی.
  • مدل برای هر دسته احتمال می‌ده.

خودتون رو بسنجید

۱۵ پرسش، هر بار تازه از میان ۳۰ پرسش این درس. آخرش فقط کارنامه رو می‌بینید: چند تا درست، چند تا نادرست.

خودتون رو بسنجید

۱۵ پرسش

  • هر بار پرسش‌ها و ترتیب گزینه‌ها عوض می‌شه.
  • تا آخر نمی‌گیم کدوم جواب درست بوده؛ می‌تونید برگردید و جوابتون رو عوض کنید.
  • آخرش کارنامه می‌گیرید: چند تا درست، چند تا نادرست.
  • اگه وسطش بستید، دوباره که باز کنید از همون‌جا ادامه می‌دید.

فصل‌های این درس

درس بعد