رگرسیون لجستیک
جواب کوتاه
رگرسیون لجستیک یه دستهبنده برای دو دسته، با وجود اینکه اسمش رگرسیونه. اول مثل رگرسیون خطی، ورودیها رو با وزنها ضرب و جمع میکنه و یه عدد درمیاره. بعد این عدد رو از یه منحنی S شکل، به اسم سیگموید یا تابع لجستیک، رد میکنه که هر عددی رو به یه عدد بین صفر و یک میبره: همون احتمال دستهی «بله». مثلا با ساعت تمرین رانندگی، احتمال قبولی امتحان شهر رو میده. آخر سر با یه مرز، مثل ۰٫۵، تصمیم میگیریم. از حدود ۱۹۷۰ پرکاربردترین مدل برای جوابهای دوحالته بوده.
امتحان شهر
بیست نفر امتحان شهر رانندگی دادن. میدونیم هر کدوم چند ساعت تمرین کرده و قبول شده یا رد. قبولیها رو بالا گذاشتیم، ردیها رو پایین:
حالا یکی دیگه ۸ ساعت تمرین کرده. چقدر شانس قبولی داره؟ اولین فکر: یه خط صاف بکشیم. ولی خطچین رو ببینید: برای تمرین کم زیر صفر میره و برای تمرین زیاد از یک بالاتر. «احتمال قبولی ۱۲۰ درصد» معنی نداره.
منحنی پررنگ بهتره: هیچوقت از صفر و یک بیرون نمیزنه، با تمرین کم نزدیک صفره، با تمرین زیاد نزدیک یک، و وسطش کمکم بالا میاد. برای ۸ ساعت، حدود ۰٫۸ میگه. به مدلی که این منحنی رو میکشه میگن رگرسیون لجستیک.
منحنی S
راز این مدل یه تابع با شکل حرف S انگلیسیه، که بهش «سیگموید» یا «تابع لجستیک» میگن:
کارش سادهست: هر عددی بهش بدید، یه عدد بین صفر و یک پس میده. عدد خیلی منفی، نزدیک صفر؛ عدد خیلی مثبت، نزدیک یک؛ خود صفر، دقیقا نیم. یعنی هر عددی رو «میچلونه» تا توی بازهی احتمال جا بشه.
این تابع رو اولین بار برای چیز دیگهای ساختن: ورهولست، حدود ۱۸۴۰، برای رشد جمعیت؛ جمعیتی که اول تند زیاد میشه و بعد کمکم به سقف میرسه.
سه قدم
- مثل رگرسیون خطی، ورودی رو ضرب در وزن کن و عدد پایه رو اضافه کن. یه عدد درمیاد، هر عددی، حتی منفی.
- این عدد رو از منحنی S رد کن. حالا یه عدد بین صفر و یک داری.
- اینو احتمال «قبول» بخون، و با یه مرز تصمیم بگیر: مثلا بالای ۰٫۵ بگو قبول.
پس رگرسیون لجستیک در اصل همون رگرسیون خطیست با یه قدم اضافه آخرش. پیچهاش هم همون وزنها و عدد پایهان، که با گرادیان کاهشی پیدا میشن.
چند ورودی
قبولی فقط به ساعت تمرین بستگی نداره. میشه چند تا ورودی داد: ساعت تمرین، تعداد جلسههای آموزشگاه، چند بار قبلا امتحان داده. برای هر کدوم یه وزن، همه با هم جمع، و بعد منحنی S.
وزنها اینجا یه حرفی میزنن: وزن مثبت یعنی این ورودی شانس قبولی رو بالا میبره؛ وزن منفی یعنی پایین میاره؛ وزن نزدیک صفر یعنی اثر چندانی نداره. برای همین رگرسیون لجستیک مدلیه که آدم میتونه بفهمه چرا یه جواب داده.
چرا «رگرسیون»؟
اسمش گیجکنندهست، چون کارش دستهبندیه. دلیلش اینه که داخلش یه رگرسیون واقعی هست: داره یه عدد پیوسته پیشبینی میکنه، یعنی احتمال. فقط ما اون احتمال رو با یه مرز به «قبول» یا «رد» تبدیل میکنیم. «لجستیک» هم از همون تابع لجستیکه.
برکسون از ۱۹۴۴ این مدل رو بهشکل یه ابزار آماری عمومی جا انداخت، و از حدود ۱۹۷۰ پرکاربردترین مدل برای جوابهای دوحالته بوده. برای بیشتر از دو دسته هم یه شکل چندکلاسه داره.
قدم بعد
دو تا سوال مونده. اول، مرز ۰٫۵ روی نمودار ورودیها چه شکلیه؟ جوابش مرز تصمیمه، درس بعد. دوم، برای آموزشش چه تابع هزینهای خوبه؟ اینجا MSE خوب کار نمیکنه و یه تابع دیگه به اسم کراسانتروپی به کار میره. این منحنی S توی نورونهای شبکهی عصبی هم زیاد دیده میشه.
جمعبندی. آنچه از این درس با خودتان میبرید.
- اسمش رگرسیونه، ولی دستهبنده.
- ورودیها × وزنها، جمع.
- از منحنی S رد کن: عدد بین صفر و یک.
- اون عدد احتمال «بله»ست.
- با یه مرز تصمیم بگیر.
خودتون رو بسنجید
۱۵ پرسش، هر بار تازه از میان ۳۰ پرسش این درس. آخرش فقط کارنامه رو میبینید: چند تا درست، چند تا نادرست.