آموزشیادگیری ماشین

درس ۴۰ از ۹۹، هوش مصنوعی، حدود ۶ دقیقه خواندن

امتیاز F1

جواب کوتاه

امتیاز F1 یه عدد بین صفر و یکه که صحت و بازخوانی رو با هم خلاصه می‌کنه، با یه جور میانگین به اسم میانگین همساز. این میانگین به عدد کوچیک‌تر حساسه؛ مثل رفت و برگشت ۶۰ کیلومتری با سرعت ۶۰ و ۳۰، که میانگین سرعتش ۴۰ می‌شه نه ۴۵، چون برگشت دو برابر طول کشیده. برای همین F1 فقط وقتی بالاست که هر دو بالا باشن، و اگه یکی صفر باشه، F1 هم صفره. اگه یکی‌شون برامون مهم‌تر باشه، شکل کلی‌ترش Fβ به اون وزن بیشتری می‌ده. ولی F1 درست منفی‌ها رو نمی‌بینه و دو جور اشتباه رو یه اندازه می‌گیره.

رفت و برگشت

تا یه شهر ۶۰ کیلومتر راهه. با سرعت ۶۰ رفتید، و موقع برگشت توی ترافیک با سرعت ۳۰ برگشتید. میانگین سرعتتون چند بود؟

اولین جوابی که به ذهن می‌رسه ۴۵، یعنی وسط ۶۰ و ۳۰. ولی رفتن یه ساعت طول کشید و برگشتن دو ساعت. کل راه ۱۲۰ کیلومتر بود در ۳ ساعت؛ یعنی میانگین واقعی ۴۰.

چرا کمتر از ۴۵؟ چون بیشتر وقت رو با سرعت کم گذروندید. به این جور میانگین می‌گن میانگین همساز؛ همیشه به عدد کوچیک‌تر نزدیک‌تره. گرفتن میانگین معمولی جای اون، یه اشتباه خیلی رایجه.

F1 همینه

امتیاز F1 همین میانگین همساز رو برای صحت و بازخوانی می‌گیره. حسابش این‌طوریه:

  1. صحت رو در بازخوانی ضرب کنید.
  2. دو برابرش کنید.
  3. تقسیم بر جمع صحت و بازخوانی کنید.

جوابش همیشه بین صفر و یکه. یک یعنی صحت و بازخوانی هر دو کامل؛ صفر یعنی یکی‌شون صفره. چون میانگین همسازه، اگه یکی کم باشه، کل نتیجه رو پایین می‌کشه؛ درست مثل اون ترافیک برگشت.

تورهای ماهیگیر

برگردیم سراغ تورهای ماهیگیر، و یه مدل متعادل هم کنارشون بذاریم:

تور بزرگ بازخوانی ۰٫۹ داشت ولی صحت ۰٫۳۱؛ میانگین معمولیشون ۰٫۶ می‌شد که خوب به نظر میاد. ولی F1 فقط ۰٫۴۶ می‌شه، چون صحت کمش رو نادیده نمی‌گیره. تور کوچیک هم همین‌طور: ۰٫۴۴. مدلی که هر دو رو ۰٫۸ داره، F1 برابر ۰٫۸ می‌گیره.

یعنی F1 به مدل‌های متعادل جایزه می‌ده، نه به مدلی که توی یکی عالیه و توی اون یکی افتضاح.

یکی صفر، همه صفر

مدل تنبل درس دقت، که همیشه می‌گفت «سالمه»، یادتونه؟ دقتش ۹۹ درصد بود ولی بازخوانیش صفر. F1 اون هم صفره.

این یکی از دلیل‌هاییه که F1 رو برای داده‌ی نامتوازن دوست دارن: مدل تنبل رو لو می‌ده. اگه یکی از صحت یا بازخوانی صفر باشه، هیچ‌جوری نمی‌شه F1 بالا گرفت.

وقتی یکی مهم‌تره

F1 صحت و بازخوانی رو یه اندازه مهم می‌دونه. ولی برای دودسنج، بازخوانی خیلی مهم‌تره؛ برای فیلتر هرزنامه، صحت.

برای همین یه شکل کلی‌تر هست به اسم Fβ (بخونید اف‌بتا). با یه عدد به اسم بتا تنظیم می‌کنیم که کدوم چقدر مهم‌تر باشه. F1 همون حالتیه که هر دو یه اندازه مهمن.

کجا کافی نیست

  • درست منفی‌ها رو نمی‌بینه: نه صحت و نه بازخوانی، درست منفی رو نمی‌شمرن. پس F1 هم نمی‌بینه که مدل چند تا «نه» رو درست گفته؛ برای بعضی داده‌های نامتوازن همین گمراه‌کننده‌ست.
  • هزینه‌ها رو یکی می‌گیره: توی دنیای واقعی، دو جور اشتباه تقریبا هیچ‌وقت هزینه‌ی برابر ندارن.
  • یه عدده: مثل همه‌ی خلاصه‌ها، چیزهایی رو پنهان می‌کنه. خود جدول رو هم نگاه کنید.

درس بعد، یه راه برای دیدن همه‌ی مرزهای احتمال با هم: منحنی ROC و AUC.

جمع‌بندی. آنچه از این درس با خودتان می‌برید.

  • F1: میانگین همساز صحت و بازخوانی.
  • به عدد کوچیک‌تر حساسه.
  • فقط وقتی بالاست که هر دو بالا باشن.
  • یکی صفر؟ F1 هم صفر.
  • Fβ: وقتی یکی مهم‌تره.

خودتون رو بسنجید

۱۵ پرسش، هر بار تازه از میان ۳۰ پرسش این درس. آخرش فقط کارنامه رو می‌بینید: چند تا درست، چند تا نادرست.

خودتون رو بسنجید

۱۵ پرسش

  • هر بار پرسش‌ها و ترتیب گزینه‌ها عوض می‌شه.
  • تا آخر نمی‌گیم کدوم جواب درست بوده؛ می‌تونید برگردید و جوابتون رو عوض کنید.
  • آخرش کارنامه می‌گیرید: چند تا درست، چند تا نادرست.
  • اگه وسطش بستید، دوباره که باز کنید از همون‌جا ادامه می‌دید.

فصل‌های این درس

درس بعد