امتیاز F1
جواب کوتاه
امتیاز F1 یه عدد بین صفر و یکه که صحت و بازخوانی رو با هم خلاصه میکنه، با یه جور میانگین به اسم میانگین همساز. این میانگین به عدد کوچیکتر حساسه؛ مثل رفت و برگشت ۶۰ کیلومتری با سرعت ۶۰ و ۳۰، که میانگین سرعتش ۴۰ میشه نه ۴۵، چون برگشت دو برابر طول کشیده. برای همین F1 فقط وقتی بالاست که هر دو بالا باشن، و اگه یکی صفر باشه، F1 هم صفره. اگه یکیشون برامون مهمتر باشه، شکل کلیترش Fβ به اون وزن بیشتری میده. ولی F1 درست منفیها رو نمیبینه و دو جور اشتباه رو یه اندازه میگیره.
رفت و برگشت
تا یه شهر ۶۰ کیلومتر راهه. با سرعت ۶۰ رفتید، و موقع برگشت توی ترافیک با سرعت ۳۰ برگشتید. میانگین سرعتتون چند بود؟
اولین جوابی که به ذهن میرسه ۴۵، یعنی وسط ۶۰ و ۳۰. ولی رفتن یه ساعت طول کشید و برگشتن دو ساعت. کل راه ۱۲۰ کیلومتر بود در ۳ ساعت؛ یعنی میانگین واقعی ۴۰.
چرا کمتر از ۴۵؟ چون بیشتر وقت رو با سرعت کم گذروندید. به این جور میانگین میگن میانگین همساز؛ همیشه به عدد کوچیکتر نزدیکتره. گرفتن میانگین معمولی جای اون، یه اشتباه خیلی رایجه.
F1 همینه
امتیاز F1 همین میانگین همساز رو برای صحت و بازخوانی میگیره. حسابش اینطوریه:
- صحت رو در بازخوانی ضرب کنید.
- دو برابرش کنید.
- تقسیم بر جمع صحت و بازخوانی کنید.
جوابش همیشه بین صفر و یکه. یک یعنی صحت و بازخوانی هر دو کامل؛ صفر یعنی یکیشون صفره. چون میانگین همسازه، اگه یکی کم باشه، کل نتیجه رو پایین میکشه؛ درست مثل اون ترافیک برگشت.
تورهای ماهیگیر
برگردیم سراغ تورهای ماهیگیر، و یه مدل متعادل هم کنارشون بذاریم:
تور بزرگ بازخوانی ۰٫۹ داشت ولی صحت ۰٫۳۱؛ میانگین معمولیشون ۰٫۶ میشد که خوب به نظر میاد. ولی F1 فقط ۰٫۴۶ میشه، چون صحت کمش رو نادیده نمیگیره. تور کوچیک هم همینطور: ۰٫۴۴. مدلی که هر دو رو ۰٫۸ داره، F1 برابر ۰٫۸ میگیره.
یعنی F1 به مدلهای متعادل جایزه میده، نه به مدلی که توی یکی عالیه و توی اون یکی افتضاح.
یکی صفر، همه صفر
مدل تنبل درس دقت، که همیشه میگفت «سالمه»، یادتونه؟ دقتش ۹۹ درصد بود ولی بازخوانیش صفر. F1 اون هم صفره.
این یکی از دلیلهاییه که F1 رو برای دادهی نامتوازن دوست دارن: مدل تنبل رو لو میده. اگه یکی از صحت یا بازخوانی صفر باشه، هیچجوری نمیشه F1 بالا گرفت.
وقتی یکی مهمتره
F1 صحت و بازخوانی رو یه اندازه مهم میدونه. ولی برای دودسنج، بازخوانی خیلی مهمتره؛ برای فیلتر هرزنامه، صحت.
برای همین یه شکل کلیتر هست به اسم Fβ (بخونید افبتا). با یه عدد به اسم بتا تنظیم میکنیم که کدوم چقدر مهمتر باشه. F1 همون حالتیه که هر دو یه اندازه مهمن.
کجا کافی نیست
- درست منفیها رو نمیبینه: نه صحت و نه بازخوانی، درست منفی رو نمیشمرن. پس F1 هم نمیبینه که مدل چند تا «نه» رو درست گفته؛ برای بعضی دادههای نامتوازن همین گمراهکنندهست.
- هزینهها رو یکی میگیره: توی دنیای واقعی، دو جور اشتباه تقریبا هیچوقت هزینهی برابر ندارن.
- یه عدده: مثل همهی خلاصهها، چیزهایی رو پنهان میکنه. خود جدول رو هم نگاه کنید.
درس بعد، یه راه برای دیدن همهی مرزهای احتمال با هم: منحنی ROC و AUC.
جمعبندی. آنچه از این درس با خودتان میبرید.
- F1: میانگین همساز صحت و بازخوانی.
- به عدد کوچیکتر حساسه.
- فقط وقتی بالاست که هر دو بالا باشن.
- یکی صفر؟ F1 هم صفر.
- Fβ: وقتی یکی مهمتره.
خودتون رو بسنجید
۱۵ پرسش، هر بار تازه از میان ۳۰ پرسش این درس. آخرش فقط کارنامه رو میبینید: چند تا درست، چند تا نادرست.