آموزشیادگیری ماشین

درس ۴۲ از ۹۹، هوش مصنوعی، حدود ۷ دقیقه خواندن

سنجش مدل عددی: MAE، RMSE، R²

جواب کوتاه

برای مدلی که یه عدد پیش‌بینی می‌کنه، سه سنجه‌ی معروف هست. MAE یعنی به‌طور میانگین چقدر اشتباه کرده؛ اندازه‌ی خطاها رو میانگین می‌گیریم. RMSE ریشه‌ی میانگین مربع خطاست؛ به اشتباه‌های بزرگ وزن بیشتری می‌ده. هر دو به واحد خود چیزن، مثلا کیلو. R² می‌گه مدل از یه حدس تنبل که برای همه یه عدد ثابت (میانگین) می‌گه، چقدر بهتره؛ یک یعنی بی‌نقص، صفر یعنی مثل حدس تنبل، و منفی یعنی از اون هم بدتر. مثلا میوه‌فروشی که وزن هندونه‌ها رو حدس زده: MAE ۰٫۸ کیلو، RMSE حدود ۰٫۹ کیلو، R² برابر ۰٫۹.

میوه‌فروش و هندونه‌ها

یه میوه‌فروش ادعا می‌کنه با دست وزن هندونه رو حدس می‌زنه. پنج تا هندونه رو حدس زد، بعد گذاشتیمشون روی ترازو:

حدس‌هاش بد نیست؛ گاهی یه کیلو بیشتر، گاهی یه کیلو کمتر، گاهی دقیق. ولی «بد نیست» عدد نیست. این میوه‌فروش در اصل یه مدل عددیه، و برای سنجیدنش سه تا عدد معروف داریم.

به‌طور میانگین چقدر

  1. برای هر هندونه، اندازه‌ی خطا رو بنویسید، بی علامت: ۱، ۰، ۱، ۱، ۱.
  2. میانگین بگیرید: ۴ تقسیم بر ۵، یعنی ۰٫۸.

به این می‌گن MAE، یعنی میانگین قدر مطلق خطا. خوبیش اینه که خیلی راحت به زبون میاد: «این میوه‌فروش به‌طور میانگین ۸۰۰ گرم اشتباه می‌کنه». هر کسی می‌فهمه یعنی چی.

اشتباه‌های بزرگ

توی درس کاشی‌های خطا دیدیم اگه خطاها رو به توان دو برسونیم، اشتباه بزرگ خیلی سنگین‌تر حساب می‌شه. اینجا مربع‌ها می‌شن ۱، ۰، ۱، ۱، ۱؛ میانگینشون ۰٫۸، و ریشه‌ش حدود ۰٫۹ کیلو. به این می‌گن RMSE.

اینجا RMSE و MAE به هم نزدیکن، چون همه‌ی اشتباه‌ها کوچیک و هم‌اندازه بودن. ولی اگه میوه‌فروش یه بار ۵ کیلو اشتباه می‌کرد، RMSE خیلی بیشتر از MAE بالا می‌رفت. پس اگه RMSE خیلی از MAE بزرگ‌تر بود، یعنی چند تا اشتباه گنده هست.

از حدس تنبل چقدر بهتر

«۸۰۰ گرم اشتباه» خوبه یا بد؟ بستگی داره هندونه‌ها چقدر با هم فرق داشتن. بیایید با یه حدس تنبل مقایسه کنیم که اصلا به هندونه نگاه نمی‌کنه و برای همه می‌گه «۸ کیلو»، یعنی میانگین وزن‌ها:

جمع مربع فاصله‌های حدس تنبل ۴۰ شد؛ مال میوه‌فروش فقط ۴. یعنی میوه‌فروش ۹۰ درصد این خطا رو از بین برده. به این عدد می‌گن R² (بخونید «آر دو»): ۱ منهای ۴ تقسیم بر ۴۰، یعنی ۰٫۹.

  • R² یک یعنی بی‌نقص.
  • R² صفر یعنی درست مثل حدس تنبل؛ هیچ چیزی یاد نگرفته.
  • R² منفی یعنی از حدس تنبل هم بدتر! ممکنه پیش بیاد.

R² یه معنی دیگه هم داره: «سهمی از پراکندگی وزن‌ها که مدل تونسته پیش‌بینی کنه». و چون واحد نداره، برای مقایسه‌ی مدل‌ها روی داده‌های مختلف هم به کار میاد.

کدوم رو بگیم

  • برای آدم‌ها: MAE، با واحد. «به‌طور میانگین ۸۰۰ گرم» رو همه می‌فهمن.
  • وقتی اشتباه گنده خیلی گرونه: RMSE، که اون‌ها رو بهتر نشون می‌ده.
  • برای مقایسه با حدس تنبل: R²؛ مثل مقایسه با مدل تنبل درس دقت.

بهترین کار اینه که بیشتر از یکی رو با هم گزارش کنید، با واحدشون، و همیشه روی داده‌ای که مدل ندیده.

قدم بعد

توی این ایستگاه چند بار دیدیم که یه عدد به‌تنهایی هیچ معنی نداره، مگه اینکه با یه چیز ساده مقایسه بشه: مدل تنبل، حدس تنبل، شیر یا خط. درس آخر ایستگاه، خط پایه، دقیقا درباره‌ی همینه.

جمع‌بندی. آنچه از این درس با خودتان می‌برید.

  • MAE: به‌طور میانگین چقدر اشتباه.
  • RMSE: اشتباه‌های بزرگ سنگین‌تر.
  • هر دو به واحد خود چیز.
  • R²: از حدس تنبل (میانگین) چقدر بهتر.
  • R² یک عالی، صفر مثل تنبل، منفی بدتر.

خودتون رو بسنجید

۱۵ پرسش، هر بار تازه از میان ۳۰ پرسش این درس. آخرش فقط کارنامه رو می‌بینید: چند تا درست، چند تا نادرست.

خودتون رو بسنجید

۱۵ پرسش

  • هر بار پرسش‌ها و ترتیب گزینه‌ها عوض می‌شه.
  • تا آخر نمی‌گیم کدوم جواب درست بوده؛ می‌تونید برگردید و جوابتون رو عوض کنید.
  • آخرش کارنامه می‌گیرید: چند تا درست، چند تا نادرست.
  • اگه وسطش بستید، دوباره که باز کنید از همون‌جا ادامه می‌دید.

فصل‌های این درس

درس بعد