ماشین چطور از مثال یاد میگیرد
جواب کوتاه
ماشین مثل کسی که زیر دوش شیر آب رو تنظیم میکنه یاد میگیره: یه حدس میزنه، میبینه چقدر غلط بوده، پیچش رو یه کم در جهت درست میچرخونه، و دوباره. این چهار قدم، یعنی حدس، سنجیدن خطا، یه کم درست کردن و تکرار، هزاران بار انجام میشه تا خطا کم بشه. پیچها اسمشون «پارامتر»ه و مدلهای بزرگ میلیاردها تا دارن؛ عدد خطا اسمش «تابع هزینه»ست؛ و روش پیدا کردن جهت چرخوندن، «گرادیان کاهشی».
زیر دوش
همه یه بار توی حموم مهمونی گیر کردیم: شیر آب رو نمیشناسی و نمیدونی جای درستش کجاست.
چی کار میکنی؟ یه جایی بازش میکنی و دستت رو میگیری زیر آب. سرده. یه کم میچرخونی سمت گرم. هنوز سرده، ولی کمتر. یه کم دیگه. حالا خوبه. هیچکس بهت نگفته «دقیقا روی ۳۷ درجه بذار»؛ از خود آب یاد گرفتی.
ماشین هم دقیقا همینطوری از مثالها یاد میگیره.
چهار قدم
یاد گرفتن ماشین یه چرخهی چهارتاییه:
- حدس. مدل با پیچهاش هر جا که هستن، جواب یه مثال رو حدس میزنه.
- خطا رو بسنج. حدسش رو با جواب درست مقایسه میکنه: چقدر فرق داشت؟
- یه کم درست کن. پیچها رو یه کم، در جهتی که خطا کمتر بشه، میچرخونه.
- دوباره. با مثال بعدی، همین کار.
همهی یادگیری ماشین، از سادهترین مدل تا بزرگترین، همین چرخهست.
با عدد، سه دور
بریم سراغ همون بنگاهی درس قبل. فرض کنید مدل ما یه پیچ بیشتر نداره: «هر متر چند؟». قیمت رو اینطوری حدس میزنه: متراژ ضرب در همین پیچ. مثالمون یه خونهی هشتاد متریه که واقعا ۴٫۸ میلیارد فروش رفته (عددها مثالن):
- پیچ روی ۳۰ میلیونه. حدس: ۸۰ ضرب در ۳۰، یعنی ۲٫۴ میلیارد. ۲٫۴ میلیارد کم گفت. پس پیچ رو بیشتر میکنیم.
- پیچ روی ۵۰. حدس: ۴ میلیارد. هنوز ۰٫۸ کمه، ولی خیلی نزدیکتر شد.
- پیچ روی ۶۰. حدس: ۴٫۸ میلیارد. خطا صفر.
توی دنیای واقعی، خطا هیچوقت دقیقا صفر نمیشه، چون مثالها زیادن و هر کدوم یه کم فرق دارن. مدل دنبال پیچی میگرده که روی همهی مثالها، روی هم، کمترین خطا رو بده.
چقدر بچرخونیم
زیر دوش اینو خوب میدونید:
- خیلی کم بچرخونی، تا شب زیر آب سردی.
- خیلی زیاد بچرخونی، یه بار یخ میکنی، یه بار میسوزی، و هیچوقت به جای درست نمیرسی.
- اندازه بچرخونی، با چند دور میرسی.
ماشین هم همین مشکل رو داره. اندازهی هر چرخوندن یه اسم داره: نرخ یادگیری.
هزاران بار، میلیاردها پیچ
مثال ما یه پیچ داشت. ولی قیمت واقعی خونه به سن، محله، طبقه و خیلی چیزهای دیگه هم بستگی داره؛ پس مدل واقعی پیچهای بیشتری داره، یکی برای هر کدوم.
مدلهای بزرگ امروز میلیاردها پیچ دارن. مثلا یه مدل زبانی که سال ۲۰۲۵ منتشر شد، ۶۷۱ میلیارد تا داشت. هیچ آدمی نمیتونه اینا رو یکییکی تنظیم کنه؛ کامپیوتر همون چهار قدم رو هزاران و میلیونها بار، با مثالهای زیاد، تکرار میکنه.
اسمهاش
این کلمهها رو توی بقیهی مسیر زیاد میبینید:
- پارامتر: همون پیچها. درس مدل و پارامتر.
- آموزش: کل این چرخه، از اول تا وقتی خطا کم بشه.
- تابع هزینه: عددی که میگه حدس چقدر غلط بود. درس تابع هزینه.
- گرادیان کاهشی: روشی که میگه هر پیچ رو به کدوم طرف بچرخونیم که خطا زودتر کم بشه. این روش رو معمولا به کوشی، ریاضیدان فرانسوی، سال ۱۸۴۷ نسبت میدن. درس گرادیان کاهشی.
قبل از اینا، یه سوال مونده: هوش مصنوعی، یادگیری ماشین و یادگیری عمیق چه فرقی دارن؟ درس بعد.
جمعبندی. آنچه از این درس با خودتان میبرید.
- حدس، خطا، یه کم درست کردن، دوباره.
- پیچ یعنی پارامتر.
- قدم نه خیلی کم، نه خیلی زیاد.
- هزاران بار، تا خطا کم بشه.
- روشش: گرادیان کاهشی.
خودتون رو بسنجید
۱۵ پرسش، هر بار تازه از میان ۳۰ پرسش این درس. آخرش فقط کارنامه رو میبینید: چند تا درست، چند تا نادرست.