آموزشیادگیری ماشین

درس ۱۴ از ۹۹، هوش مصنوعی، حدود ۶ دقیقه خواندن

تبدیل متن و دسته به عدد

جواب کوتاه

خیلی از مدل‌ها فقط عدد می‌فهمن؛ پس ستون‌هایی مثل رنگ، شهر یا متن رو باید عدد کرد. ولی اگه بگیم سفید ۱، مشکی ۲، نقره‌ای ۳، یه ترتیب ساختگی ساختیم، انگار نقره‌ای از سفید بیشتره. راه درست، مثل فرم‌های تیک‌زدنی، یکی‌روشن یا وان‌هاته: برای هر حالت یه ستون، که فقط ستون همون حالت یکه و بقیه صفر. اگه ترتیب واقعی باشه، مثل کوچیک و متوسط و بزرگ، همون ۱ و ۲ و ۳ درسته. متن رو هم ساده‌ترین راه اینه که بشمریم هر کلمه چند بار اومده؛ به این می‌گن کیسه‌ی کلمه‌ها.

فرم تیک‌زدنی

همه یه فرم اداری پر کردیم که جلوی «رنگ» چند تا مربع داره و یکیش رو تیک می‌زنی.

کسی که فرم رو می‌خونه، فقط می‌بینه کدوم مربع تیک خورده. همین رو می‌شه با عدد نوشت: مربع تیک‌خورده ۱، بقیه ۰. برای «مشکی» می‌شه ۰، ۱، ۰. این دقیقا یکی از رایج‌ترین راه‌های عددی کردن ستون‌های دسته‌ایه.

چرا لازمه؟ چون خیلی از مدل‌ها فقط عدد می‌فهمن؛ «مشکی» براشون معنی نداره. درس ویژگی عددی و دسته‌ای.

تله‌ی ۱، ۲، ۳

اولین فکری که به ذهن می‌رسه: سفید ۱، مشکی ۲، نقره‌ای ۳. ساده‌ست؛ ولی یه تله داره:

مدل عددها رو جدی می‌گیره. فکر می‌کنه نقره‌ای «بیشتر» از سفیده، و مشکی درست وسط این دو تاست. حتی میانگین سفید و نقره‌ای می‌شه مشکی! در حالی که رنگ‌ها هیچ ترتیبی ندارن. به این می‌گن ترتیب ساختگی: ما با عدد دادن، یه چیزی به داده اضافه کردیم که توش نبود.

یه ستون برای هر حالت

راه درست همون فرمه. اسمش یکی‌روشن یا «وان‌هات»ه: برای هر حالت یه ستون تازه می‌سازیم؛ توی هر ردیف، ستون همون حالت ۱ می‌شه و بقیه ۰.

ماشینسفید؟مشکی؟نقره‌ای؟
اولی (سفید)۱۰۰
دومی (مشکی)۰۱۰
سومی (نقره‌ای)۰۰۱

حالا هیچ رنگی از بقیه «بیشتر» نیست؛ فاصله‌ی هر دو رنگی از هم یه اندازه‌ست. همیشه دقیقا یکی روشنه؛ برای همین بهش می‌گن یکی‌روشن.

وقتی ترتیب واقعیه

همه‌ی دسته‌ها بی‌ترتیب نیستن. اندازه‌ی لباس یا سطح تحصیلات ترتیب داره:

اینجا همون ۱، ۲، ۳ درسته؛ چون بزرگ واقعا از متوسط بزرگ‌تره. به این دسته‌ها می‌گن ترتیب‌دار، و به رنگ و شهر می‌گن بی‌ترتیب. پیش از عددی کردن، از خودتون بپرسید: «این حالت‌ها واقعا از هم بزرگ‌تر و کوچیک‌ترن؟»

متن: کیسه‌ی کلمه‌ها

متن چی؟ ساده‌ترین راه اینه که برای هر کلمه یه ستون بذاریم و بشمریم توی هر متن چند بار اومده. مثلا برای دو تا نظر مشتری:

به این می‌گن کیسه‌ی کلمه‌ها: انگار کلمه‌های هر جمله رو ریختیم توی یه کیسه. ترتیبشون گم می‌شه، ولی تعدادشون می‌مونه. با همین ساده‌گی، برای کارهایی مثل تشخیص هرزنامه یا نظر خوب و بد، خوب جواب می‌ده.

ولی «خوب نبود» و «نبود خوب» براش یکیه؛ چون ترتیب رو نمی‌بینه. مدل‌های زبانی امروز راه‌های خیلی بهتری دارن. مسیر مدل‌های زبانی.

وقتی حالت‌ها زیادن

یکی‌روشن یه مشکل داره: اگه حالت‌ها خیلی زیاد باشن، ستون‌ها هم خیلی زیاد می‌شن. برای سه تا رنگ، سه تا ستون؛ ولی برای همه‌ی شهرهای یه کشور، صدها ستون، که بیشترشون صفرن. با کیسه‌ی کلمه‌ها هم برای هر کلمه‌ی زبون یه ستون لازمه.

چند تا راه هست: حالت‌های کم‌تکرار رو توی یه «بقیه» جمع کنیم؛ یا به جای یه ستون برای هر حالت، به هر حالت یه فهرست کوتاه عدد بدیم که حالت‌های شبیه، عددهای شبیه بگیرن. به این دومی می‌گن امبدینگ؛ توی مسیر مدل‌های زبانی کامل می‌بینیمش.

حالا که همه‌ی ستون‌ها عدد شدن، یه قدم دیگه مونده: ساختن ستون‌های بهتر از همین داده. درس آخر این ایستگاه: مهندسی ویژگی.

جمع‌بندی. آنچه از این درس با خودتان می‌برید.

  • مدل عدد می‌خواد؛ دسته باید عدد بشه.
  • ۱، ۲، ۳ برای دسته‌ی بی‌ترتیب، ترتیب ساختگی می‌سازه.
  • یکی‌روشن: یه ستون صفر و یک برای هر حالت.
  • ترتیب واقعی؟ همون ۱، ۲، ۳.
  • متن: شمردن کلمه‌ها، بی ترتیب.

خودتون رو بسنجید

۱۵ پرسش، هر بار تازه از میان ۳۰ پرسش این درس. آخرش فقط کارنامه رو می‌بینید: چند تا درست، چند تا نادرست.

خودتون رو بسنجید

۱۵ پرسش

  • هر بار پرسش‌ها و ترتیب گزینه‌ها عوض می‌شه.
  • تا آخر نمی‌گیم کدوم جواب درست بوده؛ می‌تونید برگردید و جوابتون رو عوض کنید.
  • آخرش کارنامه می‌گیرید: چند تا درست، چند تا نادرست.
  • اگه وسطش بستید، دوباره که باز کنید از همون‌جا ادامه می‌دید.

فصل‌های این درس

درس بعد