تبدیل متن و دسته به عدد
جواب کوتاه
خیلی از مدلها فقط عدد میفهمن؛ پس ستونهایی مثل رنگ، شهر یا متن رو باید عدد کرد. ولی اگه بگیم سفید ۱، مشکی ۲، نقرهای ۳، یه ترتیب ساختگی ساختیم، انگار نقرهای از سفید بیشتره. راه درست، مثل فرمهای تیکزدنی، یکیروشن یا وانهاته: برای هر حالت یه ستون، که فقط ستون همون حالت یکه و بقیه صفر. اگه ترتیب واقعی باشه، مثل کوچیک و متوسط و بزرگ، همون ۱ و ۲ و ۳ درسته. متن رو هم سادهترین راه اینه که بشمریم هر کلمه چند بار اومده؛ به این میگن کیسهی کلمهها.
فرم تیکزدنی
همه یه فرم اداری پر کردیم که جلوی «رنگ» چند تا مربع داره و یکیش رو تیک میزنی.
کسی که فرم رو میخونه، فقط میبینه کدوم مربع تیک خورده. همین رو میشه با عدد نوشت: مربع تیکخورده ۱، بقیه ۰. برای «مشکی» میشه ۰، ۱، ۰. این دقیقا یکی از رایجترین راههای عددی کردن ستونهای دستهایه.
چرا لازمه؟ چون خیلی از مدلها فقط عدد میفهمن؛ «مشکی» براشون معنی نداره. درس ویژگی عددی و دستهای.
تلهی ۱، ۲، ۳
اولین فکری که به ذهن میرسه: سفید ۱، مشکی ۲، نقرهای ۳. سادهست؛ ولی یه تله داره:
مدل عددها رو جدی میگیره. فکر میکنه نقرهای «بیشتر» از سفیده، و مشکی درست وسط این دو تاست. حتی میانگین سفید و نقرهای میشه مشکی! در حالی که رنگها هیچ ترتیبی ندارن. به این میگن ترتیب ساختگی: ما با عدد دادن، یه چیزی به داده اضافه کردیم که توش نبود.
یه ستون برای هر حالت
راه درست همون فرمه. اسمش یکیروشن یا «وانهات»ه: برای هر حالت یه ستون تازه میسازیم؛ توی هر ردیف، ستون همون حالت ۱ میشه و بقیه ۰.
| ماشین | سفید؟ | مشکی؟ | نقرهای؟ |
|---|---|---|---|
| اولی (سفید) | ۱ | ۰ | ۰ |
| دومی (مشکی) | ۰ | ۱ | ۰ |
| سومی (نقرهای) | ۰ | ۰ | ۱ |
حالا هیچ رنگی از بقیه «بیشتر» نیست؛ فاصلهی هر دو رنگی از هم یه اندازهست. همیشه دقیقا یکی روشنه؛ برای همین بهش میگن یکیروشن.
وقتی ترتیب واقعیه
همهی دستهها بیترتیب نیستن. اندازهی لباس یا سطح تحصیلات ترتیب داره:
اینجا همون ۱، ۲، ۳ درسته؛ چون بزرگ واقعا از متوسط بزرگتره. به این دستهها میگن ترتیبدار، و به رنگ و شهر میگن بیترتیب. پیش از عددی کردن، از خودتون بپرسید: «این حالتها واقعا از هم بزرگتر و کوچیکترن؟»
متن: کیسهی کلمهها
متن چی؟ سادهترین راه اینه که برای هر کلمه یه ستون بذاریم و بشمریم توی هر متن چند بار اومده. مثلا برای دو تا نظر مشتری:
به این میگن کیسهی کلمهها: انگار کلمههای هر جمله رو ریختیم توی یه کیسه. ترتیبشون گم میشه، ولی تعدادشون میمونه. با همین سادهگی، برای کارهایی مثل تشخیص هرزنامه یا نظر خوب و بد، خوب جواب میده.
ولی «خوب نبود» و «نبود خوب» براش یکیه؛ چون ترتیب رو نمیبینه. مدلهای زبانی امروز راههای خیلی بهتری دارن. مسیر مدلهای زبانی.
وقتی حالتها زیادن
یکیروشن یه مشکل داره: اگه حالتها خیلی زیاد باشن، ستونها هم خیلی زیاد میشن. برای سه تا رنگ، سه تا ستون؛ ولی برای همهی شهرهای یه کشور، صدها ستون، که بیشترشون صفرن. با کیسهی کلمهها هم برای هر کلمهی زبون یه ستون لازمه.
چند تا راه هست: حالتهای کمتکرار رو توی یه «بقیه» جمع کنیم؛ یا به جای یه ستون برای هر حالت، به هر حالت یه فهرست کوتاه عدد بدیم که حالتهای شبیه، عددهای شبیه بگیرن. به این دومی میگن امبدینگ؛ توی مسیر مدلهای زبانی کامل میبینیمش.
حالا که همهی ستونها عدد شدن، یه قدم دیگه مونده: ساختن ستونهای بهتر از همین داده. درس آخر این ایستگاه: مهندسی ویژگی.
جمعبندی. آنچه از این درس با خودتان میبرید.
- مدل عدد میخواد؛ دسته باید عدد بشه.
- ۱، ۲، ۳ برای دستهی بیترتیب، ترتیب ساختگی میسازه.
- یکیروشن: یه ستون صفر و یک برای هر حالت.
- ترتیب واقعی؟ همون ۱، ۲، ۳.
- متن: شمردن کلمهها، بی ترتیب.
خودتون رو بسنجید
۱۵ پرسش، هر بار تازه از میان ۳۰ پرسش این درس. آخرش فقط کارنامه رو میبینید: چند تا درست، چند تا نادرست.