برچسب زدن داده
جواب کوتاه
برچسب زدن یعنی کنار هر نمونه، جواب درستش رو بنویسیم؛ مثل برچسب روی شیشههای مربا. معمولا آدمها این کار رو میکنن: گاهی مردم عادی، گاهی کارشناس، مثل دکتری که عکس رادیولوژی رو نگاه میکنه. کار گرون و کندیه؛ دادهی برچسبدار خیلی گرونتر از دادهی خامه. و هر اشتباهش مستقیم به مدل میرسه: یه پژوهش دید حتی دادههای آزمون ده پایگاه معروف، بهطور میانگین ۳٫۳ درصد برچسب غلط دارن. راهنمای روشن، چند نفر برای هر نمونه، و یه بار دیگه نگاه کردن، برچسبها رو بهتر میکنه.
شیشههای مربا
انباری مادربزرگ رو یادتونه؟ یه قفسه شیشهی مربا، روی هر کدوم یه برچسب: آلبالو، به، آلبالو…
حالا اگه یه نفر عجله کرده باشه و روی شیشهی آلبالو نوشته باشه «به»، هر کی بعدا برای مربای به بره سراغش، آلبالو برمیداره. شیشه تقصیری نداره؛ برچسب غلطه.
مدل یادگیری ماشین هم هر چی روی برچسب نوشته باشه رو باور میکنه. برچسب همون ستون آخر جدوله؛ جوابی که مدل باید یاد بگیره. درس ویژگی و برچسب.
کی برچسب میزنه
معمولا آدمها، با قضاوت خودشون. چند نمونه از برچسبهایی که آدمها میزنن:
- توی این عکس اسبه یا گاو؟
- توی این صدا چه کلمههایی گفته شد؟
- این خبر دربارهی چیه؟
- این لکه توی عکس رادیولوژی توموره یا نه؟
بعضیهاش رو هر کسی میتونه بزنه. بعضیهاش، مثل آخری، کارشناس میخواد؛ و کارشناس هم وقتش کمه، هم گرونه.
گاهی هم، وقتی یه مدل با یه کم دادهی برچسبدار یاد گرفت، خودش برای دادهی تازه برچسب حدس میزنه و آدم فقط اونا رو میسنجه. ولی باز اول کار یه آدم لازمه.
گرون و کند
دادهی خام ارزونه: عکس و متن همهجا هست. ولی دادهی برچسبدار خیلی گرونتره، چون پشت هر برچسب یه آدم نشسته.
برای یکی از پایگاههای عکس معروف، که بعدا خیلی از پیشرفتهای یادگیری عمیق روش ساخته شد، ۳٫۲ میلیون عکس رو بیش از ۴۹ هزار نفر، از راه یه بازار کار اینترنتی، برچسب زدن. فکرش رو بکنید: هر عکس رو یکی باید نگاه میکرد و مینوشت توش چیه.
برای همین گاهی فقط بخشی از داده برچسب داره، و از بقیه هم یه جوری استفاده میکنن. یادگیری نیمهنظارتی.
برچسب غلط
آدم خسته میشه، عجله میکنه، اشتباه میکنه. سال ۲۰۲۱ یه گروه پژوهشگر، دادههای آزمونِ ده تا پایگاه معروف عکس و متن و صدا رو گشتن:
بهطور میانگین ۳٫۳ درصد برچسبها غلط بود. توی یکی از پایگاههای بزرگ عکس، ۲٬۹۱۶ تا برچسب غلط پیدا کردن؛ یعنی ۶ درصد. و جالبش اینجاست: وقتی برچسبها رو درست کردن، گاهی یه مدل کوچیکتر از یه مدل بزرگتر بهتر درومد. یعنی برچسب غلط، حتی اینکه کدوم مدل بهتره رو هم عوض میکنه.
برچسب یهطرفه هم مدل یهطرفه میسازه. اگه اونایی که برچسب میزنن همه یه جور فکر کنن، مدل هم همونطور فکر میکنه.
برچسب بهتر
گاهی هم دو نفر به یه چیز، دو تا جواب میدن؛ اونم نه چون یکیشون بیدقته، چون کار واقعا سخته:
اگه شما دادهای برای مدل جمع میکنید، این چند تا کمک میکنه:
- یه راهنمای روشن بنویسید. با مثال: «اگه این شکلی بود، بزن آلبالو؛ اگه گیلاس بود، بزن گیلاس».
- بعضی نمونهها رو به دو سه نفر بدید. جاهایی که با هم فرق دارن، همون جاهای سخت یا راهنمای گنگه.
- یه بار دیگه نگاه کنید. یه تیکه از برچسبها رو، تصادفی، دوباره بسنجید.
- از آدمهای جورواجور کمک بگیرید. که برچسبها یهطرفه نشن.
برچسب درست شد؛ ولی خود داده هم ممکنه کثیف باشه: خونهی خالی، ردیف تکراری، عدد عجیب. درس بعد: دادهی کثیف.
جمعبندی. آنچه از این درس با خودتان میبرید.
- برچسب یعنی جواب درست کنار هر نمونه.
- آدمها میزننش؛ گاهی کارشناس.
- گرون و کنده.
- برچسب غلط، مدل غلط.
- راهنمای روشن، چند نفر، دوباره نگاه.
خودتون رو بسنجید
۱۵ پرسش، هر بار تازه از میان ۳۰ پرسش این درس. آخرش فقط کارنامه رو میبینید: چند تا درست، چند تا نادرست.