داده چیست و چرا اینقدر مهم است
جواب کوتاه
داده یعنی واقعیتها و عددهای خامی که ثبت شدهاند و از آنها اطلاعات بیرون کشیده میشود: دمای هر روز، عکسهای گوشی، پیامها، نمرهها. هوش مصنوعی از داده یاد میگیرد، پس هر چه در داده باشد در جوابش هم دیده میشود؛ دادهی بد، جواب بد. داده جورهای گوناگون دارد: متن، عکس، صدا، عدد و جدول. دادهی برچسبدار یعنی نمونهای که جوابش کنارش است، و چون آدمها برچسب میزنند، گران است. چهار عیب داده: کم، غلط، یکطرفه و کهنه؛ و پاکسازی داده یعنی پیدا کردن و درست کردن یا برداشتن نمونههای خراب پیش از آموزش.
داده چیست
داده یعنی هر چیزی که ثبت شده و میشود از آن چیزی فهمید: واقعیتها و عددهای خام. چند مثال:
- دمای هوای هر روز یک شهر
- قیمت نان در ماههای یک سال
- عکسهای گوشی شما
- پیامهایی که نوشتهاید
- نمرههای یک کلاس
از دمای هر روز میشود فهمید کدام ماه گرمتر است؛ از نمرهها، کدام درس سختتر. به خود عددها داده میگویند و به چیزی که از آنها میفهمیم، اطلاعات. یک دسته دادهی کنار هم را مجموعهداده (dataset) مینامند.
کودکی که حرف زدن یاد میگیرد
کودک حرف زدن را از کسانی که دورش هستند یاد میگیرد؛ هر چه بشنود، همان را میگوید. چهار کودک را ببینید:
هوش مصنوعی همین کودک است، و داده همان چیزهایی که شنیده. برای همین میگویند «دادهی بد، جواب بد». چطور از داده یاد میگیرد را در درس هوش مصنوعی چطور یاد میگیرد دیدید.
انواع داده
دادهی جدولی، مثل فهرست نمرهها، خانهبندیشده است: هر ستون یک چیز و هر سطر یک نمونه. متن و عکس و صدا خانهبندی ندارند و برنامههای معمولی سخت از پسشان برمیآیند؛ هوش مصنوعی برای همین جورها به کار میآید.
دادهی برچسبدار
برچسب یعنی جواب درست کنار هر نمونه، مثل عکسی که زیرش نوشته «گربه»:
برچسب را معمولا آدمها میزنند، پس دادهی برچسبدار بسیار گرانتر از دادهی خام است؛ و کیفیت برچسبها مستقیم در کار مدل دیده میشود. اگر برچسب غلط باشد، مثل همان کودکی است که به گربه «سگ» گفتهاند.
چهار عیب داده
- کممدل الگو را کامل نمیبیند و در نمونههای تازه زیاد اشتباه میکند.
- غلطبرچسب نادرست یا عدد اشتباه؛ مدل همان اشتباه را یاد میگیرد و با اطمینان تکرارش میکند.
- یکطرفهاگر داده فقط از یک گروه یا یک جور باشد، مدل در بقیه بد کار میکند.
- کهنهدنیا عوض میشود؛ مدلی که با دادهی کهنه یاد گرفته، از چیزهای تازه خبر ندارد.
دادهی کهنه همان دلیلی است که هوش مصنوعی از خبرهای تازه بیخبر است؛ درسش جداست. و دادهی یکطرفه ریشهی سوگیری است.
پاکسازی داده
پیش از آموزش، داده را پاک میکنند: نمونههای خراب، نادرست، ناقص یا بیربط را پیدا میکنند و درست میکنند یا برمیدارند. مثل کسی که پیش از پختن، برنج را پاک میکند تا سنگریزهها در غذا نماند. کار پاکسازی دیده نمیشود، ولی کیفیت جوابهای مدل به آن بستگی دارد.
داده از کجا میآید
- برچسبزنی آدمهاآدمها به نمونهها برچسب میزنند؛ کاری گران و دقیق. یک پایگاه مشهور عکس بیش از ۱۴ میلیون عکس دارد که با دست برچسب خوردهاند.
- متن و عکسهای وببرای مدلهای بزرگ، حجم بسیاری از متن عمومی وب جمع و کمی پالایش میشود، بی برچسب.
- رفتار کاربرانآنچه میبینید، میخرید یا امتیاز میدهید؛ همان دادهای که سامانههای پیشنهاد از آن یاد میگیرند.
اینکه دادهی خود شما چطور به کار میرود و چه چیزهایی را به ابزارهای هوش مصنوعی ندهید، در درس حریم خصوصی میآید.
سه اشتباه
- «دادهی بیشتر همیشه یعنی مدل بهتر.»دادهی زیاد ولی غلط یا یکطرفه، مدل را بهتر نمیکند؛ کیفیت و گوناگونی به اندازهی حجم مهم است.
- «هوش مصنوعی بیطرف است، چون ماشین است.»هوش مصنوعی هر چه در داده باشد یاد میگیرد، حتی یکطرفه بودنش را؛ این را در درس سوگیری کامل میبینید.
- «مدل خودش دادهی غلط را کنار میگذارد.»مدل نمیداند کدام نمونه غلط است؛ پاکسازی داده کار پیش از آموزش است.
جمعبندی. آنچه از این درس با خودتان میبرید.
- داده: واقعیتها و عددهای خام ثبتشده.
- هوش مصنوعی هر چه در داده باشد یاد میگیرد؛ دادهی بد، جواب بد.
- انواع: متن، عکس، صدا، عدد، جدول.
- برچسب: جواب کنار نمونه؛ کار آدمها، گران.
- چهار عیب: کم، غلط، یکطرفه، کهنه.
- پاکسازی، پیش از آموزش.
خودتان را بسنجید
۱۵ پرسش، هر بار تازه از میان ۳۰ پرسش این درس. آخر آزمون فقط کارنامه را میبینید: چند درست، چند نادرست.