مدلهای زبانی بزرگ (LLM)
چتباتهای امروز درونشان چه میگذرد: از توکن و امبدینگ تا آموزش، فاینتیون، RAG و اجرای مدل روی کامپیوتر خودتان.
از صفر۱۵ ایستگاه۸۵ درسدرسها بهزودی
شروع: مدل زبانی چیست۷ درس، بهزودی
پیش از هر جزئیات، تصویر درست: مدل حدس میزند، تکه به تکه.
مدل زبانی بزرگ (LLM) چیست بهزودی
شبکهی عصبی بسیار بزرگی که با خواندن حجم عظیمی از متن یاد گرفته تکهی بعدی متن را حدس بزند و با تکرار این حدس، مینویسد و گفتگو میکند.
پیشبینی تکهی بعد: تمام کار مدل بهزودی
مدل برای هر تکهی ممکن یک احتمال میدهد که بعد از متن تا اینجا بیاید؛ همهی تواناییهایش از همین یک کار برمیآید.
مدل و چتبات: فرقشان بهزودی
مدل خود شبکهی آموزشدیده است؛ چتبات برنامهای است که مدل را با دستورهای پنهان، حافظهی گفتگو و ابزارها به کار میبرد.
هوش مصنوعی مولد چیست بهزودی
مدلهایی که چیز تازه میسازند (متن، تصویر، صدا، کد) بهجای اینکه فقط دستهبندی یا پیشبینی عددی کنند؛ مدل زبانی بزرگ نوع متنی آن است.
پردازش زبان طبیعی (NLP) و جای LLM در آن بهزودی
NLP رشتهی فهم و ساختن زبان انسان با کامپیوتر است؛ پیش از LLM برای هر کار مدل جدا میساختند، حالا یک مدل بیشتر کارها را میکند.
از مدلهای آماری تا چتباتها: تاریخچه بهزودی
شمردن دنبالهی کلمهها، بردار کلمه (۲۰۱۳)، ترنسفورمر (۲۰۱۷)، BERT و نخستین GPT (۲۰۱۸)، و چتبات عمومی در پایان ۲۰۲۲.
«بزرگ» یعنی چه بهزودی
میلیاردها پارامتر و هزاران میلیارد توکن داده؛ با بزرگ شدن، کارهایی ممکن شد که مدل کوچک نمیکرد.
متن به عدد: توکن۶ درس، بهزودی
مدل کلمه و حرف نمیبیند، توکن میبیند؛ خیلی از رفتارهای عجیبش از همینجاست.
توکن در هوش مصنوعی چیست بهزودی
تکهای از متن، کوچکتر یا برابر یک کلمه، که مدل با آن کار میکند؛ طول متن، حد مدل و هزینه با توکن شمرده میشود.
توکنسازی: شکستن متن به تکهها بهزودی
یک برنامهی ثابت (توکنساز) متن را به تکههایی از واژهنامهی خودش میشکند و به هر تکه یک شماره میدهد.
روش جفتهای پرتکرار (BPE) بهزودی
از حرفها شروع میکند و پرتکرارترین جفت کنار هم را بارها یکی میکند تا واژهنامه به اندازهی دلخواه برسد.
واژهنامهی مدل و توکنهای ویژه بهزودی
فهرست همهی تکههایی که مدل میشناسد (معمولا دهها تا صدها هزار)، بهعلاوهی نشانههای ویژه مثل «پایان متن».
چرا فارسی توکن بیشتری میخواهد بهزودی
واژهنامهها بیشتر از متن انگلیسی ساخته شدهاند، پس همان جملهی فارسی معمولا به تکههای بیشتری شکسته میشود؛ گرانتر و جاگیرتر.
چرا مدل حرفهای یک کلمه را بد میشمرد بهزودی
مدل کلمه را یک یا چند تکه میبیند، نه حرف به حرف؛ شمردن حرف و وارونه نوشتن برایش سخت است.
معنی به عدد: امبدینگ۵ درس، بهزودی
مدل با معنی کار میکند چون هر تکه را به برداری تبدیل میکند که معنی را در جای خود دارد.
- بردار: فهرستی از عددهادر مسیر یادگیری ماشین
امبدینگ در هوش مصنوعی چیست بهزودی
تبدیل هر توکن، جمله یا سند به برداری از صدها عدد، طوری که چیزهای هممعنی بردارهای نزدیک داشته باشند.
شباهت معنایی: فاصلهی دو بردار بهزودی
زاویهی میان دو بردار (شباهت کسینوسی) میگوید دو متن چقدر هممعنیاند، حتی اگر یک کلمهی مشترک نداشته باشند.
بردار کلمه و جمع و تفریق معنی بهزودی
از ۲۰۱۳ معلوم شد بردار کلمهها رابطهها را هم نگه میدارد؛ مثلا «پادشاه» منهای «مرد» بهعلاوهی «زن» نزدیک «ملکه» است.
امبدینگ وابسته به جمله بهزودی
در مدلهای امروز بردار هر کلمه به جملهاش بستگی دارد؛ «شیر» در «شیر آب» و «شیر جنگل» دو بردار جدا میگیرد.
درون مدل، در یک نگاه۵ درس، بهزودی
اینجا فقط نقشه است؛ ساختمان کامل در مسیر ترنسفورمرها.
از متن تا احتمال: مسیر داخل مدل بهزودی
توکن، امبدینگ، دهها بلوک ترنسفورمر، و در آخر یک امتیاز برای هر توکن واژهنامه که سافتمکس آن را احتمال میکند.
- ترنسفورمر در هوش مصنوعی چیستدر مسیر ترنسفورمرها
- فقط رمزگشا: خانوادهی GPTدر مسیر ترنسفورمرها
- مکانیزم توجهدر مسیر ترنسفورمرها
پارامتر چیست و چند میلیارد یعنی چه بهزودی
پارامترها عددهای قابل تنظیم درون مدلاند که در آموزش تنظیم شدهاند؛ دانش مدل در همین عددهاست، نه در فایلی از متن.
ساختن متن۷ درس، بهزودی
یک مدل و یک پرسش، جوابهای مختلف؛ کلیدش در شیوهی انتخاب تکهی بعد است.
حلقهی ساختن متن بهزودی
پیشبینی، انتخاب یک توکن، افزودن آن به متن و تکرار، تا توکن پایان یا سقف طول.
انتخاب محتملترین: ساده ولی تکراری بهزودی
همیشه بالاترین احتمال را برداشتن جواب ثابت میدهد ولی اغلب خشک و گاهی تکراری میشود.
دما (Temperature) در مدل زبانی بهزودی
امتیازها پیش از سافتمکس بر دما تقسیم میشوند؛ دمای کم انتخاب را مطمئن و یکنواخت و دمای زیاد آن را متنوع و پرخطا میکند.
نمونهبرداری top-k و top-p بهزودی
فقط از k گزینهی برتر، یا از کوچکترین گروه گزینههایی که جمع احتمالشان به p میرسد، انتخاب میشود تا گزینههای بیربط کنار بروند.
پنجرهی زمینه (Context window) بهزودی
بیشترین تعداد توکنی که مدل یکجا میبیند، پرسش و تاریخچهی گفتگو و جواب با هم؛ هر چه بیرون بماند، برای مدل وجود ندارد.
مدل گفتگوی قبلی را چطور «به یاد» دارد بهزودی
به یاد ندارد؛ برنامهی چتبات هر بار کل گفتگو را دوباره به مدل میدهد، تا جایی که در پنجره جا شود.
چرا یک پرسش دو جواب متفاوت میگیرد بهزودی
چون انتخاب هر تکه با قرعه از میان احتمالهاست؛ با دمای صفر یا قرعهی ثابت، جواب تقریبا تکرارشدنی میشود.
پیشآموزش: خواندن اینترنت۷ درس، بهزودی
بیشتر دانش و زبان مدل در این مرحله ساخته میشود، و بیشتر هزینه هم همینجاست.
پیشآموزش (Pre-training) چیست بهزودی
مدل روی هزاران میلیارد توکن متن، بی برچسب انسانی، فقط پیشبینی توکن بعد را تمرین میکند.
دادهی آموزش از کجا میآید بهزودی
صفحههای وب، کتاب، کد، مقاله و دانشنامه، که پالایش، تکراریزدایی و از متن کمکیفیت پاک میشوند.
- کراسانتروپیدر مسیر یادگیری ماشین
هزینهی آموزش: GPU، زمان و برق بهزودی
آموزش مدل بزرگ هزاران GPU را هفتهها یا ماهها مشغول میکند؛ برای همین فقط چند سازمان مدل پایهی بزرگ میسازند.
قانونهای مقیاس بهزودی
خطای مدل با بزرگتر شدن پارامتر، داده و حساب، بهشکلی پیشبینیپذیر کم میشود؛ و برای هر بودجه، نسبت بهینهای میان اندازهی مدل و داده هست.
مدل پایه: ادامهدهندهی متن، نه دستیار بهزودی
پس از پیشآموزش، مدل فقط متن را ادامه میدهد؛ به پرسش لزوما جواب نمیدهد و شاید پرسش دیگری بنویسد.
تاریخ برش دانش بهزودی
مدل از دنیا فقط تا تاریخ دادهی آموزشش خبر دارد؛ پس از آن را نمیداند مگر با جستجو یا متنی که به آن داده شود.
از مدل خام تا دستیار۷ درس، بهزودی
آنچه مدل پایه را به دستیار مفید، مؤدب و کمخطر تبدیل میکند.
تنظیم با دستور (SFT) بهزودی
مدل پایه روی نمونههای «دستور و جواب خوب» که آدمها نوشتهاند دوباره آموزش میبیند تا جواب دادن را یاد بگیرد.
نقشها در گفتگو: سیستم، کاربر، دستیار بهزودی
گفتگو با نشانههای ویژه به یک متن پیوسته تبدیل میشود که مدل یاد گرفته در آن جای «دستیار» را ادامه دهد.
پیام سیستمی بهزودی
دستوری که پیش از گفتگو میآید و نقش، لحن و مرزهای دستیار را تعیین میکند؛ کاربر معمولا آن را نمیبیند.
RLHF: یادگیری تقویتی با بازخورد انسانی بهزودی
آدمها از میان چند جواب بهتر را انتخاب میکنند، یک مدل پاداش این سلیقه را یاد میگیرد و مدل زبانی با یادگیری تقویتی به سمت جوابهای پرپاداش میرود.
مدل پاداش بهزودی
مدلی که به هر جواب یک امتیاز میدهد و جای داور انسانی را در میلیونها مقایسه میگیرد.
DPO: یادگیری مستقیم از ترجیح بهزودی
همان هدف RLHF، بی مدل پاداش جدا: مدل مستقیم از جفتهای «این بهتر از آن» آموزش میبیند؛ سادهتر و پایدارتر.
همترازی و ایمنی بهزودی
تلاش برای اینکه مدل همان کاری را بکند که آدمها واقعا میخواهند و از کمک به آسیب خودداری کند؛ و چرا هنوز کامل نیست.
فاینتیون: مدل برای کار خودتان۶ درس، بهزودی
گاهی پرسش خوب کافی نیست و مدل باید با دادهی شما کمی دوباره آموزش ببیند.
فاینتیون (Fine-tuning) چیست بهزودی
آموزش دوبارهی یک مدل آماده با دادهی کم و هدفمند خودتان، تا سبک، قالب یا کار خاصی را بهتر انجام دهد.
فاینتیون، RAG یا پرامپت: کدام بهزودی
برای دانش تازه و تغییرپذیر RAG، برای سبک و قالب ثابت فاینتیون، و اول همیشه پرامپت را امتحان کنید.
LoRA: فاینتیون سبک بهزودی
وزنهای مدل ثابت میمانند و فقط دو ماتریس کوچک آموزش میبینند که حاصلضربشان به وزنها افزوده میشود؛ حافظه و هزینه چند برابر کمتر.
داده برای فاینتیون بهزودی
چند صد تا چند هزار نمونهی تمیز و یکدست از همان کاری که میخواهید، مهمتر از نمونهی زیاد و درهم.
فراموشی فاجعهبار بهزودی
مدل با آموزش زیاد روی کار تازه، تواناییهای قبلیاش را از دست میدهد؛ نرخ یادگیری کم و LoRA کمکش میکنند.
تقطیر: مدل کوچک از مدل بزرگ بهزودی
مدل کوچک با تقلید از جوابها یا احتمالهای مدل بزرگ آموزش میبیند و بخش زیادی از توانش را با هزینهی کمتر میگیرد.
پرامپت: حرف زدن با مدل۵ درس، بهزودی
پرامپت یعنی متنی که مدل ادامه میدهد؛ هر چه آغاز روشنتر، ادامه بهتر.
پرامپت چیست و چرا کار میکند بهزودی
متنی که به مدل میدهیم؛ چون مدل محتملترین ادامه را میسازد، زمینه، نقش و مثال در پرامپت جواب را عوض میکند.
مهندسی پرامپت: اصلهای پایه بهزودی
هدف روشن، زمینهی کافی، قالب خروجی معین، مثال، و شکستن کار بزرگ به قدمهای کوچک؛ و آزمودن و بهتر کردن.
یاد دادن با مثال در پرامپت بهزودی
چند نمونهی ورودی و خروجی در پرامپت، بی هیچ آموزشی، الگو را به مدل نشان میدهد.
فکر کردن قدم به قدم بهزودی
وقتی مدل پیش از جواب، قدمهای میانی را بنویسد، در حساب و استدلال کمتر اشتباه میکند، چون هر قدم زمینهی قدم بعد میشود.
خروجی ساختاریافته (مثلا JSON) بهزودی
از مدل خروجی در قالب دقیق خواسته میشود تا برنامه بتواند آن را بخواند؛ با مثال و بررسی قالب.
محدودیتها و خطرها۶ درس، بهزودی
کسی که محدودیتها را نداند، به مدل بیش از اندازه اعتماد میکند.
توهم هوش مصنوعی (Hallucination) بهزودی
ساختن جوابی روان و مطمئن ولی نادرست؛ چون مدل برای متن محتمل آموزش دیده، نه برای درستی؛ بیشتر در پرسشهای نادر، دقیق و بی منبع.
کم کردن توهم بهزودی
دادن منبع به مدل (RAG)، اجازهی گفتن «نمیدانم»، خواستن منبع و بررسی ادعاها؛ ولی صفرش نمیکند.
تزریق دستور (Prompt injection) بهزودی
دستوری پنهان در متنی که مدل میخواند (صفحهی وب، ایمیل) میتواند جای دستور کاربر را بگیرد؛ خطر جدی برای مدلی که ابزار دارد.
- سوگیری و انصافدر مسیر یادگیری ماشین
حریم خصوصی و دادهی شما بهزودی
آنچه در گفتگو مینویسید ممکن است ذخیره یا برای آموزش به کار رود؛ رمز، دادهی شخصی و محرمانه ننویسید.
مدل واقعا میفهمد؟ بهزودی
مدل الگوهای زبان و بخشی از دانش دنیا را در خود دارد و استدلال میکند، ولی تجربه، بدن و هدف خودش را ندارد؛ پژوهشگران هنوز بر سر معنی «فهم» توافق ندارند.
RAG، ابزار و ایجنت۶ درس، بهزودی
مدل تنها، دانشش کهنه و دستش بسته است؛ با جستجو و ابزار به دنیای واقعی وصل میشود.
RAG چیست: جواب از روی منبع بهزودی
پیش از جواب، تکههای مرتبط از سندهای شما با جستجو پیدا و در پرسش گذاشته میشوند تا مدل از روی آنها جواب دهد.
تکه کردن سند برای RAG بهزودی
سند به تکههای چند صد توکنی با کمی همپوشانی بریده میشود؛ تکهی خیلی بزرگ یا خیلی کوچک جستجو را بد میکند.
جستجوی برداری بهزودی
امبدینگ همهی تکهها ذخیره میشود و برای هر پرسش، نزدیکترین بردارها پیدا میشوند؛ جستجو با معنی، نه با کلمه.
استفاده از ابزار بهزودی
مدل بهجای جواب، درخواستی ساختاریافته مینویسد (مثلا «ماشینحساب: ۱۲×۷»)، برنامه آن را اجرا و نتیجه را به مدل برمیگرداند.
ایجنت هوش مصنوعی از درون بهزودی
حلقهای از برنامهریزی، استفاده از ابزار، دیدن نتیجه و قدم بعد، تا کار تمام شود.
خطای ایجنت و مرز اختیار بهزودی
هر قدم ممکن است اشتباه باشد و خطا جمع میشود؛ کار برگشتناپذیر (پرداخت، حذف، فرستادن) باید با تأیید آدم باشد.
استدلال و چندحالته۴ درس، بهزودی
دو جهش چند سال اخیر: مدلی که پیش از جواب فکر میکند، و مدلی که تصویر و صدا هم میفهمد.
مدل استدلالی چیست بهزودی
مدلی که آموزش دیده پیش از جواب، زنجیرهی بلندی از قدمهای میانی بنویسد و بسنجد؛ در ریاضی و کد بهتر، ولی کندتر و گرانتر.
فکر بیشتر هنگام جواب بهزودی
بهجای مدل بزرگتر، حساب بیشتر در لحظهی جواب (قدمهای بیشتر، چند تلاش و انتخاب بهترین) کیفیت را بالا میبرد.
مدلهای چندحالته: متن، تصویر، صدا بهزودی
تصویر و صدا هم به تکه و بردار تبدیل میشوند و کنار توکنهای متن وارد همان مدل میشوند.
گفتگوی صوتی با مدل بهزودی
صدا به متن یا مستقیم به تکههای صوتی تبدیل میشود و جواب دوباره صدا میشود؛ تأخیر کم، کار سخت آن است.
سنجش مدل۵ درس، بهزودی
«این مدل بهتر است» بی سنجش درست فقط تبلیغ است.
مدل زبانی را چطور بسنجیم بهزودی
با آزمونهای استاندارد، مقایسهی انسانی، و مهمتر از همه، آزمون روی کار واقعی خودتان.
آزمونهای استاندارد و مرزشان بهزودی
مجموعهپرسشهای ثابت (دانش عمومی، ریاضی، کد)؛ مفیدند، ولی مدل میتواند برای آنها بهینه شود و نمره همهچیز نیست.
سرگشتگی (Perplexity) بهزودی
توان نمایی میانگین کراسانتروپی هر توکن؛ تقریبا یعنی مدل در هر قدم میان چند گزینه مردد است؛ کمتر بهتر.
مقایسهی کور با داوری انسانی بهزودی
دو جواب بی نام مدل کنار هم، و آدمها بهتر را انتخاب میکنند؛ از هزاران رأی، رتبهبندی ساخته میشود.
آلودگی دادهی آزمون بهزودی
اگر پرسشهای آزمون در دادهی آموزش بوده باشند، نمره حفظ کردن را میسنجد، نه توانایی را.
اجرای مدل روی کامپیوتر خودتان۷ درس، بهزودی
مدل وزنباز را میشود بی اینترنت و روی دستگاه خود اجرا کرد؛ با حساب درست حافظه، نه حدس.
مدل وزنباز و متنباز: فرقشان بهزودی
وزنباز یعنی فایل وزنها منتشر شده و میشود اجرا کرد؛ متنباز کامل یعنی داده و کد آموزش هم باز است؛ و پروانهی هر کدام را باید خواند.
اجرای مدل زبانی روی کامپیوتر (لوکال، آفلاین) بهزودی
فایل وزنها دانلود و با یک برنامهی اجراکننده روی پردازنده یا GPU خودتان اجرا میشود؛ داده از دستگاه بیرون نمیرود.
چقدر حافظه لازم است بهزودی
تعداد پارامتر ضرب در بایت هر پارامتر، بهعلاوهی کمی برای پنجرهی زمینه؛ مثلا ۷ میلیارد پارامتر با ۱۶ بیت حدود ۱۴ گیگابایت.
کوانتیزه کردن مدل بهزودی
وزنها با بیت کمتر (مثلا ۴ بهجای ۱۶) ذخیره میشوند؛ حافظه حدود چهار برابر کمتر، با کمی افت کیفیت.
سرعت اجرا: توکن در ثانیه بهزودی
ساختن متن بیشتر به سرعت حافظه بسته است تا قدرت پردازش؛ مدل کوچکتر و کوانتیزهشده سریعتر جواب میدهد.
مدلهای کوچک: کی کافیاند بهزودی
برای کار مشخص (دستهبندی، خلاصه، استخراج) مدل چند میلیاردی اغلب کافی، ارزان و روی گوشی و لپتاپ اجراشدنی است.
اجرای خودتان یا سرویس آنلاین بهزودی
خودتان: حریم خصوصی و بی هزینهی هر پرسش، ولی سختافزار و مدل کوچکتر؛ آنلاین: مدل بزرگتر، ولی داده بیرون میرود.
فارسی و پایان راه۲ درس، بهزودی
خوانندهی این مسیر فارسیزبان است؛ و راه باید جمعبندی شود.
مدل زبانی و زبان فارسی بهزودی
سهم فارسی در دادهی آموزش کم است و توکن بیشتری میخواهد؛ پس مدلها در فارسی معمولا ضعیفترند و آزمون فارسی روی کار خودتان لازم است.
حالا مدلهای زبانی را میشناسید بهزودی
کل راه در یک تصویر: توکن، بردار، ترنسفورمر، پیشآموزش، دستیار، پرامپت، RAG، اجرا؛ آزمون پایانی و دکمه به مسیرهای «به کار بردن».