آموزشهوش مصنوعی

مدل‌های زبانی بزرگ (LLM)

چت‌بات‌های امروز درونشان چه می‌گذرد: از توکن و امبدینگ تا آموزش، فاین‌تیون، RAG و اجرای مدل روی کامپیوتر خودتان.

از صفر۱۵ ایستگاه۸۵ درسدرس‌ها به‌زودی

شروع: مدل زبانی چیست۷ درس، به‌زودی

پیش از هر جزئیات، تصویر درست: مدل حدس می‌زند، تکه به تکه.

  1. مدل زبانی بزرگ (LLM) چیست به‌زودی

    شبکه‌ی عصبی بسیار بزرگی که با خواندن حجم عظیمی از متن یاد گرفته تکه‌ی بعدی متن را حدس بزند و با تکرار این حدس، می‌نویسد و گفتگو می‌کند.

  2. پیش‌بینی تکه‌ی بعد: تمام کار مدل به‌زودی

    مدل برای هر تکه‌ی ممکن یک احتمال می‌دهد که بعد از متن تا این‌جا بیاید؛ همه‌ی توانایی‌هایش از همین یک کار برمی‌آید.

  3. مدل و چت‌بات: فرقشان به‌زودی

    مدل خود شبکه‌ی آموزش‌دیده است؛ چت‌بات برنامه‌ای است که مدل را با دستورهای پنهان، حافظه‌ی گفتگو و ابزارها به کار می‌برد.

  4. هوش مصنوعی مولد چیست به‌زودی

    مدل‌هایی که چیز تازه می‌سازند (متن، تصویر، صدا، کد) به‌جای اینکه فقط دسته‌بندی یا پیش‌بینی عددی کنند؛ مدل زبانی بزرگ نوع متنی آن است.

  5. پردازش زبان طبیعی (NLP) و جای LLM در آن به‌زودی

    NLP رشته‌ی فهم و ساختن زبان انسان با کامپیوتر است؛ پیش از LLM برای هر کار مدل جدا می‌ساختند، حالا یک مدل بیشتر کارها را می‌کند.

  6. از مدل‌های آماری تا چت‌بات‌ها: تاریخچه به‌زودی

    شمردن دنباله‌ی کلمه‌ها، بردار کلمه (۲۰۱۳)، ترنسفورمر (۲۰۱۷)، BERT و نخستین GPT (۲۰۱۸)، و چت‌بات عمومی در پایان ۲۰۲۲.

  7. «بزرگ» یعنی چه به‌زودی

    میلیاردها پارامتر و هزاران میلیارد توکن داده؛ با بزرگ شدن، کارهایی ممکن شد که مدل کوچک نمی‌کرد.

متن به عدد: توکن۶ درس، به‌زودی

مدل کلمه و حرف نمی‌بیند، توکن می‌بیند؛ خیلی از رفتارهای عجیبش از همین‌جاست.

  1. توکن در هوش مصنوعی چیست به‌زودی

    تکه‌ای از متن، کوچک‌تر یا برابر یک کلمه، که مدل با آن کار می‌کند؛ طول متن، حد مدل و هزینه با توکن شمرده می‌شود.

  2. توکن‌سازی: شکستن متن به تکه‌ها به‌زودی

    یک برنامه‌ی ثابت (توکن‌ساز) متن را به تکه‌هایی از واژه‌نامه‌ی خودش می‌شکند و به هر تکه یک شماره می‌دهد.

  3. روش جفت‌های پرتکرار (BPE) به‌زودی

    از حرف‌ها شروع می‌کند و پرتکرارترین جفت کنار هم را بارها یکی می‌کند تا واژه‌نامه به اندازه‌ی دلخواه برسد.

  4. واژه‌نامه‌ی مدل و توکن‌های ویژه به‌زودی

    فهرست همه‌ی تکه‌هایی که مدل می‌شناسد (معمولا ده‌ها تا صدها هزار)، به‌علاوه‌ی نشانه‌های ویژه مثل «پایان متن».

  5. چرا فارسی توکن بیشتری می‌خواهد به‌زودی

    واژه‌نامه‌ها بیشتر از متن انگلیسی ساخته شده‌اند، پس همان جمله‌ی فارسی معمولا به تکه‌های بیشتری شکسته می‌شود؛ گران‌تر و جاگیرتر.

  6. چرا مدل حرف‌های یک کلمه را بد می‌شمرد به‌زودی

    مدل کلمه را یک یا چند تکه می‌بیند، نه حرف به حرف؛ شمردن حرف و وارونه نوشتن برایش سخت است.

معنی به عدد: امبدینگ۵ درس، به‌زودی

مدل با معنی کار می‌کند چون هر تکه را به برداری تبدیل می‌کند که معنی را در جای خود دارد.

  1. بردار: فهرستی از عددهادر مسیر یادگیری ماشین
  2. امبدینگ در هوش مصنوعی چیست به‌زودی

    تبدیل هر توکن، جمله یا سند به برداری از صدها عدد، طوری که چیزهای هم‌معنی بردارهای نزدیک داشته باشند.

  3. شباهت معنایی: فاصله‌ی دو بردار به‌زودی

    زاویه‌ی میان دو بردار (شباهت کسینوسی) می‌گوید دو متن چقدر هم‌معنی‌اند، حتی اگر یک کلمه‌ی مشترک نداشته باشند.

  4. بردار کلمه و جمع و تفریق معنی به‌زودی

    از ۲۰۱۳ معلوم شد بردار کلمه‌ها رابطه‌ها را هم نگه می‌دارد؛ مثلا «پادشاه» منهای «مرد» به‌علاوه‌ی «زن» نزدیک «ملکه» است.

  5. امبدینگ وابسته به جمله به‌زودی

    در مدل‌های امروز بردار هر کلمه به جمله‌اش بستگی دارد؛ «شیر» در «شیر آب» و «شیر جنگل» دو بردار جدا می‌گیرد.

درون مدل، در یک نگاه۵ درس، به‌زودی

این‌جا فقط نقشه است؛ ساختمان کامل در مسیر ترنسفورمرها.

  1. از متن تا احتمال: مسیر داخل مدل به‌زودی

    توکن، امبدینگ، ده‌ها بلوک ترنسفورمر، و در آخر یک امتیاز برای هر توکن واژه‌نامه که سافت‌مکس آن را احتمال می‌کند.

  2. ترنسفورمر در هوش مصنوعی چیستدر مسیر ترنسفورمرها
  3. فقط رمزگشا: خانواده‌ی GPTدر مسیر ترنسفورمرها
  4. مکانیزم توجهدر مسیر ترنسفورمرها
  5. پارامتر چیست و چند میلیارد یعنی چه به‌زودی

    پارامترها عددهای قابل تنظیم درون مدل‌اند که در آموزش تنظیم شده‌اند؛ دانش مدل در همین عددهاست، نه در فایلی از متن.

ساختن متن۷ درس، به‌زودی

یک مدل و یک پرسش، جواب‌های مختلف؛ کلیدش در شیوه‌ی انتخاب تکه‌ی بعد است.

  1. حلقه‌ی ساختن متن به‌زودی

    پیش‌بینی، انتخاب یک توکن، افزودن آن به متن و تکرار، تا توکن پایان یا سقف طول.

  2. انتخاب محتمل‌ترین: ساده ولی تکراری به‌زودی

    همیشه بالاترین احتمال را برداشتن جواب ثابت می‌دهد ولی اغلب خشک و گاهی تکراری می‌شود.

  3. دما (Temperature) در مدل زبانی به‌زودی

    امتیازها پیش از سافت‌مکس بر دما تقسیم می‌شوند؛ دمای کم انتخاب را مطمئن و یکنواخت و دمای زیاد آن را متنوع و پرخطا می‌کند.

  4. نمونه‌برداری top-k و top-p به‌زودی

    فقط از k گزینه‌ی برتر، یا از کوچک‌ترین گروه گزینه‌هایی که جمع احتمالشان به p می‌رسد، انتخاب می‌شود تا گزینه‌های بی‌ربط کنار بروند.

  5. پنجره‌ی زمینه (Context window) به‌زودی

    بیشترین تعداد توکنی که مدل یک‌جا می‌بیند، پرسش و تاریخچه‌ی گفتگو و جواب با هم؛ هر چه بیرون بماند، برای مدل وجود ندارد.

  6. مدل گفتگوی قبلی را چطور «به یاد» دارد به‌زودی

    به یاد ندارد؛ برنامه‌ی چت‌بات هر بار کل گفتگو را دوباره به مدل می‌دهد، تا جایی که در پنجره جا شود.

  7. چرا یک پرسش دو جواب متفاوت می‌گیرد به‌زودی

    چون انتخاب هر تکه با قرعه از میان احتمال‌هاست؛ با دمای صفر یا قرعه‌ی ثابت، جواب تقریبا تکرارشدنی می‌شود.

پیش‌آموزش: خواندن اینترنت۷ درس، به‌زودی

بیشتر دانش و زبان مدل در این مرحله ساخته می‌شود، و بیشتر هزینه هم همین‌جاست.

  1. پیش‌آموزش (Pre-training) چیست به‌زودی

    مدل روی هزاران میلیارد توکن متن، بی برچسب انسانی، فقط پیش‌بینی توکن بعد را تمرین می‌کند.

  2. داده‌ی آموزش از کجا می‌آید به‌زودی

    صفحه‌های وب، کتاب، کد، مقاله و دانشنامه، که پالایش، تکراری‌زدایی و از متن کم‌کیفیت پاک می‌شوند.

  3. کراس‌انتروپیدر مسیر یادگیری ماشین
  4. هزینه‌ی آموزش: GPU، زمان و برق به‌زودی

    آموزش مدل بزرگ هزاران GPU را هفته‌ها یا ماه‌ها مشغول می‌کند؛ برای همین فقط چند سازمان مدل پایه‌ی بزرگ می‌سازند.

  5. قانون‌های مقیاس به‌زودی

    خطای مدل با بزرگ‌تر شدن پارامتر، داده و حساب، به‌شکلی پیش‌بینی‌پذیر کم می‌شود؛ و برای هر بودجه، نسبت بهینه‌ای میان اندازه‌ی مدل و داده هست.

  6. مدل پایه: ادامه‌دهنده‌ی متن، نه دستیار به‌زودی

    پس از پیش‌آموزش، مدل فقط متن را ادامه می‌دهد؛ به پرسش لزوما جواب نمی‌دهد و شاید پرسش دیگری بنویسد.

  7. تاریخ برش دانش به‌زودی

    مدل از دنیا فقط تا تاریخ داده‌ی آموزشش خبر دارد؛ پس از آن را نمی‌داند مگر با جستجو یا متنی که به آن داده شود.

از مدل خام تا دستیار۷ درس، به‌زودی

آنچه مدل پایه را به دستیار مفید، مؤدب و کم‌خطر تبدیل می‌کند.

  1. تنظیم با دستور (SFT) به‌زودی

    مدل پایه روی نمونه‌های «دستور و جواب خوب» که آدم‌ها نوشته‌اند دوباره آموزش می‌بیند تا جواب دادن را یاد بگیرد.

  2. نقش‌ها در گفتگو: سیستم، کاربر، دستیار به‌زودی

    گفتگو با نشانه‌های ویژه به یک متن پیوسته تبدیل می‌شود که مدل یاد گرفته در آن جای «دستیار» را ادامه دهد.

  3. پیام سیستمی به‌زودی

    دستوری که پیش از گفتگو می‌آید و نقش، لحن و مرزهای دستیار را تعیین می‌کند؛ کاربر معمولا آن را نمی‌بیند.

  4. RLHF: یادگیری تقویتی با بازخورد انسانی به‌زودی

    آدم‌ها از میان چند جواب بهتر را انتخاب می‌کنند، یک مدل پاداش این سلیقه را یاد می‌گیرد و مدل زبانی با یادگیری تقویتی به سمت جواب‌های پرپاداش می‌رود.

  5. مدل پاداش به‌زودی

    مدلی که به هر جواب یک امتیاز می‌دهد و جای داور انسانی را در میلیون‌ها مقایسه می‌گیرد.

  6. DPO: یادگیری مستقیم از ترجیح به‌زودی

    همان هدف RLHF، بی مدل پاداش جدا: مدل مستقیم از جفت‌های «این بهتر از آن» آموزش می‌بیند؛ ساده‌تر و پایدارتر.

  7. هم‌ترازی و ایمنی به‌زودی

    تلاش برای اینکه مدل همان کاری را بکند که آدم‌ها واقعا می‌خواهند و از کمک به آسیب خودداری کند؛ و چرا هنوز کامل نیست.

فاین‌تیون: مدل برای کار خودتان۶ درس، به‌زودی

گاهی پرسش خوب کافی نیست و مدل باید با داده‌ی شما کمی دوباره آموزش ببیند.

  1. فاین‌تیون (Fine-tuning) چیست به‌زودی

    آموزش دوباره‌ی یک مدل آماده با داده‌ی کم و هدفمند خودتان، تا سبک، قالب یا کار خاصی را بهتر انجام دهد.

  2. فاین‌تیون، RAG یا پرامپت: کدام به‌زودی

    برای دانش تازه و تغییرپذیر RAG، برای سبک و قالب ثابت فاین‌تیون، و اول همیشه پرامپت را امتحان کنید.

  3. LoRA: فاین‌تیون سبک به‌زودی

    وزن‌های مدل ثابت می‌مانند و فقط دو ماتریس کوچک آموزش می‌بینند که حاصل‌ضربشان به وزن‌ها افزوده می‌شود؛ حافظه و هزینه چند برابر کمتر.

  4. داده برای فاین‌تیون به‌زودی

    چند صد تا چند هزار نمونه‌ی تمیز و یکدست از همان کاری که می‌خواهید، مهم‌تر از نمونه‌ی زیاد و درهم.

  5. فراموشی فاجعه‌بار به‌زودی

    مدل با آموزش زیاد روی کار تازه، توانایی‌های قبلی‌اش را از دست می‌دهد؛ نرخ یادگیری کم و LoRA کمکش می‌کنند.

  6. تقطیر: مدل کوچک از مدل بزرگ به‌زودی

    مدل کوچک با تقلید از جواب‌ها یا احتمال‌های مدل بزرگ آموزش می‌بیند و بخش زیادی از توانش را با هزینه‌ی کمتر می‌گیرد.

پرامپت: حرف زدن با مدل۵ درس، به‌زودی

پرامپت یعنی متنی که مدل ادامه می‌دهد؛ هر چه آغاز روشن‌تر، ادامه بهتر.

  1. پرامپت چیست و چرا کار می‌کند به‌زودی

    متنی که به مدل می‌دهیم؛ چون مدل محتمل‌ترین ادامه را می‌سازد، زمینه، نقش و مثال در پرامپت جواب را عوض می‌کند.

  2. مهندسی پرامپت: اصل‌های پایه به‌زودی

    هدف روشن، زمینه‌ی کافی، قالب خروجی معین، مثال، و شکستن کار بزرگ به قدم‌های کوچک؛ و آزمودن و بهتر کردن.

  3. یاد دادن با مثال در پرامپت به‌زودی

    چند نمونه‌ی ورودی و خروجی در پرامپت، بی هیچ آموزشی، الگو را به مدل نشان می‌دهد.

  4. فکر کردن قدم به قدم به‌زودی

    وقتی مدل پیش از جواب، قدم‌های میانی را بنویسد، در حساب و استدلال کمتر اشتباه می‌کند، چون هر قدم زمینه‌ی قدم بعد می‌شود.

  5. خروجی ساختاریافته (مثلا JSON) به‌زودی

    از مدل خروجی در قالب دقیق خواسته می‌شود تا برنامه بتواند آن را بخواند؛ با مثال و بررسی قالب.

محدودیت‌ها و خطرها۶ درس، به‌زودی

کسی که محدودیت‌ها را نداند، به مدل بیش از اندازه اعتماد می‌کند.

  1. توهم هوش مصنوعی (Hallucination) به‌زودی

    ساختن جوابی روان و مطمئن ولی نادرست؛ چون مدل برای متن محتمل آموزش دیده، نه برای درستی؛ بیشتر در پرسش‌های نادر، دقیق و بی منبع.

  2. کم کردن توهم به‌زودی

    دادن منبع به مدل (RAG)، اجازه‌ی گفتن «نمی‌دانم»، خواستن منبع و بررسی ادعاها؛ ولی صفرش نمی‌کند.

  3. تزریق دستور (Prompt injection) به‌زودی

    دستوری پنهان در متنی که مدل می‌خواند (صفحه‌ی وب، ایمیل) می‌تواند جای دستور کاربر را بگیرد؛ خطر جدی برای مدلی که ابزار دارد.

  4. سوگیری و انصافدر مسیر یادگیری ماشین
  5. حریم خصوصی و داده‌ی شما به‌زودی

    آنچه در گفتگو می‌نویسید ممکن است ذخیره یا برای آموزش به کار رود؛ رمز، داده‌ی شخصی و محرمانه ننویسید.

  6. مدل واقعا می‌فهمد؟ به‌زودی

    مدل الگوهای زبان و بخشی از دانش دنیا را در خود دارد و استدلال می‌کند، ولی تجربه، بدن و هدف خودش را ندارد؛ پژوهشگران هنوز بر سر معنی «فهم» توافق ندارند.

RAG، ابزار و ایجنت۶ درس، به‌زودی

مدل تنها، دانشش کهنه و دستش بسته است؛ با جستجو و ابزار به دنیای واقعی وصل می‌شود.

  1. RAG چیست: جواب از روی منبع به‌زودی

    پیش از جواب، تکه‌های مرتبط از سندهای شما با جستجو پیدا و در پرسش گذاشته می‌شوند تا مدل از روی آن‌ها جواب دهد.

  2. تکه کردن سند برای RAG به‌زودی

    سند به تکه‌های چند صد توکنی با کمی هم‌پوشانی بریده می‌شود؛ تکه‌ی خیلی بزرگ یا خیلی کوچک جستجو را بد می‌کند.

  3. استفاده از ابزار به‌زودی

    مدل به‌جای جواب، درخواستی ساختاریافته می‌نویسد (مثلا «ماشین‌حساب: ۱۲×۷»)، برنامه آن را اجرا و نتیجه را به مدل برمی‌گرداند.

  4. ایجنت هوش مصنوعی از درون به‌زودی

    حلقه‌ای از برنامه‌ریزی، استفاده از ابزار، دیدن نتیجه و قدم بعد، تا کار تمام شود.

  5. خطای ایجنت و مرز اختیار به‌زودی

    هر قدم ممکن است اشتباه باشد و خطا جمع می‌شود؛ کار برگشت‌ناپذیر (پرداخت، حذف، فرستادن) باید با تأیید آدم باشد.

استدلال و چندحالته۴ درس، به‌زودی

دو جهش چند سال اخیر: مدلی که پیش از جواب فکر می‌کند، و مدلی که تصویر و صدا هم می‌فهمد.

  1. مدل استدلالی چیست به‌زودی

    مدلی که آموزش دیده پیش از جواب، زنجیره‌ی بلندی از قدم‌های میانی بنویسد و بسنجد؛ در ریاضی و کد بهتر، ولی کندتر و گران‌تر.

  2. فکر بیشتر هنگام جواب به‌زودی

    به‌جای مدل بزرگ‌تر، حساب بیشتر در لحظه‌ی جواب (قدم‌های بیشتر، چند تلاش و انتخاب بهترین) کیفیت را بالا می‌برد.

  3. مدل‌های چندحالته: متن، تصویر، صدا به‌زودی

    تصویر و صدا هم به تکه و بردار تبدیل می‌شوند و کنار توکن‌های متن وارد همان مدل می‌شوند.

  4. گفتگوی صوتی با مدل به‌زودی

    صدا به متن یا مستقیم به تکه‌های صوتی تبدیل می‌شود و جواب دوباره صدا می‌شود؛ تأخیر کم، کار سخت آن است.

سنجش مدل۵ درس، به‌زودی

«این مدل بهتر است» بی سنجش درست فقط تبلیغ است.

  1. مدل زبانی را چطور بسنجیم به‌زودی

    با آزمون‌های استاندارد، مقایسه‌ی انسانی، و مهم‌تر از همه، آزمون روی کار واقعی خودتان.

  2. آزمون‌های استاندارد و مرزشان به‌زودی

    مجموعه‌پرسش‌های ثابت (دانش عمومی، ریاضی، کد)؛ مفیدند، ولی مدل می‌تواند برای آن‌ها بهینه شود و نمره همه‌چیز نیست.

  3. سرگشتگی (Perplexity) به‌زودی

    توان نمایی میانگین کراس‌انتروپی هر توکن؛ تقریبا یعنی مدل در هر قدم میان چند گزینه مردد است؛ کمتر بهتر.

  4. مقایسه‌ی کور با داوری انسانی به‌زودی

    دو جواب بی نام مدل کنار هم، و آدم‌ها بهتر را انتخاب می‌کنند؛ از هزاران رأی، رتبه‌بندی ساخته می‌شود.

  5. آلودگی داده‌ی آزمون به‌زودی

    اگر پرسش‌های آزمون در داده‌ی آموزش بوده باشند، نمره حفظ کردن را می‌سنجد، نه توانایی را.

اجرای مدل روی کامپیوتر خودتان۷ درس، به‌زودی

مدل وزن‌باز را می‌شود بی اینترنت و روی دستگاه خود اجرا کرد؛ با حساب درست حافظه، نه حدس.

  1. مدل وزن‌باز و متن‌باز: فرقشان به‌زودی

    وزن‌باز یعنی فایل وزن‌ها منتشر شده و می‌شود اجرا کرد؛ متن‌باز کامل یعنی داده و کد آموزش هم باز است؛ و پروانه‌ی هر کدام را باید خواند.

  2. اجرای مدل زبانی روی کامپیوتر (لوکال، آفلاین) به‌زودی

    فایل وزن‌ها دانلود و با یک برنامه‌ی اجراکننده روی پردازنده یا GPU خودتان اجرا می‌شود؛ داده از دستگاه بیرون نمی‌رود.

  3. چقدر حافظه لازم است به‌زودی

    تعداد پارامتر ضرب در بایت هر پارامتر، به‌علاوه‌ی کمی برای پنجره‌ی زمینه؛ مثلا ۷ میلیارد پارامتر با ۱۶ بیت حدود ۱۴ گیگابایت.

  4. کوانتیزه کردن مدل به‌زودی

    وزن‌ها با بیت کمتر (مثلا ۴ به‌جای ۱۶) ذخیره می‌شوند؛ حافظه حدود چهار برابر کمتر، با کمی افت کیفیت.

  5. سرعت اجرا: توکن در ثانیه به‌زودی

    ساختن متن بیشتر به سرعت حافظه بسته است تا قدرت پردازش؛ مدل کوچک‌تر و کوانتیزه‌شده سریع‌تر جواب می‌دهد.

  6. مدل‌های کوچک: کی کافی‌اند به‌زودی

    برای کار مشخص (دسته‌بندی، خلاصه، استخراج) مدل چند میلیاردی اغلب کافی، ارزان و روی گوشی و لپ‌تاپ اجراشدنی است.

  7. اجرای خودتان یا سرویس آنلاین به‌زودی

    خودتان: حریم خصوصی و بی هزینه‌ی هر پرسش، ولی سخت‌افزار و مدل کوچک‌تر؛ آنلاین: مدل بزرگ‌تر، ولی داده بیرون می‌رود.

فارسی و پایان راه۲ درس، به‌زودی

خواننده‌ی این مسیر فارسی‌زبان است؛ و راه باید جمع‌بندی شود.

  1. مدل زبانی و زبان فارسی به‌زودی

    سهم فارسی در داده‌ی آموزش کم است و توکن بیشتری می‌خواهد؛ پس مدل‌ها در فارسی معمولا ضعیف‌ترند و آزمون فارسی روی کار خودتان لازم است.

  2. حالا مدل‌های زبانی را می‌شناسید به‌زودی

    کل راه در یک تصویر: توکن، بردار، ترنسفورمر، پیش‌آموزش، دستیار، پرامپت، RAG، اجرا؛ آزمون پایانی و دکمه به مسیرهای «به کار بردن».