سلام 🙋🏻♂️
🔹بیشتر آموزش های مربوط به مدل های زبانی بزرگ یا همون LLM ها به تشریح مفاهیم نظری یا معرفی ابزارهای آماده حول اون ها می پردازند، اما به نظرم برای درک واقعی این فناوری زمانی شکل می گیره که مسیر تولید و پردازش متن رو قدم به قدم و در سطح کد بررسی کنیم. توی ویدئویی که لینکش رو آخر پست می گذارم، یک پروژه تحت عنوان how-llms-work دقیقاً با همین رویکرد بررسی شده.
🔹توی این پروژه، مسیر حرکت داده از لحظه ورود متن تا تولید پاسخ، به بخش های کوچک تر تقسیم شدن:
ابتدا نحوه تبدیل متن خام به توکن بررسی میشه و سپس نمایش برداری یا Embedding این توکنها معرفی میشن. در ادامه، ساختار لایه های ترنسفورمر، مکانیزم Attention یا توجه، جریان عبور داده میان لایه ها و در نهایت فرآیند تولید خروجی به صورت گام به گام پیادهسازی شدند.
یکی از ویژگی های ارزشمند این پروژه، حذف پیچیدگی های غیرضروری بود. در واقع به جای آنکه بیاد مخاطب رو با میلیون ها خط کد یا فریم ورک های سنگین روبرو کنه، سعی کرده هر بخش از معماری رو به صورت مستقل و آموزشی پیاده کنه. در نتیجه ارتباط بین مفاهیم تئوری و پیادهسازی عملی به خوبی قابل بررسی و یادگیری هست.
🔹در کنار مباحث مربوط به معماری ترنسفورمر، پروژه به موضوعاتی مثل فرآیند آموزش مدل، نحوه بهینه سازی وزن ها، تولید توکن به صورت خودبازگشتی و تأثیر پارامترهای مختلف در کیفیت خروجی نیز اشاره های دقیقی داره که این موضوع کمک می کنه که دید مناسبی نسبت به چرخه کامل توسعه یک LLM به مخاطب بده.
🔹میشه گفت این ریپو بیش از آنکه یک پروژه تولیدی باشه، یک منبع آموزشی برای دوستان مهندس نرمافزار، محققین این حوزه و علاقمندان هوش مصنوعی هست که دوست دارند بدونند مدل های زبانی دقیقاً چطور کار می کنن و هر بخش از معماری چه نقشی در تولید پاسخ نهایی داره.
🔹اگر تا حالا فقط از سرویس هایی مثل ChatGPT، Claude یا Gemini استفاده می کردید و کنجکاوید بدونید پشت این مدل ها چه سازوکاری قرار داره، بررسی این ویدئو و ریپوزیتوی مرتبط با اون میتونه نقطه شروع مناسبی برای ورود به مباحث فنی LLMها باشه. در پایان هم می تونید با بررسی کدهای پروژه، مسیر تبدیل مفاهیم نظری به پیاده سازی واقعی رو مشاهده کنید.
✅خلاصه مطالبی که در این ویدئو بررسی می شوند:
- آشنایی با روند تکامل مدل های زبانی از نسلهای اولیه تا LLMهای مدرن
- درک معماری داخلی مدل های زبانی و نحوه پردازش متن
- آشنایی با مفاهیمی مانند Tokenization، Embedding و Transformer
- بررسی مکانیزم Attention و فرآیند تولید متن توسط مدل
- مروری بر مراحل آموزش، Fine-tuning و همراستاسازی مدل با بازخورد انسانی (RLHF)
- پیادهسازی عملی یک LLM ساده و بررسی ساختار کد پروژه از صفر
🎞مشاهده ویدئو آموزشی:
https://www.youtube.com/watch?v=YmLp8qe87A0
🔗لینک گیتهاب پروژه:
https://github.com/w3cj/how-llms-work
〰️〰️〰️〰️〰️
سلامت باشید و برقرار ✌️
ارادتمند❤️
♾️ علیرضا کاربُر هستم و اینجا درباره کنجکاویهام پیرامون تکنولوژی و کسب و کار مینویسم.
