در مدل های اخیر تر مانند GEPA یک شیفت جالب اتفاق افتاده است. به جای آنکه پارامتر ها را تغییر دهیم سه مدل زبانی با نقش های مختلف ساخته می شوند. یک «تولید کننده» (generator) زنجیره ی افکار که نمونه های مختلفی می سازد. یک داور Judge که به هر مسیر یک امتیاز بر اساس نتیجه و دنباله می دهد. و در نهایت یک «اندیشمند»( reflector) که مسیر ها و امتیاز ها را در نظر میگیرد و بر اساس آن ها یک اصلاح بر پرامپت اولیه (initial prompt) ایجاد می کند! دنباله ی این تغییرات به تدریج به بهتر کردن Generator منجر می شود!
در قسمت قبل دیدیم که مدل های زبانی می توانند رفتار های به کلی متفاوت و حتی مجموعه ی توانمندی ها (skillset) مختلف داشته باشند. در اینجا سه نقش «تولید کننده»، «داور» و «متفکر» در کنار هم یک مساله ی بهینه سازی را حل می کنند بدون آنکه در تغییر پارامتر ها درگیر شوند. این «یادگیری» در متن با حرکت بین این نقش ها مسیری است که اهمیت بیشتر و بیشتری خواهد یافت چرا که بسیار بهینه تر و در یک مدیوم بسیار غنی تر (خود زبان) حرکت می کند که براحتی می تواند کمبود های مدل های پایه را رفع کند و چارچوب جالب تری برای یادگیری را به پژوهشگران نشان دهد.
July 18, 2026 224 1