Skill.md ni endi o'qitsa bo'ladi
Skill.md - odam tomonidan qo'lda yoziladi va ko'pincha o'zgaradi, u haqattan ham to'g'ri natija beryaptimi yoki boshqa joyini buzdimi? uni aniqlash qiyinroq.
Microsoft Research jamoasi bunga yechim sifatida neyron tarmoqlarni oʻqitish (training) metodologiyasini oddiy text fayllarga olib kiribdi va SkillOpt freymvorkini taqdim etibdi.
SkillOpt qanday ishlaydi?
Tizim til modelining (LLM) oʻzini oʻzgartirmaydi (vaznlarga weights tegmaydi). U model boshqaradigan koʻrsatmalar matnini (skill.md) xuddi neyron tarmoq kabi oʻqitadi:
1. Rollout (Sinov va Ijro):
Agent joriy promt (skill) yordamida berilgan vazifalarni bajarib ko'radi. Barcha muvaffaqiyatli va muvaffaqiyatsiz urinishlar (trajektoriyalar) va ularning natijalari tizim tomonidan yozib boriladi.
2. Reflect (Tahlil va Mulohaza):
Maxsus optimizer-LLM ishga tushadi. U muvaffaqiyatli va muvaffaqiyatsiz bo'lgan natijalar partiyasini (minibatches) sinchiklab tahlil qiladi va qaysi so'zlar yoki usullar foyda berganini, qaysilari esa agentni adashtirganini aniqlaydi.
3. Edit (Tahrirlash va Filtr):
Tizim matn ichiga yangi qoidalar qo'shish (add), eskilarni o'chirish (delete) yoki almashtirish (replace) operatsiyalarini tayyorlaydi. Belgilangan o'zgarishlar limiti (budget) doirasida eng yaxshi o'zgartirish variantlari birlashtiriladi va reytinglanadi.
4. Gate (Tekshiruv):
Yangi tayyorlangan promt darhol production'ga chiqarilmaydi. U alohida tekshiruv testidan (held-out selection) o'tkaziladi. Agar yangi promt agentning umumiy aniqligini oshirsa — saqlab qolinadi, aks holda rad etilib, eski barqaror versiyaga qaytiladi.
Batafsil






