بیاید اطلاعاتی که تا الان پیدا کرده رو با Dn نشون بدیم، یعنی: Dn=a1,q1,a2,q2, ...,an,qn اکیناتور P(C|Dn) رو داره. از خودش میپرسه: "حالا من اگر سوال q رو بپرسم، به چه احتمالی چه جواب aای دریافت میکنم؟" یعنی میخواد توزیع P(A|q,Dn) رو بدونه. اگر روی c جمع بزنیم: P(A=a|q,Dn)=∑P(A=a|c,q)P(c|Dn) این رو لیترالی همینجوری بخونید! به ازای هر آبجکت c اکیناتور میدونه که جواب a چقدر محتمله که همون P(a|c,q) هست (در دیتابیسش ذخیره شده)، و اکیناتور الان اعتقاد داره که آبجکت تقریبا چیه که همون P(c|Dn) هست. ضرب کنید جمع بزنید! خب. به من چه؟ مسأله اینه که اکیناتور باید همون "کدوم سوال بیشترین اطلاعات رو به من میده؟" استفاده کنه؛ درواقع باید از آنتروپی استفاده کنه. عدم قطعیت اکیناتور راجعبه C (چقدر غیرمطمئنه که C چیه)، تا به اینجا که اطلاعات Dn رو داره، به شکل زیر نمایش داده میشه که جمع روی c هست: H(C|Dn)=-∑P(c|Dn) log P(c|Dn) (همون قضیهی آنتروپی شنون و این حرفا.) وقتی میخواد سوالی مثل q بپرسه، نمیدونه چه جوابی مثل a دریافت خواهد کرد، اما میتونه حدس بزنه که به ازای "هر" جوابی که دریافت کنه، چقدر عدم قطعیتش پایین میاد؛ درواقع، به دیتای Dn (که تا الان شامل سوالها و جوابها بوده)، فقط یه سوال q اضافه میکنیم و میپرسیم که چقدر از عدم قطعیت اکیناتور راجعبه C کم شده؟ یعنی محاسبهی آنتروپی زیر که جمع روی a هست (چون به ازای هر جواب ممکن داره میبینه چقدر ممکنه عدم قطعیتش کاهش پیدا کنه): H(C|q,Dn)=∑P(a|q,Dn)H(C|a,q,Dn) دقت کنید که همهی پارامترهای مذکور رو داریم! :) پس حالا، یه مرور کنیم؛ اکیناتور تا اینجا که nتا سوال پرسیده و nتا جواب دریافت کرده، عدم قطعیت H(C|Dn) داره. این عدد هرچقدر بزرگتر باشه، اکیناتور "نامطمئنتر" هست که آبجکت چیه. پس از پرسیدن سوال q، عدم قطعیتی به شکل H(C|q,Dn) داره، که انتظار داریم این عدد قطعا کوچیکتر از H(C|Dn) باشه چون بالاخره داره یه سوال دیگه جواب میده. مسأله اینه که، کدوم سوال q هست که اختلاف این دوتارو کوچکترین خودش بکنه؟ اینجا مفهومی تحت عنوان بهرهی اطلاعات یا Information Gain به وجود میاد: چقدر اطلاعات با آزمایشم (در اینجا، سوال پرسیدنم) به دست آوردم؟ یعنی: G=H(C|Dn)-H(C|q,Dn) و G هرچقدر بزرگتر، عدم قطعیت ما در ادامه کمتر. بدینترتیب، اکیناتور میگرده qای رو پیدا میکنه که G رو بیشینه کنه، و همون سوال رو میپرسه، و ادامه میده، تا زمانی که توزیع اصلی P(C|Dn) به ازای یک c در C انقدر بزرگ بشه که مطمئن بشه "عه خب، آبجکت مذکور قطعا پنکهست!"
بیاید اطلاعاتی که تا الان پیدا کرده رو با Dn نشون بدیم، یعنی… — azimy's digital diary. — TG.ME
August 12, 2026 714 9