برای بررسی کیفیت عملکرد مدل، میزان دقت آن در شناسایی شدت نارسایی میترال را با ارزیابیهای کاردیولوژیستهای خبره مقایسه کردند. آنها از دو معیار اصلی استفاده کردند:
- کاپای وزنی (κ): این یک آمار است که نشان میدهد چقدر نتایج مدل با ارزیابیهای کاردیولوژیستها همخوانی دارد. مقدار بالاتر به معنای توافق بهتر است.
- ناحیه زیر منحنی مشخصه عملکرد گیرنده (AUROC): این معیار نشان میدهد مدل چقدر خوب میتواند بین سطوح مختلف شدت نارسایی میترال تمایز قائل شود. مقدار بالاتر AUROC نشاندهنده دقت بیشتر مدل در پیشبینی صحیح است.
آنها به انواع مختلف نارسایی میترال نگاه کردند تا ببینند آیا مدل عملکرد متفاوتی دارد یا خیر. مثلاً بررسی کردند که آیا مدل در تشخیص نارسایی میترال اولیه نسبت به نارسایی میترال ثانویه یا انواع مختلف آن (مانند نارسایی میترال اگزانتریک) بهتر یا بدتر عمل میکند.
این کار کمک میکند تا بفهمند آیا مدل برای تمامی انواع نارسایی میترال به طور یکسان عملکرد خوبی دارد یا نیاز به بهبود در برخی زمینهها دارد.
موارد ناهماهنگ موقعیتهایی هستند که ارزیابی شدت نارسایی میترال توسط مدل یادگیری عمیق با ارزیابیهای کاردیولوژیستهای خبره مطابقت ندارد. به عبارت دیگر، بین آنچه مدل میگوید و آنچه کارشناسان انسانی میگویند، اختلاف نظر وجود دارد.
برای این موارد ناهماهنگ، جایی که نظرات مدل و کاردیولوژیستها همراستا نبود، یک گروه متخصص به دقت این موارد را بررسی کرد. کارشناسان این موارد را بررسی کردند تا بفهمند چرا اختلاف نظر وجود دارد و ببینند آیا پیشبینیهای مدل دقیق است یا مشکلاتی وجود دارد که باید برطرف شوند.
با تحلیل این موارد، محققان میتوانند الگوها یا اشتباهات احتمالی مدل را شناسایی کنند. این کمک میکند تا عملکرد مدل بهبود یابد و مطمئن شود که مدل قابل اعتماد است.
آپتودیت هوش مصنوعی پزشکی
#آموزشی
#پژوهشی
#محتوای_اختصاصی

