نویسندگان میخواهند از دیدگاه ریاضی توضیح دهند که چرا شبکههای عصبی عمیق با وجود پیچیدگی زیادشان کار میکنند. برای این کار، نظریه #یادگیری_عمیق را حول سه ستون اصلی سازماندهی میکنند: نظریه تقریب (Approximation Theory)، نظریه بهینهسازی (Optimization Theory) و نظریه یادگیری آماری/تعمیم (Statistical Learning Theory).
کتاب ابتدا Gradient Descent، Stochastic Gradient Descent و Backpropagation را از نظر ریاضی بررسی میکند و سپس نشان میدهد که در برخی شرایط، مخصوصاً زمانی که شبکه بسیار عریض و overparameterized باشد، میتوان رفتار آموزش را با ابزارهایی مانند Neural Tangent Kernel (NTK) تحلیل کرد. در برخی میتوان اثبات کرد که الگوریتم بهینهسازی به یک minimum جهانی برای خطای تجربی میرسد.
همچنین ساختار Loss Landscape بررسی میشود تا مشخص شود آیا minimumهای نامطلوب یا saddle pointهایی وجود دارند که الگوریتم آموزش در آنها گیر کند.
چرا شبکههای بسیار بزرگ Overfit نمیکنند؟
▪️ Mathematical theory of deep learning
#کتاب #منابع #آمار #ریاضی #شبکه_عصبی
☑️ @AI_DeepMind
✅ @AI_Person





