کتاب مبانی ریاضی یادگیری عمیق نویسندگان می‌خواهند از دیدگاه ریاضی… — DeepMind AI Expert — TG.ME

کتاب مبانی ریاضی یادگیری عمیق

نویسندگان می‌خواهند از دیدگاه ریاضی توضیح دهند که چرا شبکه‌های عصبی عمیق با وجود پیچیدگی زیادشان کار می‌کنند. برای این کار، نظریه #یادگیری_عمیق را حول سه ستون اصلی سازمان‌دهی می‌کنند: نظریه تقریب (Approximation Theory)، نظریه بهینه‌سازی (Optimization Theory) و نظریه یادگیری آماری/تعمیم (Statistical Learning Theory).

کتاب ابتدا Gradient Descent، Stochastic Gradient Descent و Backpropagation را از نظر ریاضی بررسی می‌کند و سپس نشان می‌دهد که در برخی شرایط، مخصوصاً زمانی که شبکه بسیار عریض و overparameterized باشد، می‌توان رفتار آموزش را با ابزارهایی مانند Neural Tangent Kernel (NTK) تحلیل کرد. در برخی می‌توان اثبات کرد که الگوریتم بهینه‌سازی به یک minimum جهانی برای خطای تجربی می‌رسد.

همچنین ساختار Loss Landscape بررسی می‌شود تا مشخص شود آیا minimumهای نامطلوب یا saddle pointهایی وجود دارند که الگوریتم آموزش در آن‌ها گیر کند.

چرا شبکه‌های بسیار بزرگ Overfit نمی‌کنند؟


▪️ Mathematical theory of deep learning

#کتاب #منابع #آمار #ریاضی #شبکه_عصبی

☑️ @AI_DeepMind
@AI_Person
👍8❤4🔥3👌1🆒1
August 26, 2026 2.7K 114