نسخه PyTorch 2.14؛ Fault Tolerance واقعی برای Distributed Training در… — VIRSUN — TG.ME

⚡️نسخه PyTorch 2.14؛ Fault Tolerance واقعی برای Distributed Training

در نسخه PyTorch 2.14 تحمل خطا به‌صورت جدی وارد c10d شده است. قبلاً خرابی یک Rank در Jobهای بزرگ معمولاً یعنی نابودی Process Group، راه‌اندازی مجدد و از دست رفتن بخشی از وضعیت گرم‌شده کل کلاستر.

حالا Backend و ProcessGroup APIهایی برای reconfiguration درجا دارند؛ یعنی می‌توان گروه را بدون ری‌استارت کامل Distributed Runtime بازسازی کرد.

اضافه‌شده‌ها شامل in-place reconfiguration، abort hooks، pre/post collective hooks و پشتیبانی Fault Tolerance در Gloo در کنار nccl2 است. این تغییر برای Trainingهای بزرگ مهم است، چون هرچه کلاستر بزرگ‌تر باشد، هزینه یک Restart کامل هم بیشتر می‌شود.

⚠️ فعلاً این APIها unstable علامت خورده‌اند و ممکن است در نسخه‌های بعدی تغییر کنند.

[جزئیات انتشار PyTorch 2.14]
(https://pytorch.org/blog/pytorch-2-14-release-blog/

@rss_ai_ir
❤️ حمایت از کانال: [Daramet]
(https://daramet.com/Virsun

#PyTorch #DistributedTraining #FaultTolerance #DeepLearning #NCCL #Gloo #MachineLearning #هوش_مصنوعی
🙏29🔥10👍9❤3
September 4, 2026 806 7