⚡️نسخه PyTorch 2.14؛ Fault Tolerance واقعی برای Distributed Training
در نسخه PyTorch 2.14 تحمل خطا بهصورت جدی وارد c10d شده است. قبلاً خرابی یک Rank در Jobهای بزرگ معمولاً یعنی نابودی Process Group، راهاندازی مجدد و از دست رفتن بخشی از وضعیت گرمشده کل کلاستر.
حالا Backend و ProcessGroup APIهایی برای reconfiguration درجا دارند؛ یعنی میتوان گروه را بدون ریاستارت کامل Distributed Runtime بازسازی کرد.
اضافهشدهها شامل in-place reconfiguration، abort hooks، pre/post collective hooks و پشتیبانی Fault Tolerance در Gloo در کنار nccl2 است. این تغییر برای Trainingهای بزرگ مهم است، چون هرچه کلاستر بزرگتر باشد، هزینه یک Restart کامل هم بیشتر میشود.
⚠️ فعلاً این APIها unstable علامت خوردهاند و ممکن است در نسخههای بعدی تغییر کنند.
[جزئیات انتشار PyTorch 2.14]
(https://pytorch.org/blog/pytorch-2-14-release-blog/
@rss_ai_ir
❤️ حمایت از کانال: [Daramet]
(https://daramet.com/Virsun
#PyTorch #DistributedTraining #FaultTolerance #DeepLearning #NCCL #Gloo #MachineLearning #هوش_مصنوعی

29
10
9
3September 4, 2026 806 7