🔥🖥️ آموزش مدل 2B با RTX 5090 و فقط چند هزار دلار!
مقاله جدید Puro-2B نشان میدهد Pretraining مدلهای میلیاردپارامتری لزوماً به دیتاسنترهای میلیوندلاری نیاز ندارد.
محققان یک مدل 2B را از صفر، روی GPUهای مصرفی RTX 5090 و تا 1.4 تریلیون Token با FP8 آموزش دادهاند.
نتیجه جالب: 💰 حدود $4.4K → سطح عملکرد Qwen2-1.5B
💰 کمتر از $6.9K → نزدیک Qwen2.5-1.5B در ارزیابی خود پژوهشگران.
برای کاهش هزینه از ترکیبی از FP8 Training، بهینهسازی آموزشی، Curriculum Model Averaging و Data Recipe استفاده شده است.
🔥 نکته مهمتر اینکه کد، داده، Recipe آموزشی و وزنهای مدل نیز منتشر شدهاند؛ یعنی آزمایشگاههای کوچکتر هم میتوانند Pretraining واقعی LLM را تجربه کنند.
[مقاله Puro-2B در arXiv]
(https://arxiv.org/abs/2608.27370
[مدلها در Hugging Face]
(https://huggingface.co/collections/thu-pacman/puro-2b
@rss_ai_ir
❤️ حمایت از کانال:
https://daramet.com/Virsun
#Puro2B #RTX5090 #LLM #Pretraining #OpenSourceAI #هوش_مصنوعی

28
8
6
6
4September 1, 2026 769 9