آموزش مدل 2B با RTX 5090 و فقط چند هزار دلار! مقاله جدید Puro-2B نشان… — VIRSUN — TG.ME

🔥🖥️ آموزش مدل 2B با RTX 5090 و فقط چند هزار دلار!

مقاله جدید Puro-2B نشان می‌دهد Pretraining مدل‌های میلیاردپارامتری لزوماً به دیتاسنترهای میلیون‌دلاری نیاز ندارد.

محققان یک مدل 2B را از صفر، روی GPUهای مصرفی RTX 5090 و تا 1.4 تریلیون Token با FP8 آموزش داده‌اند.

نتیجه جالب: 💰 حدود $4.4K → سطح عملکرد Qwen2-1.5B
💰 کمتر از $6.9K → نزدیک Qwen2.5-1.5B در ارزیابی خود پژوهشگران.

برای کاهش هزینه از ترکیبی از FP8 Training، بهینه‌سازی آموزشی، Curriculum Model Averaging و Data Recipe استفاده شده است.

🔥 نکته مهم‌تر اینکه کد، داده، Recipe آموزشی و وزن‌های مدل نیز منتشر شده‌اند؛ یعنی آزمایشگاه‌های کوچک‌تر هم می‌توانند Pretraining واقعی LLM را تجربه کنند.

[مقاله Puro-2B در arXiv]
(https://arxiv.org/abs/2608.27370

[مدل‌ها در Hugging Face]

(https://huggingface.co/collections/thu-pacman/puro-2b

@rss_ai_ir
❤️ حمایت از کانال:
https://daramet.com/Virsun

#Puro2B #RTX5090 #LLM #Pretraining #OpenSourceAI #هوش_مصنوعی
🙏28❤8👍6🔥6👌4
September 1, 2026 769 9