В основе современный Transformer decoder, дополненный несколькими лёгкими механизмами для повышения стабильности обучения и эффективности на небольшом масштабе:
- Grouped-Query Attention (GQA): 8 query heads / 2 KV heads
- Per-head QK-Norm перед вычислением attention scores
- Content-dependent scalar gates на residual-ветках Attention и MLP
Архитектура построена поверх Hugging Face Mistral, при этом attention и decoder layers заменены собственной реализацией Q-Project.
Весь pretrain был проведён на одной NVIDIA Tesla V100 16GB SXM2. Для меня это в том числе эксперимент в том, насколько далеко можно зайти в обучении собственных архитектур на относительно доступном железе.
🔗 Модель: https://huggingface.co/q-project/Q-50M-Base
⚖️ Лицензия: apache-2.0
Если хотите поддержать дальнейшие эксперименты и обучение более крупных версий Q-Project, буду благодарен за помощь со сбором на GPU
❤️ Поддержать проект: https://tbank.ru/cf/8ePhMsJklEX



