Архитектура MoE:
- 770B параметров всего
- 49B активны на токен
- контекст до 1 млн токенов
- упор на coding, agentic-задачи и продуктивность
Использует Gated DeepSeek Sparse Attention + IndexCache, чтобы удешевить длинный контекст и переиспользовать sparse-индексы между слоями.
Tencent позиционирует Hy4 как frontier-level open model с доступной стоимостью запуска.
Apache 2.0
https://huggingface.co/tencent/Hy4-preview
@ai_machinelearning_big_data
#Tencent





