🔥 За одну неделю вышло сразу 6 интересных open-weight моделей
Пока все ждут веса Kimi K3 и Ling 3.0, в LLM Architecture Gallery Себастьяна Расчки появилось несколько свежих архитектур.
1. Nanbeige 4.2 3B
Всего 3B non-embedding параметров, но используется Looped Transformer: один и тот же стек слоёв проходит дважды. Больше эффективной глубины без удвоения весов.
https://huggingface.co/Nanbeige/Nanbeige4.2-3B
2. Laguna S 2.1
118B MoE, только 8B активных параметров, 48 слоёв и контекст 1M токенов. Сделана Poolside с упором на coding agents и длинные задачи.
https://huggingface.co/poolside/Laguna-S-2.1
3. Motif-3-Beta
Огромный 314B-A13B MoE: 384 routed experts, 8 активируются на токен, контекст 256K.
https://huggingface.co/Motif-Technologies/Motif-3-Beta
4. Solar Open 2
250B-A15B MoE от Upstage с 1M контекстом. Архитектура чередует три linear-attention слоя с одним обычным softmax-attention слоем. Модель рассчитана на длинные agentic workflows.
https://www.upstage.ai/blog/en/solar-open-2
5. Antares 1B
Компактная security-модель Cisco для анализа репозиториев и поиска потенциально уязвимого кода. Основана на Granite и дообучена под agentic terminal workflows.
https://huggingface.co/fdtn-ai/antares-1b
6. BTL-3
Rank-32 LoRA для Qwen3.6-27B, заточенная под coding agents и tool calling. Авторы заявляют 95,1% HumanEval и 88,5% BFCL v4 AST.
https://huggingface.co/badtheorylabs/BTL-3
Полная галерея архитектур:
https://sebastianraschka.com/llm-architecture-gallery/
@Python_Community_ru

huggingface.co
Nanbeige/Nanbeige4.2-3B · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
July 27, 2026 584 7