пост в основном про 3 модели : Kimi-K2.6, Deepseek-V4-Pro… — катафейка — TG.ME

пост в основном про 3 модели : Kimi-K2.6, Deepseek-V4-Pro, MiMo-V2.5-Pro (немного про GLM-5.1 и Minimax-M2.7).

у каждой из них свыше триллиона параметров — это около 2 терабайт, если говорить про вес. по моему мнению это лучшее что есть в открытом доступе, а в ряде задач они объективно сильнее gpt-5.5 и claude-opus-4.7. при этом параметров у проприетарных моделей на самом деле примерно столько же — в ~1-6 раз больше.

вот таблица с примерным количеством параметров проприетарных моделей. составлена на основе arxiv с поправками из lesswrong:
• gemini-3.1-pro — 4.65t
• gemini-3-flash — 2.53t
• gpt-5.5 — 1.46t
• gpt-5 — 1.33t
• opus-4.7 — 1.13t
• grok-4.20 — 0.77t
• sonnet-4.6 — 0.66t
• grok-4.3 — 0.5t


со второй половины 2025 и до сих пор закрытые модели не показали большого отрыва от открытых — хотя у американских компаний намного больше вычислительных мощностей и исследовательских ресурсов. разрыв на бенчмарках в среднем ~10%. claude и gpt иногда лучше в реальной работе, но ошибочно думать, что все китайцы фокусируются на бенчмарках.

не стоит доверять ни бенчмаркам, ни маркетингу закрытых моделей. впрочем, доверять китайцам, которые публикуют не только размер, но и процесс обучения, тоже не стоит — реальную информацию по делу они пишут не всегда. на данный момент самая прозрачная команда — это deepseek-v4, тут без вопросов. на втором месте kimi. у glm и qwen дела тоже неплохи. у mimo стратегия догоняющая, а вот у minimax всё не очень — модель плохо справляется с задачами, которые не заточены на кодинг, хардкодит ответы и имитирует формат. как многие замечают, minimax — довольно небольшая модель, но баллы на бенчмарках набирает уверенно. на самом деле для своего веса в 230b параметров база знаний у неё маленькая: даже не вместила гимн россии, в то время как куда более скромная gemma4 на 31b параметров запросто выдаёт точный текст.

я без исключений рекомендую попробовать китайские модели всем, кто раньше пользовался только закрытыми — а именно claude, gpt, gemini.

почему? у китайских моделей принципиально другой процесс обучения. именно из-за этого они в ряде задач справляются лучше.

а теперь про сами модели:
kimi-k2.6 хорошо ориентируется в мире благодаря knowledge data rephrasing — обучению, при котором факт из датасета не просто скармливается модели, а переписывается в разных стилях. за счёт этого kimi неплохо решает задачи, требующие осознания фактов, и по той же причине хорошо следует инструкциям.

deepseek-v4-pro хорошо пишет креативный текст. но в отличие от claude, в процессе обучения deepseek генерирует несколько вариантов решения и прогоняет тесты — лучшие идут в плюс, худшие в минус. поэтому модель может хорошо оптимизировать архитектуру вашего проекта — лучше чем тот же claude, который награждается за самый правильный, безопасный и подходящий ответ. так же устроены и остальные американские модели: их учат тому, как должен выглядеть правильный ответ. а deepseek учат другому — как пройти несколько тестов и остаться с правильным решением.

mimo-v2.5-pro использует уникальную пост-тренинг парадигму mopd. в ней модель учится у нескольких «учителей» одновременно, причём награду получает на каждом токене, а не только за финальный результат. на части бенчмарков модель входит в топ-3 после gpt и claude.

стоит упомянуть и glm-5.1 как хорошую модель — хотя чувства к ней смешанные. как мне кажется, glm тренируют на бенчмарках, хоть прямых доказательств этому и нет. впрочем, в мире модель ориентируется хорошо, как и kimi — где-то обходит её, где-то уступает.
May 9, 2026 533 27