gemini 3.5 flash — самый провальный релиз за последнее время да, это… — катафейка — TG.ME

gemini 3.5 flash — самый провальный релиз за последнее время

да, это уже все знают. но кроме соотношения цены/качества, странной выдачи — ничего не обсуждают массово. мне бы хотелось засветить упущенные моменты многими и попытаться разобраться — что случилось.

самая главная претензия у всех — цена.
модель стоит больше чем все прошлые модели, но на большинстве бенчмарков хуже, чем gemini 3.1 pro.
как по мне, у этой модели не должно быть цели затмить 3.1 pro, ведь это flash версия, а не pro.
по поводу цены — мне кажется, гугл ранее давал доступ к своим моделям в минус, в позапрошлом посте было вскользь сказано про кол-во параметров у моделей gemini и у них больше всего параметров. это значит, что, вероятнее всего, модели gemini обходятся компании дороже, чем другим компаниям давать доступ к их моделям. тогда гугл решил повысить цену, чтобы элементарно окупать затраты.

зачем гугл выпустили эту модель?
если взглянуть, то на самом деле в некоторых бенчмарках у ArtificialAnalysis набирает намного больше, чем gemini 3.1 pro, а в некоторых — наоборот.
где модель лучше/хуже, чем gemini 3.1 pro?
+ GDPval-AA - бенчмарк на агентность и реальный мир.
+ APEX-Agents-AA - агентный бенчмарк.
- Terminal-Bench - программная инженерия.

итог:
+ Agentic index - на 11 очков больше, чем у gemini 3.1 pro.
- Coding index - на 10 очков меньше, чем у gemini 3.1 pro.
то есть модель лучше в агентских задачах, но заметно хуже в остальных задачах. кажется, что гугл пытается исправить главную жалобу на все их предыдущие модели - плохая агентность и вызов инструментов. возможно, gemini 3.5 pro будет моделью для кодинга, а gemini 3.5 flash помощник для агентских задач.

мышление. то, о чем никто не говорит.
только известный в "узких" кругах благодаря своему ютуб-каналу Theo упомянул про проблему размышления:
I'm not convinced that DeepMind ever actually figured out how reasoning works.
The models have been useless since they introduced it.
————
Я не уверен, что DeepMind когда-либо действительно разбирались в том, как работает мышление.
Модели стали бесполезны с момента выхода этой функции
via X


- так что с мышлением?
в UGI-Leaderboard такая ситуация:
Модель |NatInt|Txtbook|WrldModel|Writing|AvgChar|
high |68.98-|78.98- | 67.95+ | 69.71-| 13123 |
medium |72.42+|80.75 | 65.47 | 72.54+| 10636 |
low |71.12 |82.97 | 58.33- | 72.44 | 6597 |
minimal|72.31 |83.82+ | 63.79 | 72.47 | none |

эти результаты не поддаются никакой логике, усиленное мышление ухудшает качество текста, кода, фактов. единственное улучшение — понимание реального мира.
казалось бы, количество символов в мышлении (AvgChar) увеличилось, но модель деградирует. да, результаты разнятся на 1-4 балла, но если рассматривать в этом ключе, то мышление не улучшает модель все равно и это пустая трата токенов.
эта небольшая разница между режимами мышления происходила со всеми моделями от гугл, от 2.5 до 3.1. у конкурентов такой проблемы нет.

забавный вывод: выключайте мышление в моделях от google, чтобы не тратить лишние деньги на токены.
❤4👎4👍1
May 26, 2026 757 29 1