Модель стала экономнее и тратит меньше токенов, но этот выигрыш перекрывает более высокая цена. Галлюцинирует Astra реже, зато хуже справилась с частью тестов на научные и рабочие задачи и на анализ длинного контекста.
В отдельном индексе кодинг-агентов прирост заметнее, хотя до лидерства далеко. При этом первые тестеры от GPT-6 в восторге.
В чем проблема?
❤️ — в бенчмарках
🤣 — в модели




