Перед началом эксперимента мне казалось, что результат будет примерно… — Исаев Василий - заметки про it, python и ai — TG.ME

Перед началом эксперимента мне казалось, что результат будет примерно одинаковым или чуть лучше у маленьких моделей с высоким уровнем рассуждений, но на моих задачах получилось довольно неожиданно.

Кейс 1: внести небольшие правки в код. Качество одинаковое, но Terra закончила задачу за 54 секунды, а Luna за 134 секунды. Terra использовала 111k токенов, а Luna 211k.

Кейс 2: большая задача по изменению бизнес-логики в среднем сервисе. Terra High 6,83/10, Sol Low 9,50/10. Sol Low оказался качественнее, быстрее и потратил в 2,5 раза меньше токенов.

Кейс 3: большая задача. Написать большой сервис, включая Bluetooth-логику и математику. По качеству результаты оказались довольно близкими, но Luna даже не стала запускать рантайм. Luna High 5,70/10, Sol Medium 6,63/10.

Какой тут можно сделать вывод?
Похоже, что небольшие модели имеют смысл только с low/medium уровнем рассуждений. Всё-таки лучше взять модель побольше, но с меньшим уровнем рассуждений. Она работает быстрее и дешевле.

Также есть вопросы к передовым моделям, например, к Soul 5.6 Ultra. Возникает ощущение, что они чуть лучше показывают себя на бенчмарках, а в реальных задачах не дают настолько большого прироста пользы. Но это уже тема отдельного поста.
1🤔4❤1
August 22, 2026 104