Тут речь идет о конкретной функции кластеризации сайтов по тематикам, определении языка (подтверждении скорее, т.к. определяет скрипт), подтверждение стоп-тематик, помочь извлечь доп. мусорные слова определяющие стоп-тематики для пополнения словаря и т.д.
Отправная точка: GPT 5.4 Mini, 0,0013$/запрос.
--
Боевой тест моделей
На выборке в 100 доменов потестил всё, что дешевле или равно по цене GPT 5.4 Mini. Эталоном была прошлая проверка GPT 5.4 Mini + ручной осмотр этих 100 сайтов. В кандидаты для дальнейших тестов попали:
- deepseek-v3.2 - работает медленней и не лучше v4 flash.
- deepseek-v4-flash - отличный вариант, с боевым промтом справился неплохо.
- deepseek-v4-pro - немного лучше v4 flash, но медленней и в несколько раз дороже, прирост вы пару % того не стоит.
- gemini-3.1-flash-lite - reasoning жрет непредсказуемо, а полностью выключить его нельзя. Иногда выходило дороже Mini даже.
- glm-5.2 - неплохой вариант, но слишком "округляет" ответы, мало внимания к деталям, Deepseek отработал лучше.
Увы, они не дотянули до Mini прям сильно. Но решил попробовать с лучшим кандидатом + самым дешевым, но быстрым. И главная ошибка тут - не потестить GPT 5.6 Luna, я что-то забыл про нее совсем. Возможно чуть позже или в других сценариях.
deepseek-v4-flash: в 5 раз дешевле по входу, в 16 по выходу. Переключили, качество просело. Нужно было понять насколько.Увеличил выборку до 2000 доменов, размеченных mini: языки, стоп-тематики, заглушки и т.д. И взялся точить промты.
Что за варианты промптов гонял:
P0 — боевой, как есть. 43 кода тематик, порядок принятия решения, стоп-темы, правила приоритета, границы похожих кодов, правила для заглушек. 11к символов.
P1 — P0 + шапка-контракт: «ты классификатор, только JSON, до 60 токенов, не отказывайся на adult/gambling».
P2 — P1 + правила про мусорные страницы подняты в самое начало, с числовым порогом «меньше 30 слов = заглушка».
P3 — сжатие вдвое: те же решения, выброшены длинные объяснения.
P4 — P3 + три примера готовых ответов (заглушка хостера, escort-страница, японский гестхаус).
P5 — минимум: словарь кодов и 7 правил, 2 978 символов.
P6 — P3 + точечные фиксы: «заглушка ≠ other», «страница от хостера ≠ internet_web», мультикатегорийный магазин = shopping.
--
Результаты первой серии
Все на одних и тех же 2000 доменах. Колонки: тема, заглушки, язык, доля валидного JSON, цена запроса, устойчивость (на скольких доменах три прогона дали один и тот же результат, если меньше 100% - модель отвечала иначе, хоть и похоже, иногда это был лучше вариант, а иногда хуже).
промпт симв тема junk язык JSON $ уст.
mini P0 11159 88% 100% 100% 100% 0.0013 80%
P0 deepseek 11159 70% 90% 95% 95% 0.0002 100%
P1 контракт 11545 70% 85% 95% 100% 0.0003 100%
P2 junk верх 12275 60% 90% 95% 95% 0.0003 100%
P3 сжатый 6386 75% 88% 97% 97% 0.0002 75%
P4 +примеры 7019 75% 98% 95% 98% 0.0002 75%
P5 минимум 2978 70% 90% 95% 95% 0.0001 100%
P6 P3+фиксы 7404 75% 97% 98% 98% 0.0002 70%
▪️ Сжатие промпта вдвое улучшило результат (70% → 75%). Длинные объяснения, написанные под GPT, deepseek только путали.
▪️ Примеры ответов починили заглушки — 88% → 98%. Страницу в 98 символов модель раньше принимала за живой сайт.
▪️ Контракт вывода убрал обрывы. Reasoning-модель обрывала JSON на середине на adult-страницах: рассуждения съедали лимит токенов.
▪️ Перенос правил про мусор в начало уронил тему до 60% — модель цеплялась за проверку на заглушку и дальше решала хуже.
--
Еще 5 тестов и сравнение с лучшими
P7 — к каждому из 43 кодов дописал 4 реальные ниши из нашего реестра.
P8 — «сначала улики»: модель обязана выписать 3–6 слов прямо со страницы, и только потом выбрать код.
P9 — «два кандидата»: сначала два подходящих кода, потом выбор победителя, причём «развлечения», «покупки» и «другое» проигрывают второму кандидату.
P10 — сначала тип страницы (магазин / блог / компания / медиа / каталог / заглушка), потом тема; жёсткий запрет уходить в «другое».
P11 — словарь сгруппирован в 6 блоков (стоп-темы, дом, деньги, тело и разум, техника, досуг): сначала блок, потом код внутри.
промпт симв тема junk язык JSON $ уст.
P7 словарь 14927 73% 95% 95% 97% 0.0002 75%
P8 улики 7762 60% 80% 90% 90% 0.0002 100%
P9 кандидаты 7648 77% 97% 98% 100% 0.0002 75%
P10 тип стр. 8021 75% 85% 95% 95% 0.0002 100%
P11 дерево 7757 70% 90% 95% 95% 0.0002 100%
Гипотеза «дать подробнее нашу таксономию» не подтвердилась. P7 — 73%, хуже голого списка кодов и в полтора раза дороже. Примеры работают как шум: модель подгоняет страницу под знакомую формулировку вместо того, чтобы читать содержимое. Отдельно проверили версию без русских вкраплений, целиком по-английски — на flash тот же результат, 79%, только заглушки подтянулись до 99%.
Победил P9: 77% темы, 100% валидного JSON. Он всё равно хуже Mini, но вопрос цены при одинаковой скорости и стабильности - в 7 раз на боевых тестах. Подогнав промты удалось выжать + 7% точности тематики и мусора, 8% точности языка и снизить стоимость на 20%. Безусловно, если вы в день делаете несколько тысяч запросов - я бы оставался на Mini, но на объемах - разница в цене в 7 раз, это больно 😁
промпт симв тема junk язык JSON $ уст.
mini P0 11159 88% 100% 100% 100% 0.0013 80%
P9 кандидаты 7648 77% 97% 98% 100% 0.0002 75%















