#llms
"Публичные бенчмарки помогают увидеть общую картину, но плохо предсказывают, как модель поведёт себя в конкретном продукте. На реальных данных и task-specific метриках расстановка сил между моделями может заметно меняться: одни хуже работают с доменной терминологией, другие не выдерживают нужный формат ответа, третьи дают приемлемое качество, но выигрывают по стоимости или снижают зависимость от внешнего провайдера."
https://youtu.be/ES6TgMywx6g
YouTube
Олег Бобриков. От публичных бенчмарков к модельной стратегии:как выбирать LLM для продуктов компании
Публичные бенчмарки помогают увидеть общую картину, но плохо предсказывают, как модель поведёт себя в конкретном продукте. На реальных данных и task-specific метриках расстановка сил между моделями может заметно меняться: одни хуже работают с доменной терминологией…

July 31, 2026 99 2