Наши дата-инженеры задали себе этот вопрос, когда начали масштабировать LLM-разметку на большие объемы данных.
Так появился llm_markup — универсальный Spark-инструмент, который берет на себя батчинг, параллельные запросы к LLM API, контроль нагрузки, повторы и валидацию ответов.
Инженер по работе с большими данными Дима Иванов рассказывает о том, как это устроено — на примере оценки качества поиска и классификации отзывов.
Но llm_markup этим не ограничивается и подходит для разных задач массовой LLM-обработки. Главное, чтобы их можно было описать источником данных, промптом и форматом ответа.
✨ Читать на Хабре
#LaTech_habr








