Подведомственное учреждение Росстата опубликовало вакансию, связанную с построением LLM под нужды Росстата, причем с развилкой - обучение модели с нуля или адаптация существующей модели. На практике развилка иллюзорна. Обучение LLM с нуля - огромные затраты на GPU (вычислительные ресурсы), разметку и подготовку корпуса текстов. Оптимально использовать и дообучать существующие открытые модели под конкретные задачи.
В описании упоминается, что задачи LLM в Росстате - генерация документов, смысловой поиск, вопросно-ответные системы, классификация, суммаризация. Задачи очень общие, но в ключе того, что сейчас делают статистические ведомства в мире (хотя разработки на порталах пока не доступны):
1) семантический поиск и генеративный ответ. Как правило, это поиск на основе метаданных, онтологий и векторных эмбеддингов с доступом через интерфейс и API. Например, в StatsChat от британского ONS веб‑страницы разбиваются на фрагменты, фрагменты переводятся в векторные эмбеддинги, и по запросу пользователя проводится поиск по базе. Результаты передаются в LLM (Flan‑T5‑Large), которая формулирует ответ только на их основе, не придумывая новые факты.
2) данные по запросу на естественном языке (text-to-SQL). Швейцарские статистики разрабатывают чат‑бота Statbot.Swiss. Пользователь задаёт вопрос на естественном языке («Сколько электрических автомобилей в Цюрихе?»), после чего система конвертирует запрос в SQL, извлекает данные из портала, строит графики и выдаёт структурированный ответ.
Аналогично проектируется IMF StatGPT - это перевод запроса пользователя в запросы к официальным API для получения статистики из баз данных, потому что ChatGPT “из коробки” при запросе экономических показателей правильно отвечает в среднем лишь в 34% случаев. AI агент класса text-to-SQL скоро будет на www.sberindex.ru.
3) автоматическая классификация и перевод кодов на новые версии классификаций. Национальный институт статистики и экономических исследований Франции Insee переводит коды экономической деятельности с NACE Rev 2 на новую NACE 2025. LLM получает список допустимых кодов и их описания, анализирует описание деятельности предприятия и выбирает подходящий код.
ClassifAI от ONS строит эмбеддинги для описаний кодов классификаций, с их помощью подбирает несколько подходящих кодов для текста (например, описания вакансии или деятельности), обращается к LLM (Gemini‑Pro) для выбора лучшего кода. Может задать уточняющий вопрос.
4) Редактирование и генерация метаданных. Банк международных расчётов BIS сделал «BIS Metadata AI Editor»на основе SDMX: статистик загружает файл метаданных, приложение генерирует исправленный дополненный вариант, дальше можно принять, отклонить или отредактировать результат.
5) Перевод кода на свободные языки программирования. Статистическое управление Ирландии разработало «SAS‑to‑R Transcompiler» на базе GPT‑4, который автоматически переводит код SAS в R, облегчая переход на открытое ПО.
6) Генерация аналитических документов. Национальный институт статистики и географии Мексики INEGI сделал прототип, в котором LLM генерирует аналитические отчёты на основе внутренних данных. Процесс состоит из 4 этапов: определить набор экономических индикаторов, получить индикаторы через API, передать результаты модели (Mixtral 8×7B) для интерпретации и сформировать текст отчёта. Все расчёты выполняются внешними скриптами, не LLM, то есть вычисления контролируемые.
Также статистики экспериментируют с таргетированной коммуникацией для разных групп пользователей, генерацией синтетических данных, аннотированием выбросов (привязка к событиям).
Всё это строится на открытых моделях, при этом даже важнее не сама LLM, а связка между AI и проверенными данными. Именно эту задачу пытается решить инициатива Global Trusted Data Commons: AI‑readiness для официальной статистики предполагает:
- использование стандарта SDMX, обогащенное описание метаданных (позволит устанавливать соответствие между, например, инфляцией и ИПЦ)
- открытые API, чтобы модели могли запрашивать статистику напрямую у первоисточника и обеспечивать неизменную точность.