Давненько мы с вами не виделись. Загрузка сейчас довольно большая, особенно на курсе — мы со студентами заканчиваем модуль по Apache Spark (тому самому, который не любят все дата-инженеры 😅)
До конца недели можно досдать практическое задание (построить витрину данных, представляющую собой набор агрегатов по месяцам на основе лога таможни), и мы уже переходим к реляционным базам данных.
И раз уж тема зашла про спарк — принес вам крутой кейс от сбера по работе с таблицами с сотнями терабайт данных:
Ребятам удалось сократить процесс обновления с 9-12 часов до 30-40 минут — это точно стоит почитать

