В мире больших данных мы все чаще сталкиваемся с терминами «data lake» и «data swamp». И если первый хорошо знаком большинству инженеров и аналитиков, то второй нередко остается за завесой неопределенности.
Data Swamp — это «заболоченное» хранилище данных, в котором информация накапливается хаотично, без должной структуры и управления. В отличие от data lake, который представляет собой управляемое и четко организованное хранилище, data swamp — это беспорядок, в котором крайне сложно искать нужные данные.
Причины возникновения data swamp:
отсутствие систематизации и каталогизации данных хаотичная загрузка данных без контроля качества и проверок разрозненная структура данных, отсутствие общих стандартов и правил