Чем грузить? Приветик моим дата инженерным подписчикам. Сегодня я… — Ваня инженер 🇸🇪 — TG.ME

Чем грузить?

Приветик моим дата инженерным подписчикам. Сегодня я расскажу вам про свою боль.

Живём мы в 2026 году, LLM-ки все переписывают на раст, клод находит мифического масштаба цепочки уязвимостей в софте, а дата инженеры тем временем что? Продолжают грузить таблички в Data WareHouse раз в день шелл скриптами.

И когда у меня встал вопрос, чем же грузить таблички в DWH у нас в Hemnet, я призадумался:

Spark — хорош, но админить его и искать, какие там джарники и куда ему надо подсунуть, чтобы заработал коннектор, — бесит
dlt — вроде как новая хипстерская штука, обещающая превосходный DX, на поверку оказалась дырявым корытом, которое пока не залатаешь, не поплывёт
Fivetran — ничего сказать не могу, не пробовал, но как минимум это менеджед сервис без опенсорсной альтернативы
Airbyte — деплоить целую кучу сервисов просто чтобы гонять батч джобы, это, конечно, выдающийся пример оверинжиниринга (а потом дебажить, когда один из них отвалился, ага)
Pandas/Polars — да выдаст господь пару терабайт оперативки людям, которые пользуют Pandas для перегрузки данных. Впрочем, API у него удобный, этого не отнимешь. Polars в плане памяти получше, но это все равно не ETL тул.

А чем пользуетесь вы для загрузки, и удобно ли вам? Может, мои представления устарели, и появилось новое, стало лучше старое?
❤10🔥1
August 20, 2026 616 29 6