Чем грузить?
Приветик моим дата инженерным подписчикам. Сегодня я расскажу вам про свою боль.
Живём мы в 2026 году, LLM-ки все переписывают на раст, клод находит мифического масштаба цепочки уязвимостей в софте, а дата инженеры тем временем что? Продолжают грузить таблички в Data WareHouse раз в день шелл скриптами.
И когда у меня встал вопрос, чем же грузить таблички в DWH у нас в Hemnet, я призадумался:
• Spark — хорош, но админить его и искать, какие там джарники и куда ему надо подсунуть, чтобы заработал коннектор, — бесит
• dlt — вроде как новая хипстерская штука, обещающая превосходный DX, на поверку оказалась дырявым корытом, которое пока не залатаешь, не поплывёт
• Fivetran — ничего сказать не могу, не пробовал, но как минимум это менеджед сервис без опенсорсной альтернативы
• Airbyte — деплоить целую кучу сервисов просто чтобы гонять батч джобы, это, конечно, выдающийся пример оверинжиниринга (а потом дебажить, когда один из них отвалился, ага)
• Pandas/Polars — да выдаст господь пару терабайт оперативки людям, которые пользуют Pandas для перегрузки данных. Впрочем, API у него удобный, этого не отнимешь. Polars в плане памяти получше, но это все равно не ETL тул.
А чем пользуетесь вы для загрузки, и удобно ли вам? Может, мои представления устарели, и появилось новое, стало лучше старое?
10
1August 20, 2026 616 29 6