IT Пингвин
Будни дата-инженера: как я забирал данные из Kafka и строил витрину в хранилище за один спринт
Многие, кто читает эту статью, вообще не из IT. Аналитики, BI-шники, бэкендеры, ребята, которые только думают вкатываться. И далеко не все понимают, чем реально занимается дата-инженер. Сфера задач у DE обширная...
: 🔧 7 инструментов дата-инженера — в одном посте, без воды 👉Kafka — брокер сообщений. Данные летят потоком, система гарантирует порядок внутри партиции. Не заменяет хранилище, не умеет SQL. 👉NiFi — визуальный конвейер. Собираешь поток из блоков мышкой: забрал из Kafka → трансформировал → положил в Greenplum. Без горы кода. Greenplum — MPP-СУБД на базе PostgreSQL. Запросы выполняются параллельно по сегментам. Сильна в широких джойнах на больших объёмах, чувствительна к перекосам данных. 👉Data Vault — методология моделирования. Бизнес-ключи (Hubs), связи (Links), атрибуты и история (Satellites). Легко добавлять источники, но таблиц становится много — без витрин не обойтись. 👉dbt — трансформации как код. Пишешь SQL, dbt собирает DAG, управляет зависимостями и тестами. Не качает данные, только Transform внутри хранилища. 👉Airflow — оркестратор. Запускает всё по расписанию, следит за ретраями и SLA. Не стримит, но управляет жизненным циклом стриминговых задач. 👉DWH — не один инструмент, а платформа слоями: сырой слой (STG) → согласованное ядро (DDS) → витрины под потребителей (Data Marts). Если хочешь подробный разбор каждого — есть статья. Какой инструмент вызывает больше всего вопросов? Напишите, сделаю отдельный пост 📝
Как выглядит задача дата-инженера в реальной жизни ML-команда разработала модель рекомендаций смен для сборщиков. Результаты скидывают в топик Kafka. Нам нужно забрать это в хранилище и построить витрину. Что по факту делаем: 1️⃣ Получаем креды на Kafka ML, собираем pipeline в NiFi, настраиваем буферизацию (каждые 10 минут или 10 000 сообщений) и обработку кривых сообщений 2️⃣ Данные падают в сырой слой Greenplum — таблица stg_... с JSON внутри 3️⃣ Пишем парсер, генерим суррогатные ключи, обогащаемданными из DDS-слоя (Data Vault) 4️⃣ Оборачиваем всё в dbt-модели, пушим через Git, ревьюер проверяет, запускаем миграцию в Airflow Витрина на проде. Данные появились. Задача закрыта. Из нюансов: подключение к чужой Kafka, тестовые топики, разработка на малом объёме, обход DDS-слоя. И да — глубоко вникать в то, как ML генерит рекомендации, было некогда. Моязадача — забрать, очистить, положить в витрину. А дальше — дело аналитиков. С каким стеком собираете пайплайны вы? Kafka + NiFi, Spark, кастомный код? Напишите в комменты 👇
Ловушка на собеседовании: почему “база — для хранения, хранилище — для аналитики” — это опасный ответ»
Представьте: вы на собеседовании, и интервьюер просит объяснить разницу между базой данных, хранилищем и озером данных. Вы выдаёте классический ответ: «База — это где данные лежат, а хранилище — это где их анализируют»...
