3 подписчика
Как выглядит задача дата-инженера в реальной жизни
ML-команда разработала модель рекомендаций смен для сборщиков. Результаты скидывают в топик Kafka. Нам нужно забрать это в хранилище и построить витрину.
Что по факту делаем:
1️⃣ Получаем креды на Kafka ML, собираем pipeline в NiFi, настраиваем буферизацию (каждые 10 минут или 10 000 сообщений) и обработку кривых сообщений
2️⃣ Данные падают в сырой слой Greenplum — таблица stg_... с JSON внутри
3️⃣ Пишем парсер, генерим суррогатные ключи, обогащаемданными из DDS-слоя (Data Vault)
4️⃣ Оборачиваем всё в dbt-модели, пушим через Git, ревьюер проверяет, запускаем миграцию в Airflow
Витрина на проде. Данные появились. Задача закрыта.
Из нюансов: подключение к чужой Kafka, тестовые топики, разработка на малом объёме, обход DDS-слоя. И да — глубоко вникать в то, как ML генерит рекомендации, было некогда. Моязадача — забрать, очистить, положить в витрину. А дальше — дело аналитиков.
С каким стеком собираете пайплайны вы? Kafka + NiFi, Spark, кастомный код? Напишите в комменты 👇
Около минуты
2 дня назад