Курс по ETL-разработке и оркестрации на Dagster и Apache Nifi, DLT [Инжеренка.Тех] [Д. Володин, Б. Житников, И. Матвеев] [Основательный подход]

ALL DAR Bot

🛡 МОДЕРАТОР 🛡
Регистрация
26 Март 2018
Сообщения
84.130
Автор: Основательный подход
Название: Курс по ETL-разработке и оркестрации на Dagster и Apache Nifi, DLT [Инжеренка.Тех] [Д. Володин, Б. Житников, И. Матвеев] [Основательный подход]

Описание:
Научитесь строить

- надежные ETL-пайплайны на базе Dagster и Apache NiFi,

- применяя Software Defined Assets и кастомные IOManager для сбора и записи данных в PostgreSQL.

Вы освоите автоматизацию обработки информации через внешние API и развертывание оркестратора в контейнерах Docker.

Спойлер: Программа
Модуль 1

Dagster

ETL, оркестрация и активы данных

От теории ETL до production-деплоя Dagster: учимся проектировать пайплайны, работать с Software Defined Assets, ресурсами, партициями, расписаниями и интеграцией с dbt.

0 Теория ETL — доступно в бесплатной части

Теоретический фундамент инженерии данных: как сырая информация превращается в бизнес-ценность через ETL-процессы. Разбираем OLTP и OLAP, batch и stream обработку.

Чему вы научитесь:

  • Выбирать ETL, ELT или EtLT под требования бизнеса к скорости и качеству данных.
  • Извлекать и нормализовать данные на Python.
  • Готовить первый пайплайн к загрузке в аналитическое хранилище.
1 Введение в Dagster — доступно в бесплатной части

Погружаемся в экосистему Dagster и переход от выполнения задач к управлению активами данных через Software Defined Assets. Разбираем декларативный подход, ресурсы и проверки качества.

Чему вы научитесь:

  • Проектировать устойчивые пайплайны данных.
  • Разделять бизнес-логику и инфраструктуру через IOManagers и Resources.
  • Запускать локальный проект Dagster и настраивать Asset Checks.
2 SDA в Dagster — доступно в бесплатной части

Практика работы с Software Defined Assets: пишем первый ассет, настраиваем зависимости, добавляем метаданные и смотрим граф данных в UI.

Чему вы научитесь:

  • Проектировать связанные цепочки ассетов.
  • Управлять контекстом выполнения и логированием.
  • Внедрять Asset Checks, которые блокируют обработку данных при ошибках.
3 Configurable Resource

Цель урока: Научиться создавать собственные ресурсы для работы с внешними системами.

Практика на уроке: Создадим подключение к внешнему API.

4 IOManager

Цель урока: Научиться создавать инструменты для сохранения и последующего использования данных из SDA.

Практика на уроке: Создадим IOManager для записи сырых данных в PostgreSQL.

5 Partitions

Цель урока: Научиться разбивать SDA на более мелкие логические и физические части.

Практика на уроке: Разделим данные по дате, напишем методы для ресурса и менеджера.

6 Автоматизация

Цель урока: Научиться создавать правила для автоматического получения и обработки данных.

Практика на уроке: Напишем несколько расписаний и зададим правила для автоматической материализации ассета.

7 Ops, Jobs, Hooks

Цель урока: Научиться управлять задачами, которые не связаны напрямую с данными.

Практика на уроке: Создадим утилитарные задачи для запуска из UI, добавим алертинг и юнит-тесты.

8 Интеграция с dbt

Цель урока: Запустить dbt-проект в Dagster.

Практика на уроке: Познакомимся с подходами к интеграции, добавим расписание и настройку партиционирования.

9 Деплой

Цель урока: Запустить Dagster в Docker.

Практика на уроке: Запустим все, что сделали ранее, отдельно, и подготовим к релизу в production.

Модуль 2 NiFi

Потоки данных и визуальная обработка

Учимся собирать data flow: получать данные из внешних источников, обрабатывать, разделять, маршрутизировать и сохранять их в PostgreSQL.

10 Введение в NiFi

Получите понимание, какие задачи может решать NiFi, а для каких лучше выбрать другой инструмент.

11 Получение и обработка данных

Цель урока: Научиться создавать потоки NiFi, получать данные и выполнять простейшие операции обработки.

Практика на уроке: Создадим подключение к внешнему API.

12 Сохранение данных

Цель урока: Научиться обрабатывать структурированные данные и сохранять их в системы.

Практика на уроке: Создадим поток для записи сырых данных в PostgreSQL.

13 Сложная обработка

Цель урока: Разобраться со сложными механизмами обработки и управления данными.

Практика на уроке: Будем делить данные, управлять обработкой и распределением данных в кластере.

Модуль 3 DLT

Пайплайны, API, файлы и end-to-end проект

Собираем практический стек DLT: ресурсы и источники, REST API, файловые источники, S3, интеграцию с Dagster и финальный пайплайн.

14 Знакомство с DLT и создание первого пайплайна

  • Установка DLT и настройка рабочего окружения.
  • Работа с демонстрационными данными о шахматных партиях.
  • Загрузка данных в DuckDB и анализ через SQL-клиент.
15 Ресурсы и источники данных в DLT

  • Понятия @dlt.resource и @dlt.source, их назначение и различия.
  • Создание ресурсов для работы с CSV-файлами.
  • Подключение к ClickHouse как источнику данных.
16 Работа с REST API и конфигурацией

  • Подключение к GitHub API для получения issues и данных о контрибьюторах.
  • Использование встроенного источника rest_api_source.
  • Настройка пагинации для обработки больших объемов данных.
17 Загрузка файлов из различных источников

  • Работа с локальными и облачными файлами.
  • Обработка Parquet-файлов на примере данных о поездках самокатов.
  • Подключение и загрузка данных из Amazon S3.
  • Анализ загруженных данных: подсчет записей в таблице events.
18 Интеграция с Dagster

  • Создание проекта Dagster с помощью scaffold.
  • Работа с @dlt_assets для управления активами данных.
  • Кастомизация пайплайнов через DagsterDltTranslator.
  • Безопасное хранение токенов и конфигурации через .env файлы.
19 Практический проект: end-to-end пайплайн

  • Создание единого пайплайна с интеграцией API, ClickHouse и файловых источников.
  • Настройка ассетов и мониторинг через интерфейс Dagster.
  • Валидация результатов: консолидация всех данных в едином хранилище.

Стек, который вы освоите на курсе: Dagster, SDA (Software Defined Asset), IOManager, dbt, Docker, PostgreSQL, API Integration, NiFi, DLT

Почему на базе Dagster и NiFi?

Dagster – ключевой инструмент Modern Data Stack. Он дает инженерам гибкость и контроль, недоступные в старых решениях, позволяя строить сложные и надежные пайплайны.

Как проходит обучение?

Наш подход к обучению стирает границы между теорией и практикой, предлагая вам немедленное применение знаний в реальных условиях. Забудьте о скучных видеолекциях и бесконечном запоминании правил.

Вас ждет более 60 задач из разных бизнес-сфер, которые вы возьмете в портфолио

https://inzhenerka.tech/dagster#program

Цена 39000 руб.

Материал «Курс по ETL-разработке и оркестрации на Dagster и Apache Nifi, DLT [Инжеренка.Тех] [Д. Володин, Б. Житников, И. Матвеев] [Основательный подход]», возможно, скоро появится на All-DAR.

Пройдите регистрацию и оформите Premium подписку, чтобы первым получить доступ, и воспользуйтесь поиском — может быть, он уже опубликован.

Скрытый контент для пользователей All-dar.
 

Присоединяйтесь, чтобы открыть полный доступ

Комментарии и материалы этой темы доступны только зарегистрированным участникам

Новый участник?

Регистрация занимает меньше минуты

Уже с нами?

Войдите в свой аккаунт

Сверху