Data Engineer: проектирование, автоматизация и обработка данных в корпоративных системах
Получить консультацию по обучению
Ближайшая дата
16 - 20 Ноября 2026 г.
Длительность
5 дн. 40 ак.час
Форма обучения
Дистанционно
Документ
Удостоверение о повышении квалификации
Стоимость
75 000 ₽
О курсе
Программа курса ориентирована на специалистов, стремящихся повысить уровень компетентности в области автоматизации подготовки данных для их эффективного анализа. Процесс обучения построен на системе практико-ориентированного подхода. Цель – научиться проектировать процессы (ETL/ELT-процессы) обработки данных в различных датах инструментах (Apache Spark, AirFlow), работать с большими данными в Hadoop и Spark, составлять сложные SQL-запросы в Apache Hive.
Программа курса
Модуль 1. Организация работы с данными
Архитектуры хранилища и витрин данных, озера данных
Структуры данных и их применение 3NF, ROLAP, flat, Data Vault Anchor и их применение Примеры структур данных источников для тестовой витрины и тестового аналитического набора данных
Разновидности систем управления базами данных: РСУБД
Разновидности систем управления базами данных: NOSQL MongoDB, Redis Особенности обработки запросов в СУБД NOSQL
Разновидности систем управления базами данных: MPP Обзор MPP хранилищ
Модуль 2. Экосистема больших данных
Распределённая файловая система HDFS
SQL поверх больших данных Hive и Impala Пример создания и реструктуризации витрины данных в HDFS/Impala
Оперативный механизм распределённой обработки данных Spark Модель вычислений и RDD Data Frames и Spark SQL Обзор Apache PyArrow Пример создания и реструктуризации аналитического набора данных в Spark Отладка, профилирование и мониторинг Spark Job
Модуль 3. Автоматизация извлечения, преобразования и загрузки данных
Механизмы ETL и ELT
Airflow как инструмент: Набор библиотек Executor, worker и операторы-сенсоры Репозиторий Airflow, мониторинг процессов Планировщик задач Airflow
Графовое описание процессов DAG и операторы задач
ETL для тестовой витрины данных и тестового аналитического набора данных
Сложные конвейеры обработки (pipeline)
Разработка собственных операторов задач.
Модуль 4. Проверка и повышение качества данных
Характеристики и метрики качества данных Профилирование, контроль качества и очистка данных
Инструменты обеспечения качества данных Пример реализации контроля для тестового набора данных
Заполните форму и мы свяжемся с вами в ближайшее время
Как вы будете учиться
Занятия
Занятия проводятся как очно в аудитории с непосредственным взаимодействием между преподавателем и слушателями. Для тех, кто не может присутствовать физически, предусмотрено участие через платформу MTS.link.
Процесс обучения
Занятия включают лекции, семинары и групповые проекты. Материалы подаются в виде презентаций, которые могут содержать графику, видео. Полученные знания закрепляются тестированиями и практическими заданиями, а затем вы получаете развернутую обратную связь от эксперта курса.
Сопровождение
Вы можете задавать вопросы преподавателю в режиме реального времени. Так же у каждой группы есть кураторы, которые всегда на связи и помогают решить организационные вопросы.
Получить персональное предложение
Хотите быть в курсе последних новостей?
Подпишитесь на нашу рассылку и станьте одним из первых, кто будет в курсе
всех новостей АИС!
Пожалуйста, заполните все обязательные поля корректно.
Ваша заявка принята!
Наши менеджеры свяжутся с вами в самое ближайшее время!
Наши менеджеры свяжутся с вами в самое ближайшее время!
Мы используем файлы cookie
Чтобы улучшить работу сайта и предоставить вам больше возможностей для обучения.
Продолжая использовать сайт, вы соглашаетесь с условиями использования файлов cookie.