Data Engineer: ETL, Airflow, Spark, BigQuery
Будуйте data-платформу: SQL, Python, Airflow, dbt, Kafka, Spark, Snowflake/BigQuery. Найбільш недонасичений ринок 2026 — зарплати від $3k. З інтерактивними задачами в кожному уроці.
📚 14 модулів📝 32 уроків💻 52 задач⏱ 14 модулів · 32 уроки
Програма курсу
Модуль 1. Сучасний data-стек: lambda vs kappa, batch vs stream3 ур. · 8 зад.
- ▶Що таке Data Engineer і чому це hot ринок 20263 зад.Безкоштовно
- 🔒Modern data stack, Lambda vs Kappa, OLTP vs OLAP3 зад.
- 🔒Anti-patterns, scaling, idempotency, late-arriving data2 зад.
Модуль 2. Просунутий SQL: window functions, CTE, оптимізація3 ур. · 7 зад.
- 🔒Window functions: ROW_NUMBER, LAG/LEAD, partitions3 зад.
- 🔒CTE, recursive queries, materialized vs inline2 зад.
- 🔒EXPLAIN ANALYZE, indexes, partitioning, optimization2 зад.
Модуль 3. Python для DE: pandas, polars, ETL-patterns2 ур. · 4 зад.
- 🔒Python для DE: pandas, polars, pyarrow, Parquet2 зад.
- 🔒ETL patterns: incremental, watermark, schema evolution2 зад.
Модуль 4. PostgreSQL для DE: партиції, materialized views, EXPLAIN2 ур. · 4 зад.
- 🔒PostgreSQL: replication, CDC через Debezium, partitioning2 зад.
- 🔒Postgres: replication, PgBouncer, JSONB, tuning2 зад.
Модуль 5. ClickHouse: аналітика на колонкових БД2 ур. · 3 зад.
- 🔒ClickHouse: columnar OLAP DB, MergeTree, ORDER BY2 зад.
- 🔒ClickHouse production: replication, sharding, Kafka, MV1 зад.
Модуль 6. Apache Airflow: DAGs, dependencies, dynamic tasks3 ур. · 4 зад.
- 🔒Apache Airflow: DAGs, schedule, operators, XCom2 зад.
- 🔒Airflow production: executors, secrets, monitoring1 зад.
- 🔒Advanced Airflow + Dagster, Prefect, custom operators1 зад.
Модуль 7. dbt: моделі, тести, документація2 ур. · 3 зад.
- 🔒dbt: models, sources, refs, materializations, tests2 зад.
- 🔒dbt advanced: packages, env, CI/CD, Cloud vs Core1 зад.
Модуль 8. Apache Kafka: streaming, Connect, exactly-once2 ур. · 4 зад.
- 🔒Apache Kafka: topics, partitions, producers/consumers2 зад.
- 🔒Kafka production: Connect, EOS, monitoring, scaling2 зад.
Модуль 9. PySpark: distributed processing, оптимізація2 ур. · 3 зад.
- 🔒Apache Spark: DataFrames, lazy evaluation, SQL API2 зад.
- 🔒Spark optimization: skew, shuffle, caching, partitioning1 зад.
Модуль 10. Data Lakes: Parquet, Delta, Iceberg2 ур. · 3 зад.
- 🔒Data Lakes + Iceberg, Delta, Hudi — open table formats2 зад.
- 🔒Data lake production: file layout, compaction, governance1 зад.
Модуль 11. DWH порівняння: BigQuery, Snowflake, Redshift2 ур. · 2 зад.
- 🔒DWH comparison: BigQuery, Snowflake, Redshift, Databricks1 зад.
- 🔒DWH deep-dive: partitioning, clustering, MV, ML1 зад.
Модуль 12. Data quality: Great Expectations, monitoring2 ур. · 2 зад.
- 🔒Data quality: GE, Soda, dbt tests, data contracts1 зад.
- 🔒Monitoring: observability, alerts, SLAs, lineage tools1 зад.
Модуль 13. Observability: lineage, OpenLineage, alerts2 ур. · 2 зад.
- 🔒OpenLineage, DataHub, alerts strategy, SLAs1 зад.
- 🔒DataOps: code review, CI/CD, environments, tools landscape1 зад.
Модуль 14. Capstone: real-time analytics pipeline на Kafka + Spark + dbt + BigQuery3 ур. · 3 зад.
- 🔒Capstone (1/3): real-time analytics pipeline architecture1 зад.
- 🔒Capstone (2/3): dbt transformations, marts, tests1 зад.
- 🔒Capstone (3/3): BI, monitoring, deploy, career path1 зад.
Про курс
Про курс
Data Engineer — людина, що будує data pipelines: від raw events до dashboards. Найбільш недонасичений ринок розробки в 2026: попит зростає, а спеціалістів катастрофічно мало.
Чого ви навчитеся
- Просунутий SQL: window functions, CTE, оптимізація запитів
- Python для data engineering: pandas, polars, ETL-patterns
- Бази даних: PostgreSQL, ClickHouse, аналітичні vs OLTP
- Apache Airflow: DAGs, sensors, XCom, dynamic tasks
- dbt: моделі, тести, документація, мутації
- Apache Kafka: streaming, exactly-once, Connect
- Apache Spark: PySpark, оптимізація, partitioning
- Data Lakes: Parquet, Delta, Iceberg
- DWH: BigQuery, Snowflake, Redshift — коли що
- Data quality: Great Expectations, тестування pipeline-ів
- Orchestration patterns: incremental, backfill, idempotency
- Observability: lineage (OpenLineage), DataDog, моніторинг
- Cloud: AWS S3+Glue, GCP, Azure Synapse
- Capstone: real-time analytics pipeline
Для кого
Backend/Python-розробники, аналітики, що хочуть перейти у data engineering. Потрібен Python middle-рівень і базовий SQL.
Інструменти
Python, PostgreSQL, ClickHouse, Apache Airflow, dbt, Apache Kafka, PySpark, BigQuery/Snowflake, Docker, Terraform, AWS/GCP.