FFlauron
Курси/Середній → Senior

Data Engineer: ETL, Airflow, Spark, BigQuery

Будуйте data-платформу: SQL, Python, Airflow, dbt, Kafka, Spark, Snowflake/BigQuery. Найбільш недонасичений ринок 2026 — зарплати від $3k. З інтерактивними задачами в кожному уроці.

📚 14 модулів📝 32 уроків💻 52 задач14 модулів · 32 уроки

Програма курсу

Модуль 1. Сучасний data-стек: lambda vs kappa, batch vs stream3 ур. · 8 зад.
  • Що таке Data Engineer і чому це hot ринок 20263 зад.Безкоштовно
  • 🔒Modern data stack, Lambda vs Kappa, OLTP vs OLAP3 зад.
  • 🔒Anti-patterns, scaling, idempotency, late-arriving data2 зад.
Модуль 2. Просунутий SQL: window functions, CTE, оптимізація3 ур. · 7 зад.
  • 🔒Window functions: ROW_NUMBER, LAG/LEAD, partitions3 зад.
  • 🔒CTE, recursive queries, materialized vs inline2 зад.
  • 🔒EXPLAIN ANALYZE, indexes, partitioning, optimization2 зад.
Модуль 3. Python для DE: pandas, polars, ETL-patterns2 ур. · 4 зад.
  • 🔒Python для DE: pandas, polars, pyarrow, Parquet2 зад.
  • 🔒ETL patterns: incremental, watermark, schema evolution2 зад.
Модуль 4. PostgreSQL для DE: партиції, materialized views, EXPLAIN2 ур. · 4 зад.
  • 🔒PostgreSQL: replication, CDC через Debezium, partitioning2 зад.
  • 🔒Postgres: replication, PgBouncer, JSONB, tuning2 зад.
Модуль 5. ClickHouse: аналітика на колонкових БД2 ур. · 3 зад.
  • 🔒ClickHouse: columnar OLAP DB, MergeTree, ORDER BY2 зад.
  • 🔒ClickHouse production: replication, sharding, Kafka, MV1 зад.
Модуль 6. Apache Airflow: DAGs, dependencies, dynamic tasks3 ур. · 4 зад.
  • 🔒Apache Airflow: DAGs, schedule, operators, XCom2 зад.
  • 🔒Airflow production: executors, secrets, monitoring1 зад.
  • 🔒Advanced Airflow + Dagster, Prefect, custom operators1 зад.
Модуль 7. dbt: моделі, тести, документація2 ур. · 3 зад.
  • 🔒dbt: models, sources, refs, materializations, tests2 зад.
  • 🔒dbt advanced: packages, env, CI/CD, Cloud vs Core1 зад.
Модуль 8. Apache Kafka: streaming, Connect, exactly-once2 ур. · 4 зад.
  • 🔒Apache Kafka: topics, partitions, producers/consumers2 зад.
  • 🔒Kafka production: Connect, EOS, monitoring, scaling2 зад.
Модуль 9. PySpark: distributed processing, оптимізація2 ур. · 3 зад.
  • 🔒Apache Spark: DataFrames, lazy evaluation, SQL API2 зад.
  • 🔒Spark optimization: skew, shuffle, caching, partitioning1 зад.
Модуль 10. Data Lakes: Parquet, Delta, Iceberg2 ур. · 3 зад.
  • 🔒Data Lakes + Iceberg, Delta, Hudi — open table formats2 зад.
  • 🔒Data lake production: file layout, compaction, governance1 зад.
Модуль 11. DWH порівняння: BigQuery, Snowflake, Redshift2 ур. · 2 зад.
  • 🔒DWH comparison: BigQuery, Snowflake, Redshift, Databricks1 зад.
  • 🔒DWH deep-dive: partitioning, clustering, MV, ML1 зад.
Модуль 12. Data quality: Great Expectations, monitoring2 ур. · 2 зад.
  • 🔒Data quality: GE, Soda, dbt tests, data contracts1 зад.
  • 🔒Monitoring: observability, alerts, SLAs, lineage tools1 зад.
Модуль 13. Observability: lineage, OpenLineage, alerts2 ур. · 2 зад.
  • 🔒OpenLineage, DataHub, alerts strategy, SLAs1 зад.
  • 🔒DataOps: code review, CI/CD, environments, tools landscape1 зад.
Модуль 14. Capstone: real-time analytics pipeline на Kafka + Spark + dbt + BigQuery3 ур. · 3 зад.
  • 🔒Capstone (1/3): real-time analytics pipeline architecture1 зад.
  • 🔒Capstone (2/3): dbt transformations, marts, tests1 зад.
  • 🔒Capstone (3/3): BI, monitoring, deploy, career path1 зад.

Про курс

Про курс

Data Engineer — людина, що будує data pipelines: від raw events до dashboards. Найбільш недонасичений ринок розробки в 2026: попит зростає, а спеціалістів катастрофічно мало.

Чого ви навчитеся

  • Просунутий SQL: window functions, CTE, оптимізація запитів
  • Python для data engineering: pandas, polars, ETL-patterns
  • Бази даних: PostgreSQL, ClickHouse, аналітичні vs OLTP
  • Apache Airflow: DAGs, sensors, XCom, dynamic tasks
  • dbt: моделі, тести, документація, мутації
  • Apache Kafka: streaming, exactly-once, Connect
  • Apache Spark: PySpark, оптимізація, partitioning
  • Data Lakes: Parquet, Delta, Iceberg
  • DWH: BigQuery, Snowflake, Redshift — коли що
  • Data quality: Great Expectations, тестування pipeline-ів
  • Orchestration patterns: incremental, backfill, idempotency
  • Observability: lineage (OpenLineage), DataDog, моніторинг
  • Cloud: AWS S3+Glue, GCP, Azure Synapse
  • Capstone: real-time analytics pipeline

Для кого

Backend/Python-розробники, аналітики, що хочуть перейти у data engineering. Потрібен Python middle-рівень і базовий SQL.

Інструменти

Python, PostgreSQL, ClickHouse, Apache Airflow, dbt, Apache Kafka, PySpark, BigQuery/Snowflake, Docker, Terraform, AWS/GCP.