FFlauron
Data Engineer: ETL, Airflow, Spark, BigQuery
Безкоштовний урок-прев'ю

Що таке Data Engineer і чому це hot ринок 2026

Data Engineer — людина, що будує data pipelines: від raw events до dashboards, ML, analytics. У 2026 — найбільш недонасичений ринок з зарплатами $3-8k у УА. Розберемо, що це за роль і чому це hot.

Хто такий Data Engineer

Роль Що робить
Data Analyst Пише SQL, робить dashboards, analytics insights
Data Scientist ML моделі, статистичний аналіз, A/B-тести
ML Engineer Деплоїть моделі у production, MLOps
Data Engineer Будує infrastructure — pipelines, warehouses, streams

Data Engineer — фундамент. Без нього інші три не можуть працювати.

Що робить Data Engineer на практиці

  • Ingest — забрати дані з різних джерел (PostgreSQL, Kafka, APIs, files)
  • Transform — clean, enrich, aggregate, join з іншими даними
  • Load — у data warehouse або data lake
  • Schedule — Airflow DAGs запускають це регулярно
  • Quality — tests на дані, alerts на anomalies
  • Optimize — швидкі queries, partitioning, indexing
  • Monitor — lineage, freshness, SLAs

Современний стек 2026

[Sources]
├── PostgreSQL (OLTP — production DB)
├── Kafka (events streaming)
├── REST APIs (3rd party)
└── Files (CSV, JSON у S3)

       ↓ Ingestion
       
[Data Lake / Warehouse]
├── BigQuery / Snowflake / Redshift (DWH)
└── S3 / GCS + Iceberg / Delta (lake)

       ↓ Transformation (dbt, Spark, SQL)
       
[Curated layers]
├── staging
├── intermediate
└── marts

       ↓ Consumption
       
[Consumers]
├── BI tools (Looker, Tableau, Metabase)
├── ML training
├── Reverse ETL → Salesforce, HubSpot
└── Operational dashboards

Batch vs Streaming

Batch

  • Що: обробка великих обсягів даних періодично (раз на годину/день)
  • Tools: Airflow + dbt + Spark
  • Latency: хвилини-години
  • Use cases: щоденні reports, ML training datasets, historical analytics
  • 80% реальних pipeline-ів — batch

Streaming

  • Що: real-time обробка events як вони з'являються
  • Tools: Kafka + Flink / Spark Streaming / ksqlDB
  • Latency: мс-секунди
  • Use cases: fraud detection, real-time dashboards, alerting
  • Складніше і дорожче за batch

Lambda vs Kappa архітектура

Lambda

[Source] → [Batch layer] → [Serving] ← [Speed layer]
            (Spark)         (DWH)      (Kafka+Flink)

Два паралельні шляхи: точний batch + швидкий streaming. Дублювання логіки, складно.

Kappa

[Source] → [Streaming] → [Serving]

Тільки streaming. Reprocessing — re-play з Kafka. Простіше, але потрібно щоб stream-tool міг handle batch-volume.

У 2026 — Kappa winning з появою Iceberg + Spark Streaming + Flink. Lambda — legacy.

OLTP vs OLAP

OLTP OLAP
Online Transaction Processing Online Analytical Processing
Production app DB Data Warehouse
PostgreSQL, MySQL BigQuery, Snowflake, Redshift, ClickHouse
Row-oriented Columnar
Few rows, fast Mass scans, aggregations
ACID transactions Eventual consistency OK
Тисячі QPS reads/writes Хвилини на queries по TB

Data Engineer працює переважно з OLAP + ingestion з OLTP/streams.

Звичайний workflow

  1. Stakeholder (analyst, PM): "Треба report по конверсії"
  2. Identify sources: events у Kafka, users у Postgres, orders в API
  3. Design schema: staging → intermediate → mart
  4. Build pipeline: Airflow DAG, dbt models
  5. Test: Great Expectations, dbt tests
  6. Deploy: CI/CD, scheduled run
  7. Monitor: dashboards, alerts
  8. Iterate: optimize, scale

Метрики Data Engineer

  • Pipeline reliability — % successful runs за останній місяць (>99%)
  • Data freshness — як часто оновлюється (hourly, daily, real-time)
  • SLA — стандарт час для critical pipelines (наприклад, 6 AM щодня)
  • Cost — DWH compute, storage, network (great DWH bills $20k+/міс)
  • Data quality — % rows, що пройшли validation
  • Lineage coverage — % датасетів з документованою lineage

Кар'єра в data engineering

Level Що очікують Зарплата УА 2026
Junior SQL, Python, Airflow basics $1-2k
Middle Spark, dbt, design pipelines $2-4k
Senior Architecture, scale, optimization $4-7k
Staff Multi-team coordination, vision $7-12k

Зарплати вищі за середні Backend через специфічні навики (DWH, Spark) і дефіцит. Багато компаній шукають "хоч когось хто розуміє dbt".

Топ-компанії, що наймають DE

  • FinTech: Monobank, IBOX, Sense — багато даних, real-time
  • E-commerce: Rozetka, Prom, Stylus — analytics-heavy
  • MarTech: Sendinblue, Inteliroute, Devart — analytics для клієнтів
  • Outsourcing: топ-50 — Data Engineer для клієнтів з US/EU
  • Product: GitLab Ukraine (remote), Plata, Reface

Що ти отримаєш у курсі

Через 32 модулі зможеш:

  • Писати advanced SQL (window functions, CTEs, optimization)
  • Будувати pipelines на Airflow
  • Робити modeling на dbt
  • Працювати з Spark для big data
  • Підключати Kafka для streaming
  • Зберігати у BigQuery / Snowflake / Iceberg
  • Налаштовувати data quality з Great Expectations
  • Відстежувати lineage і alerts
  • Capstone — повний real-time pipeline з sources до dashboards

Це ринок-готова експертиза, що дає $3-8k у УА.

Тест: перевір себе

Інтерактивні задачі — single_choice, multiple_choice, true_false.

Сподобався урок?

Придбайте повний курс, щоб отримати доступ до всіх уроків.

Перейти до курсу