Що таке Data Engineer і чому це hot ринок 2026
Data Engineer — людина, що будує data pipelines: від raw events до dashboards, ML, analytics. У 2026 — найбільш недонасичений ринок з зарплатами $3-8k у УА. Розберемо, що це за роль і чому це hot.
Хто такий Data Engineer
| Роль | Що робить |
|---|---|
| Data Analyst | Пише SQL, робить dashboards, analytics insights |
| Data Scientist | ML моделі, статистичний аналіз, A/B-тести |
| ML Engineer | Деплоїть моделі у production, MLOps |
| Data Engineer | Будує infrastructure — pipelines, warehouses, streams |
Data Engineer — фундамент. Без нього інші три не можуть працювати.
Що робить Data Engineer на практиці
- Ingest — забрати дані з різних джерел (PostgreSQL, Kafka, APIs, files)
- Transform — clean, enrich, aggregate, join з іншими даними
- Load — у data warehouse або data lake
- Schedule — Airflow DAGs запускають це регулярно
- Quality — tests на дані, alerts на anomalies
- Optimize — швидкі queries, partitioning, indexing
- Monitor — lineage, freshness, SLAs
Современний стек 2026
[Sources]
├── PostgreSQL (OLTP — production DB)
├── Kafka (events streaming)
├── REST APIs (3rd party)
└── Files (CSV, JSON у S3)
↓ Ingestion
[Data Lake / Warehouse]
├── BigQuery / Snowflake / Redshift (DWH)
└── S3 / GCS + Iceberg / Delta (lake)
↓ Transformation (dbt, Spark, SQL)
[Curated layers]
├── staging
├── intermediate
└── marts
↓ Consumption
[Consumers]
├── BI tools (Looker, Tableau, Metabase)
├── ML training
├── Reverse ETL → Salesforce, HubSpot
└── Operational dashboards
Batch vs Streaming
Batch
- Що: обробка великих обсягів даних періодично (раз на годину/день)
- Tools: Airflow + dbt + Spark
- Latency: хвилини-години
- Use cases: щоденні reports, ML training datasets, historical analytics
- 80% реальних pipeline-ів — batch
Streaming
- Що: real-time обробка events як вони з'являються
- Tools: Kafka + Flink / Spark Streaming / ksqlDB
- Latency: мс-секунди
- Use cases: fraud detection, real-time dashboards, alerting
- Складніше і дорожче за batch
Lambda vs Kappa архітектура
Lambda
[Source] → [Batch layer] → [Serving] ← [Speed layer]
(Spark) (DWH) (Kafka+Flink)
Два паралельні шляхи: точний batch + швидкий streaming. Дублювання логіки, складно.
Kappa
[Source] → [Streaming] → [Serving]
Тільки streaming. Reprocessing — re-play з Kafka. Простіше, але потрібно щоб stream-tool міг handle batch-volume.
У 2026 — Kappa winning з появою Iceberg + Spark Streaming + Flink. Lambda — legacy.
OLTP vs OLAP
| OLTP | OLAP |
|---|---|
| Online Transaction Processing | Online Analytical Processing |
| Production app DB | Data Warehouse |
| PostgreSQL, MySQL | BigQuery, Snowflake, Redshift, ClickHouse |
| Row-oriented | Columnar |
| Few rows, fast | Mass scans, aggregations |
| ACID transactions | Eventual consistency OK |
| Тисячі QPS reads/writes | Хвилини на queries по TB |
Data Engineer працює переважно з OLAP + ingestion з OLTP/streams.
Звичайний workflow
- Stakeholder (analyst, PM): "Треба report по конверсії"
- Identify sources: events у Kafka, users у Postgres, orders в API
- Design schema: staging → intermediate → mart
- Build pipeline: Airflow DAG, dbt models
- Test: Great Expectations, dbt tests
- Deploy: CI/CD, scheduled run
- Monitor: dashboards, alerts
- Iterate: optimize, scale
Метрики Data Engineer
- Pipeline reliability — % successful runs за останній місяць (>99%)
- Data freshness — як часто оновлюється (hourly, daily, real-time)
- SLA — стандарт час для critical pipelines (наприклад, 6 AM щодня)
- Cost — DWH compute, storage, network (great DWH bills $20k+/міс)
- Data quality — % rows, що пройшли validation
- Lineage coverage — % датасетів з документованою lineage
Кар'єра в data engineering
| Level | Що очікують | Зарплата УА 2026 |
|---|---|---|
| Junior | SQL, Python, Airflow basics | $1-2k |
| Middle | Spark, dbt, design pipelines | $2-4k |
| Senior | Architecture, scale, optimization | $4-7k |
| Staff | Multi-team coordination, vision | $7-12k |
Зарплати вищі за середні Backend через специфічні навики (DWH, Spark) і дефіцит. Багато компаній шукають "хоч когось хто розуміє dbt".
Топ-компанії, що наймають DE
- FinTech: Monobank, IBOX, Sense — багато даних, real-time
- E-commerce: Rozetka, Prom, Stylus — analytics-heavy
- MarTech: Sendinblue, Inteliroute, Devart — analytics для клієнтів
- Outsourcing: топ-50 — Data Engineer для клієнтів з US/EU
- Product: GitLab Ukraine (remote), Plata, Reface
Що ти отримаєш у курсі
Через 32 модулі зможеш:
- Писати advanced SQL (window functions, CTEs, optimization)
- Будувати pipelines на Airflow
- Робити modeling на dbt
- Працювати з Spark для big data
- Підключати Kafka для streaming
- Зберігати у BigQuery / Snowflake / Iceberg
- Налаштовувати data quality з Great Expectations
- Відстежувати lineage і alerts
- Capstone — повний real-time pipeline з sources до dashboards
Це ринок-готова експертиза, що дає $3-8k у УА.
Тест: перевір себе
Інтерактивні задачі — single_choice, multiple_choice, true_false.