Этот веб-сайт использует файлы cookie, чтобы обеспечить вам наилучший сервис
Хорошо
Статьи

Что просят у Data Engineer в 2026 году: анализ 119 вакансий с hh.ru

Я решила разобраться, что реально происходит на рынке труда для data-специалистов в России. Не по ощущениям и не по статьям двухлетней давности, а по живым данным. Собрала 119 вакансий с hh.ru, распарсила описания и посмотрела, что там внутри.

Как собирала данные

Официального API у hh.ru нет в открытом доступе, поэтому использовала парсинг HTML через requests и BeautifulSoup. Прошлась по 13 страницам поиска по запросам «data engineer», «дата инженер», «ETL разработчик» и смежным — итого 119 релевантных вакансий после фильтрации.
Для каждой вакансии собирала:

  • название и компанию
  • город
  • зарплату (если указана)
  • полное описание — чтобы вытащить стек технологий
Парсинг с паузами между запросами занял около 15 минут.
Важное уточнение: парсинг — это хрупкий инструмент. hh.ru может изменить вёрстку, и код перестанет работать. Также возможна блокировка при большом числе запросов. Все данные собраны в учебных целях.

Что по технологиям

Из описаний вакансий извлекла упоминания 20 ключевых технологий с помощью регулярных выражений.
Топ-10 по числу упоминаний:

  1. Python
  2. SQL
  3. Spark
  4. Airflow
  5. Docker
  6. Kafka
  7. ClickHouse
  8. PostgreSQL
  9. Kubernetes
  10. dbt
Без сюрпризов: Python и SQL — базовые требования почти везде. Spark и Airflow идут следом — классический стек для батч-обработки. Интересно, что ClickHouse обогнал PostgreSQL: это отражает реальный тренд на аналитические базы данных в российских компаниях.
Облачные технологии (AWS, GCP, Azure) встречаются значительно реже — российский рынок исторически ориентирован на on-premise решения.

Что по зарплатам

Зарплата указана только в 18% вакансий — это важная оговорка для любых выводов.
Среди тех, где зарплата есть (большинство в рублях):
  • Медианная зарплата: ~200 000 ₽
  • Средняя зарплата: чуть выше медианы из-за выбросов на Senior/Lead позициях
Встречались вакансии в долларах и тенге — конвертировала по курсу на дату сбора
По грейдам картина предсказуемая: Senior и Lead ожидаемо зарабатывают больше, но большинство вакансий грейд явно не указывают. Определяла его эвристически по тексту — «junior», «senior», «старший» и т.д. Из-за этого категория «Не указан» оказалась самой большой.

Что по городам

Москва доминирует — ничего неожиданного. На втором месте удалённая работа (ремоут), на третьем Санкт-Петербург. Остальные города представлены единичными вакансиями.

Что в итоге

Рынок data-специалистов в России в 2026 году выглядит так:

  • Python + SQL — обязательный минимум
  • Spark + Airflow — стандартный бэкенд для большинства компаний
  • ClickHouse растёт быстрее, чем кажется
  • Зарплаты непрозрачны: 65% вакансий её не указывают
  • Грейды часто не прописаны явно

Весь код для парсинга и анализа открытый — ноутбук на GitHub и датасет на Kaggle. Если интересно воспроизвести или адаптировать под другую специальность — берите.
Данные: июнь 2026, 247 вакансий до фильтрации, hh.ru

Инструменты: Python, BeautifulSoup, pandas, matplotlib, seaborn
BI Аналитика