Я решила разобраться, что реально происходит на рынке труда для data-специалистов в России. Не по ощущениям и не по статьям двухлетней давности, а по живым данным. Собрала 119 вакансий с hh.ru, распарсила описания и посмотрела, что там внутри.
Как собирала данные
Официального API у hh.ru нет в открытом доступе, поэтому использовала парсинг HTML через requests и BeautifulSoup. Прошлась по 13 страницам поиска по запросам «data engineer», «дата инженер», «ETL разработчик» и смежным — итого 119 релевантных вакансий после фильтрации.
Для каждой вакансии собирала:
- название и компанию
- город
- зарплату (если указана)
- полное описание — чтобы вытащить стек технологий
Парсинг с паузами между запросами занял около 15 минут.
Важное уточнение: парсинг — это хрупкий инструмент. hh.ru может изменить вёрстку, и код перестанет работать. Также возможна блокировка при большом числе запросов. Все данные собраны в учебных целях.
Что по технологиям
Из описаний вакансий извлекла упоминания 20 ключевых технологий с помощью регулярных выражений.
Топ-10 по числу упоминаний:
- Python
- SQL
- Spark
- Airflow
- Docker
- Kafka
- ClickHouse
- PostgreSQL
- Kubernetes
- dbt
Без сюрпризов: Python и SQL — базовые требования почти везде. Spark и Airflow идут следом — классический стек для батч-обработки. Интересно, что ClickHouse обогнал PostgreSQL: это отражает реальный тренд на аналитические базы данных в российских компаниях.
Облачные технологии (AWS, GCP, Azure) встречаются значительно реже — российский рынок исторически ориентирован на on-premise решения.
Что по зарплатам
Зарплата указана только в 18% вакансий — это важная оговорка для любых выводов.
Среди тех, где зарплата есть (большинство в рублях):
- Медианная зарплата: ~200 000 ₽
- Средняя зарплата: чуть выше медианы из-за выбросов на Senior/Lead позициях
По грейдам картина предсказуемая: Senior и Lead ожидаемо зарабатывают больше, но большинство вакансий грейд явно не указывают. Определяла его эвристически по тексту — «junior», «senior», «старший» и т.д. Из-за этого категория «Не указан» оказалась самой большой.
Что по городам
Москва доминирует — ничего неожиданного. На втором месте удалённая работа (ремоут), на третьем Санкт-Петербург. Остальные города представлены единичными вакансиями.
Что в итоге
Рынок data-специалистов в России в 2026 году выглядит так:
Весь код для парсинга и анализа открытый — ноутбук на GitHub и датасет на Kaggle. Если интересно воспроизвести или адаптировать под другую специальность — берите.
- Python + SQL — обязательный минимум
- Spark + Airflow — стандартный бэкенд для большинства компаний
- ClickHouse растёт быстрее, чем кажется
- Зарплаты непрозрачны: 65% вакансий её не указывают
- Грейды часто не прописаны явно
Весь код для парсинга и анализа открытый — ноутбук на GitHub и датасет на Kaggle. Если интересно воспроизвести или адаптировать под другую специальность — берите.
Данные: июнь 2026, 247 вакансий до фильтрации, hh.ru
Инструменты: Python, BeautifulSoup, pandas, matplotlib, seaborn
Инструменты: Python, BeautifulSoup, pandas, matplotlib, seaborn