Emphasoft · Санкт-Петербург

Data Engineer (Scala) — Emphasoft

Разработка, тестирование и оптимизация процессов сбора, предобработки, агрегации и трансформации данных в аналитические витрины. Создание и мониторинг регулярных пайплайнов в...

Опубликована сегодня

Коротко о вакансии

Зарплату работодатель не назвал — вилку обсуждают на собеседовании.

Описание вакансии

Ищем Data Engineer для создания витрин данных и интеграции с ML-моделью подбора тарифов. Работа с корпоративными источниками, хранилищами (HDFS, Hive, GreenPlum, реляционные СУБД), построение пайплайнов и подготовка признаков для рекомендательной системы.


Обязанности:

  • Разработка, тестирование и оптимизация процессов сбора, предобработки, агрегации и трансформации данных в аналитические витрины.
  • Создание и мониторинг регулярных пайплайнов в Apache Airflow для расчёта признаков абонентов (трафик, начисления, ARPU, услуги, тарифы).
  • Разработка и оптимизация Spark-приложений на Scala для пакетной обработки данных и подготовки фичей для ML-модели.
  • Реализация контура обратной связи (feedback loop) для рекомендательной системы: сбор, валидация и передача откликов абонентов в ML-модель.
  • Интеграция со смежными сервисами и API: отказоустойчивость, логирование, контроль таймаутов, мониторинг качества данных.
  • Оптимизация производительности: партиционирование, профилирование, управление памятью и ресурсами кластера.
  • Покрытие кода тестами, документирование витрин (DDL, Data Dictionary) и ETL-процессов в Confluence.

Требования:

  • Опыт в роли Data Engineer — от 1.5 до 2 лет.

Apache Spark:

  • Опыт разработки на Scala — от 1.5 лет.
  • Понимание архитектуры Spark (driver, executor, стадии, shuffling, data locality).
  • DataFrames/Datasets API, Spark SQL.
  • Форматы: Parquet, ORC, Avro, JSON, CSV. Чтение/запись в HDFS, Hive, JDBC.
  • Оптимизация: partitioning, repartition/coalesce, broadcast variables, accumulators, cache/persist.
  • Профилирование через Spark UI и логи Yarn.

Scala:

  • Коллекции (List, Seq, Map, Set), функции высшего порядка (map, flatMap, filter, foldLeft).
  • ООП и ФП: traits, case classes, tuples, pattern matching, Option/Either/Try.
  • Сборка: sbt или maven (assembly / fat-jar).

Apache Airflow:

  • Разработка и документирование production DAG.
  • Расписание (schedule_interval, cron), catchup, depends_on_past.
  • Операторы: SparkSubmitOperator, PythonOperator, BashOperator.
  • Variables, Connections, XCom, сенсоры, макросы, Trigger Rules.

Python:

  • Уверенное владение (PEP8, ООП, модули, virtualenv).
  • Модульные тесты (pytest, unittest).
  • Web-API: RESTful API, requests/aiohttp, JSON, обработка ошибок и таймаутов.

SQL и хранилища:

  • Продвинутый SQL: JOIN (inner, left, full, semi/anti), оконные функции (ROW_NUMBER, DENSE_RANK, LEAD, LAG), CTE, подзапросы.
  • Проектирование таблиц, партиционирование, индексы, View / Materialized View.
  • Понимание HDFS и Hive.
Linux и CI/CD:
  • Linux/Bash (навигация, поиск, логи).

Мы предлагаем:

  • Полностью удалённую работу.

  • Гибкий график — вы самостоятельно управляете своим рабочим временем.

  • Оформление по договору B2B (как ИП или самозанятый).

  • Корпоративные курсы английского языка для профессионального роста.

  • 3 оплачиваемых больничных дня в год.

  • Культуру, основанную на доверии и самостоятельности, без микроменеджмента и излишней бюрократии.

  • Git (ветки, merge requests), базовое понимание Docker.

Вакансия опубликована 18 сентября, проверена 19.09.2026. Открыть оригинал.

Как откликнуться

Отклик оформляется на странице работодателя — кнопка выше ведёт туда напрямую. Перед отправкой стоит подогнать резюме под текст вакансии: работодатели читают первые строки и ищут в них свои слова. Если рассылаете отклики десятками, посмотрите сервис автооткликов — он отправляет их за вас по заданным настройкам, до 50 в сутки. Про сам поиск работы есть разбор в статье как быстро найти работу.

Спросите нейросети о вакансии

Отвечает DeepSeek по данным этой страницы: зарплата против рынка, условия, работодатель

Вопросы по этой вакансии

Сколько платят на позиции «Data Engineer (Scala)»?

Вилку работодатель не назвал — обсуждать деньги придётся на собеседовании. Для ориентира: в среднем по направлению «Дата-сайентист» платят 200 000 ₽.

Какой опыт нужен?

В требованиях указано: от 1 года до 3 лет. Формат работы удалённый, переезд не потребуется.

Вакансия ещё открыта?

Да, на 19.09.2026 она активна: каждую ночь каталог сверяется с источником, закрытые предложения помечаются и уходят из списков.

О компании

Emphasoft

Emphasoft is an international company headquartered in Finland. We develop software for startups, small, and medium-sized businesses worldwide. Our work helps businesses grow, develop new products and adopt cutting-edge technologies. Why Join Emphasoft? Global Projects You’ll work with clients from the USA, UK, Australia, Europe, and Russia. This is your chance to gain global experience and ta…

Похожие вакансии

Соседи по направлению с близкими требованиями.

Data Engineer

Зарплата не указана

ГКУ Инфогород · Москва

Разработка, поддержка и развитие аналитических систем хранения данных. Разработка, поддержка ETL процессов сбора и обработки данных. Создание и развитие системы...

От 3 до 6 летДата-сайентистОпубликована 17 сентября

Team Lead Data Scientist (команда Сервисов Мониторинга корпоративных клиентов)

Зарплата не указана

СБЕР · Москва

Менторство и развитие исследователей данных, мл-инженеров и разработчиков команды. Разбор инцидентов, ответственность за бизнес-эффект продукта, расчет финансового эффекта...

От 3 до 6 летДата-сайентистОпубликована 17 сентября

Data Scientist

до 252 900 ₽

ЛИДЛИНКС · Краснодар

Adspend – DSP-система для запуска и управления programmatic-рекламой в web. MediaDesk – Trading Desk платформа, объединяющая закупки и интегрированная с...

Можно удалённоОт 3 до 6 летДата-сайентистОпубликована 17 сентября

Senior ML engineer

Зарплата не указана

СБЕР · Санкт-Петербург

Погрузиться в процессы и продукты компании, с целью улучшения процессов с помощью ML. Разрабатывать и тестировать новые гипотезы связанные с...

От 3 до 6 летДата-сайентистОпубликована 17 сентября

AI/ML Engineer (LLM, AI Agents)

Зарплата не указана

Emphasoft · Санкт-Петербург

Разрабатывать и выводить в production решения на базе AI/LLM. Проектировать и развивать AI-агентов на базе LLM.

Можно удалённоОт 3 до 6 летДата-сайентистОпубликована 16 сентября

Стажер-инженер технологий машинного обучения

Зарплата не указана

Р-Вижн · Москва

Разработка backend-сервисов на Python (FastAPI): интеграционные коннекторы к внутренним системам, вспомогательные API, обработчики очередей. Доработка сервиса гибридного поиска и...

Можно удалённоНет опытаСтажировкаДата-сайентистОпубликована 18 сентября

Другие вакансии компании

AI/ML Engineer (LLM, AI Agents)

Зарплата не указана

Emphasoft · Санкт-Петербург

Разрабатывать и выводить в production решения на базе AI/LLM. Проектировать и развивать AI-агентов на базе LLM.

Можно удалённоОт 3 до 6 летДата-сайентистОпубликована 16 сентября

Расчёты по этой вакансии

Пригодится до собеседования: сколько останется на руки от названной суммы, как считаются отпускные и переработки.

Ещё по направлению

Модели машинного обучения, прогнозы и рекомендации: Python, статистика, продакшен.