Senior Data Engineer в Trust & Safety — RWB (Wildberries & Russ)
Следить за тем, чтобы один и тот же признак был согласован между обучением и продакшеном (одна логика расчёта, единый контракт).
Компания набирает: 3610 вакансийОпубликована сегодня
Коротко о вакансии
Зарплату работодатель не назвал — вилку обсуждают на собеседовании. В требованиях: python, sql, java, cassandra, redis. Компания нанимает активно — открытых позиций сейчас 3610.
Описание вакансии
Мы — команда платформы данных в направлении Trust & Safety. Делаем данные и признаки для моделей машинного обучения, которые используются в антифроде, модерации контента и других продуктах. У нас есть как потоковая платформа (Databus/Kafka + Flink + Redis/Cassandra), так и “озеро” данных на S3/Apache Iceberg с доступом через Trino.
Мы ищем дата-инженера, который обеспечит расчёт и поставку признаков для ML-моделей — от чтения сырых событий до записи финальных значений в онлайн- и офлайн-хранилища.
Вам предстоит:
Проектировать и разрабатывать потоковые процессы, которые читают события из Databus/Kafka и считают онлайн‑признаки, записывая их в Redis и Cassandra;
Проектировать и разрабатывать пакетные процессы, которые читают данные из S3/Iceberg через Trino, считают офлайн‑признаки и пишут результаты обратно в S3/Iceberg и/или ClickHouse;
Следить за тем, чтобы один и тот же признак был согласован между обучением и продакшеном (одна логика расчёта, единый контракт);
Настраивать расписания, пересчёты и бэки, чтобы признаки обновлялись вовремя и выдерживали SLA по свежести;
Работать с качеством данных: добавлять проверки, мониторить аномалии, разбирать инциденты, когда “признак поехал”;
Совместно с DS и аналитиками придумывать новые признаки и помогать перевести их из экспериментальных скриптов в стабильные пайплайны.
Вы нам подходите, если есть:
4–5+ лет опыта в роли Data Engineer / Backend+Data;
Уверенный опыт работы с Kafka‑подобными очередями (Databus/Kafka): продюсеры/консьюмеры, партиционирование, ключи, обработка ошибок;
Практический опыт со streaming‑движком (желательно Flink; Spark Structured Streaming подойдёт, если есть реальный прод‑опыт);
Опыт работы с Redis или Cassandra как онлайновым хранилищем данных/признаков;
Опыт работы с S3‑подобным хранилищем и табличным форматом (Iceberg/Delta/Hudi) и доступа к ним через SQL‑движок (Trino/Presto/Spark SQL);
Отличное знание SQL и опыт работы с ClickHouse;
Python на уровне уверенной разработки data‑скриптов и сервисной логики;
Опыт настройки и сопровождения пайплайнов в Airflow;
Понимание задач ML‑пайплайнов: train/serve skew, пересчёты признаков, влияние задержек и потерь событий.
Стек технологий
Потоковая обработка и очереди: Databus(Redpanda)/Kafka, Apache Flink (или Spark Structured Streaming при готовности переучиться на Flink (java));
Онлайновое хранение признаков: Redis, Cassandra;
Хранение и офлайн‑фичи: S3 + Apache Iceberg, доступ через Trino;
Аналитическое хранилище: ClickHouse;
Оркестрация и обработка: Airflow, Python, dbt (для batch‑части и моделирования в DWH);
Плюсом будет опыт с одним из feature‑store решений (Feast или аналоги) — многие компани.
Вакансия опубликована 23 сентября, проверена 24.09.2026. Открыть оригинал.
Ключевые навыки
PythonSQLJavaCassandraRedis
Как откликнуться
Отклик оформляется на странице работодателя — кнопка выше ведёт туда напрямую.
Перед отправкой стоит подогнать резюме под текст вакансии: работодатели читают первые строки и ищут в них свои слова.
Если рассылаете отклики десятками, посмотрите сервис автооткликов — он отправляет их за вас
по заданным настройкам, до 50 в сутки. Про сам поиск работы есть разбор в статье
как быстро найти работу.
Спросите нейросети о вакансии
Отвечает DeepSeek по данным этой страницы: зарплата против рынка, условия, работодатель
Вопросы по этой вакансии
Сколько платят на позиции «Senior Data Engineer в Trust & Safety»?
Вилку работодатель не назвал — обсуждать деньги придётся на собеседовании. Для ориентира: в среднем по направлению «Дата-сайентист» платят 160 000 ₽.
Какой опыт нужен?
В требованиях указано: от 3 до 6 лет. Формат работы удалённый, переезд не потребуется.
Вакансия ещё открыта?
Да, на 24.09.2026 она активна: каждую ночь каталог сверяется с источником, закрытые предложения помечаются и уходят из списков.
Wildberries — это экосистема возможностей, где люди и технологии создают будущее торговли вместе.
Доверие миллионов покупателей, продавцов, тысяч сотрудников и исполнителей делают Wildberries одной из крупнейших международных цифровых платформ.
#ВыбирайWB — стань частью команды с амбициями, которая не боится масштабов.…
Разработка и внедрение ML-моделей прогнозирования спроса (временные ряды + градиентный бустинг + нейросети) на уровне SKU. Автоматизация пайплайнов ретрайна...
Проектирование и оптимизация аналитического хранилища данных (ClickHouse / StarRocks / аналоги). Проектирование и развитие data-пайплайнов для обработки событий кибербезопасности.
Разрабатывать архитектуру решений для хранения, обработки и анализа больших объемов данных под потребности продуктовой команды. Проводить анализ и оптимизацию существующих...
Сетевые политики внутри кластера (NetworkPolicy, Cilium/Calico), ingress-контроллеры, egress-контроль. SRE и надёжность. SLI/SLO/error budget на ключевые...
Можно удалённоОт 3 до 6 летДата-сайентистОпубликована 23 сентября
Строить автоматические и полуавтоматические пайплайны проверки качества данных, чтобы находить технические и смысловые дефекты до попадания данных в обучение.