Главная›Вакансии›IT и разработка›Дата-сайентист›ML-инженер (Online RL) / Post-Training LLM

СБЕР · Москва

ML-инженер (Online RL) / Post-Training LLM — СБЕР

Реализовывать и дорабатывать подходы post-training и online RL. Проектировать и проводить эксперименты: формулировать гипотезы, подбирать конфигурации, анализировать результаты не...

Компания набирает: 3438 вакансий

Коротко о вакансии

Зарплату работодатель не назвал — вилку обсуждают на собеседовании. Компания нанимает активно — открытых позиций сейчас 3438.

Описание вакансии

Мы развиваем GigaChat и ищем сильного ML-инженера в команду online RL. Это роль для человека, который умеет доводить исследовательские идеи до работающих решений: проектировать и запускать эксперименты, строить надёжные пайплайны обучения и добиваться реального роста качества модели.

Нам нужен не просто исполнитель задач, а инженер с сильным исследовательским мышлением, который способен самостоятельно разбираться в сложных проблемах, предлагать новые идеи и решения и нести ответственность за результат

Обязанности

Разрабатывать и улучшать методы online RL

Реализовывать и дорабатывать подходы post-training и online RL.

Проектировать и проводить эксперименты: формулировать гипотезы, подбирать конфигурации, анализировать результаты не только на уровне метрик, но и на уровне причин.

Разбираться, почему модель стала лучше или хуже, насколько устойчив результат и можно ли его масштабировать на другие домены и типы задач.

Следить за state-of-the-art: читать статьи, воспроизводить результаты, адаптировать лучшие подходы под наши задачи и инфраструктуру.

Строить и развивать инфраструктуру обучения

Разрабатывать и поддерживать пайплайны online RL: от генерации rollout'ов и сбора reward-сигналов до обновления весов модели.

Обеспечивать воспроизводимость экспериментов: версионирование данных, конфигов, чекпоинтов, контроль деградаций.

Оптимизировать throughput и эффективность использования GPU: distributed training, параллелизм, профилирование узких мест.

Выстраивать связку между моделью, средами исполнения, верификаторами и reward-моделями так, чтобы новые идеи можно было быстро проверять.

Работать с данными и системой оценки качества

Участвовать в проектировании и реализации reward-сигналов: rule-based верификаторы, reward-модели, LLM-as-a-judge, execution-based проверки.

Строить и улучшать пайплайны подготовки данных: фильтрация, дедупликация, балансировка, контроль утечек.

Анализировать ошибки модели, выявлять систематические слабые места и формировать целевые обучающие выборки для их устранения.

Работать в сильной команде

Тесно взаимодействовать с исследователями, другими инженерами, командами данных и инфраструктуры.

Брать на себя ответственность за целые куски системы: от идеи до результата в проде.

Делиться знаниями, участвовать в код-ревью, помогать поднимать общую планку качества.

Требования

Отличное владение Python и PyTorch.

Практический опыт в LLM post-training: RLHF, online RL, DPO или смежных направлениях.

Опыт проведения ML-экспериментов от начала до конца: постановка гипотезы → реализация → анализ → выводы.

Понимание distributed training: Data Parallel, FSDP, DeepSpeed или аналоги.

Умение писать чистый, надёжный, production-ready код.

Способность разбираться в сложных системах и самостоятельно находить и устранять узкие места.

Будет плюсом

Опыт работы с reward-моделями, process reward models, LLM-as-a-judge.

Опыт построения сред исполнения, sandboxes и верификаторов для code- или STEM-задач.

Опыт работы с large-scale inference и оптимизацией генерации (vLLM, Sglang и т.д.).

Понимание современных open-source стеков для обучения LLM (Verl, Megatron, TRL и др.).

Публикации, open-source вклад или сильный прикладной track record.

Условия

Сильные и сложные задачи на переднем крае развития русскоязычных LLM.

Прямое влияние на качество модели: результаты твоей работы видны в бенчмарках и в продукте.

Команду сильных инженеров и исследователей, у которых есть чему поучиться.

Возможность совмещать инженерную и исследовательскую работу.

Конкурентную компенсацию, премии и расширенный соцпакет.

Вакансия опубликована 25 сентября, проверена 29.09.2026. Открыть оригинал.

Как откликнуться

Отклик оформляется на странице работодателя — кнопка выше ведёт туда напрямую. Перед отправкой стоит подогнать резюме под текст вакансии: работодатели читают первые строки и ищут в них свои слова. Если рассылаете отклики десятками, посмотрите сервис автооткликов — он отправляет их за вас по заданным настройкам, до 50 в сутки. Про сам поиск работы есть разбор в статье как быстро найти работу.

Спросите нейросети о вакансии

Отвечает DeepSeek по данным этой страницы: зарплата против рынка, условия, работодатель

Вопросы по этой вакансии

Сколько платят на позиции «ML-инженер (Online RL) / Post-Training LLM»?

Вилку работодатель не назвал — обсуждать деньги придётся на собеседовании. Для ориентира: в среднем по направлению «Дата-сайентист» платят 190 000 ₽.

Какой опыт нужен?

В требованиях указано: от 3 до 6 лет. Работать нужно на месте, город — Москва.

Вакансия ещё открыта?

Да, на 29.09.2026 она активна: каждую ночь каталог сверяется с источником, закрытые предложения помечаются и уходят из списков.

О компании

СБЕР

Сбер — высокотехнологичная компания и крупнейший банк в России, Центральной и Восточной Европе. Мы собираем лучшие технологии и управленческие методы из мировой практики, обучаем и переобучаем сотрудников, заботимся об их физическом и ментальном здоровье, помогаем достигать поставленных целей и развиваться в выбранном направлении. Мы делаем всё возможное, чтобы каждый сотрудник чувствовал заботу …

Открытых вакансий: 3438

Похожие вакансии

Соседи по направлению с близкими требованиями.

Quantitative Researcher

Зарплата не указана

Дубайт · Москва

Разработка и оптимизация моделей для прогнозирования финансовых инструментов: Alpha Research, Signal Generation, в том числе с использованием алгоритмов машинного обучения...

От 1 года до 3 летДата-сайентистОпубликована 28 сентября

Lead ML Engineer (Recsys)

Зарплата не указана

СБЕР · Москва

Формировать технологическое видение и roadmap развития ML Engineering и MLOps в направлении рекомендательных систем, определяя ключевые инженерные приоритеты и точки...

Более 6 летДата-сайентистОпубликована 18 сентября

Online RL (General) / Post-Training LLM в GigaChat

Зарплата не указана

СБЕР · Москва

Разрабатывать и улучшать методы online RL. Реализовывать и дорабатывать подходы post-training и online RL. Проектировать и проводить эксперименты: формулировать...

От 3 до 6 летДата-сайентистОпубликована 25 сентября

Data Engineer (Data Governance)

Зарплата не указана

Digital Chief · Москва

Проектирование и внедрение систем управления качеством данных (Data Quality Frameworks). Поддержка и развитие каталогов данных (data catalog, lineage, схемы, владельцы...

От 3 до 6 летДата-сайентистОпубликована 26 сентября

Senior Data Scientist (LLM / Agents)

Зарплата не указана

Lamoda Tech · Москва

Создавать и развивать AI-ассистентов для разработки и аналитики: кодовые AI ассистенты для автоматизации разработки, помощник аналитика для ускорения экспериментов...

Можно удалённоОт 3 до 6 летДата-сайентистОпубликована 25 сентября

Другие вакансии компании

Дизайнер / AI-аналитик

до 250 000 ₽

СБЕР · Москва

Разработка и развитие фирменного визуального стиля аналитических материалов по AI, технологиям и рынкам. Создание единой дизайн-системы и библиотеки шаблонов...

От 3 до 6 летДизайнерОпубликована 3 сентября

Менеджер по развитию малого бизнеса

от 214 000 ₽+55% к среднему

СБЕР · Петропавловск-Камчатский

Развивать бизнес клиентов из закрепленной базы, подбирая решения от Сбера. Выезжать на переговоры к клиентам. Предлагать клиентам продукты, рекомендованные AI...

От 1 года до 3 летМенеджер по продажамОпубликована 21 сентября

Помощник руководителя (Центр иммерсивных решений)

от 198 300 ₽+92% к среднему

СБЕР · Москва

Планирование рабочего дня руководителя, ведение рабочего графика. Контроль бумажного и электронного документооборота. Ведение деловой переписки с внутренними и внешними клиентами...

От 1 года до 3 летПомощник руководителяОпубликована 22 сентября

Расчёты по этой вакансии

Пригодится до собеседования: сколько останется на руки от названной суммы, как считаются отпускные и переработки.

Ещё по направлению

Модели машинного обучения, прогнозы и рекомендации: Python, статистика, продакшен.