Главная›Вакансии›IT и разработка›Дата-сайентист›Руководитель направления Online RL (STEM) / Post-Training LLM в команду GigaChat

СБЕР · Москва

Руководитель направления Online RL (STEM) / Post-Training LLM в команду GigaChat — СБЕР

Развивать направление online RL для STEM-задач. Определять, как должно развиваться направление online RL в STEM-домене: какие задачи для...

Компания набирает: 3438 вакансий

Коротко о вакансии

Зарплату работодатель не назвал — вилку обсуждают на собеседовании. Компания нанимает активно — открытых позиций сейчас 3438.

Описание вакансии

Мы развиваем GigaChat и ищем сильного руководителя направления online RL в домене STEM (математика, естественные науки, инженерные и технические дисциплины). Это роль для человека, который умеет одновременно развивать методы обучения моделей, глубоко разбираться в предметной области и выстраивать процессы сбора и подготовки данных.

Нам нужен не просто менеджер, а сильный технический руководитель, который способен глубоко погружаться в детали, самостоятельно собирать ключевые части решения и доводить идеи до реального роста качества модели.

Обязанности
  • Развивать направление online RL для STEM-задач
  • Определять, как должно развиваться направление online RL в STEM-домене: какие задачи для нас наиболее важны, как измерять прогресс и что в первую очередь ограничивает рост качества модели.
  • Вести направление целиком: от постановки гипотез и плана работ до внедрения результатов в регулярный цикл обучения модели.
  • Принимать решения о приоритетах между развитием методов, сбором данных, инфраструктурой и системой оценки качества.
  • Разрабатывать и улучшать методы обучения
  • Развивать подходы post-training и online RL для задач по математике, физике, химии, биологии и другим STEM-дисциплинам.
  • Продумывать и внедрять способы оценки качества, которые помогают модели лучше решать реальные задачи: строить цепочки рассуждений, находить верные ответы, корректно применять формулы и методы, работать с многошаговыми задачами.
  • Определять, в каких случаях online RL действительно даёт прирост качества по сравнению с supervised fine-tuning и другими подходами, а в каких — нет.
  • Проводить эксперименты и разбирать результаты не только на уровне метрик, но и на уровне причин: почему модель стала лучше или хуже, насколько устойчив результат и можно ли его перенести на другие типы задач.
  • Писать ключевой код и развивать инфраструктуру
  • Самостоятельно писать и дорабатывать критичные части пайплайнов online RL.
  • Делать надёжные и воспроизводимые эксперименты: с понятными версиями данных, конфигами, сравнением запусков и контролем деградаций.
  • Выстраивать связку между моделью, верификаторами, reward-сигналами и обучающими пайплайнами так, чтобы новые идеи можно было быстро проверять и быстро доводить до практического результата.
  • Оставаться сильным инженером и исследователем, а не только руководителем: при необходимости самому разбирать узкие места в коде, экспериментах и качестве данных.
  • Строить контур данных для обучения
  • Организовывать сбор и подготовку данных для online RL в STEM-домене: задачи разной сложности, эталонные решения, формальные и автоматические верификаторы, синтетические и реальные сценарии.
  • Формировать качественные обучающие выборки с хорошим покрытием по дисциплинам, уровням сложности (от школьных до олимпиадных и университетских задач), типам рассуждений и типовым ошибкам модели.
  • Встраивать в пайплайны проверки качества: символьную и численную верификацию ответов, проверку промежуточных шагов рассуждений, контроль утечек, удаление дублей, балансировку по сложности и предметным областям.
  • Делать так, чтобы каждый цикл обучения улучшал не только модель, но и сам процесс: появлялись новые данные, новые сложные примеры, более точные критерии качества и лучшее понимание слабых мест модели.
  • Руководить сильной технической командой
  • Руководить командой исследователей и инженеров, задавать высокую планку по качеству решений, скорости работы и глубине проработки.
  • Помогать команде превращать исследовательские идеи в работающие решения, которые можно встроить в основной цикл обучения.
  • Удерживать баланс между глубиной исследований, инженерной надёжностью и практическим результатом для модели.
Требования
  • Отличное владение Python и PyTorch.
  • Практический опыт в LLM post-training: RLHF, online RL или смежных направлениях.
  • Понимание специфики STEM-домена: формальная верификация ответов, chain-of-thought reasoning, работа с математической нотацией, многошаговые решения, типовые ошибки моделей в рассуждениях.
  • Умение ставить гипотезы, проектировать эксперименты и принимать решения на основе результатов.
  • Опыт руководства сильной технической командой.
  • Готовность лично писать важные части системы руками.

Будет плюсом

  • Сильный математический или естественнонаучный бэкграунд (профильное образование, олимпиадный опыт, публикации).
  • Опыт построения верификаторов и reward-моделей для задач STEM.
  • Опыт построения пайплайнов данных, а не только работы с уже готовыми датасетами.
  • Опыт работы с distributed training или large-scale inference.
  • Опыт разработки систем оценки качества для LLM (бенчмарки, LLM-as-a-judge, process reward models).
  • Опыт работы с synthetic data generation, curriculum learning, active data collection.
  • Понимание современных open-source стеков для обучения и инференса больших языковых моделей.
  • Публикации, open-source вклад или сильный прикладной research track record.
Условия
  • Сильные и сложные задачи на переднем крае развития русскоязычных LLM.
  • Большую степень влияния на архитектуру решений, методы обучения и качество итоговой модели.
  • Команду сильных инженеров и исследователей.
  • Возможность совмещать управление направлением с глубокой технической работой.
  • Конкурентную компенсацию, премии и расширенный соцпакет.

Вакансия опубликована 25 сентября, проверена 29.09.2026. Открыть оригинал.

Как откликнуться

Отклик оформляется на странице работодателя — кнопка выше ведёт туда напрямую. Перед отправкой стоит подогнать резюме под текст вакансии: работодатели читают первые строки и ищут в них свои слова. Если рассылаете отклики десятками, посмотрите сервис автооткликов — он отправляет их за вас по заданным настройкам, до 50 в сутки. Про сам поиск работы есть разбор в статье как быстро найти работу.

Спросите нейросети о вакансии

Отвечает DeepSeek по данным этой страницы: зарплата против рынка, условия, работодатель

Вопросы по этой вакансии

Сколько платят на позиции «Руководитель направления Online RL (STEM) / Post-Training LLM в команду GigaChat»?

Вилку работодатель не назвал — обсуждать деньги придётся на собеседовании. Для ориентира: в среднем по направлению «Дата-сайентист» платят 190 000 ₽.

Какой опыт нужен?

В требованиях указано: от 3 до 6 лет. Работать нужно на месте, город — Москва.

Вакансия ещё открыта?

Да, на 29.09.2026 она активна: каждую ночь каталог сверяется с источником, закрытые предложения помечаются и уходят из списков.

О компании

СБЕР

Сбер — высокотехнологичная компания и крупнейший банк в России, Центральной и Восточной Европе. Мы собираем лучшие технологии и управленческие методы из мировой практики, обучаем и переобучаем сотрудников, заботимся об их физическом и ментальном здоровье, помогаем достигать поставленных целей и развиваться в выбранном направлении. Мы делаем всё возможное, чтобы каждый сотрудник чувствовал заботу …

Открытых вакансий: 3438

Похожие вакансии

Соседи по направлению с близкими требованиями.

ML Research Engineer – Image & Video Generation (Модельные риски генеративных моделей)

Зарплата не указана

СБЕР · Москва

Реализовывать на Python инструменты для запуска моделей, сбора результатов и расчёта метрик. Обеспечивать воспроизводимость экспериментов и развивать внутреннюю библиотеку оценки.

От 3 до 6 летДата-сайентистОпубликована 18 сентября

ML Engineer (Recommendation Systems)

Зарплата не указана

Флаувау · Москва

Задача нетиповая, и это стоит понимать до отклика. Ассортимент, который видит пользователь, определяется геозоной доставки и наличием товара у конкретного...

Можно удалённоОт 3 до 6 летДата-сайентистОпубликована 26 сентября

AI Agent Engineer (NLP/LLM)

Зарплата не указана

IEK GROUP · Москва

Разрабатывать мульти‑агентные системы на LangGraph (ReAct, Human‑in‑the‑loop, Subagents и др). Разрабатывать RAG‑пайплайнов, работать с векторными...

Можно удалённоОт 3 до 6 летДата-сайентистОпубликована 25 сентября

Главный ML инженер

Зарплата не указана

Альфа-Банк · Москва

Тестировать и участвовать в разработке пайплайнов внедрения моделей. Внедрять модели машинного обучения. Сопровождать полный цикл сборки модели. Обрабатывать и анализировать...

Можно удалённоОт 1 года до 3 летДата-сайентистОпубликована 28 сентября

Quantitative Researcher

Зарплата не указана

Дубайт · Москва

Разработка и оптимизация моделей для прогнозирования финансовых инструментов: Alpha Research, Signal Generation, в том числе с использованием алгоритмов машинного обучения...

От 1 года до 3 летДата-сайентистОпубликована 28 сентября

Lead ML Engineer (Recsys)

Зарплата не указана

СБЕР · Москва

Формировать технологическое видение и roadmap развития ML Engineering и MLOps в направлении рекомендательных систем, определяя ключевые инженерные приоритеты и точки...

Более 6 летДата-сайентистОпубликована 18 сентября

Другие вакансии компании

Дизайнер / AI-аналитик

до 250 000 ₽

СБЕР · Москва

Разработка и развитие фирменного визуального стиля аналитических материалов по AI, технологиям и рынкам. Создание единой дизайн-системы и библиотеки шаблонов...

От 3 до 6 летДизайнерОпубликована 3 сентября

Менеджер по развитию малого бизнеса

от 214 000 ₽+55% к среднему

СБЕР · Петропавловск-Камчатский

Развивать бизнес клиентов из закрепленной базы, подбирая решения от Сбера. Выезжать на переговоры к клиентам. Предлагать клиентам продукты, рекомендованные AI...

От 1 года до 3 летМенеджер по продажамОпубликована 21 сентября

Помощник руководителя (Центр иммерсивных решений)

от 198 300 ₽+92% к среднему

СБЕР · Москва

Планирование рабочего дня руководителя, ведение рабочего графика. Контроль бумажного и электронного документооборота. Ведение деловой переписки с внутренними и внешними клиентами...

От 1 года до 3 летПомощник руководителяОпубликована 22 сентября

Расчёты по этой вакансии

Пригодится до собеседования: сколько останется на руки от названной суммы, как считаются отпускные и переработки.

Ещё по направлению

Модели машинного обучения, прогнозы и рекомендации: Python, статистика, продакшен.