Руководитель направления Online RL (STEM) / Post-Training LLM в команду GigaChat — СБЕР
Развивать направление online RL для STEM-задач. Определять, как должно развиваться направление online RL в STEM-домене: какие задачи для...
Компания набирает: 3438 вакансий
Коротко о вакансии
Зарплату работодатель не назвал — вилку обсуждают на собеседовании. Компания нанимает активно — открытых позиций сейчас 3438.
Описание вакансии
Мы развиваем GigaChat и ищем сильного руководителя направления online RL в домене STEM (математика, естественные науки, инженерные и технические дисциплины). Это роль для человека, который умеет одновременно развивать методы обучения моделей, глубоко разбираться в предметной области и выстраивать процессы сбора и подготовки данных.
Нам нужен не просто менеджер, а сильный технический руководитель, который способен глубоко погружаться в детали, самостоятельно собирать ключевые части решения и доводить идеи до реального роста качества модели.
Обязанности
Развивать направление online RL для STEM-задач
Определять, как должно развиваться направление online RL в STEM-домене: какие задачи для нас наиболее важны, как измерять прогресс и что в первую очередь ограничивает рост качества модели.
Вести направление целиком: от постановки гипотез и плана работ до внедрения результатов в регулярный цикл обучения модели.
Принимать решения о приоритетах между развитием методов, сбором данных, инфраструктурой и системой оценки качества.
Разрабатывать и улучшать методы обучения
Развивать подходы post-training и online RL для задач по математике, физике, химии, биологии и другим STEM-дисциплинам.
Продумывать и внедрять способы оценки качества, которые помогают модели лучше решать реальные задачи: строить цепочки рассуждений, находить верные ответы, корректно применять формулы и методы, работать с многошаговыми задачами.
Определять, в каких случаях online RL действительно даёт прирост качества по сравнению с supervised fine-tuning и другими подходами, а в каких — нет.
Проводить эксперименты и разбирать результаты не только на уровне метрик, но и на уровне причин: почему модель стала лучше или хуже, насколько устойчив результат и можно ли его перенести на другие типы задач.
Писать ключевой код и развивать инфраструктуру
Самостоятельно писать и дорабатывать критичные части пайплайнов online RL.
Делать надёжные и воспроизводимые эксперименты: с понятными версиями данных, конфигами, сравнением запусков и контролем деградаций.
Выстраивать связку между моделью, верификаторами, reward-сигналами и обучающими пайплайнами так, чтобы новые идеи можно было быстро проверять и быстро доводить до практического результата.
Оставаться сильным инженером и исследователем, а не только руководителем: при необходимости самому разбирать узкие места в коде, экспериментах и качестве данных.
Строить контур данных для обучения
Организовывать сбор и подготовку данных для online RL в STEM-домене: задачи разной сложности, эталонные решения, формальные и автоматические верификаторы, синтетические и реальные сценарии.
Формировать качественные обучающие выборки с хорошим покрытием по дисциплинам, уровням сложности (от школьных до олимпиадных и университетских задач), типам рассуждений и типовым ошибкам модели.
Встраивать в пайплайны проверки качества: символьную и численную верификацию ответов, проверку промежуточных шагов рассуждений, контроль утечек, удаление дублей, балансировку по сложности и предметным областям.
Делать так, чтобы каждый цикл обучения улучшал не только модель, но и сам процесс: появлялись новые данные, новые сложные примеры, более точные критерии качества и лучшее понимание слабых мест модели.
Руководить сильной технической командой
Руководить командой исследователей и инженеров, задавать высокую планку по качеству решений, скорости работы и глубине проработки.
Помогать команде превращать исследовательские идеи в работающие решения, которые можно встроить в основной цикл обучения.
Удерживать баланс между глубиной исследований, инженерной надёжностью и практическим результатом для модели.
Требования
Отличное владение Python и PyTorch.
Практический опыт в LLM post-training: RLHF, online RL или смежных направлениях.
Понимание специфики STEM-домена: формальная верификация ответов, chain-of-thought reasoning, работа с математической нотацией, многошаговые решения, типовые ошибки моделей в рассуждениях.
Умение ставить гипотезы, проектировать эксперименты и принимать решения на основе результатов.
Опыт руководства сильной технической командой.
Готовность лично писать важные части системы руками.
Будет плюсом
Сильный математический или естественнонаучный бэкграунд (профильное образование, олимпиадный опыт, публикации).
Опыт построения верификаторов и reward-моделей для задач STEM.
Опыт построения пайплайнов данных, а не только работы с уже готовыми датасетами.
Опыт работы с distributed training или large-scale inference.
Опыт разработки систем оценки качества для LLM (бенчмарки, LLM-as-a-judge, process reward models).
Опыт работы с synthetic data generation, curriculum learning, active data collection.
Понимание современных open-source стеков для обучения и инференса больших языковых моделей.
Публикации, open-source вклад или сильный прикладной research track record.
Условия
Сильные и сложные задачи на переднем крае развития русскоязычных LLM.
Большую степень влияния на архитектуру решений, методы обучения и качество итоговой модели.
Команду сильных инженеров и исследователей.
Возможность совмещать управление направлением с глубокой технической работой.
Конкурентную компенсацию, премии и расширенный соцпакет.
Вакансия опубликована 25 сентября, проверена 29.09.2026. Открыть оригинал.
Как откликнуться
Отклик оформляется на странице работодателя — кнопка выше ведёт туда напрямую.
Перед отправкой стоит подогнать резюме под текст вакансии: работодатели читают первые строки и ищут в них свои слова.
Если рассылаете отклики десятками, посмотрите сервис автооткликов — он отправляет их за вас
по заданным настройкам, до 50 в сутки. Про сам поиск работы есть разбор в статье
как быстро найти работу.
Спросите нейросети о вакансии
Отвечает DeepSeek по данным этой страницы: зарплата против рынка, условия, работодатель
Вопросы по этой вакансии
Сколько платят на позиции «Руководитель направления Online RL (STEM) / Post-Training LLM в команду GigaChat»?
Вилку работодатель не назвал — обсуждать деньги придётся на собеседовании. Для ориентира: в среднем по направлению «Дата-сайентист» платят 190 000 ₽.
Какой опыт нужен?
В требованиях указано: от 3 до 6 лет. Работать нужно на месте, город — Москва.
Вакансия ещё открыта?
Да, на 29.09.2026 она активна: каждую ночь каталог сверяется с источником, закрытые предложения помечаются и уходят из списков.
Сбер — высокотехнологичная компания и крупнейший банк в России, Центральной и Восточной Европе.
Мы собираем лучшие технологии и управленческие методы из мировой практики, обучаем и переобучаем сотрудников, заботимся об их физическом и ментальном здоровье, помогаем достигать поставленных целей и развиваться в выбранном направлении. Мы делаем всё возможное, чтобы каждый сотрудник чувствовал заботу …
Реализовывать на Python инструменты для запуска моделей, сбора результатов и расчёта метрик. Обеспечивать воспроизводимость экспериментов и развивать внутреннюю библиотеку оценки.
Задача нетиповая, и это стоит понимать до отклика. Ассортимент, который видит пользователь, определяется геозоной доставки и наличием товара у конкретного...
Можно удалённоОт 3 до 6 летДата-сайентистОпубликована 26 сентября
Тестировать и участвовать в разработке пайплайнов внедрения моделей. Внедрять модели машинного обучения. Сопровождать полный цикл сборки модели. Обрабатывать и анализировать...
Можно удалённоОт 1 года до 3 летДата-сайентистОпубликована 28 сентября
Разработка и оптимизация моделей для прогнозирования финансовых инструментов: Alpha Research, Signal Generation, в том числе с использованием алгоритмов машинного обучения...
От 1 года до 3 летДата-сайентистОпубликована 28 сентября
Формировать технологическое видение и roadmap развития ML Engineering и MLOps в направлении рекомендательных систем, определяя ключевые инженерные приоритеты и точки...
Разработка и развитие фирменного визуального стиля аналитических материалов по AI, технологиям и рынкам. Создание единой дизайн-системы и библиотеки шаблонов...
Развивать бизнес клиентов из закрепленной базы, подбирая решения от Сбера. Выезжать на переговоры к клиентам. Предлагать клиентам продукты, рекомендованные AI...
Планирование рабочего дня руководителя, ведение рабочего графика. Контроль бумажного и электронного документооборота. Ведение деловой переписки с внутренними и внешними клиентами...