СБЕР · Москва

Senior Research Engineer (LLM Pretraining) — СБЕР

Архитектура и законы масштабирования. Рецепт обучения: оптимизаторы, расписание learning rate, нормализация, точность вычислений. Устойчивость больших прогонов и ускорение сходимости.

Компания набирает: 3438 вакансий

Коротко о вакансии

Зарплату работодатель не назвал — вилку обсуждают на собеседовании. Компания нанимает активно — открытых позиций сейчас 3438.

Описание вакансии

Мы занимаемся pretrain'ом больших языковых моделей в GigaChat: проектируем архитектуру, подбираем рецепт обучения и поддерживаем весь инженерный контур вокруг него.

Недавно мы обучили MoE-модель на 700 миллиардов параметров — и на этом не собираемся останавливаться. Обучение идёт на кластерах H100 и B200. GigaChat — самый быстрорастущий проект Сбера, и pretrain — его ядро.

Чем занимается команда

  • Архитектура и законы масштабирования.
  • Рецепт обучения: оптимизаторы, расписание learning rate, нормализация, точность вычислений.
  • Устойчивость больших прогонов и ускорение сходимости.
  • Диагностика обучения и оценка изменений с опорой на математический аппарат.
  • Инженерный контур: воспроизводимость, тесты, CI/CD.
  • Роль с акцентом на модель, оптимизацию и инфраструктуру обучения, а не на данные. Главная цель — делать обучение быстрее, надёжнее и предсказуемее.

Какие задачи стоят перед командой

  • Ускорение цикла «идея → эксперимент → вывод → внедрение».
  • Снижение количества ручных прогонов и неочевидных сбоев, повышение воспроизводимости и прозрачности результатов.
  • Повышение надёжности больших прогонов.
  • Ранняя диагностика деградаций и отделение реальных улучшений от ложных сигналов (расхождение, NaN, коллапс энтропии, артефакты маршрутизации, ложное снижение функции потерь).
  • Обеспечение безопасного масштабирования при внедрении крупных архитектурных изменений.
  • Анализ влияния сложных архитектур (например, mixture of experts и маршрутизация) на качество, стабильность и скорость обучения.
  • Определение и развитие метрик, корректно отражающих изменения в обучении моделей.

Почему мы

Масштаб - 700B MoE уже обучена, дальше — больше. Кластеры на H100 и B200.

Публикации. Можно и нужно писать статьи по результатам своей работы — это не ограничивается.

Команда - в России нет другой команды, которая занимается pretrain'ом на таком масштабе. Коллеги — люди, которые глубоко разбираются в теме.

Влияние. Вы берёте направление целиком. Это не «выполнять задачи из бэклога», а самостоятельно определять, что важно, и доводить до результата.

Обязанности
  • Взять на себя целое направление внутри pretrain'а и развивать его: от постановки задач и планирования экспериментов до внедрения результатов в основное обучение.

  • Проектировать и проводить эксперименты: формулировать гипотезы, запускать абляции, сравнивать подходы, разбираться в результатах и превращать выводы в решения для основного обучения.

  • Разбираться с нестабильностью на больших прогонах: искать причины деградаций, строить диагностические метрики, предлагать изменения в оптимизаторе, расписании lr, нормализациях, инициализации, клиппинге, точности вычислений и маршрутизации.

  • Работать с архитектурой смеси экспертов (MoE): маршрутизатор, балансировка нагрузки, переполнение, артефакты маршрутизации, влияние на качество и производительность.

  • Поддерживать большие прогоны и продолжения обучения с чекпоинтов: следить за дрейфом, проверять изменения в коде и конфигурации, снижать риск регрессий.

  • Улучшать инженерное качество контура обучения: ревью критичных изменений, стратегия тестирования, воспроизводимость экспериментов, профилирование и устранение узких мест.

Требования
  • Глубокое понимание устройства обучения нейросетей: не на уровне обзоров и пересказов, а на уровне, где вы можете объяснить, почему конкретный прогон расходится, глядя на кривые функции потерь, нормы градиентов и энтропии.

  • Способность самостоятельно взять направление и довести его до результата: от чтения статей и постановки гипотез до внедрения в основной трейн.

  • Практический опыт с PyTorch и именно с обучением моделей, а не только с инференсом.

  • Умение доводить исследовательские идеи до надёжного инженерного решения: воспроизводимость, конфиги, тесты, автоматизация, понятные критерии качества.

  • Хорошую инженерную культуру: аккуратные PR, профилирование, внимание к качеству кода, понятные отчёты об экспериментах.

Будет плюсом

  • Опыт со смешанной точностью и распределённым обучением.
  • Опыт построения систем оценки моделей или инфраструктуры для экспериментов.
Условия
  • Удалённо.
  • Возможность оформления в аккредитованную IT-компанию.
  • Годовая премия по итогам работы до 6 окладов.
  • Регулярный пересмотр зарплат.
  • Корпоративный спортзал и зоны отдыха.
  • Более 400 программ СберУниверситета для роста.
  • Программа адаптации и помощь руководителя на старте.
  • Крупнейшее DS&AI community — более 600 DS банка, регулярный обмен знаниями, опытом и лучшими практиками, интерактивные лекции и мастер-классы от ведущих ВУЗов и экспертов технологических компаний, дайджест о самых последних разработках в области DS&AI и отчеты с крупнейших конференций мира, регулярные внутренние митапы.
  • Расширенный ДМС, льготное страхование для семьи, корпоративная пенсионная программа.
  • Ипотека для сотрудников по дисконтной программе.
  • СберПрайм+ и скидки у партнёров.
  • Бонус за рекомендации в команду

Вакансия опубликована 25 сентября, проверена 29.09.2026. Открыть оригинал.

Как откликнуться

Отклик оформляется на странице работодателя — кнопка выше ведёт туда напрямую. Перед отправкой стоит подогнать резюме под текст вакансии: работодатели читают первые строки и ищут в них свои слова. Если рассылаете отклики десятками, посмотрите сервис автооткликов — он отправляет их за вас по заданным настройкам, до 50 в сутки. Про сам поиск работы есть разбор в статье как быстро найти работу.

Спросите нейросети о вакансии

Отвечает DeepSeek по данным этой страницы: зарплата против рынка, условия, работодатель

Вопросы по этой вакансии

Сколько платят на позиции «Senior Research Engineer (LLM Pretraining)»?

Вилку работодатель не назвал — обсуждать деньги придётся на собеседовании. Для ориентира: в среднем по направлению «Дата-сайентист» платят 190 000 ₽.

Какой опыт нужен?

В требованиях указано: от 3 до 6 лет. Работать нужно на месте, город — Москва.

Вакансия ещё открыта?

Да, на 29.09.2026 она активна: каждую ночь каталог сверяется с источником, закрытые предложения помечаются и уходят из списков.

О компании

СБЕР

Сбер — высокотехнологичная компания и крупнейший банк в России, Центральной и Восточной Европе. Мы собираем лучшие технологии и управленческие методы из мировой практики, обучаем и переобучаем сотрудников, заботимся об их физическом и ментальном здоровье, помогаем достигать поставленных целей и развиваться в выбранном направлении. Мы делаем всё возможное, чтобы каждый сотрудник чувствовал заботу …

Открытых вакансий: 3438

Похожие вакансии

Соседи по направлению с близкими требованиями.

Middle+ ML-инженер в Pricing

Зарплата не указана

«UZUM TECHNOLOGIES» · Москва

Модели спроса и цены: прогноз спроса, оценка влияния цены и скидки на продажи, рекомендации по оптимальной цене. Качество моделей: feature...

Можно удалённоОт 3 до 6 летДата-сайентистОпубликована 21 сентября

Старший дата-инженер в VK Музыку

Зарплата не указана

VK · Москва

Миграция в целевую архитектуру данных. Реализация и систематизация ETL-процессов согласно требованиям. Оптимизация работы с данными для продуктовой аналитики.

Можно удалённоОт 3 до 6 летДата-сайентистОпубликована 22 сентября

Data Scientist (NLP / Prompt Engineering)

Зарплата не указана

СБЕР · Москва

Развивать промпты агентов: системные и ролевые промпты, few-shot, схемы рассуждения, tool calling, извлечение структурированных знаний из документов.

От 1 года до 3 летДата-сайентистОпубликована 23 сентября

Data Scientist Middle

Зарплата не указана

Koronatech · Новосибирск

Команда ML в Koronatech за 7 лет реализовала более 50 проектов с использованием машинного обучения, таких как: выбор лучшего предложения...

От 1 года до 3 летДата-сайентистОпубликована 28 сентября

Data Engineer / Spark в офисе

Зарплата не указана

Neoflex · Москва

Взаимодействие с командой и заказчиком по уточнению требований. Анализ чужого и написание своего кода на SQL, Python, Spark.

От 1 года до 3 летДата-сайентистОпубликована 28 сентября

Риск-аналитик

Зарплата не указана

Авто Финанс Банк · Москва

Разработка ML-моделей — построение моделей классификации и регрессии для бизнес-задач: от обучения и валидации до мониторинга качества в продакшене...

От 1 года до 3 летДата-сайентистОпубликована 26 сентября

Другие вакансии компании

Дизайнер / AI-аналитик

до 250 000 ₽

СБЕР · Москва

Разработка и развитие фирменного визуального стиля аналитических материалов по AI, технологиям и рынкам. Создание единой дизайн-системы и библиотеки шаблонов...

От 3 до 6 летДизайнерОпубликована 3 сентября

Менеджер по развитию малого бизнеса

от 214 000 ₽+55% к среднему

СБЕР · Петропавловск-Камчатский

Развивать бизнес клиентов из закрепленной базы, подбирая решения от Сбера. Выезжать на переговоры к клиентам. Предлагать клиентам продукты, рекомендованные AI...

От 1 года до 3 летМенеджер по продажамОпубликована 21 сентября

Помощник руководителя (Центр иммерсивных решений)

от 198 300 ₽+92% к среднему

СБЕР · Москва

Планирование рабочего дня руководителя, ведение рабочего графика. Контроль бумажного и электронного документооборота. Ведение деловой переписки с внутренними и внешними клиентами...

От 1 года до 3 летПомощник руководителяОпубликована 22 сентября

Расчёты по этой вакансии

Пригодится до собеседования: сколько останется на руки от названной суммы, как считаются отпускные и переработки.

Ещё по направлению

Модели машинного обучения, прогнозы и рекомендации: Python, статистика, продакшен.