Главная›Вакансии›IT и разработка›Дата-сайентист›Руководитель направления ML Pretrain LLM

СБЕР · Москва

Руководитель направления ML Pretrain LLM — СБЕР

Развивать архитектуру моделей GigaChat. Определять, как должна развиваться архитектура pretrain-моделей: какие направления наиболее важны, как измерять прогресс и что...

Компания набирает: 3438 вакансий

Коротко о вакансии

Зарплату работодатель не назвал — вилку обсуждают на собеседовании. Компания нанимает активно — открытых позиций сейчас 3438.

Описание вакансии

Мы развиваем GigaChat и ищем сильного руководителя направления ML pretrain больших языковых моделей. Недавно мы обучили MoE-модель на 700 миллиардов параметров и не собираемся останавливаться — обучение идёт на кластерах H100 и B200, а pretrain является ядром самого быстрорастущего AI-проекта Сбера.

Это роль для человека, который возьмёт на себя архитектурную часть pretrain: design моделей, законы масштабирования, выбор и адаптация attention / MoE / позиционных схем, а также все архитектурные решения, которые определяют, какой именно будет следующая флагманская модель GigaChat. Нам нужен не просто менеджер, а сильный технический руководитель, который способен глубоко погружаться в детали, самостоятельно собирать ключевые части решения и доводить архитектурные идеи до реального роста качества модели на масштабе.

Обязанности
  • Развивать архитектуру моделей GigaChat
  • Определять, как должна развиваться архитектура pretrain-моделей: какие направления наиболее важны, как измерять прогресс и что в первую очередь ограничивает рост качества модели.
  • Проектировать архитектуру флагманских моделей и отвечать за ключевые архитектурные решения: attention, позиционные схемы (RoPE и варианты), нормализации, активации, инициализация.
  • Развивать MoE-архитектуру: маршрутизация, балансировка экспертов, устойчивость маршрутизатора, влияние на качество и производительность.
  • Работать с long-context и мультимодальностью на уровне архитектуры: что именно нужно менять в модели, чтобы эти возможности работали стабильно.
  • Изучать и применять законы масштабирования
  • Проводить scaling-эксперименты и на их основе принимать решения по размеру модели, ширине / глубине, числу и размеру экспертов, размерам батча и длительности обучения.
  • Предсказывать, как архитектурные изменения поведут себя при переходе с небольших абляций на полный масштаб.
  • Определять и развивать метрики, которые корректно отражают архитектурные изменения в обучении моделей.
  • Определять, в каких случаях архитектурные изменения действительно дают прирост качества по сравнению с более простыми baseline'ами, а в каких — нет.
  • Анализировать стабильность архитектурных решений
  • Разбираться с нестабильностью на больших прогонах со стороны архитектуры: почему конкретная конфигурация расходится, где проявляются артефакты маршрутизации, коллапс энтропии, неустойчивости в attention.
  • Предлагать изменения в нормализациях, клиппинге, точности вычислений и структуре блоков, которые делают обучение более предсказуемым.
  • Обеспечивать безопасное масштабирование при внедрении крупных архитектурных изменений в основной трейн.
  • Писать ключевой код и оставаться сильным исследователем
  • Самостоятельно писать и дорабатывать архитектурные компоненты и абляции.
  • Делать надёжные и воспроизводимые эксперименты: понятные версии данных, конфиги, сравнение запусков, контроль деградаций.
  • Читать статьи, воспроизводить ключевые результаты и адаптировать лучшие идеи под наши задачи и инфраструктуру.
  • Оставаться сильным инженером и исследователем, а не только руководителем: при необходимости самому разбирать узкие места в коде, экспериментах и настройках обучения.
  • Руководить сильной технической командой
  • Руководить командой исследователей и инженеров, работающих над архитектурой, задавать высокую планку по качеству решений, скорости работы и глубине проработки.
  • Помогать команде превращать архитектурные идеи в работающие решения, которые можно встроить в основной цикл обучения.
  • Удерживать баланс между глубиной исследований, инженерной надёжностью и практическим результатом для модели.
Требования
  • Отличное владение Python и PyTorch.
  • Глубокое понимание устройства обучения нейросетей: не на уровне обзоров, а на уровне, где вы можете объяснить, почему конкретная архитектурная конфигурация расходится, глядя на кривые функции потерь, нормы градиентов и энтропии.
  • Глубокое понимание архитектуры LLM: Transformer, attention (MHA/GQA/MLA), RoPE и варианты позиционных эмбеддингов, нормализации, инициализации, long-context, MoE.
  • Практический опыт с обучением больших моделей (а не только инференсом) и проведением архитектурных абляций.
  • Способность самостоятельно взять направление и довести его до результата: от чтения статей и постановки гипотез до внедрения в основной трейн.
  • Умение ставить гипотезы, проектировать эксперименты и принимать решения на основе результатов.
  • Опыт руководства сильной технической командой и готовность лично писать важные части системы руками.

Будет плюсом

  • Опыт работы с MoE-архитектурами: маршрутизатор, балансировка нагрузки, переполнение, артефакты маршрутизации.
  • Опыт проведения scaling-экспериментов и работы с законами масштабирования.
  • Опыт работы с long-context и мультимодальными расширениями LLM.
  • Опыт работы с distributed training (5D-параллелизм: DP/TP/PP/EP/SP) и large-scale инференсом.
  • Публикации, open-source вклад или сильный прикладной research track record.
  • Понимание современных open-source стеков для обучения больших языковых моделей.
Условия
  • Сильные и сложные задачи на переднем крае развития русскоязычных LLM.
  • Большую степень влияния на архитектуру решений, методы обучения и качество итоговой модели.
  • Команду сильных инженеров и исследователей.
  • Возможность совмещать управление направлением с глубокой технической работой.
  • Конкурентную компенсацию, премии и расширенный соцпакет.

Вакансия опубликована 25 сентября, проверена 29.09.2026. Открыть оригинал.

Как откликнуться

Отклик оформляется на странице работодателя — кнопка выше ведёт туда напрямую. Перед отправкой стоит подогнать резюме под текст вакансии: работодатели читают первые строки и ищут в них свои слова. Если рассылаете отклики десятками, посмотрите сервис автооткликов — он отправляет их за вас по заданным настройкам, до 50 в сутки. Про сам поиск работы есть разбор в статье как быстро найти работу.

Спросите нейросети о вакансии

Отвечает DeepSeek по данным этой страницы: зарплата против рынка, условия, работодатель

Вопросы по этой вакансии

Сколько платят на позиции «Руководитель направления ML Pretrain LLM»?

Вилку работодатель не назвал — обсуждать деньги придётся на собеседовании. Для ориентира: в среднем по направлению «Дата-сайентист» платят 190 000 ₽.

Какой опыт нужен?

В требованиях указано: от 3 до 6 лет. Работать нужно на месте, город — Москва.

Вакансия ещё открыта?

Да, на 29.09.2026 она активна: каждую ночь каталог сверяется с источником, закрытые предложения помечаются и уходят из списков.

О компании

СБЕР

Сбер — высокотехнологичная компания и крупнейший банк в России, Центральной и Восточной Европе. Мы собираем лучшие технологии и управленческие методы из мировой практики, обучаем и переобучаем сотрудников, заботимся об их физическом и ментальном здоровье, помогаем достигать поставленных целей и развиваться в выбранном направлении. Мы делаем всё возможное, чтобы каждый сотрудник чувствовал заботу …

Открытых вакансий: 3438

Похожие вакансии

Соседи по направлению с близкими требованиями.

Data Scientist Middle

Зарплата не указана

Koronatech · Новосибирск

Команда ML в Koronatech за 7 лет реализовала более 50 проектов с использованием машинного обучения, таких как: выбор лучшего предложения...

От 1 года до 3 летДата-сайентистОпубликована 28 сентября

Senior Research Engineer (LLM Pretraining)

Зарплата не указана

СБЕР · Москва

Архитектура и законы масштабирования. Рецепт обучения: оптимизаторы, расписание learning rate, нормализация, точность вычислений. Устойчивость больших прогонов и ускорение сходимости.

От 3 до 6 летДата-сайентистОпубликована 25 сентября

Data Engineer / Spark в офисе

Зарплата не указана

Neoflex · Москва

Взаимодействие с командой и заказчиком по уточнению требований. Анализ чужого и написание своего кода на SQL, Python, Spark.

От 1 года до 3 летДата-сайентистОпубликована 28 сентября

Риск-аналитик

Зарплата не указана

Авто Финанс Банк · Москва

Разработка ML-моделей — построение моделей классификации и регрессии для бизнес-задач: от обучения и валидации до мониторинга качества в продакшене...

От 1 года до 3 летДата-сайентистОпубликована 26 сентября

Ведущий математик-алгоритмист / разработчик ЦОС

Зарплата не указана

ВедаПроект · Москва

Разработка и сопровождение корреляционной машины аппаратного приёмника (описание на ПЛИС и/или модели). Проектирование сигнально-кодовых конструкций для локальной радионавигационной...

От 3 до 6 летДата-сайентистОпубликована 18 сентября

ML Research Engineer – Image & Video Generation (Модельные риски генеративных моделей)

Зарплата не указана

СБЕР · Москва

Реализовывать на Python инструменты для запуска моделей, сбора результатов и расчёта метрик. Обеспечивать воспроизводимость экспериментов и развивать внутреннюю библиотеку оценки.

От 3 до 6 летДата-сайентистОпубликована 18 сентября

Другие вакансии компании

Дизайнер / AI-аналитик

до 250 000 ₽

СБЕР · Москва

Разработка и развитие фирменного визуального стиля аналитических материалов по AI, технологиям и рынкам. Создание единой дизайн-системы и библиотеки шаблонов...

От 3 до 6 летДизайнерОпубликована 3 сентября

Менеджер по развитию малого бизнеса

от 214 000 ₽+55% к среднему

СБЕР · Петропавловск-Камчатский

Развивать бизнес клиентов из закрепленной базы, подбирая решения от Сбера. Выезжать на переговоры к клиентам. Предлагать клиентам продукты, рекомендованные AI...

От 1 года до 3 летМенеджер по продажамОпубликована 21 сентября

Помощник руководителя (Центр иммерсивных решений)

от 198 300 ₽+92% к среднему

СБЕР · Москва

Планирование рабочего дня руководителя, ведение рабочего графика. Контроль бумажного и электронного документооборота. Ведение деловой переписки с внутренними и внешними клиентами...

От 1 года до 3 летПомощник руководителяОпубликована 22 сентября

Расчёты по этой вакансии

Пригодится до собеседования: сколько останется на руки от названной суммы, как считаются отпускные и переработки.

Ещё по направлению

Модели машинного обучения, прогнозы и рекомендации: Python, статистика, продакшен.