ГлавнаяВакансииIT и разработкаАналитик данныхИнженер по оценке качества ГенИИ-моделей (GenAI Evaluation Engineer)

СБЕР · Новосибирск

Инженер по оценке качества ГенИИ-моделей (GenAI Evaluation Engineer) — СБЕР

Глубоко разбираемся в подходах команд-разработчиков и в бизнес-процессах, где работают модели. Критически рассматриваем архитектурные и методологические решения и...

Берут без опытаКомпания набирает: 3438 вакансий

Коротко о вакансии

Зарплату работодатель не назвал — вилку обсуждают на собеседовании. Опыт не требуется: подойдёт новичкам и тем, кто переходит из смежной профессии. Компания нанимает активно — открытых позиций сейчас 3438.

Описание вакансии

Наша команда отвечает за независимую оценку и контроль качества генеративных моделей Банка.

Наша основная задача оценить флагманские генеративные модели Сбера – GigaChat, Kandinsky, GigaCode и PhysicalAI решений. Мы первыми видим, на что способна новая модель и проводим оценку новых возможностей прежде чем она выйдет к пользователям.

Мы не просто «проверяем метрики», а:

  • глубоко разбираемся в подходах команд-разработчиков и в бизнес-процессах, где работают модели
  • критически рассматриваем архитектурные и методологические решения и предлагаем улучшения
  • разрабатываем собственные проверки, метрики и бенчмарки и фреймворки для их запуска
  • проводим оценку логов пользователей для построения наиболее релевантного тестирования

Отдельный фокус – R&D деятельность:

  • создание новых методологий оценки качества
  • участие в разработке и развитии передовых банковских и российских бенчмарков (MERA, POLLUX и др.)
  • адаптация передовых мировых бенчмарков под специфику банковских кейсов
  • и многое другое

Эта роль про независимое измерение фундаментального качества модели: не про их обучение – этим занимается отдельная команда.

Что предстоит делать
  • придумывать, как вообще измерить модель

ИИ стремительно развивается в мире и выходят новые модели и их виды, однако не всегда любая новая модель стала лучше предыдущей. Вам будет необходимо создать план по её проверке: что именно измерять, на какой выборке, с чем сравнивать, какая разница вообще будет считаться разницей в реальном качестве.

  • отвечать за достоверность измерений

Полученные метрики не всегда отражают только лишь качество модели. Нужно уметь отделять реальный прирост качества от прочих факторов: ловить утечки данных в обучение, отличать дефект модели от дефекта замера, промпта или обвязки и проявлять тот же скепсис к собственной методологии: измеряем ли мы то, что заявили.

  • разбираться в причинах ошибок

«Модель ошиблась» – это не вывод, а начало работы. Найденная вами причина той или иной проблемы модели превращается в рекомендацию команде разработки, а рекомендация – в следующую версию модели, которая этой ошибки уже не делает.

  • строить автоматическую оценку

Разрабатывать LLM- и VLM-судей под конкретные задачи, разрабатывать с нуля собственные или дорабатывать существующие библиотеки валидации полного цикла и следим за фронтиром AI-исследований в области оценки моделей

  • строить то, чем пользуются другие

Фреймворки оценки, который вы развиваете – общие для команд по всему Банку. Бенчмарки, которые вы делаете, являются достоверной базой реального качества для разработчиков Банка и вне.

Требования
  • умение проводить технический и научный ресерч: находить и критически разбирать актуальные статьи, бенчмарки, модели и реализации; переводить ресерч в конкретные идеи для тестирования и развития внутренних подходов
  • статистика и дизайн эксперимента: доверительные интервалы, размер выборки, проверка гипотез, поправки на множественные сравнения
  • понимание современных AI-агентов и агентных систем: понимать, чем агент отличается от обычного вызова LLM; знать основные компоненты агентной системы: роли, инструменты, контекст, память и оркестрация
  • понимаете, как устроены генеративным модели изнутри: трансформер и механизм внимания, диффузии, токенизация, параметры генерации, этапы обучения
  • опыт с генеративными моделями и понимание, как их оценивают: метрики, бенчмарки, human evaluation, Model-as-a-judge и его ограничения
  • продуктовое мышление: связывать тестирование с реальными пользовательскими сценариями и понимать, какие ошибки критичны для продукта, понимать влияние результатов на релиз и дальнейшее развитие модели
  • Python на продакшн-уровне: чистый код по PEP 8, ООП и типовые паттерны проектирования, аннотации типов, привычка к линтерам и статическому анализу (ruff, mypy). Создаете и поддерживаете production-код eval-пайплайнов, читаете и ревьюите чужой
  • будет плюсом: R&D-опыт или участие в создании бенчмарков; мультимодальные модели (изображения, видео, аудио); evaluation-фреймворки и harness; RAG; работа с асессорами; coding-агенты (Claude Code, Codex, Cursor); опыт работы с оркестрацией: LangGraph, OpenClaw, навыки вайбкодинга и AI-assisted coding.
Условия
  • годовая премия до 6 окладов и регулярный пересмотр зарплат
  • гибкий формат удаленной работы на территории г. Новосибирска
  • расширенный ДМС, льготное страхование для семьи
  • более 400 образовательных программ СберУниверситета
  • DS&AI community (600+ специалистов, митапы, мастер-классы)
  • корпоративный спортзал
  • гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
  • подписка Прайм с возможностью совместного использования на трёх близких.
  • реферальная программа для сотрудников: можно пригласить в команду знакомых профессионалов и получить вознаграждение
  • современный офис и гибридный формат, спортзал, снэки и кофе.

Вакансия опубликована 17 сентября, проверена 18.09.2026. Открыть оригинал.

Как откликнуться

Отклик оформляется на странице работодателя — кнопка выше ведёт туда напрямую. Перед отправкой стоит подогнать резюме под текст вакансии: работодатели читают первые строки и ищут в них свои слова. Если рассылаете отклики десятками, посмотрите сервис автооткликов — он отправляет их за вас по заданным настройкам, до 50 в сутки. Про сам поиск работы есть разбор в статье как быстро найти работу.

Вопросы по этой вакансии

Сколько платят на позиции «Инженер по оценке качества ГенИИ-моделей (GenAI Evaluation Engineer)»?

Вилку работодатель не назвал — обсуждать деньги придётся на собеседовании. Для ориентира: в среднем по направлению «Аналитик данных» платят 115 000 ₽.

Какой опыт нужен?

В требованиях указано: нет опыта. Работать нужно на месте, город — Новосибирск.

Вакансия ещё открыта?

Да, на 18.09.2026 она активна: каждую ночь каталог сверяется с источником, закрытые предложения помечаются и уходят из списков.

О компании

СБЕР

Сбер — высокотехнологичная компания и крупнейший банк в России, Центральной и Восточной Европе. Мы собираем лучшие технологии и управленческие методы из мировой практики, обучаем и переобучаем сотрудников, заботимся об их физическом и ментальном здоровье, помогаем достигать поставленных целей и развиваться в выбранном направлении. Мы делаем всё возможное, чтобы каждый сотрудник чувствовал заботу …

Открытых вакансий: 3438

Похожие вакансии

Соседи по направлению с близкими требованиями.

Начальник отдела разработки DWH и BI

Зарплата не указана

РМК Диджитал · Екатеринбург

Планирование, постановка задач сотрудникам отдела, контроль выполнения. Разработка решений в области хранилища данных и BI-аналитики. Разработка КХД.

От 3 до 6 летАналитик данныхОпубликована 15 сентября

Data Engineer (Новосибирск)

Зарплата не указана

СБЕР · Новосибирск

Поиск и анализ источников данных. Аналитика и проектирование витрин данных под потребности бизнес-заказчиков. Разработка витрин данных на основе Greenplum...

От 3 до 6 летАналитик данныхОпубликована 15 сентября

Консультант-аналитик 1С

до 120 000 ₽

АКВАСТОК · Краснодар

Составление технических заданий для разработчиков. Написание инструкций по работе с программами. Анализ задачи и подбор оптимального решения (доработка конфигурации).

От 1 года до 3 летАналитик данныхОпубликована 17 сентября

Стажер в отдел прогнозирования спроса с функциями аналитика

до 75 000 ₽

METRO Россия · Москва

Построение прогноза продаж по категории товара. Расчёт промо и сезонных коэффициентов. Анализ факторов улучшения точности прогнозирования. Работа с прогнозом на...

Нет опытаПроектАналитик данныхОпубликована 17 сентября

Fullstack аналитик (FMCG/Retail)

Зарплата не указана

IBS · Нижний Новгород

Декомпозиция бизнес-требований по техническим характеристикам. Участие в выработке решений по архитектурному проекту. Постановка задач по разработке и их сопровождение.

От 3 до 6 летАналитик данныхОпубликована 14 сентября

Аналитик

Зарплата не указана

7 Утра · Воронеж

Сбор и обработка данных, анализ, прогнозирование, предоставление информации. Формирование и предоставление регулярной отчетности, аналитической информации. План-факторный анализ, подготовка презентаций.

От 3 до 6 летАналитик данныхОпубликована 14 сентября

Другие вакансии компании

Senior QA Automation Engineer (HR-платформа)

от 260 000 ₽+117% к среднему

СБЕР · Москва

Тестирование приложений: Web-приложение (включая PWA), Backend-тестирование, API-тестирование, мобильные приложения (Android, iOS, iPad). Работа с Jira (управление задачами...

От 3 до 6 летТестировщикОпубликована 17 сентября

Дизайнер / AI-аналитик

до 250 000 ₽

СБЕР · Москва

Разработка и развитие фирменного визуального стиля аналитических материалов по AI, технологиям и рынкам. Создание единой дизайн-системы и библиотеки шаблонов...

От 3 до 6 летДизайнерОпубликована 3 сентября

Персональный менеджер Сбер Премьер

от 225 900 ₽+51% к среднему

СБЕР · Москва

Вести инвестиционный портфель клиента. Готовить для клиента предложения по оптимальному набору продуктов и услуг в зависимости от его профиля.

От 1 года до 3 летМенеджер по продажамОпубликована 17 сентября

Расчёты по этой вакансии

Пригодится до собеседования: сколько останется на руки от названной суммы, как считаются отпускные и переработки.

Ещё по направлению

SQL, BI-отчёты и дашборды: сбор данных, витрины, ответы бизнесу на вопросы цифрами.