Проектирование и поддержка GPU-кластера инференса (Nvidia) для десятков тысяч пользователей: скалирование, балансировка и приоритизация запросов, пользовательские лимиты.
Компания набирает: 220 вакансий
Коротко о вакансии
Зарплату работодатель не назвал — вилку обсуждают на собеседовании. В требованиях: python, fastapi. Компания нанимает активно — открытых позиций сейчас 220.
Описание вакансии
О команде: Наша команда обеспечивает доступность нейросетей для тысяч пользователей одновременно. Мы сопровождаем и улучшаем production-платформу для хостинга LLM: ее надежность, производительность и масштабирование. Кроме того, мы создаём прикладные AI-продукты на базе LLM. Ищем опытного инженера, которому интересно работать и с платформенной частью, и с продуктовой.
Чем предстоит заниматься:
Инфраструктура и высоконагруженный инференс (Platform Engineering):
Проектирование и поддержка GPU-кластера инференса (Nvidia) для десятков тысяч пользователей: скалирование, балансировка и приоритизация запросов, пользовательские лимиты;
Надежность и observability: обеспечение SLA и предотвращение регрессий;
Оценка и внедрение новых LLM.
Продуктовая разработка (LLM Application):
Разработка AI-сервисов: AI Code Assistant (Co-Pilot), AI Chat, AI Code Review;
Проектирование пайплайнов автоматизаций: tool/function calling, обработка ошибок, управление контекстом/состоянием;
Интеграции: встраивание AI-сервисов в корпоративную среду (API, БД, legacy-системы).
Исследования и прототипирование (R&D):
Проведение экспериментов, создание MVP и выстраивание пути доведения до продакшена;
Исследование новых технологий и подходов для улучшения продуктов.
Мы ждем от будущего члена команды:
Экспертиза в Python & Backend:
Опыт разработки на Python (5+ лет), знание стандартов: typing, асинхронность, паттерны проектирования;
Опыт создания высоконагруженных API (FastAPI или аналоги), работа с очередями, воркерами и фоновыми задачами.
Архитектура и надежность (Production):
Опыт построения gateway/router, управление ключами, маршрутизация, пользовательские лимиты;
Опыт поддержки высоконагруженных сервисов в продакшене: стабильность контрактов, обработка ошибок.
Глубокие знания LLM & Inference:
Опыт работы с инструментами инференса (vLLM, SGLang, OpenAI API), понимание их внутренней работы;
Опыт настройки инференса под highload: latency/throughput, управление GPU-ресурсами;
Опыт построения решений с tool/function calling: MCP, guardrails, борьба с галлюцинациями.
Дополнительно приветствуем:
Насмотренность в применении AI агентов, мультиагентных систем, оркестрации инструментов;
Понимание основных метрик качества LLM решений, опыт проведения A/B-тестов и офлайн-оценки: eval-сеты, human eval, etc;
Опыт Lua-разработки;
Опыт разработки и интеграции MCP.
Вакансия опубликована 25 сентября, проверена 29.09.2026. Открыть оригинал.
Ключевые навыки
PythonFastAPI
Как откликнуться
Отклик оформляется на странице работодателя — кнопка выше ведёт туда напрямую.
Перед отправкой стоит подогнать резюме под текст вакансии: работодатели читают первые строки и ищут в них свои слова.
Если рассылаете отклики десятками, посмотрите сервис автооткликов — он отправляет их за вас
по заданным настройкам, до 50 в сутки. Про сам поиск работы есть разбор в статье
как быстро найти работу.
Спросите нейросети о вакансии
Отвечает DeepSeek по данным этой страницы: зарплата против рынка, условия, работодатель
Вопросы по этой вакансии
Сколько платят на позиции «Senior LLM Inference Backend Engineer»?
Вилку работодатель не назвал — обсуждать деньги придётся на собеседовании. Для ориентира: в среднем по направлению «Дата-сайентист» платят 190 000 ₽.
Какой опыт нужен?
В требованиях указано: от 3 до 6 лет. Формат работы удалённый, переезд не потребуется.
Вакансия ещё открыта?
Да, на 29.09.2026 она активна: каждую ночь каталог сверяется с источником, закрытые предложения помечаются и уходят из списков.
YADRO – российская технологическая компания, деятельность которой пронизывает все сферы цифровой жизни человека на территории России. С 2014 года мы создаём, производим и поддерживаем фундаментальные для российского рынка продукты: линейки серверов, систем хранения данных и коммутаторы для ЦОДов различных ИТ-компаний, банков, ритейлеров, предприятий сферы образования, энергетики, транспорта и тд. …
Реализовывать и дорабатывать подходы post-training и online RL. Проектировать и проводить эксперименты: формулировать гипотезы, подбирать конфигурации, анализировать результаты не...
Создавать и развивать AI-ассистентов для разработки и аналитики: кодовые AI ассистенты для автоматизации разработки, помощник аналитика для ускорения экспериментов...
Можно удалённоОт 3 до 6 летДата-сайентистОпубликована 25 сентября
Мультимодальные датасеты. Сбор и подготовка данных для задач с изображениями, аудио и видео: диалоги, инструкции, пользовательские сценарии. Пайплайны данных.
Организация и ведение операционной деятельности команды: дейли-митинги, спринт-планирования, ретроспективы, проведение демо для заказчика. Управление командам разработки ИИ проектов...
Проводить исследования и писать тесты к разработанным алгоритмам. Разрабатывать инструменты автоматизации настроек, проверок и выпуска прибора. Участвовать в стендовой отработке...
Разрабатывать конструкции радиоэлектронных устройств, испытательных стендов и технологической оснастки. Проводить реверс-инжиниринг существующих изделий и анализ требований заказчика.
Администрированием, развитием и поддержкой серверной инфраструктуры на базе Linux. Настройкой, поддержкой и оптимизацией веб-серверов и прокси-серверов (Nginx, HAProxy...
Отвечать за процессы: синхронизация, планирование, развитие эффективности команды и формирование культуры (вместе с продуктовым и техническим лидами). Ведение коммуникации в...