Инженер по обеспечению надежности генеративного ИИ
Технологии
Описание вакансии
Кратко о роли
Lamoda ищет инженера по обеспечению надежности генеративного ИИ для работы над внедрением и эксплуатацией ML-платформ.
Ключевые задачи
- Внедрение и эксплуатация GenAI и ML-платформ.
- Работа с LLM-инференсом и оптимизация производительности.
- Проектирование и эксплуатация API для доступа к моделям.
- Настройка и поддержка RAG-систем.
- Мониторинг ресурсов GPU и стоимости инференса.
Обязательные требования
- Опыт промышленной разработки или эксплуатации GenAI/ML-платформ.
- Практический опыт работы с LLM-инференсом (vLLM, TGI, Triton, llama.cpp).
- Понимание метрик эксплуатации LLM (задержки, throughput, память).
- Опыт проектирования API (авторизация, лимиты, маршрутизация).
- Знание принципов RAG (эмбеддинги, векторный поиск, reranking).
- Готовность работать в офисе в Москве.
Условия и бенефиты
- Фултайм занятость.
- Работа в офисе (Москва).
- Зарплата по итогам собеседования (ориентировочно 300 000 – 450 000 ₽).
Процесс найма
- Для отклика перейдите по ссылке на карьерный сайт компании.
Инженер по обеспечению надежности генеративного ИИ в Lamoda.
Задачи:
- Промышленная разработка, внедрение и эксплуатация GenAI-, ML- или Data-платформ.
- Работа с LLM-инференсом: vLLM, Text Generation Inference, Triton Inference Server, llama.cpp или аналогичные решения.
- Обеспечение надежности и производительности LLM: контроль задержек, throughput, batch-запросов, потоковой генерации, контекстного окна, потребления памяти, GPU-ресурсов и стоимости инференса.
- Проектирование и эксплуатация API для доступа к моделям (OpenAI-совместимые интерфейсы, авторизация, лимиты, маршрутизация, отказоустойчивость).
- Работа с RAG: разбиение документов на фрагменты, эмбеддинги, векторный и гибридный поиск, reranking, фильтрация, версионирование индексов и оценка качества retrieval.
Требования:
- Опыт промышленной разработки, внедрения или эксплуатации GenAI-, ML- или Data-платформ.
- Практический опыт работы с LLM-инференсом.
- Понимание особенностей эксплуатации LLM.
- Опыт проектирования или эксплуатации API.
- Понимание принципов RAG.
Условия:
- Фултайм, офис (Москва).
- Зарплата по итогам собеседования (среднерыночная 300 000 – 450 000 ₽).
Оригинальная вакансия:
https://t.me/myresume_ru/14542