Lead AI / RAG Engineer: Self-Hosted Knowledge Platform
Технологии
Описание вакансии
Кратко о роли
Eventum AI ищет Lead AI / RAG Engineer для проектирования и разработки production-grade self-hosted knowledge platform. Роль предполагает работу над архитектурой, интеграцию данных и обеспечение безопасности retrieval-систем.
Ключевые задачи
- Проектирование архитектуры и hands-on разработка production RAG-платформы.
- Разработка ingestion-пайплайнов для различных форматов документов (PDF, сканы, таблицы, Google Workspace).
- Реализация permission-aware retrieval и ACL enforcement.
- Разработка гибридного поиска, эмбеддингов, реранкинга и генерации ответов с цитированием.
- Развертывание и тестирование open-weight моделей через vLLM и аналогичную инфраструктуру.
- Создание систем оценки качества, регрессионного тестирования и обеспечение observability.
Обязательные требования
- 6+ лет профессионального опыта в Software / ML Engineering.
- Опыт разработки production LLM / RAG систем.
- Сильные навыки Python и backend-разработки.
- Практический опыт с embeddings, vector search, reranking и document pipelines.
- Опыт работы с vLLM, SGLang, Triton, TGI или аналогичными технологиями.
- Сильные навыки cloud / infrastructure (Azure, Docker, Terraform, Kubernetes, CI/CD).
- Опыт LLM evaluation и обеспечения production reliability.
Будет плюсом
- Опыт работы с Google Workspace APIs и permissions.
- Знание pgvector / Qdrant.
- Опыт работы с BM25 + dense retrieval.
- Навыки в OCR / Document AI и мультимодальных моделях.
- Опыт работы с Prometheus / Grafana.
- Опыт работы в no-egress или security-sensitive environments.
Условия и бенефиты
- Полностью удалённый формат работы.
- Оплата 65–90 USD gross в час.
- Работа над сложными production-grade AI / RAG системами.
- Прямое взаимодействие с senior-командой Eventum AI и техническим руководством клиента.
Процесс найма
- Для отклика перейдите по ссылке на страницу вакансии.
Eventum AI — AI engineering consultancy, специализирующаяся на разработке production-grade LLM, RAG, agent и document-intelligence систем.
Основные задачи проекта:
- Создать production-grade self-hosted knowledge platform.
- Обеспечить качественный и безопасный retrieval корпоративных данных.
- Реализовать гибридный поиск и генерацию ответов с подтверждением источниками.
- Развернуть и оптимизировать open-weight LLM.
- Построить систему оценки качества и регрессионного тестирования.
- Обеспечить надёжность, наблюдаемость и production deployment решения.
Обязанности:
- Проектировать архитектуру и участвовать в hands-on разработке production RAG / knowledge platform.
- Разрабатывать ingestion документов из Google Workspace, PDF, сканов, таблиц и изображений.
- Реализовывать permission-aware retrieval и ACL enforcement на этапе запроса.
- Разрабатывать hybrid search, embeddings, reranking и генерацию ответов с цитированием.
- Разворачивать и тестировать open-weight модели через vLLM или аналогичную инфраструктуру.
- Создавать evaluation и regression-системы для retrieval, качества ответов, безопасности и обновлений моделей.
- Отвечать за production deployment, observability, CI/CD, документацию и передачу решения.
- Работать напрямую с senior-командой Eventum AI и техническим руководством клиента.
Требования:
- 6+ лет профессионального опыта в Software / ML Engineering.
- Опыт разработки production LLM / RAG систем.
- Сильные навыки Python и backend-разработки.
- Практический опыт с embeddings, vector search, reranking и document pipelines.
- Опыт работы с vLLM, SGLang, Triton, TGI или аналогичными технологиями.
- Сильные навыки cloud / infrastructure.
- Опыт с Azure, Docker, Terraform / Kubernetes и CI/CD.
- Опыт LLM evaluation и обеспечения production reliability.
- Готовность работать одновременно с ML, backend, data и infrastructure.
Будет плюсом:
- Google Workspace APIs и permissions.
- pgvector / Qdrant.
- BM25 + dense retrieval.
- OCR / Document AI.
- Multimodal models, Prometheus / Grafana, опыт работы с security-sensitive environments.
Оригинальная вакансия:
https://t.me/datajobskz/1080