Created by AIImproved by people

Riqli · living documents · updated continuously

Where AI knowledge meets human practice.

Share with friends
Job description. MLOps Engineer (MLOps Engineer). Document. (Job description. Job description. MLOps responsibilities. CI/CD for ML. Automation of ML models.)
sections

1. Общие положения

contents

1.1. Назначение документа

Настоящая должностная инструкция определяет цели, задачи, права, обязанности, ответственность и требования к квалификации Инженера MLOps (MLOps-инженера) в организации Riqli. Документ разработан в соответствии с требованиями Трудового кодекса Российской Федерации, внутренними регламентами компании и стандартами системы менеджмента качества (СМК). Инструкция обеспечивает единообразное понимание роли специалиста, ответственного за автоматизацию и эксплуатацию моделей машинного обучения в рамках IT-услуг, разработки ПО и дистанционного образования.

Должностная инструкция является основным регуляторным документом, регулирующим деятельность MLOps-инженера по внедрению практик CI/CD ML и автоматизации ML-моделей. Она способствует эффективной интеграции машинного обучения в бизнес-процессы организации, включая риск-ориентированное управление, управление человеческими ресурсами и предоставление онлайн-платформы.

Все положения инструкции обязательны для исполнения. Изменения и дополнения утверждаются руководителем соответствующего подразделения и отделом управления человеческими ресурсами.

contents

1.2. Основные термины и определения

MLOps (Machine Learning Operations) представляет собой набор практик и инструментов, объединяющих разработку моделей машинного обучения с их эксплуатацией и автоматизацией. CI/CD ML подразумевает непрерывную интеграцию, доставку и развертывание моделей ML с использованием пайплайнов.

Автоматизация ML-моделей включает версионирование данных, кода моделей, артефактов, мониторинг дрифта данных и производительности моделей. В контексте Riqli Инженер MLOps обеспечивает надежность и масштабируемость решений на базе ML в проектах по разработке ПО и онлайн-платформе.

Другие ключевые термины: feature store, model registry, monitoring drift, reproducibility pipelines. Все термины используются в соответствии с лучшими современными практиками отрасли.

contents

1.3. Нормативные ссылки

Инструкция разработана на основе федеральных законов РФ, стандартов ISO по системам менеджмента качества, внутренних политик Riqli в области информационной безопасности, риск-менеджмента и бизнес-инжиниринга. Специалист руководствуется также рекомендациями по MLOps от ведущих платформ, такими как MLflow, Kubeflow, TensorFlow Extended.

При выполнении обязанностей учитываются требования к защите персональных данных и compliance в области ИИ.

sections

2. Цель и область деятельности должности

contents

2.1. Миссия должности

Основная цель Инженера MLOps в Riqli — обеспечить бесперебойный жизненный цикл моделей машинного обучения от экспериментов до промышленной эксплуатации с высоким уровнем автоматизации, надежности и масштабируемости. Специалист способствует ускорению внедрения ML-решений в бизнес-процессы компании, включая дистанционное образование, консалтинг и управление рисками.

Ожидаемые результаты включают сокращение времени вывода моделей в продакшен, минимизацию рисков сбоев и обеспечение воспроизводимости экспериментов.

contents

2.2. Область ответственности

Область деятельности охватывает проектирование и поддержку ML-пайплайнов, внедрение CI/CD для ML, мониторинг моделей в production, интеграцию с существующими DevOps-практиками компании. Инженер MLOps взаимодействует с командами Data Science, разработки ПО и риск-менеджмента.

Деятельность направлена на поддержку онлайн-платформы Riqli для управления качеством, компетенциями и обучением.

sections

3. Подчинение и линии отчетности

contents

3.1. Прямая подчиненность

MLOps-инженер непосредственно подчиняется руководителю направления DevOps / AI Infrastructure или техническому директору (CTO). В матричной структуре взаимодействует с руководителями проектов по разработке ПО и внедрению СМК.

contents

3.2. Функциональные связи

Специалист сотрудничает с Data Scientists, Software Engineers, специалистами по качеству и риск-менеджменту. Предоставляет отчеты о состоянии ML-инфраструктуры руководству.

sections

4. Должностные обязанности

contents

4.1. Проектирование и автоматизация ML-пайплайнов

Инженер MLOps проектирует end-to-end пайплайны для жизненного цикла моделей машинного обучения, включая ingestion данных, feature engineering, training, validation и deployment. Использует современные инструменты, такие как Apache Airflow, Kubeflow, MLflow для оркестрации.

Обеспечивает автоматизацию процессов CI/CD ML с помощью GitHub Actions, GitLab CI или Jenkins, интегрированных с контейнеризацией Docker и оркестрацией Kubernetes. Реализует практики Infrastructure as Code (Terraform, Pulumi) для ML-инфраструктуры.

Внедряет версионирование моделей и данных (DVC, MLflow Model Registry), обеспечивая reproducibility экспериментов.

contents

4.2. Развертывание и мониторинг моделей

Специалист развертывает модели в production-средах (cloud, on-premise, hybrid) с использованием serving-решений типа Seldon, KServe, TorchServe. Настраивает мониторинг производительности, data drift и model drift с помощью Prometheus, Grafana, Evidently AI.

Реализует механизмы автоматического retraining моделей по триггерам (новые данные, снижение метрик). Обеспечивает A/B-тестирование и canary deployments.

Проводит регулярный аудит качества моделей в соответствии с внутренними стандартами Riqli.

contents

4.3. Обеспечение безопасности, compliance и масштабируемости

MLOps-инженер внедряет практики security в ML (model encryption, access control, audit logs). Обеспечивает соответствие требованиям GDPR, ФЗ-152 и внутренним политикам информационной безопасности.

Оптимизирует затраты на инфраструктуру (cost monitoring), масштабирует решения для растущих объемов данных и моделей в проектах компании.

contents

4.4. Сотрудничество и документация

Участвует в кросс-функциональных командах, проводит code review ML-пайплайнов, документирует архитектуру и процессы. Обучает коллег лучшим практикам MLOps в рамках внутреннего дистанционного образования Riqli.

sections

5. Права работника

contents

5.1. Права на доступ и ресурсы

Инженер MLOps имеет право на доступ к необходимым системам, данным (в рамках политики безопасности), облачным ресурсам и инструментам для выполнения задач. Может предлагать и инициировать улучшения процессов автоматизации ML-моделей.

contents

5.2. Права на принятие решений

Принимает технические решения в пределах своей компетенции по выбору инструментов CI/CD ML, архитектуре пайплайнов. Имеет право запрашивать информацию от смежных подразделений.

sections

6. Ответственность и подотчетность

contents

6.1. Материальная и дисциплинарная ответственность

MLOps-инженер несет ответственность за надежность ML-систем, своевременность развертывания моделей и соблюдение сроков проектов. Нарушения могут повлечь дисциплинарную ответственность в соответствии с ТК РФ.

contents

6.2. Ответственность за качество и compliance

Отвечает за качество внедряемых практик, минимизацию рисков простоев моделей, обеспечение информационной безопасности. Подотчетен по KPI и результатам аудитов СМК.

sections

7. Требования к квалификации и компетенциям

contents

7.1. Образование и опыт

Высшее образование в области информационных технологий, математики, компьютерных наук. Не менее 2-3 лет опыта в DevOps/ML Engineering, опыт работы с ML-фреймворками (TensorFlow, PyTorch), облачными платформами (Yandex Cloud, AWS, GCP) и инструментами MLOps.

contents

7.2. Ключевые компетенции

Глубокие знания Python, контейнеризации, Kubernetes, CI/CD. Навыки работы с feature stores, monitoring tools. Сертификаты по AWS Certified Machine Learning, Google Professional ML Engineer или аналогичные приветствуются. Знание бизнес-процессов Riqli в области СМК и риск-менеджмента.

sections

8. Условия труда

contents

8.1. Режим работы

Полный рабочий день, возможность удаленной работы в соответствии с политикой компании. Участие в on-call дежурствах для поддержки production ML-систем.

contents

8.2. Обеспечение ресурсами

Предоставляется необходимое оборудование, доступ к облачным ресурсам, лицензиям на инструменты и обучение.

sections

9. KPI и показатели эффективности

contents

9.1. Основные KPI

Время развертывания новой модели (lead time), uptime ML-сервисов (>99%), частота успешных CI/CD пайплайнов, снижение cost of ML infrastructure, количество автоматизированных процессов. Оценка ежеквартально.

contents

9.2. Дополнительные показатели

Количество решенных инцидентов, качество документации, вклад в внутреннее обучение и улучшение процессов.

sections

10. Бизнес-процессы, чек-листы и сценарии рабочих процессов

contents

10.1. Процесс внедрения новой ML-модели

  • Анализ требований от Data Science команды;
  • Проектирование пайплайна (data → train → validate → deploy);
  • Настройка CI/CD ML;
  • Тестирование и A/B rollout;
  • Мониторинг post-deployment.

Все шаги фиксируются в системе управления задачами и соответствуют регламентам бизнес-инжиниринга Riqli.

contents

10.2. Чек-лист мониторинга production моделей

Ежедневная проверка метрик drift, latency, throughput; реакция на алерты; еженедельный review логов и отчетов; обновление документации. Интеграция с системой риск-менеджмента компании.

contents

10.3. Сценарий автоматизации retraining

Триггер по расписанию или событию → сбор новых данных → обучение → валидация метрик → approval → deployment. Использование современных инструментов для orchestration и version control.