Created by AIImproved by people

Riqli · living documents · updated continuously

Where AI knowledge meets human practice.

Share with friends
Карта KPI / система показателей эффективности. AI-тренер. Document. (KPI. Key performance indicators. Показатели эффективности. Метрики качества. Accuracy. Relevance. Hallucination rate. Human evaluation. Model performance metrics.)
sections

1. Общие положения

contents

1.1. Назначение документа

Настоящий документ устанавливает единые требования к формированию, мониторингу и анализу ключевых показателей эффективности (KPI) для сотрудников и подразделений Riqli. Документ определяет порядок разработки «Карты KPI», методы сбора данных и критерии оценки результативности для всех бизнес-направлений: IT-услуги и разработка ПО, дистанционное образование, управленческий консалтинг, риск-ориентированное управление, управление человеческими ресурсами и знаниями, а также внедрение систем менеджмента качества (СМК) и риск-менеджмента.

Карта KPI является обязательным инструментом управления для всех руководителей и специалистов, чья деятельность подлежит количественной и качественной оценке. Она служит основой для принятия кадровых решений, расчета переменной части оплаты труда и определения векторов стратегического развития.

contents

1.2. Правовая и нормативная основа

Документ разработан в соответствии с Трудовым кодексом Российской Федерации, внутренними регламентами Riqli, стандартами ISO 9001:2015 (Системы менеджмента качества) и ISO 31000:2018 (Менеджмент рисков). При разработке KPI учитываются требования корпоративной стратегии развития и политики управления эффективностью.

Все показатели должны быть согласованы с методологией системы риск-менеджмента, что обеспечивает баланс между достижением целей и допустимым уровнем операционных рисков. Внесение изменений в Карту KPI осуществляется по решению Комитета по управлению эффективностью и фиксируется отдельным приказом.

contents

1.3. Основные термины и определения

  • Карта KPI — структурированный набор взаимосвязанных показателей, отражающих ключевые аспекты деятельности подразделения или сотрудника, с указанием целевых значений и весовых коэффициентов.
  • Показатель эффективности (KPI) — измеримый индикатор результативности процесса или функции, используемый для оценки прогресса в достижении стратегических целей.
  • Метрики качества — количественные характеристики, описывающие соответствие результатов работы установленным стандартам (например, Accuracy, Relevance).
  • AI-тренер — специалист, ответственный за адаптацию, калибровку и тестирование моделей машинного обучения и языковых моделей, а также за контроль качества их выходных данных в рамках образовательных и консультационных продуктов Riqli.
sections

2. Цель и задачи должности AI-тренера (в контексте KPI)

contents

2.1. Цель роли

Обеспечение высокого качества и объективности контента, генерируемого AI-системами Riqli, путем мониторинга, оценки и дообучения моделей. Основная цель — достижение целевых значений KPI по релевантности, точности (Accuracy) и минимизации галлюцинаций (Hallucination rate) в соответствии с регламентами платформы SmartQ и требованиями заказчиков.

Деятельность AI-тренера направлена на повышение качества продуктов в области дистанционного образования и управленческого консалтинга, где достоверность информации является критическим фактором успеха.

contents

2.2. Ожидаемые результаты

  • Соответствие контента, генерируемого AI, стандартам качества Riqli (не менее 95% по Relevance и Accuracy).
  • Снижение Hallucination rate до уровня не более 2% в тестовых и продуктовых выборках.
  • Регулярное обновление «Карты KPI» AI-тренера на основе анализа метрик эффективности и обратной связи от потребителей контента.
  • Формирование отчетов по результатам human evaluation для руководства и Комитета по управлению эффективностью.
sections

3. Подчинение и организационная структура

contents

3.1. Линии подчинения

AI-тренер находится в функциональном подчинении у Руководителя отдела разработки AI-продуктов и в административном подчинении у Директора по управлению эффективностью. В части выполнения контрольных процедур и оценки KPI взаимодействует с департаментом СМК (Системы менеджмента качества) и HR (Управление человеческими ресурсами).

При выполнении задач в рамках конкретных проектов (например, внедрение AI-ассистента в дистанционное образование) AI-тренер может получать указания от проектных менеджеров с сохранением отчетности по KPI перед функциональным руководителем.

contents

3.2. Матричные связи

  • С департаментом разработки ПО — по вопросам интеграции метрик качества в CI/CD пайплайны и мониторинг производительности моделей.
  • С департаментом управленческого консалтинга — для согласования критериев Relevance и предметной достоверности.
  • С отделом риск-менеджмента — для определения пороговых значений KPI, превышение которых требует запуска плана реагирования на риски.
sections

4. Должностные обязанности AI-тренера

contents

4.1. Разработка и актуализация системы оценки

AI-тренер разрабатывает методологии и чек-листы для проведения human evaluation выходных данных AI. Определяет критерии оценки Accuracy (фактическая точность), Relevance (релевантность запросу) и Hallucination rate (доля вымышленных фактов). Ведет «Карту KPI» подразделения, предлагая корректировки целевых значений на основе анализа операционных данных и стратегических целей Riqli.

Осуществляет калибровку моделей путем формирования датасетов для дообучения (fine-tuning) и валидации. Согласовывает изменения метрик с департаментом СМК для обеспечения соответствия стандартам ISO 9001.

contents

4.2. Мониторинг и контроль качества

Проводит ежедневный мониторинг метрик качества модели в продуктивной среде и в процессе тестирования. Использует инструменты дашбордов (например, Grafana, Prometheus) для визуализации показателей Accuracy и Relevance в разрезе бизнес-процессов. При фиксации отклонений от допустимых значений (бенчмарков) инициирует процедуру «Остановка конвейера» и проводит анализ первопричин (Root Cause Analysis).

Формирует еженедельные сводки по ключевым показателям для руководства. В рамках управления качеством ведет реестр ошибок (Bug Report) с классификацией по типам «галлюцинаций» и «нерелевантности», что служит основой для метрики Hallucination rate.

contents

4.3. Человеческая оценка (Human Evaluation) и асессмент

Организует и проводит сессии human evaluation с привлечением внешних и внутренних экспертов (асессоров) для проверки качества работы AI-моделей. Разрабатывает инструкции для асессоров, определяя шкалы оценки (например, по шкале Лайкерта от 1 до 5).

Анализирует результаты «человеческой оценки», выявляет паттерны ошибок, не улавливаемые автоматическими тестами. Внедряет корректирующие действия на основе этих выводов, обновляя промпты и параметры семплинга (Temperature, Top-P) для повышения Relevance и снижения Hallucination rate.

contents

4.4. Отчетность и анализ эффективности

Подготавливает аналитические отчеты по динамике KPI для Комитета по управлению эффективностью. В отчетах отражает:

  • Тренды Accuracy и Relevance за период.
  • Статистику Hallucination rate по категориям запросов (образовательные, консультационные, технические).
  • Сравнительный анализ целевых и фактических метрик.

Отчетность служит основой для корректировки «Карты KPI» и определения зон фокуса для следующего цикла дообучения моделей. Все отчеты хранятся в корпоративной системе SmartQ в разделе «Управление эффективностью».

contents

4.5. Управление компетенциями и знаниями в области AI

Актуализирует знания о современных архитектурах моделей (Transformer, LLM) и методах оценки их качества (BLEU, ROUGE, BertScore). Делится лучшими практиками с командой разработки через внутренние воркшопы.

В рамках управления человеческими ресурсами и знаниями участвует в разработке программ обучения для сотрудников, использующих AI-инструменты, с акцентом на понимание метрик качества и интерпретацию KPI AI-тренера.

sections

5. Права сотрудника

contents

5.1. Права на доступ к информации и ресурсам

AI-тренер имеет право запрашивать у подразделений Riqli информацию, необходимую для расчета и анализа ключевых показателей эффективности. Включая логи работы системы, данные о пользовательском опыте и отчеты о сбоях. Требовать от департамента разработки ПО предоставления доступа к логам инференса моделей и метрикам производительности инфраструктуры.

contents

5.2. Право на инициативу и согласование

Выносить на рассмотрение Комитета по управлению эффективностью предложения по изменению целевых значений KPI или введению новых метрик. Участвовать в обсуждении бюджетов и ресурсов, выделяемых на дообучение моделей и проведение человеческой оценки.

Останавливать процесс выкатки новой версии модели в продуктивную среду при критическом падении показателей Accuracy или росте Hallucination rate выше установленного порога.

sections

6. Ответственность

contents

6.1. Ответственность за выполнение KPI

Несет персональную ответственность за достижение целевых показателей, зафиксированных в «Карте KPI» AI-тренера на текущий квартал. В случае недостижения плановых значений Accuracy или Relevance обязан подготовить план корректирующих мероприятий.

Ответственность наступает за достоверность данных, предоставляемых в отчетах по human evaluation и мониторингу метрик качества.

contents

6.2. Ответственность за соблюдение регламентов

Ответственность за соблюдение регламентов СМК при проведении оценочных процедур. В случае выявления нарушений методологии оценки (например, использование некорректных датасетов для validation) применяются дисциплинарные взыскания в соответствии с внутренними правилами Riqli.

Несет ответственность за сохранность данных и конфиденциальность информации, полученной в ходе анализа работы AI-систем.

sections

7. Квалификационные требования

contents

7.1. Требования к образованию и опыту

  • Высшее образование (магистр или специалист) в области Computer Science, Data Science, Математики, Физики или Лингвистики.
  • Опыт работы с моделями машинного обучения (NLP) от 3 лет, опыт в оценке качества AI-систем приветствуется.
  • Опыт работы с фреймворками для ML (PyTorch, TensorFlow) и библиотеками для работы с текстами (NLTK, SpaCy).
contents

7.2. Компетенции и навыки

  • Глубокое понимание современных LLM (GPT, Gemini, YandexGPT) и принципов их оценки.
  • Владение методами human evaluation, знание статистических методов обработки результатов.
  • Уверенное владение Python, SQL, знание принципов работы с API и векторными базами данных.
  • Понимание бизнес-контекста Riqli: дистанционное образование, консалтинг, риск-менеджмент.
  • Наличие сертификатов по Data Science или AI будет преимуществом.
sections

8. Условия работы

contents

8.1. Режим работы и средства

Работа осуществляется в гибридном формате (удаленно / в офисе) с ненормированным графиком в пределах общей рабочей недели. Предоставляется доступ к корпоративным IT-ресурсам, включая облачные вычислительные мощности (GPU кластеры) и лицензионное ПО для разработки и анализа данных.

Рабочие инструменты: корпоративная платформа SmartQ для управления задачами и KPI, система контроля версий Git, среды разработки Jupyter Lab / VS Code.

sections

9. Ключевые показатели эффективности (KPI) AI-тренера

contents

9.1. Accuracy (Точность)

Доля ответов AI, в которых фактические данные полностью соответствуют эталонным или научно-подтвержденным источникам. Целевое значение: не менее 95% для категории «Образование» и не менее 90% для категории «Консалтинг». Расчет производится автоматически на основе кросс-валидации с выделенным тестовым набором данных.

В случае использования математических вычислений, точность проверяется через встроенные формулы, например: Accuracy=TP+TNTP+TN+FP+FNAccuracy = \frac{TP + TN}{TP + TN + FP + FN}, где TP, TN, FP, FN — классические метрики confusion matrix.

contents

9.2. Relevance (Релевантность)

Показатель того, насколько ответ модели соответствует контексту запроса и ожиданиям пользователя. Оценивается по шкале от 0 до 1 (дискретно с шагом 0.1) на основе агрегированной оценки асессоров (средняя взвешенная по категориям запросов).

Целевое значение Relevance: не менее 0.9 для всех типов запросов. Мониторинг проводится еженедельно с использованием A/B тестирования новых промптов.

contents

9.3. Hallucination Rate (Уровень галлюцинаций)

Доля ответов AI, содержащих фактические ошибки, вымышленные цитаты, неверные ссылки или данные, не подтвержденные источниками. Целевой показатель — менее 2% от общего объема ответов.

Измеряется как отношение количества выявленных галлюцинаций к общему числу проверенных ответов за период. При превышении порога в 5% инициируется пересмотр промпт-инжиниринга и датасетов дообучения.

contents

9.4. Human Evaluation Score (HES)

Композитный показатель, рассчитываемый по итогам human evaluation. Включает оценку экспертов по следующим критериям: полезность, ясность, логичность и полнота. Целевой HES — 4.8 из 5.0.

Оценка проводится не реже одного раза в месяц на стратифицированной выборке из 500 диалогов. Сотрудник несет ответственность за планирование и организацию этих сессий.

contents

9.5. Периодичность пересмотра KPI

«Карта KPI» пересматривается ежеквартально Комитетом по управлению эффективностью с учетом изменения бизнес-приоритетов и технологического ландшафта. Внесение изменений оформляется приказом и доводится до сведения AI-тренера не позднее чем за 5 рабочих дней до начала нового квартала.

Промежуточная оценка выполнения KPI проводится ежемесячно для оперативного реагирования на отклонения.

sections

10. Бизнес-процессы, чек-листы и сценарии рабочих потоков

contents

10.1. Процесс дообучения модели (Fine-tuning)

AI-тренер инициирует процесс дообучения при падении Accuracy ниже 93%. Этапы:

  1. Сбор репрезентативной выборки (датасета) из логов продуктивной среды (10 000+ примеров).
  2. Аннотирование данных экспертами предметной области (консалтинг, образование).
  3. Запуск пайплайна дообучения с использованием фреймворка PyTorch на выделенном GPU-кластере.
  4. Валидация новой модели на тестовом наборе данных и расчет метрик.
  5. Проведение A/B-теста на 10% трафика перед полным выкатом.

Весь процесс фиксируется в системе управления версиями моделей (MLflow, DVC).

contents

10.2. Процесс Human Evaluation (Человеческая оценка)

Регламентированная процедура оценки качества AI-ответов:

  • Формирование выборки запросов (стратификация по типам и сложности).
  • Подготовка инструкции для асессоров с четкими критериями оценки (Relevance, Accuracy).
  • Распределение задач среди асессоров через платформу (аналог Toloka / Label Studio).
  • Сбор оценок и расчет статистических показателей (среднее, медиана, согласованность).
  • Генерация отчета и загрузка результатов в SmartQ для привязки к «Карте KPI».

Ответственный: AI-тренер. Периодичность: не реже 1 раза в месяц.

contents

10.3. Чек-лист проверки качества перед релизом

  • Проверка Accuracy на офлайн-датасете (последняя версия).
  • Проверка Relevance на тестовом наборе промптов от ключевых заказчиков.
  • Анализ Hallucination rate на сложных, многозадачных запросах.
  • Проверка времени инференса (латентность) на эталонном оборудовании.
  • Визуальный пресмотр 50 случайных ответов AI-тренером.

При успешном прохождении всех пунктов чек-листа ставится отметка «Готово к релизу» в системе контроля задач.

contents

10.4. Сценарий реагирования на падение качества

При обнаружении аномалий в метриках (например, резкое падение Accuracy на 5% за час) AI-тренер действует по следующему плану:

  • Шаг 1: Идентификация причины (проблемы в данных, сбой в API, изменение в поведении модели).
  • Шаг 2: Временный откат к предыдущей стабильной версии модели.
  • Шаг 3: Детальный анализ «плохих» запросов и формирование кейсов для дообучения.
  • Шаг 4: Уведомление заинтересованных сторон (Руководитель продукта, СМК).

Время на откат: не более 15 минут. Результаты расследования оформляются актом и учитываются при корректировке KPI на следующий период.

contents

10.5. Работа с платформой SmartQ и регламентация

Все задачи AI-тренера, включая планирование сессий human evaluation, отслеживание выполнения KPI и формирование отчетов, ведутся в корпоративной системе SmartQ. В системе реализован модуль «Управление эффективностью», где отображаются дашборды по Accuracy, Relevance и Hallucination rate.

Процесс согласования «Карты KPI» цифровизирован: после создания проекта Карты она направляется на визу ответственным лицам в SmartQ через бизнес-процесс «Согласование документов СМК».

contents

10.6. Взаимодействие с риск-ориентированным управлением

AI-тренер участвует в идентификации рисков, связанных с использованием AI (например, риск юридической ответственности за галлюцинации в консалтинге). Предлагает мероприятия по минимизации этих рисков, включая ужесточение пороговых значений KPI для критичных направлений.

Регулярно представляет в Отдел риск-менеджмента отчеты о потенциальных уязвимостях моделей, что интегрировано в общий процесс риск-ориентированного управления организацией.

sections

11. Заключительные положения

contents

11.1. Вступление в силу и контроль исполнения

Настоящий документ вступает в силу с момента утверждения Генеральным директором Riqli. Контроль за исполнением требований документа возлагается на Директора по управлению эффективностью и Руководителя отдела разработки AI-продуктов.

Сотрудник обязан ознакомиться с документом под подпись в электронной системе управления документами.

contents

11.2. Порядок внесения изменений

Изменения в документ вносятся по инициативе сотрудника, руководителя или Комитета по управлению эффективностью. Проект изменений разрабатывается инициатором, проходит экспертизу в Отделе СМК и утверждается приказом Генерального директора.

Все изменения нумеруются и вносятся в Лист регистрации изменений в конце документа.