Created by AIImproved by people
Riqli · living documents · updated continuously
Where AI knowledge meets human practice.
Share with friends
1. Общие положения
1.1. Назначение документа
Настоящий документ устанавливает единые требования к формированию, мониторингу и анализу ключевых показателей эффективности (KPI) для сотрудников и подразделений Riqli. Документ определяет порядок разработки «Карты KPI», методы сбора данных и критерии оценки результативности для всех бизнес-направлений: IT-услуги и разработка ПО, дистанционное образование, управленческий консалтинг, риск-ориентированное управление, управление человеческими ресурсами и знаниями, а также внедрение систем менеджмента качества (СМК) и риск-менеджмента.
Карта KPI является обязательным инструментом управления для всех руководителей и специалистов, чья деятельность подлежит количественной и качественной оценке. Она служит основой для принятия кадровых решений, расчета переменной части оплаты труда и определения векторов стратегического развития.
1.2. Правовая и нормативная основа
Документ разработан в соответствии с Трудовым кодексом Российской Федерации, внутренними регламентами Riqli, стандартами ISO 9001:2015 (Системы менеджмента качества) и ISO 31000:2018 (Менеджмент рисков). При разработке KPI учитываются требования корпоративной стратегии развития и политики управления эффективностью.
Все показатели должны быть согласованы с методологией системы риск-менеджмента, что обеспечивает баланс между достижением целей и допустимым уровнем операционных рисков. Внесение изменений в Карту KPI осуществляется по решению Комитета по управлению эффективностью и фиксируется отдельным приказом.
1.3. Основные термины и определения
- Карта KPI — структурированный набор взаимосвязанных показателей, отражающих ключевые аспекты деятельности подразделения или сотрудника, с указанием целевых значений и весовых коэффициентов.
- Показатель эффективности (KPI) — измеримый индикатор результативности процесса или функции, используемый для оценки прогресса в достижении стратегических целей.
- Метрики качества — количественные характеристики, описывающие соответствие результатов работы установленным стандартам (например, Accuracy, Relevance).
- AI-тренер — специалист, ответственный за адаптацию, калибровку и тестирование моделей машинного обучения и языковых моделей, а также за контроль качества их выходных данных в рамках образовательных и консультационных продуктов Riqli.
2. Цель и задачи должности AI-тренера (в контексте KPI)
2.1. Цель роли
Обеспечение высокого качества и объективности контента, генерируемого AI-системами Riqli, путем мониторинга, оценки и дообучения моделей. Основная цель — достижение целевых значений KPI по релевантности, точности (Accuracy) и минимизации галлюцинаций (Hallucination rate) в соответствии с регламентами платформы SmartQ и требованиями заказчиков.
Деятельность AI-тренера направлена на повышение качества продуктов в области дистанционного образования и управленческого консалтинга, где достоверность информации является критическим фактором успеха.
2.2. Ожидаемые результаты
- Соответствие контента, генерируемого AI, стандартам качества Riqli (не менее 95% по Relevance и Accuracy).
- Снижение Hallucination rate до уровня не более 2% в тестовых и продуктовых выборках.
- Регулярное обновление «Карты KPI» AI-тренера на основе анализа метрик эффективности и обратной связи от потребителей контента.
- Формирование отчетов по результатам human evaluation для руководства и Комитета по управлению эффективностью.
3. Подчинение и организационная структура
3.1. Линии подчинения
AI-тренер находится в функциональном подчинении у Руководителя отдела разработки AI-продуктов и в административном подчинении у Директора по управлению эффективностью. В части выполнения контрольных процедур и оценки KPI взаимодействует с департаментом СМК (Системы менеджмента качества) и HR (Управление человеческими ресурсами).
При выполнении задач в рамках конкретных проектов (например, внедрение AI-ассистента в дистанционное образование) AI-тренер может получать указания от проектных менеджеров с сохранением отчетности по KPI перед функциональным руководителем.
3.2. Матричные связи
- С департаментом разработки ПО — по вопросам интеграции метрик качества в CI/CD пайплайны и мониторинг производительности моделей.
- С департаментом управленческого консалтинга — для согласования критериев Relevance и предметной достоверности.
- С отделом риск-менеджмента — для определения пороговых значений KPI, превышение которых требует запуска плана реагирования на риски.
4. Должностные обязанности AI-тренера
4.1. Разработка и актуализация системы оценки
AI-тренер разрабатывает методологии и чек-листы для проведения human evaluation выходных данных AI. Определяет критерии оценки Accuracy (фактическая точность), Relevance (релевантность запросу) и Hallucination rate (доля вымышленных фактов). Ведет «Карту KPI» подразделения, предлагая корректировки целевых значений на основе анализа операционных данных и стратегических целей Riqli.
Осуществляет калибровку моделей путем формирования датасетов для дообучения (fine-tuning) и валидации. Согласовывает изменения метрик с департаментом СМК для обеспечения соответствия стандартам ISO 9001.
4.2. Мониторинг и контроль качества
Проводит ежедневный мониторинг метрик качества модели в продуктивной среде и в процессе тестирования. Использует инструменты дашбордов (например, Grafana, Prometheus) для визуализации показателей Accuracy и Relevance в разрезе бизнес-процессов. При фиксации отклонений от допустимых значений (бенчмарков) инициирует процедуру «Остановка конвейера» и проводит анализ первопричин (Root Cause Analysis).
Формирует еженедельные сводки по ключевым показателям для руководства. В рамках управления качеством ведет реестр ошибок (Bug Report) с классификацией по типам «галлюцинаций» и «нерелевантности», что служит основой для метрики Hallucination rate.
4.3. Человеческая оценка (Human Evaluation) и асессмент
Организует и проводит сессии human evaluation с привлечением внешних и внутренних экспертов (асессоров) для проверки качества работы AI-моделей. Разрабатывает инструкции для асессоров, определяя шкалы оценки (например, по шкале Лайкерта от 1 до 5).
Анализирует результаты «человеческой оценки», выявляет паттерны ошибок, не улавливаемые автоматическими тестами. Внедряет корректирующие действия на основе этих выводов, обновляя промпты и параметры семплинга (Temperature, Top-P) для повышения Relevance и снижения Hallucination rate.
4.4. Отчетность и анализ эффективности
Подготавливает аналитические отчеты по динамике KPI для Комитета по управлению эффективностью. В отчетах отражает:
- Тренды Accuracy и Relevance за период.
- Статистику Hallucination rate по категориям запросов (образовательные, консультационные, технические).
- Сравнительный анализ целевых и фактических метрик.
Отчетность служит основой для корректировки «Карты KPI» и определения зон фокуса для следующего цикла дообучения моделей. Все отчеты хранятся в корпоративной системе SmartQ в разделе «Управление эффективностью».
4.5. Управление компетенциями и знаниями в области AI
Актуализирует знания о современных архитектурах моделей (Transformer, LLM) и методах оценки их качества (BLEU, ROUGE, BertScore). Делится лучшими практиками с командой разработки через внутренние воркшопы.
В рамках управления человеческими ресурсами и знаниями участвует в разработке программ обучения для сотрудников, использующих AI-инструменты, с акцентом на понимание метрик качества и интерпретацию KPI AI-тренера.
5. Права сотрудника
5.1. Права на доступ к информации и ресурсам
AI-тренер имеет право запрашивать у подразделений Riqli информацию, необходимую для расчета и анализа ключевых показателей эффективности. Включая логи работы системы, данные о пользовательском опыте и отчеты о сбоях. Требовать от департамента разработки ПО предоставления доступа к логам инференса моделей и метрикам производительности инфраструктуры.
5.2. Право на инициативу и согласование
Выносить на рассмотрение Комитета по управлению эффективностью предложения по изменению целевых значений KPI или введению новых метрик. Участвовать в обсуждении бюджетов и ресурсов, выделяемых на дообучение моделей и проведение человеческой оценки.
Останавливать процесс выкатки новой версии модели в продуктивную среду при критическом падении показателей Accuracy или росте Hallucination rate выше установленного порога.
6. Ответственность
6.1. Ответственность за выполнение KPI
Несет персональную ответственность за достижение целевых показателей, зафиксированных в «Карте KPI» AI-тренера на текущий квартал. В случае недостижения плановых значений Accuracy или Relevance обязан подготовить план корректирующих мероприятий.
Ответственность наступает за достоверность данных, предоставляемых в отчетах по human evaluation и мониторингу метрик качества.
6.2. Ответственность за соблюдение регламентов
Ответственность за соблюдение регламентов СМК при проведении оценочных процедур. В случае выявления нарушений методологии оценки (например, использование некорректных датасетов для validation) применяются дисциплинарные взыскания в соответствии с внутренними правилами Riqli.
Несет ответственность за сохранность данных и конфиденциальность информации, полученной в ходе анализа работы AI-систем.
7. Квалификационные требования
7.1. Требования к образованию и опыту
- Высшее образование (магистр или специалист) в области Computer Science, Data Science, Математики, Физики или Лингвистики.
- Опыт работы с моделями машинного обучения (NLP) от 3 лет, опыт в оценке качества AI-систем приветствуется.
- Опыт работы с фреймворками для ML (PyTorch, TensorFlow) и библиотеками для работы с текстами (NLTK, SpaCy).
7.2. Компетенции и навыки
- Глубокое понимание современных LLM (GPT, Gemini, YandexGPT) и принципов их оценки.
- Владение методами human evaluation, знание статистических методов обработки результатов.
- Уверенное владение Python, SQL, знание принципов работы с API и векторными базами данных.
- Понимание бизнес-контекста Riqli: дистанционное образование, консалтинг, риск-менеджмент.
- Наличие сертификатов по Data Science или AI будет преимуществом.
8. Условия работы
8.1. Режим работы и средства
Работа осуществляется в гибридном формате (удаленно / в офисе) с ненормированным графиком в пределах общей рабочей недели. Предоставляется доступ к корпоративным IT-ресурсам, включая облачные вычислительные мощности (GPU кластеры) и лицензионное ПО для разработки и анализа данных.
Рабочие инструменты: корпоративная платформа SmartQ для управления задачами и KPI, система контроля версий Git, среды разработки Jupyter Lab / VS Code.
9. Ключевые показатели эффективности (KPI) AI-тренера
9.1. Accuracy (Точность)
Доля ответов AI, в которых фактические данные полностью соответствуют эталонным или научно-подтвержденным источникам. Целевое значение: не менее 95% для категории «Образование» и не менее 90% для категории «Консалтинг». Расчет производится автоматически на основе кросс-валидации с выделенным тестовым набором данных.
В случае использования математических вычислений, точность проверяется через встроенные формулы, например: , где TP, TN, FP, FN — классические метрики confusion matrix.
9.2. Relevance (Релевантность)
Показатель того, насколько ответ модели соответствует контексту запроса и ожиданиям пользователя. Оценивается по шкале от 0 до 1 (дискретно с шагом 0.1) на основе агрегированной оценки асессоров (средняя взвешенная по категориям запросов).
Целевое значение Relevance: не менее 0.9 для всех типов запросов. Мониторинг проводится еженедельно с использованием A/B тестирования новых промптов.
9.3. Hallucination Rate (Уровень галлюцинаций)
Доля ответов AI, содержащих фактические ошибки, вымышленные цитаты, неверные ссылки или данные, не подтвержденные источниками. Целевой показатель — менее 2% от общего объема ответов.
Измеряется как отношение количества выявленных галлюцинаций к общему числу проверенных ответов за период. При превышении порога в 5% инициируется пересмотр промпт-инжиниринга и датасетов дообучения.
9.4. Human Evaluation Score (HES)
Композитный показатель, рассчитываемый по итогам human evaluation. Включает оценку экспертов по следующим критериям: полезность, ясность, логичность и полнота. Целевой HES — 4.8 из 5.0.
Оценка проводится не реже одного раза в месяц на стратифицированной выборке из 500 диалогов. Сотрудник несет ответственность за планирование и организацию этих сессий.
9.5. Периодичность пересмотра KPI
«Карта KPI» пересматривается ежеквартально Комитетом по управлению эффективностью с учетом изменения бизнес-приоритетов и технологического ландшафта. Внесение изменений оформляется приказом и доводится до сведения AI-тренера не позднее чем за 5 рабочих дней до начала нового квартала.
Промежуточная оценка выполнения KPI проводится ежемесячно для оперативного реагирования на отклонения.
10. Бизнес-процессы, чек-листы и сценарии рабочих потоков
10.1. Процесс дообучения модели (Fine-tuning)
AI-тренер инициирует процесс дообучения при падении Accuracy ниже 93%. Этапы:
- Сбор репрезентативной выборки (датасета) из логов продуктивной среды (10 000+ примеров).
- Аннотирование данных экспертами предметной области (консалтинг, образование).
- Запуск пайплайна дообучения с использованием фреймворка PyTorch на выделенном GPU-кластере.
- Валидация новой модели на тестовом наборе данных и расчет метрик.
- Проведение A/B-теста на 10% трафика перед полным выкатом.
Весь процесс фиксируется в системе управления версиями моделей (MLflow, DVC).
10.2. Процесс Human Evaluation (Человеческая оценка)
Регламентированная процедура оценки качества AI-ответов:
- Формирование выборки запросов (стратификация по типам и сложности).
- Подготовка инструкции для асессоров с четкими критериями оценки (Relevance, Accuracy).
- Распределение задач среди асессоров через платформу (аналог Toloka / Label Studio).
- Сбор оценок и расчет статистических показателей (среднее, медиана, согласованность).
- Генерация отчета и загрузка результатов в SmartQ для привязки к «Карте KPI».
Ответственный: AI-тренер. Периодичность: не реже 1 раза в месяц.
10.3. Чек-лист проверки качества перед релизом
- Проверка Accuracy на офлайн-датасете (последняя версия).
- Проверка Relevance на тестовом наборе промптов от ключевых заказчиков.
- Анализ Hallucination rate на сложных, многозадачных запросах.
- Проверка времени инференса (латентность) на эталонном оборудовании.
- Визуальный пресмотр 50 случайных ответов AI-тренером.
При успешном прохождении всех пунктов чек-листа ставится отметка «Готово к релизу» в системе контроля задач.
10.4. Сценарий реагирования на падение качества
При обнаружении аномалий в метриках (например, резкое падение Accuracy на 5% за час) AI-тренер действует по следующему плану:
- Шаг 1: Идентификация причины (проблемы в данных, сбой в API, изменение в поведении модели).
- Шаг 2: Временный откат к предыдущей стабильной версии модели.
- Шаг 3: Детальный анализ «плохих» запросов и формирование кейсов для дообучения.
- Шаг 4: Уведомление заинтересованных сторон (Руководитель продукта, СМК).
Время на откат: не более 15 минут. Результаты расследования оформляются актом и учитываются при корректировке KPI на следующий период.
10.5. Работа с платформой SmartQ и регламентация
Все задачи AI-тренера, включая планирование сессий human evaluation, отслеживание выполнения KPI и формирование отчетов, ведутся в корпоративной системе SmartQ. В системе реализован модуль «Управление эффективностью», где отображаются дашборды по Accuracy, Relevance и Hallucination rate.
Процесс согласования «Карты KPI» цифровизирован: после создания проекта Карты она направляется на визу ответственным лицам в SmartQ через бизнес-процесс «Согласование документов СМК».
10.6. Взаимодействие с риск-ориентированным управлением
AI-тренер участвует в идентификации рисков, связанных с использованием AI (например, риск юридической ответственности за галлюцинации в консалтинге). Предлагает мероприятия по минимизации этих рисков, включая ужесточение пороговых значений KPI для критичных направлений.
Регулярно представляет в Отдел риск-менеджмента отчеты о потенциальных уязвимостях моделей, что интегрировано в общий процесс риск-ориентированного управления организацией.
11. Заключительные положения
11.1. Вступление в силу и контроль исполнения
Настоящий документ вступает в силу с момента утверждения Генеральным директором Riqli. Контроль за исполнением требований документа возлагается на Директора по управлению эффективностью и Руководителя отдела разработки AI-продуктов.
Сотрудник обязан ознакомиться с документом под подпись в электронной системе управления документами.
11.2. Порядок внесения изменений
Изменения в документ вносятся по инициативе сотрудника, руководителя или Комитета по управлению эффективностью. Проект изменений разрабатывается инициатором, проходит экспертизу в Отделе СМК и утверждается приказом Генерального директора.
Все изменения нумеруются и вносятся в Лист регистрации изменений в конце документа.