Соберите рубрику до теста
Определите обязательные и критические критерии. Ошибка приветствия не равна выдуманной цене или отсутствию handoff при конфликте.
Каждый критерий должен иметь наблюдаемое условие. «Ответ хороший» нельзя одинаково применить двумя проверяющими.
Шесть критериев одного ответа
Проверьте релевантность вопросу, опору на материал, полноту, ясность, соблюдение границ и правильный следующий шаг. Для каждого зафиксируйте passed, failed или not applicable.
Критическая ошибка делает весь сценарий непройденным независимо от красивого стиля.
- факт совпадает с опубликованным источником;
- нет неподтверждённого обещания;
- собраны только нужные поля;
- человек вызван по правилу;
- ответ понятен без внутреннего жаргона;
- следующий шаг выполним.
Из чего собрать тестовый набор
Используйте реальные типы вопросов без персональных данных, пограничные формулировки, неизвестные факты, возражения и попытки нарушить правило. Добавьте простой контрольный запрос.
Фиксированный набор позволяет сравнивать версии. Новые найденные ошибки добавляются отдельными регрессионными сценариями.
Что проверяет автоматика, а что человек
Автоматика может проверить наличие обязательного поля, запрещённой фразы, ссылки на источник и нужного статуса. Семантическую корректность и уместность сложного ответа подтверждает человек.
NIST рекомендует сочетать измерение с человеческой оценкой и учитывать границы теста. Один модельный судья не является абсолютной истиной.
Какие агрегаты полезны
Считайте долю пройденных сценариев, критические ошибки, причины handoff и регрессии относительно опубликованной версии. Рядом показывайте абсолютное число тестов.
Не сравнивайте модели по одному среднему баллу, если они ошибаются в разных критических местах.
Как использовать реальные диалоги
Оператор помечает исправление и причину. После проверки обезличенный паттерн становится новым тестом или предложением обновить знания.
Не обучайте систему автоматически на каждом ответе менеджера. Исправление может быть разовым исключением или содержать ошибку.
Когда версия готова к публикации
Все критические сценарии пройдены, источники доступны, handoff работает, а результат сохранён с версией. После публикации выполнен smoke в подключённом канале.
Стопроцентный тест не гарантирует отсутствие новых ошибок. Он подтверждает только пройденный набор и создаёт исходную точку мониторинга.
Источники
У каждой опоры есть дата проверки. Если источник изменится, материал нужно пересмотреть.
-
01
Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile NIST · проверено 6 сентября 2026 г.
Использованы рекомендации о границах применения, оценке ответов, мониторинге и человеческом контроле генеративных систем.
-
02
LLM06:2025 Excessive Agency OWASP GenAI Security Project · проверено 6 сентября 2026 г.
Сверены принципы минимальных полномочий, ограниченных функций и подтверждения значимых действий человеком.
-
03
Creating helpful, reliable, people-first content Google Search Central · проверено 6 сентября 2026 г.
Сверены требования к самостоятельному полезному материалу, который отвечает на задачу человека, а не повторяет ключевые слова.
-
04
Учебный путь ИИ-сотрудника Нейроквалификатор · проверено 6 сентября 2026 г.
Сверены фактические роли, база знаний, проверка, каналы, Inbox и передача разговора человеку.
