К содержимому

Блог

Сначала evals, потом промпты

Зачем гоняем регрессию LLM-выходов перед каждым релизом — и как это сменило ритм AI-поставки в ZNN.

Evals — новые юнит-тесты

Когда продуктовая команда шипит фичу на LLM, соблазн — крутить промпты уже в проде. Это работает, пока апдейт модели тихо не сменит тон, не снимет комплаенс-гардрейл или не нагаллюцинирует цену.

Eval-сьюты для нас — такой же регрессионный гейт: фиксированный вход, ожидаемые свойства и fail-fast шаг в CI до деплоя.

Что реально мерим

Не каждый выход должен совпасть слово в слово. Скорим:

  • Структурные проверки — форма JSON, обязательные поля, максимальная длина
  • Семантические рубрики — меньшая модель или набор правил ловит нарушения политики
  • Близость к золотому набору — расстояние эмбеддингов до одобренных ответов на рискованных флоу

Как раскатывать на практике

Начните с десяти кейсов из живых тикетов поддержки или продаж. Добавляйте один новый фейл каждый раз, когда прод вас удивляет. За месяц получается осмысленная сетка безопасности, которая не душит эксперименты.

Когда можно пропустить

Исследовательские прототипы и внутренние инструменты могут идти быстрее. Клиентские флоу с деньгами, здоровьем или юридическими последствиями — нет.

Начать проект, если нужно поднять evals к следующему AI-релизу.

Блог