Оценка качества ИИ-систем (AI Evaluation) — систематическая проверка того, насколько модель, ассистент или агент корректно выполняет целевые задачи в representative scenarios.
Что оценивают
Task success.
Factual accuracy.
Groundedness.
Safety.
Tool-use correctness.
Latency.
Cost.
Human intervention rate.
Offline и online evaluation
Offline Eval
Online Eval
Фиксированный test set
Реальные production interactions
Удобно сравнивать версии
Показывает живой behavior
Контролируемые сценарии
Нужны privacy и monitoring
Eval должен соответствовать use case
Общий benchmark модели не заменяет проверку на ваших данных, задачах, языках и критических edge cases.