Что оценивают
- Task success.
- Factual accuracy.
- Groundedness.
- Safety.
- Tool-use correctness.
- Latency.
- Cost.
- Human intervention rate.
Offline и online evaluation
Eval должен соответствовать use case
Общий benchmark модели не заменяет проверку на ваших данных, задачах, языках и критических edge cases.