Перед запуском
Создайте eval set из реальных задач, baseline человека/текущего процесса, risk tiers и критические failure modes. Сначала измеряйте сильную конфигурацию, затем оптимизируйте model cost/latency. Write permissions и high-risk actions не включайте до устойчивого quality baseline.
Эксперимент 1. Read-only copilot baseline
Гипотеза: AI создаст value уже без action permissions
Как проверить: Дайте agent доступ только к approved read tools and compare workflow time/quality.
Основная метрика: time saved / quality. Guardrail: hallucination rate.
Эксперимент 2. Draft-only mode
Гипотеза: draft actions сократят работу человека без execution risk
Как проверить: Agent готовит email/report/campaign changes, человек подтверждает.
Основная метрика: cycle time. Guardrail: review rework.
Эксперимент 3. Approval-gated action
Гипотеза: agent сможет безопасно выполнять low/medium-risk action after approval
Как проверить: Добавьте one write tool with explicit human approval.
Основная метрика: successful actions. Guardrail: policy violations.
Эксперимент 4. Bounded autonomy
Гипотеза: узкий automatic action within limits снизит latency
Как проверить: Разрешите action только в defined amount/state/window with rollback.
Основная метрика: completion time / accuracy. Guardrail: incident rate.
Эксперимент 5. Single agent vs workflow code
Гипотеза: deterministic steps in code снизят cost/error
Как проверить: Сравните fully agentic flow и hybrid: code for validation/merge, model for judgement.
Основная метрика: quality per cost. Guardrail: engineering complexity.
Эксперимент 6. Single agent vs multi-agent
Гипотеза: разделение независимых workstreams улучшит quality enough to justify overhead
Как проверить: Run same eval set with single-agent and manager+specialists.
Основная метрика: end-to-end score. Guardrail: latency/cost.
Эксперимент 7. Parallel subagents
Гипотеза: parallel research снизит latency without quality loss
Как проверить: Split independent sources/segments and merge structured outputs.
Основная метрика: time-to-result. Guardrail: duplicate/conflicting work.
Эксперимент 8. Independent reviewer agent
Гипотеза: второй reviewer снизит high-severity errors
Как проверить: Add separate critique stage with different instructions/evidence access.
Основная метрика: critical error rate. Guardrail: cost/false rejection.
Эксперимент 9. Human reviewer vs reviewer agent
Гипотеза: AI review может снять часть нагрузки, сохранив escalation
Как проверить: Compare human-only and AI-precheck + human exceptions.
Основная метрика: review hours / error rate. Guardrail: automation bias.
Эксперимент 10. Stricter tool permissions
Гипотеза: least privilege снизит action risk без сильной потери completion
Как проверить: Remove unnecessary tools/scopes in treatment.
Основная метрика: policy incidents. Guardrail: completion rate.
Эксперимент 11. Tool schema simplification
Гипотеза: меньше ambiguous tool parameters улучшит correct tool use
Как проверить: Simplify one complex action API into narrow functions.
Основная метрика: tool-call success. Guardrail: coverage.
Эксперимент 12. Structured output contract
Гипотеза: JSON/schema снизит downstream parsing errors
Как проверить: Compare free text handoff and schema-constrained output.
Основная метрика: valid outputs. Guardrail: loss of nuance.
Эксперимент 13. Retrieval before reasoning
Гипотеза: grounded context снизит unsupported claims
Как проверить: Require knowledge retrieval for specific task class.
Основная метрика: factual accuracy. Guardrail: latency.
Эксперимент 14. Source freshness check
Гипотеза: agent будет реже использовать stale knowledge
Как проверить: Add date/source policy and stale threshold.
Основная метрика: fresh-source compliance. Guardrail: task completion.
Эксперимент 15. Confidence-based escalation
Гипотеза: low-confidence cases лучше передавать человеку
Как проверить: Define confidence/evidence threshold and route exceptions.
Основная метрика: high-severity error rate. Guardrail: escalation volume.
Эксперимент 16. Retry limit
Гипотеза: bounded retries снизят cost and repeated failures
Как проверить: Set max retries/backoff vs unrestricted retry.
Основная метрика: cost per successful task. Guardrail: completion rate.
Эксперимент 17. Idempotency key
Гипотеза: повтор tool call не создаст duplicate action
Как проверить: Add idempotency to one transactional workflow and simulate timeout.
Основная метрика: duplicate action rate. Guardrail: implementation cost.
Эксперимент 18. Rollback workflow
Гипотеза: reversible actions снизят incident impact
Как проверить: Store previous state and test automated/manual rollback.
Основная метрика: mean time to recover. Guardrail: rollback errors.
Эксперимент 19. Eval-driven model routing
Гипотеза: простые cases можно отдавать cheaper model without losing quality
Как проверить: Classify task difficulty and route models; compare same eval suite.
Основная метрика: quality-adjusted cost. Guardrail: routing mistakes.
Эксперимент 20. Prompt/version regression suite
Гипотеза: автоматические evals поймают degradation до production
Как проверить: Run fixed golden cases on every prompt/model/tool change.
Основная метрика: regressions caught. Guardrail: test maintenance.
Эксперимент 21. Production trace review
Гипотеза: sampling traces выявит новые failure modes
Как проверить: Review random + high-risk runs weekly and convert failures into eval cases.
Основная метрика: new failure detection. Guardrail: review workload.
Эксперимент 22. User-confirmation before high-risk action
Гипотеза: explicit confirmation снизит harmful actions
Как проверить: Require confirmation with summary of amount/object/impact.
Основная метрика: critical incident rate. Guardrail: extra friction.
Эксперимент 23. Memory off vs scoped memory
Гипотеза: scoped task memory улучшит continuity without cross-task leakage
Как проверить: Compare stateless vs workflow-scoped memory on repeated tasks.
Основная метрика: completion/consistency. Guardrail: privacy leakage.
Эксперимент 24. Agent ROI by workflow
Гипотеза: не все agent use cases окупаются одинаково
Как проверить: Run 4-week pilots across 2–3 workflows with full cost/review accounting.
Основная метрика: net value per workflow. Guardrail: measurement burden.
Эксперимент 25. Shadow mode before execution
Гипотеза: shadow recommendations predict value and reveal errors safely
Как проверить: Run agent alongside human without acting, compare decisions and outcomes.
Основная метрика: decision agreement/quality. Guardrail: delay to value.
Как строить лестницу автономии
Переход на следующий уровень должен зависеть от evals, production incident history и reversibility, а не от возможности модели технически вызвать tool.
Как оценивать агента
Сочетайте offline evals и production metrics. Offline: task success, policy, tool correctness, factuality. Production: human correction, escalation, latency, cost, incidents, adoption и business result. Редкая high-severity ошибка должна иметь отдельный threshold и не растворяться в среднем score.
Как экспериментировать с multi-agent
Сначала single-agent baseline. Добавляйте subagents только если есть независимые parallel tasks, permission separation, domain specialization или context limits. Сравнивайте end-to-end quality/cost; больше agents не равно лучше.
Как превращать ошибки в систему обучения
Каждый production failure классифицируйте: instruction, retrieval, tool, data, policy, model, orchestration. Добавляйте representative case в regression suite. Так eval set развивается вместе с реальным workflow.