Appearance
Управляемая автономность
Автономность не включается одним флагом
Автономность не является бинарной. Команда должна выбирать уровень autonomy по типу задачи, цене ошибки, quality signals, правам доступа и зрелости harness. Один и тот же agent может только советовать в security-задаче и автоматически выполнять low-risk cleanup.
Уровни autonomy
| Level | Описание | Пример |
|---|---|---|
| Recommend | Агент анализирует и предлагает действия. | Диагностика incident, план рефакторинга. |
| Assist | Агент готовит изменения, человек запускает или утверждает. | PR draft, migration plan. |
| Execute | Агент выполняет bounded задачу внутри sandbox. | Исправить тест, обновить компонент. |
| Autonomous | Агент сам выбирает ready tasks и проходит gates. | Низкорисковая очередь cleanup задач. |
Как повышать или снижать уровень
Повышать автономность можно, если:
- task contract стабилен;
- checks покрывают critical behavior;
- rollback дешевый;
- secrets не нужны;
- blast radius мал;
- logs достаточны для audit;
- human review остается в правильной точке.
Снижать автономность нужно, если:
- ошибка дорогая;
- нет reliable tests;
- затрагиваются данные пользователей;
- нужны production credentials;
- последствия сложно откатить;
- спецификация спорная.
Считайте не только токены
Считать нужно не только стоимость токенов. В decision входит:
- latency;
- время human review;
- стоимость retries;
- стоимость failed run;
- стоимость упущенного контекста;
- opportunity cost;
- цена ошибки.
Пример: считаем один класс задач
Иллюстративный расчёт (числа — порядок величин для калибровки, подставьте свои). Класс задач: bounded bugfix с готовым task contract и надёжными tests. Ставка инженера — $100/час.
| Компонент | Агент + harness | Инженер вручную |
|---|---|---|
| Работа | $2 tokens × 1.4 (retry budget) = $2.80 | 45 мин = $75.00 |
| Подготовка contract | 10 мин человека = $16.70 | входит в работу |
| Review результата | 15 мин человека = $25.00 | 10 мин (self-review + PR) = $16.70 |
| Ожидаемая цена ошибки | 5% × $200 (откат + повторный review) = $10.00 | 2% × $200 = $4.00 |
| Итого на задачу | ≈ $54.50 | ≈ $95.70 |
Выводы, которые важнее конкретных цифр:
- Токены — наименьшая статья расходов. $2.80 из $54.50. Оптимизировать модель дешевле, чем оптимизировать человеческое время вокруг неё, — бессмысленно.
- Доминируют человеческие минуты: contract + review дают ~76% стоимости agent-пути. Поэтому главы Task Contracts и Team Workflow — это экономические главы, а не бюрократия.
- Расчёт переворачивается от price of error. Поднимите цену ошибки с $200 до $20 000 (production data) — и 5% риска стоят $1000/задачу. Именно это, а не стоимость токенов, определяет допустимый уровень автономии.
- Contract и review переиспользуются: на потоке из 20 однотипных задач цена contract амортизируется, а review ускоряется за счёт PR risk summary.
Такой расчёт стоит сделать один раз на каждый класс задач из adoption policy. Он превращает спор «доверяем ли мы агенту» в разговор о стоимости, риске и maturity.
На что не соглашаться
- Давать автономность по доверию к модели, а не по зрелости harness.
- Не считать human review как cost.
- Пускать агента в production без plan, dry-run и rollback.
- Не различать low-risk cleanup и high-risk domain changes.
Что сделать руками
Соберите policy для команды через шаблон adoption policy. Для каждого класса задач укажите не только allowed level, но и gates, rollback и owner.