Skip to content

Хендбук по Agentic Engineering

AI coding почти всегда начинается одинаково: кто-то отдаёт агенту небольшую задачу, получает рабочий diff и думает: «Так, это можно масштабировать». Через пару недель становится видно, что масштабируется не только скорость, но и хаос. PR растут, reviewer не понимает исходный intent, контекст живёт в чате, а фраза агента "готово" начинает подменять инженерную проверку.

Этот хендбук про более взрослый режим работы. Команда не просто просит AI написать код, а строит процесс, в котором agent берёт ограниченную задачу, работает в понятных границах, оставляет evidence и проходит проверки до того, как результат считают готовым.

Для кого

Хендбук рассчитан на людей, которые уже пробовали AI coding tools и хотят перейти от личных экспериментов к воспроизводимому командному workflow.

Он особенно полезен:

  • middle/senior engineers, которые отвечают за качество изменений;
  • tech leads, которым нужно разложить AI coding на понятный процесс;
  • platform/devtools/infrastructure команды;
  • engineering managers с техническим бэкграундом;
  • продуктовые команды со сложным доменом, privacy, compliance или высокой ценой ошибки.

Если вы ищете набор «сильных промптов», это не тот материал. Здесь фокус на инженерной системе вокруг агента: задачи, контекст, проверки, права доступа, логи, ревью и rollout.

Как выглядит результат

После внедрения процесс выглядит не как «мы доверяем агенту», а как обычная engineering line:

БылоСтало
"Попроси агента поправить onboarding"Есть task contract: цель, scope, non-goals, acceptance criteria, testing plan.
Контекст держится в голове автора задачиКонтекст лежит в AGENTS.md, specs, task notes и context pack.
Reviewer смотрит большой diff и пытается понять intentReviewer видит spec, run summary, checks, risk summary и policy exceptions.
Агент сам сообщает, что всё готовоHarness классифицирует результат по checks: done, failed, blocked, needs_review.
Опасные действия ловятся вручнуюTool gateway и policy gate блокируют unsafe commands, write paths и external actions.
Успех зависит от конкретного человека и конкретного promptПроцесс можно повторить, replay, улучшать и постепенно автоматизировать.

Итоговый образ простой:

text
spec -> task contract -> context -> harness -> backend output -> checks -> logs -> review

Как читать

Не обязательно читать всё подряд. Выберите маршрут под свою задачу.

Если вы один инженер: начните с Agentic Engineering, затем Task contract и Verification. После этого запустите практическую цепочку.

Если вы внедряете это в команду: прочитайте разработку от spec, архитектуру инструкций, tool gateway и policy, командный workflow и управляемую автономность.

Если вы строите platform/harness: идите через memory и knowledge base, минимальный harness, observability, оценку harness, очередь задач и self-hosting.

Перед чтением проверьте prerequisites: это не входной экзамен, а калибровка ожиданий.

Практическая линия

В репозитории есть labs, которые можно запустить руками:

text
examples/harness-labs/
examples/algi-lite/

Сначала вручную пишется минимальный harness v01. Потом предыдущая версия harness строит следующую версию harness, а новая версия строит очередной кусок ALGI.

text
v01 hand-written runner
-> builds v02 with JSONL logs
-> v02 builds ALGI pain diary
-> v02 builds v03 with policy gates
-> v03 builds ALGI clinician report

Это важная часть курса: ALGI не лежит готовым приложением. Он появляется как результат работы harness над specs, task contracts, policy и checks. Поэтому примеры не остаются словами: в каждой практической главе есть изменение в harness или в продукте.

Оглавление

#РазделЧто вы сделаете
0Практика: harness строит ALGIЗапустите chapter-by-chapter цепочку в локальном repo.
1Agentic EngineeringРазберёте, почему agent без harness не является production workflow.
2Разработка от specЗафиксируете behavior в spec до генерации кода.
3Task contractПревратите расплывчатую просьбу в ограниченную задачу с проверками.
4Архитектура инструкцийРазложите instructions по слоям: chat, specs, AGENTS.md, policies, skills.
5Context engineeringСоберёте context pack без лишнего шума.
6Memory и knowledge baseРазделите trajectory, project memory и retrievable knowledge base.
7Минимальный harnessНапишете первый runner и отделите harness от backend.
8Tool gateway и policyОпишете tools, policy gates и audit trail.
9Безопасность агентовРазберёте prompt injection, lethal trifecta и supply chain risks.
10Проверка результатаСоберёте quality gate: tests, static checks, evaluator, retry/review/block rules.
11ObservabilityДобавите events, logs, run summary и failure taxonomy.
12Оценка harnessПроверите сам harness через eval set и replay.
13Очередь задачРазложите epic на dependencies, ready queue и безопасный parallelism.
14Командный workflowВстроите agent-generated changes в PR/review процесс.
15Harness по доменамНастроите разные loops для frontend, backend, mobile и DevOps.
16Управляемая автономностьОпределите уровни autonomy, approval gates и rollback.
17Lifecycle агентаЗаведёте registry, owner, eval coverage и incident response.
18Self-hostingСпроектируете путь, где harness улучшает ограниченные части самого себя.
CФинальный проектСоберёте end-to-end agentic engineering harness под продуктовую или platform-задачу.

Шаблоны

ШаблонКогда открыть
Task contractКогда задача ещё слишком расплывчатая.
BDD specКогда нужно описать behavior до кода.
Spec review checklistПеред запуском agent/backend.
Context packКогда нужно собрать минимальный полезный context.
Project memory patchКогда lesson из run/review должен стать stable memory.
Tool catalogПеред подключением tools, MCP или external actions.
PolicyКогда нужно зафиксировать allowed commands, paths и approval-required actions.
Run summaryПосле запуска, чтобы reviewer видел evidence.
PR risk summaryПеред review agent-generated PR.
Eval suiteКогда меняете harness и хотите не сломать прошлые cases.
Agent registry entryПеред использованием agent/backend в командном процессе.

Сквозные кейсы

  • ALGI / ALGORA - продуктовый кейс: приложение для пациентов с хронической болью и врачей.
  • yolo-runner-like Harness - инженерный reference system: runner, task graph, checks, logs, observability, self-hosting.

Если хочется внедрить это в команду

Самостоятельное чтение даст язык и базовые artifacts. Для команды обычно нужна адаптация под конкретный repo, backlog, CI, review process, domain constraints и risk tolerance.

Если нужен B2B-формат для вашей engineering-команды, откройте Контакты.

Agentic Engineering: Context Engineering + Harness Engineering