Agent Harness Kit, versão zero ponto sete.

O Agent Harness Kit é uma camada local de governança de execução para agentes de programação. Codex, Claude Code ou outro host compatível continuam escrevendo o software. O Kit define como o trabalho é entendido, delimitado, ordenado, verificado, retomado e, quando o host permite, distribuído entre agentes independentes.

Instale a ferramenta de linha de comando com U V, pipx ou pip, abra o projeto e execute agent harness install. Uma instalação completa cria a pasta contida agent harness kit e duas entradas na raiz do projeto: A G E N T S ponto markdown para o Codex e CLAUDE ponto markdown para o Claude Code. Se esses arquivos já contêm instruções do projeto, o instalador preserva o conteúdo fora de um único bloco gerenciado. Abra um novo contexto do agente na raiz e o host poderá detectar o Kit sem um prompt de ativação separado. Agent harness doctor verifica as três entradas.

A versão zero ponto sete é adaptativa. Toda solicitação que altera o projeto recebe um caminho de execução e um nível independente de assurance. Direct trivial atende edições mecânicas de conteúdo ou apresentação. Vibe executa uma pequena mudança local de comportamento com check determinístico focado e sem artefatos do Harness. Graph only acrescenta ordem durável, ownership e capacidade de retomada. Full Harness fica reservado para coordenação multiagente real, loop de decisão humana, auditoria exigida, modelo insuficiente, ambiguidade consequente não resolvida ou pedido explícito. Assurance none fecha com a verificação do executor. Light e full exigem um revisor realmente independente em contexto novo.

Antes de decompor trabalho em grafo ou Harness completo, o preflight executável verifica todos os arquivos declarados, scripts de pacote, nomes de variáveis de ambiente, comandos nativos, validador, exigências de navegador ou sandbox e capacidade comprovada de workers. Uma falha de setup vira um pré-requisito exato ou uma degradação de capacidade antes da criação das tarefas, em vez de reaparecer em vários planos frustrados.

A retomada também começa pela evidência. O agente faz primeiro uma sondagem limitada e sem efeitos colaterais da árvore de trabalho, do estado relevante de runtime e do check atual mais útil. Contexto do projeto, pendências, grafo e handoffs correntes são lidos apenas quando essa evidência deixa uma lacuna ou quando é necessário recuperar ownership. Testes e estado de runtime atuais superam documentos de transferência obsoletos.

O Kit separa estado humano de estado técnico. PENDING ponto markdown controla decisões humanas, ações necessárias e a visão macro dos resultados de produto ainda incompletos. TASK GRAPH ponto markdown controla dependências, prontidão, leases, dispatch, progresso e recuperação técnica. Esse estado durável permite que uma conversa nova continue sem reconstruir o projeto pelo histórico do chat.

O planejamento é proporcional. Trabalho delimitado no mesmo contexto pode usar uma especificação inline compacta. Unidades planejadas normalmente representam de quinze a trinta minutos de trabalho ativo do agente, com exceções menores ou maiores justificadas por atomicidade, custo de runtime ou risco. Um documento TASK separado só existe quando outro contexto vai consumi-lo. Handoffs e pacotes de review só são criados para um revisor, subagente ou destinatário humano realmente separado.

Mudanças de comportamento usam evidência significativa de RED e GREEN. A verificação começa pelo check focado mais estreito e só sobe quando necessário para workspace, integração, checkpoint global e entrega. Uma edição pequena não dispara toda a suíte do repositório por padrão. Falhas técnicas recebem recuperação limitada dentro do escopo aprovado; mudanças de produto, escopo, custo material, permissão ou integridade experimental ainda exigem decisão humana.

Quando vários nós do grafo estão prontos, o scheduler considera dependências, checkpoints de assurance, capacidade de workers e sobreposição de conjuntos de escrita ou impacto. Ele seleciona o maior lote possível sem colisões, em vez de uma lista gulosa apenas conveniente. O orquestrador ativo usa a capacidade real do host para criar subagentes ou tarefas, dispara o lote e repõe capacidade conforme o trabalho termina. Se o host não fornece contextos paralelos, o Kit registra fallback sequencial em vez de fingir paralelismo.

O estado de runtime é inspecionável. As transições do grafo usam compare and swap, substituição por arquivo temporário e coordenação entre processos, impedindo que um escritor desatualizado sobrescreva silenciosamente uma revisão nova. Eventos formam uma cadeia append only com hashes e identificadores idempotentes. As métricas registram lane, assurance, formato de execução, quantidade de artefatos, tempo de cerimônia e implementação, aprovações, gates que realmente atuaram, duração planejada e real, reviews, remediações, revisões do grafo e tokens informados pelo host. Várias execuções sem benefício de gates produzem uma sugestão visível de caminho mais leve.

A interface de linha de comando executa de forma determinística a instalação, inspeção, classificação de pedidos, preflight, agendamento, transições de estado, métricas, validação e preparação de pacotes de dispatch. O host do agente executa a programação, a criação real de subagentes, a revisão independente, a integração e a entrega conforme suas capacidades e permissões. O Kit não mantém um daemon autônomo. Leases são contratos validados de ownership, não locks do sistema operacional. Ele não concede credenciais, não faz merge, deploy ou publicação sozinho.

Em resumo, o Agent Harness Kit transforma programação por conversa em execução com memória durável, autoridade limitada, verificação proporcional, coordenação segura e evidência de que o processo realmente ajudou.
