Pular para o conteúdo principal

Agentic Loop Simulator

Watch a coding agent run an agentic loop, one step at a time. A planner, a builder, and a judge cycle through plan, build, verify, and repeat until the goal is met. Toggle the separate judge off to see why an agent grading its own work ships confident bugs. An animation-first, interactive explainer of loop engineering and how it maps to Claude Code.

Categoria: DevOps

O que você vai aprender

  • O que é um loop agêntico: planejar, construir, julgar, depois repetir até o objetivo ser cumprido
  • Por que um agente de código termina trabalho de múltiplas etapas sozinho em vez de responder uma vez
  • Como a decisão no fim de cada loop escolhe continuar ou parar
  • Por que o judge deveria ser um agente separado, e o que acontece quando não é
  • Por que o custo em tokens se acumula conforme a janela de contexto cresce a cada loop
  • Como as fases se mapeiam ao Claude Code: subagentes, as ferramentas Read/Edit/Bash, e uma condição de parada

Tópicos abordados: ai, agents, agentic, loops, loop-engineering, claude-code, llm, coding-agents, automation, educational, interactive

// simulador

Agentic Loop Simulator

Watch a coding agent run an agentic loop, one step at a time. A planner, a builder, and a judge cycle through plan, build, verify, and repeat until the goal is met. Toggle the separate judge off to see why an agent grading its own work ships confident bugs. An animation-first, interactive explainer of loop engineering and how it maps to Claude Code.

Loop agêntico · três agentes

Um loop de três agentes: plan, build, judge

Tarefa: adicionar um endpoint /signup funcional (fazer hash da senha, retornar 201)
ou use ← →Velocidade
1
Plan
agente planner

Decidir o único próximo passo em direção ao objetivo.

idle
2
Build
agente builder + ferramentas

Fazer: ler, editar, rodar um comando.

idle
3
Judge
agente judge (separado)

Avaliar o resultado contra o objetivo e o spec.

idle
o judge decide: repetir ou parar
prontoAperte Play para ver três agentes construírem uma funcionalidade juntos, um loop de cada vez. Devagar por padrão.

Estado do loop

Iteração0 / loops
Tokens nesta execução0k
Todo o contexto é reenviado a cada loop, então o custo sobe conforme ele cresce.
Objetivo: senha com hash + 201não cumprido
Suíte de testesnão rodou

Janela de contexto (cresce a cada loop)

Vazia. Os agentes começam só com a tarefa.
PlanNo Claude Code: um subagente planner, ou um turno em plan mode que escreve o próximo passo.
BuildO agente principal usando Read, Edit, Bash para mudar o código.
JudgeUm subagente revisor separado, idealmente um modelo diferente, checando contra os testes e o spec.

Modelo ilustrativo do padrão de loop multiagente (plan → build → judge → repetir) usado por agentes de código como o Claude Code. Mostra o harness e a divisão de papéis, não o raciocínio interno de nenhum modelo. Desligue o judge separado para ver por que um agente que avalia o próprio trabalho publica bugs com confiança.

Sobre este simulador de loop agêntico

O que você vai aprender

  • Como um agente de código roda um loop em vez de responder um único prompt
  • Os três papéis: um planner escolhe o próximo passo, um builder o executa, um judge o checa
  • Por que "os testes passam" não é o mesmo que "o objetivo foi cumprido"
  • Por que o judge ser um agente separado é o que impede o loop de publicar bugs com confiança
  • Como a janela de contexto cresce a cada loop, e por que isso faz o custo subir
  • O que cada fase mapeia no Claude Code

Como o loop funciona

  • Plan: reúne o objetivo e o último resultado, decide o único próximo passo
  • Build: executa uma ação, lê um arquivo, edita código, roda um comando
  • Judge: avalia o resultado contra o objetivo e o spec, não só os testes
  • Decidir: objetivo cumprido significa parar, não cumprido significa voltar ao plan

Veja o verificador fazer a diferença

O controle mais importante do simulador é a chave "agente judge separado". Com ela ligada, um segundo agente revisa o trabalho contra o spec e pega um código de status que o builder errou. Desligue e o builder avalia o próprio trabalho, vê testes verdes, e para, publicando um bug com confiança. É por isso que loops de agentes sérios separam o agente que escreve o código do agente que o checa.

Como isso mapeia para o Claude Code

Plan e Judge são o tipo de trabalho que você entrega a um subagente, muitas vezes um modelo diferente, para que o judge não esteja avaliando sua própria tarefa. Build é o agente principal usando as ferramentas Read, Edit e Bash. O loop roda até uma condição de objetivo ou um limite de turnos, do mesmo jeito que um harness real mantém um agente trabalhando até o trabalho estar de fato concluído.

Vá mais fundo

O post relacionado, Stop Prompting, Start Looping, cobre por que engenheiros da Anthropic, NVIDIA, e outros dizem que o trabalho está mudando de escrever prompts para desenhar loops, e o que realmente torna um loop confiável em vez de uma forma cara de publicar bugs.

Por que aprender assim?

  • O loop é um ciclo simples, mas é o que transforma um chatbot em um agente.
  • Ver os passos de plan, build e judge se passando o bastão torna o padrão concreto.
  • Ver um loop sem verificação terminar errado é a forma mais rápida de aprender por que a verificação importa.

Experimente também

Sponsored
Carbon Ads
$ cd /games
// compartilhar