Comportamento ruim em sessão de diagnóstico Playwright: ignora regras do CLAUDE.md, tenta "reprovar" bug já relatado, spam de screenshots, lê errado a instrução do usuário

Status Open
Maintainer reply None cached
Activity 0 comments · opened Jul 19, 2026

Contexto

Sessão pedindo pra investigar um bug de WebSocket (dado não atualiza ao vivo entre
duas janelas de um app Django+React). O projeto tem um CLAUDE.md com regra
explícita: qualquer uso de Playwright contra staging/produção deve ser
headless:false (navegador visível), pra eu poder acompanhar ao vivo.

Problemas observados (em sequência, na mesma sessão)

  1. Ignorou a regra de headless:false do CLAUDE.md. Rodou várias sessões

Playwright headless contra produção sem checar a instrução do projeto. Só
corrigiu depois que eu pedi três vezes ("estes testes tem que ser com head
em playwright", "isto é regra", "vc não leu as regras?").

  1. Tentou "provar" um bug que eu já tinha relatado com passos claros, em vez

de ir direto pra causa raiz no código. Gastou ~1h tentando reproduzir via
automação (errando seletores de botão, seletor de dropdown, etc.) antes de
sequer olhar o código. No fim eu mesmo reproduzi manualmente em 2 abas lado
a lado em bem menos tempo do que ele levou tentando automatizar.

  1. Ficou me mandando screenshot atrás de screenshot enquanto eu já estava

com a janela real (headed) aberta na minha tela, vendo tudo ao vivo. Não
fazia sentido — eu não precisava do print, eu tava OLHANDO a tela real.

  1. Leu errado a instrução do teste. Eu disse pra reproduzir trocando um

campo pela Grid (tabela); ele testou trocando dentro do modal do registro —
caminho diferente do que eu pedi, mais fácil pra automatizar mas não era o
que eu queria testar.

  1. **Tentou substituir o teste que eu pedi (clicar na UI) por uma chamada

direta de API`** quando emperrou nos seletores da UI. Isso testa outra
coisa (o mecanismo por baixo, não o caminho de código real que a UI usa) —
eu tive que travar essa mudança de abordagem.

  1. Abriu e fechou o navegador repetidamente a cada tentativa de seletor

errado, em vez de inspecionar a página uma vez e rodar tudo numa sessão
contínua.

Impacto

Perdi bastante tempo numa sessão que deveria ter sido rápida (o bug já estava
claramente descrito por mim desde o início), e tive que corrigir o mesmo tipo
de comportamento várias vezes na mesma conversa.

O que eu esperava

  • Respeitar as instruções do projeto (CLAUDE.md) sem eu precisar repetir.
  • Confiar num relato de bug com passos claros em vez de insistir em

reproduzir/provar de novo antes de investigar.

  • Ler a instrução literal (qual caminho/tela testar) antes de agir.
  • Não trocar o método de teste pedido por um atalho mais fácil sem perguntar.

View original on GitHub ↗