Comportamento ruim em sessão de diagnóstico Playwright: ignora regras do CLAUDE.md, tenta "reprovar" bug já relatado, spam de screenshots, lê errado a instrução do usuário
Contexto
Sessão pedindo pra investigar um bug de WebSocket (dado não atualiza ao vivo entre
duas janelas de um app Django+React). O projeto tem um CLAUDE.md com regra
explícita: qualquer uso de Playwright contra staging/produção deve serheadless:false (navegador visível), pra eu poder acompanhar ao vivo.
Problemas observados (em sequência, na mesma sessão)
- Ignorou a regra de headless:false do CLAUDE.md. Rodou várias sessões
Playwright headless contra produção sem checar a instrução do projeto. Só
corrigiu depois que eu pedi três vezes ("estes testes tem que ser com head
em playwright", "isto é regra", "vc não leu as regras?").
- Tentou "provar" um bug que eu já tinha relatado com passos claros, em vez
de ir direto pra causa raiz no código. Gastou ~1h tentando reproduzir via
automação (errando seletores de botão, seletor de dropdown, etc.) antes de
sequer olhar o código. No fim eu mesmo reproduzi manualmente em 2 abas lado
a lado em bem menos tempo do que ele levou tentando automatizar.
- Ficou me mandando screenshot atrás de screenshot enquanto eu já estava
com a janela real (headed) aberta na minha tela, vendo tudo ao vivo. Não
fazia sentido — eu não precisava do print, eu tava OLHANDO a tela real.
- Leu errado a instrução do teste. Eu disse pra reproduzir trocando um
campo pela Grid (tabela); ele testou trocando dentro do modal do registro —
caminho diferente do que eu pedi, mais fácil pra automatizar mas não era o
que eu queria testar.
- **Tentou substituir o teste que eu pedi (clicar na UI) por uma chamada
direta de API`** quando emperrou nos seletores da UI. Isso testa outra
coisa (o mecanismo por baixo, não o caminho de código real que a UI usa) —
eu tive que travar essa mudança de abordagem.
- Abriu e fechou o navegador repetidamente a cada tentativa de seletor
errado, em vez de inspecionar a página uma vez e rodar tudo numa sessão
contínua.
Impacto
Perdi bastante tempo numa sessão que deveria ter sido rápida (o bug já estava
claramente descrito por mim desde o início), e tive que corrigir o mesmo tipo
de comportamento várias vezes na mesma conversa.
O que eu esperava
- Respeitar as instruções do projeto (CLAUDE.md) sem eu precisar repetir.
- Confiar num relato de bug com passos claros em vez de insistir em
reproduzir/provar de novo antes de investigar.
- Ler a instrução literal (qual caminho/tela testar) antes de agir.
- Não trocar o método de teste pedido por um atalho mais fácil sem perguntar.