Como Avaliar a Qualidade de um Prompt de IA (e Dar uma Nota Antes de Publicar)
Para avaliar a qualidade de um prompt de IA, pontue quatro dimensões mensuráveis antes de rodar qualquer teste: clareza (tarefa sem ambiguidade), especificidade (requisitos de output concretos), estrutura (ordem lógica das instruções) e robustez (tratamento de variações no input). Avaliação estrutural vem primeiro, avaliação de output vem depois. Num benchmark de 1.018 prompts reais, a média foi 54/100 e só 10,5% chegaram a um score de produção (75+); robustez é a dimensão mais fraca. Cole o prompt no PromptEval para ter o score 0–100 em menos de 10 segundos.
A maioria das pessoas testa um prompt rodando uma vez, lendo o resultado e concluindo que "ficou bom". Esse método funciona nas condições exatas em que você testou. Não diz nada sobre se o prompt vai se manter em escala, com inputs variados ou após uma atualização do modelo.
Avaliar a qualidade de um prompt significa algo mais específico: uma análise sistemática de se o prompt em si, independente de qualquer output, está estruturado para produzir resultados consistentes. Existem duas camadas: avaliação estrutural (o que você pode checar antes de ter outputs) e avaliação de output (o que você mede depois). A maioria dos guias pula a primeira e fica se perguntando por que a segunda continua encontrando as mesmas falhas.
O que a qualidade de prompt realmente mede
"Qualidade" em um prompt não é um julgamento subjetivo sobre se o output soou bem. É uma propriedade mensurável do texto do prompt, que você pode avaliar antes de gerar um único output.
O atalho pro passo estrutural: as ferramentas de avaliação de prompt automatizam essa checagem em segundos, a comparação cobre cinco opções e qual encaixa em cada fluxo.
As quatro dimensões estruturais que determinam a qualidade de um prompt formam o framework CERC (Clareza, Especificidade, Robustez, Composição/Estrutura):
| Dimensão | O que mede | Falha típica |
|---|---|---|
| Clareza | A tarefa tem exatamente uma interpretação razoável. Um leitor sem contexto anterior entenderia o que você quer. | Verbos vagos ("me ajude com"), prompts com múltiplas tarefas sem priorização, pronomes ambíguos |
| Especificidade | Os requisitos de output são concretos e mensuráveis: formato, comprimento, tom, escopo. O modelo não tem decisões de "como ficou pronto" a tomar. | Adjetivos no lugar de restrições ("escreva um resumo claro" vs. "escreva um resumo de 3 frases em linguagem simples") |
| Estrutura | Instruções seguem ordem lógica: papel primeiro, contexto segundo, tarefa terceiro, formato por último. Instruções relacionadas estão agrupadas. | Spec de formato enterrado depois da tarefa, papel ausente, restrições espalhadas pelo texto |
| Robustez | O prompt trata variações nos inputs reais. Casos extremos são antecipados. Não com instruções genéricas, mas com tratamento específico para os cenários de falha mais prováveis. | Prompt assume input limpo e bem-formado quando usuários reais enviam qualquer coisa |
Detalhamos cada dimensão aqui com exemplos. O resumo vem dos dados: no relatório State of Prompt Quality, que avaliou 1.018 prompts, a média ficou em 54/100 e apenas 10,5% alcançaram um score de produção (75+). Robustez foi a dimensão mais fraca, com média 31,5, e apareceu como o ponto mais baixo em 96% dos prompts. Isso é esperado: quase ninguém escreve o que o prompt deve fazer no dia ruim (input vazio, ambíguo, fora do escopo) antes de ver uma falha acontecer.
Avaliação estrutural: o que checar antes de rodar
Três perguntas diagnósticas que revelam problemas estruturais em menos de 5 minutos:
- Você consegue descrever o formato do output esperado sem olhar para outputs anteriores? Se não, o prompt está subespecificado. O modelo vai decidir o formato, e vai decidir diferente a cada vez.
- Duas pessoas diferentes poderiam ler esse prompt e ter expectativas diferentes sobre como é um output correto? Se sim, o modelo está fazendo esse julgamento. Ele vai fazer diferente em cada execução, input e versão de modelo.
- Se um usuário mandar um input extremo, string vazia, texto muito longo, assunto fora do escopo, o prompt diz o que fazer? Se não, o modelo inventa uma resposta.
A maneira mais rápida de fazer avaliação estrutural é colar o prompt no PromptEval. Você recebe um score 0–100 com callouts específicos por dimensão em menos de 10 segundos. Sem API key, sem dataset, sem instalação. O plano gratuito cobre 3 avaliações por mês.
Teste agora
Você acabou de aprender o que a avaliação estrutural verifica. Veja onde seu prompt falha, o PromptEval avalia gratuitamente com 3 créditos, sem cartão de crédito. Leva 10 segundos.
Exemplo antes e depois com scores
O framework aplicado a um prompt de triagem de suporte, antes e depois da revisão:
Antes:
Score: 31/100. Clareza: 55 · Especificidade: 12 · Estrutura: 40 · Robustez: 17
Depois:
Score: 84/100. Clareza: 88 · Especificidade: 91 · Estrutura: 82 · Robustez: 75
O que mudou: papel definido, formato de output é um JSON com chaves exatas e valores enumerados, "o que o cliente quer" dividido em dois conceitos distintos, caso extremo (sem pedido claro) tratado explicitamente. A melhora de 53 pontos não exigiu um modelo melhor, exigiu um prompt melhor.
O que é um score normal (e quais consertos rendem mais)
Um score "normal" fica em torno de 54/100. Esse é o número que sustenta o resto deste guia: no benchmark State of Prompt Quality (n=1.018 prompts reais), a média foi 54, a mediana caiu na mesma faixa e só 1 em cada 10 prompts passou de 75. Ou seja, se o seu primeiro score vier entre 45 e 60, você está exatamente onde quase todo mundo começa, e a distância até produção é menor do que parece.
O relatório também mediu quanto cada correção estrutural move o score, na média da base. Isso transforma "melhore o prompt" numa lista ordenada por retorno:
| Conserto (uma linha no prompt) | Ganho médio no score | Dimensão que ataca |
|---|---|---|
| Declarar o formato do output (ex: "responda em JSON com as chaves X, Y, Z") | +29 | Especificidade |
| Definir 2–3 restrições do que o modelo nunca deve fazer | +24 | Robustez |
| Tratar o dia ruim: "se o input for vazio, ambíguo ou fora do escopo, peça esclarecimento em vez de chutar" | alto | Robustez |
| Colar um exemplo de output bom | +10 | Estrutura |
A linha do "dia ruim" merece destaque: 85% dos prompts da base pontuam abaixo de 50 justamente nesse comportamento, então uma única frase de fallback costuma ser o conserto de maior retorno que existe. Se você só tem tempo para uma edição, é essa. Os números completos por dimensão estão no resumo do relatório em português.
Avaliação de output: a segunda camada
Avaliação estrutural diz se o prompt está bem-formado. Não diz se ele produz os outputs que seu caso de uso exige. Para isso você precisa de avaliação de output, e ela requer inputs reais.
O que um conjunto mínimo de testes inclui:
- 15–30 inputs representando a distribuição real do que usuários vão mandar
- Para cada input: um critério escrito do que "correto" parece. Não um exemplo de output, mas um padrão testável que você pode aplicar a qualquer output
- Pelo menos 3 casos extremos intencionais: os inputs mais prováveis de causar falhas
Como você pontua cada output depende do tipo de tarefa. Existem três métodos, e escolher o errado gera ruído:
- Métricas por referência (BLEU, ROUGE). Comparam o output gerado com uma resposta de referência palavra a palavra. Funcionam para tarefas determinísticas com uma resposta certa (tradução, extração, sumarização com gabarito). São quase inúteis para tarefas abertas: um output ótimo com outras palavras recebe nota baixa.
- LLM-as-a-judge. Um segundo modelo pontua o output contra um critério que você escreve ("a resposta cita apenas fatos do ticket?"). É o método padrão para tarefas abertas porque avalia sentido, não sobreposição de palavras. A ressalva: o juiz herda vieses e precisa de um critério explícito, senão vira opinião. Escreva a rubrica antes de rodar.
- Verificação programática. Um teste de código valida propriedades objetivas: o JSON faz parse? Os campos obrigatórios existem? O valor está na lista permitida? É barato, determinístico e pega o tipo de falha que mais quebra integração.
Avaliação estrutural (o score 0–100 em clareza, especificidade, estrutura e robustez) é uma quarta camada, anterior a todas essas: ela não olha nenhum output, olha o prompt. É por isso que vem primeiro.
Erro mais comum: rodar avaliação de output em um prompt estruturalmente fraco. Se o prompt pontua abaixo de 50 na avaliação estrutural, corrija as falhas estruturais primeiro. Testes de output em um prompt malformado geram resultados ruidosos que não apontam a causa raiz. Para comparar duas variantes de prompt de forma sistemática, este guia sobre teste A/B de prompts cobre o processo passo a passo.
Quando score menor é intencional
Nem todo prompt precisa de score acima de 80. Prompts criativos ou exploratórios são projetados para ter menor especificidade, deixar espaço para o modelo. Um prompt de escrita criativa com score 35 em especificidade não é uma falha. Um prompt de triagem de suporte com 35 em especificidade é um risco de produção.
A pergunta relevante não é "esse score está baixo demais?" mas "esse score é intencional?" Se você não consegue explicar por que um score baixo é uma escolha de design, provavelmente não é.
Integrar avaliação no seu workflow
O workflow que funciona individualmente:
- Escreva o prompt
- Avalie estruturalmente via PromptEval (10 segundos) ou manualmente (10 min)
- Corrija as 1–2 falhas estruturais com maior impacto
- Reavalie e salve na biblioteca com versionamento
- Monte conjunto de 15–30 inputs de interações reais
- Rode avaliação de output
- Marque a versão aprovada como produção
Versionamento é o passo que a maioria pula, e é o que torna a avaliação útil ao longo do tempo. Sem ele, você não sabe se uma mudança realmente melhorou a qualidade ou se está vendo variância. Para custo: este guia sobre otimização de tokens de prompt mostra como comprimir prompts sem perder a qualidade estrutural que você acabou de construir.
Se quiser exercitar disciplina de prompt engineering com feedback imediato, o Desafio Diário do PromptEval dá um novo problema por dia com critérios definidos de antemão, exatamente o que a passagem de especificidade exige.
Perguntas frequentes
O que é qualidade de prompt de IA?
É uma medida de quão bem a estrutura do prompt foi projetada para produzir outputs consistentes. Cobre clareza, especificidade, estrutura e robustez, propriedades do texto do prompt, não do output.
Como pontuar meu prompt?
Cole no PromptEval. Score 0–100 em 4 dimensões com callouts específicos em menos de 10 segundos. Plano gratuito com 3 avaliações por mês.
Qual é um bom score?
75 ou mais é o threshold de produção, mas no benchmark de 1.018 prompts só 10,5% chegaram lá; a média foi 54. Acima de 70 já é seguro para casos de alto risco. Abaixo de 50 gera outputs inconsistentes em escala. Score baixo em especificidade para prompts criativos pode ser intencional.
BLEU e ROUGE servem para avaliar prompt?
Servem para avaliar o output de tarefas determinísticas (tradução, extração) comparando com uma resposta de referência. Não medem a qualidade do prompt em si e são fracos para tarefas abertas. Para pontuar o prompt antes de rodar, use avaliação estrutural; para outputs abertos, use um LLM-as-a-judge com critério escrito.
Preciso de dataset para avaliar qualidade de prompt?
Não, para avaliação estrutural. Ferramentas como o PromptEval pontuam sem nenhum input. Para avaliação de output, sim. Você precisa de inputs representativos com critérios escritos.
Qual a diferença entre avaliação estrutural e de output?
Estrutural analisa o prompt antes de qualquer execução, mais rápida, sem dataset, pega a maioria das falhas. De output verifica se os resultados atendem seus critérios para inputs reais, mais lenta, requer dataset representativo.
Mais artigos
Tags XML no Claude: Como Estruturar Prompts Como a Anthropic Recomenda (2026)
2026-09-25 · 10 min de leitura
Formato de Prompt para Claude, GPT e Gemini: O Que Muda em Cada Modelo (2026)
2026-09-20 · 11 min de leitura
Por Que Seu Prompt Não Funciona (e Como Achar a Causa Real)
2026-07-14 · 8 min de leitura
Avalie seus prompts antes de ir para produção
PromptEval pontua prompts de 0–100 em 4 dimensões — clareza, estrutura, contexto e especificação de saída.
Testar grátis →