Distrator Não Funcional: a Regra dos 5% e o Que Ela Revela da Sua Prova
Uma alternativa escolhida por menos de 5% dos respondentes não está funcionando. Uma questão de quatro opções com dois distratores mortos é, na prática, uma questão de duas opções.
Um distrator é considerado não funcional quando é selecionado por menos de 5% dos respondentes que chegaram ao item (Tarrant, Ware e Mohammed, 2009). Uma questão de múltipla escolha que mantém duas ou mais opções não funcionais opera, na prática, com menos alternativas do que declara: uma questão de quatro alternativas com dois distratores mortos é, estatisticamente, uma questão de duas alternativas. A consequência correta diante desse diagnóstico não é descartar o item, e sim devolvê-lo para revisão das opções, mantendo o enunciado e a resposta correta caso o restante da estrutura esteja sólido.
Esse critério parece um detalhe de planilha de simulado, mas ele expõe uma falha estrutural que passa despercebida até por quem já roda análise de item com rigor. É possível um item ter discriminação estatisticamente adequada e, ainda assim, ter alternativas que ninguém escolhe. Isso já foi documentado na literatura internacional, com número exato, em duas questões geradas por IA que superaram o critério de bisserial 0,30 e mesmo assim carregaram distratores quebrados. Este artigo detalha o que é um distrator não funcional, por que ele reduz a informação de um item mesmo quando a estatística de discriminação parece boa, e como uma coordenação de curso deve reagir operacionalmente quando o relatório do simulado interno mostrar esse padrão.
O que é um distrator não funcional?
Um distrator não funcional é uma alternativa incorreta escolhida por menos de 5% dos respondentes que chegaram ao item, segundo a definição operacional estabelecida por Tarrant, Ware e Mohammed (2009), que também é a origem do índice D calculado sobre os 27% superiores e os 27% inferiores da distribuição de escores. A lógica por trás do critério é direta: cada distrator existe para capturar um erro de raciocínio específico e plausível para o nível de formação testado. Se praticamente ninguém escolhe uma alternativa, ela não está capturando erro nenhum. Ela está apenas ocupando espaço visual na tela do candidato, sem cumprir sua função de medida.
Isso é diferente de dizer que a alternativa está "errada" no sentido factual. Um distrator pode estar clinicamente correto em sua formulação e, ainda assim, ser um mau distrator, porque nenhum candidato minimamente preparado cometeria aquele erro. A revisão de redação de itens trata isso como um defeito estrutural do item, não como um erro de conteúdo: é a diferença entre revisão clínica, que pergunta se a informação está correta, e revisão de redação, que pergunta se a opção mede alguma coisa (Haladyna, Downing e Rodriguez, 2002; Downing, 2005).
Na prática de bancada, o cálculo é simples: divide-se o número de respondentes que escolheram aquela alternativa específica pelo total de respondentes que chegaram ao item. Se o resultado for inferior a 5%, a opção está sinalizada como candidata a reformulação. Isso exige que o relatório do simulado informe a frequência de escolha por alternativa, não apenas o percentual de acerto do item como um todo, ponto que retomamos na seção operacional deste artigo.
Leia tambémConstrução de Banco de Questões de Medicina: O Desafio da Redação de Itens Inéditos →
Por que isso importa mais do que parece?
Isso importa porque a contagem de alternativas que uma questão declara na tela não é a mesma coisa que o número de alternativas que ela oferece estatisticamente. Uma questão de quatro alternativas com dois distratores não funcionais funciona, na prática, como uma questão de duas alternativas: o candidato despreparado que elimina por instinto as duas opções implausíveis chega à mesma decisão de quem estudou o suficiente para eliminar apenas os erros plausíveis, e a chance de acerto por eliminação sobe sem que a instituição tenha decidido isso conscientemente.
É importante ser tecnicamente preciso aqui para não confundir esse fenômeno com parâmetro de item. O ENAMED usa o modelo de Rasch, de um parâmetro, conforme a Nota Técnica INEP nº 42/2025, e sob esse modelo não existe parâmetro de acerto casual no item. O chute é comportamento do respondente, não propriedade formal do item na equação de Rasch. O ENAMED, além disso, sempre trabalha com quatro alternativas, nunca cinco (Nota Técnica INEP nº 42/2025). Isso significa que, do ponto de vista da estimação psicométrica formal, um distrator não funcional não "quebra" o modelo Rasch da mesma forma que quebraria um modelo de três parâmetros, que estima acerto casual explicitamente.
Ainda assim, o defeito importa, e importa muito, por uma razão diferente: opção morta reduz a informação que o item entrega sobre a habilidade do respondente. Um item com dois distratores inertes discrimina de fato entre dois grupos de candidatos, os que sabem e os que não sabem, com menos nuance do que um item com quatro opções plenamente funcionais, porque a decisão real que o candidato enfrenta é mais simples do que a estrutura sugere. Em outras palavras, mesmo fora do universo de modelos que estimam acerto casual como parâmetro, a variância irrelevante introduzida por distratores mortos empobrece o item enquanto instrumento de medida.
Leia tambémDe Onde Vem a Nota de Corte 60 do ENAMED? Angoff Modificado e TS TRI →
Um item pode discriminar bem e ainda ter distrator quebrado?
Sim, e esse é o achado que sustenta a tese deste artigo. Kiyak, Coşkun, Budakoğlu e Uluoğlu (2024), no European Journal of Clinical Pharmacology, incorporaram duas questões de múltipla escolha baseadas em caso, geradas por ChatGPT, a uma prova de farmacoterapia racional respondida por 99 estudantes de quarto ano de medicina, depois de revisão por painel de especialistas e sem modificação substantiva de conteúdo. Ambas as questões superaram o critério de correlação bisserial pontual de 0,30, com valores de 0,41 e 0,39, o que indicaria, sob leitura apressada, dois itens tecnicamente sólidos. E ainda assim, uma delas manteve três das suas opções classificadas como não funcionais, cada uma escolhida por menos de 5% dos respondentes.
O achado importa porque desfaz uma suposição comum em coordenações que rodam análise de item de forma simplificada: a de que discriminação boa é sinônimo de item bem construído. Discriminação e qualidade das opções são dimensões diferentes do mesmo item, e uma pode estar satisfatória enquanto a outra está comprometida. É exatamente por isso que um workflow de validação de itens trata revisão de redação e prontidão psicométrica como portões distintos, e não como uma única checagem (Destefani, Ferreira e Destefani, 2026).
A tabela a seguir resume o que cada dimensão de análise detecta e, mais importante para efeito de gestão, o que ela não detecta, para que a coordenação não interprete a aprovação em uma dimensão como aprovação geral do item.
| Dimensão avaliada | O que ela detecta | O que ela NÃO detecta |
|---|---|---|
| Correlação bisserial (discriminação) | Se quem acerta o item tem, em média, escore-resto mais alto do que quem erra | Se as opções incorretas estão sendo escolhidas de forma equilibrada ou se estão mortas |
| Dificuldade (p, proporção de acertos) | Se o item está fácil ou difícil demais para a decisão que o escore sustenta | A causa da dificuldade: pode ser exigência clínica real ou pista textual |
| Revisão clínica de especialista | Se o conteúdo está correto e alinhado a diretrizes vigentes | Se a estrutura das opções mede o construto pretendido sem ruído |
| Análise de distratores (regra dos 5%) | Se cada opção incorreta está sendo escolhida por respondentes reais | A causa raiz para cada distrator específico não funcionar, que exige revisão qualitativa |
Leia tambémO Que a Evidência Diz Sobre Questões Geradas por IA: Três Estudos, Três Lições →
O que fazer quando o distrator não funciona?
A resposta correta é não rejeitar o item, e sim devolvê-lo para revisão das opções, preservando o enunciado, o vetor clínico e a resposta correta quando estes já foram validados na revisão de conteúdo. Rejeitar um item inteiro por causa de um distrator morto é desperdiçar trabalho de redação e de validação clínica que, em geral, está intacto: o problema não está no que o item avalia, está em como as opções incorretas foram formuladas.
Reescrever um distrator funcional exige que ele represente um erro clínico reconhecível, ou seja, algo que um candidato do nível de formação testado poderia plausivelmente pensar ou fazer diante daquele cenário, e não uma alternativa implausível que qualquer estudante elimina de imediato por bom senso, sem precisar do conhecimento específico que o item pretende avaliar. Um distrator bem construído captura um raciocínio incompleto, uma etapa pulada, uma dose equivocada de uma classe farmacológica plausível, ou uma conduta que seria correta em outro contexto clínico mas não naquele.
O exemplo trabalhado por Destefani, Ferreira e Destefani (2026) ilustra esse movimento de forma didática, embora seja explicitamente hipotético, sem dado real de aluno e com valores que são placeholders para mostrar onde cada decisão ocorre no fluxo, e não um caso real de qualquer instituição. Uma questão sobre manejo inicial de pneumonia adquirida na comunidade em adulto ambulatorial passou pela revisão clínica sem ressalvas: o especialista confirmou que o enunciado era acurado e que a resposta seguia a orientação vigente. Mas falhou na revisão de redação, porque duas das quatro opções eram implausíveis para qualquer candidato do nível testado, e a resposta correta era perceptivelmente mais longa que as demais alternativas, uma pista de comprimento que introduz variância irrelevante ao construto. O item foi classificado como "requer modificação" e voltou para reescrita: os distratores implausíveis foram substituídos por erros clínicos reconhecíveis, e as quatro opções foram equilibradas em comprimento. Só depois dessa reformulação o item seguiu para pilotagem.
O ponto que a coordenação precisa reter é que a revisão de distrator é trabalho de redação de item, não trabalho de estatística. A estatística aponta onde está o problema; a solução vem da mesma disciplina que escreveu o distrator com defeito.
Que outros defeitos a revisão das opções deveria pegar?
A revisão de opções deveria capturar todo tipo de variância irrelevante ao construto, ou seja, qualquer característica da questão que permita ao candidato acertar por um motivo que não é saber medicina. O distrator não funcional é apenas um desses defeitos; os outros são igualmente comuns em bancos de questões produzidos sob pressão de prazo, e todos compartilham a mesma consequência: o aluno explora uma característica estrutural do item, e não o conteúdo clínico, para chegar à resposta.
A pista de comprimento é a mais estudada e mais fácil de detectar em revisão visual: quando o gabarito é sistematicamente mais longo, mais detalhado ou mais qualificado do que os distratores, candidatos aprendem, de forma implícita e sem saber conteúdo nenhum, que a alternativa "mais completa" tende a ser a correta. Pistas gramaticais aparecem quando o enunciado está no singular e apenas uma alternativa concorda gramaticalmente, ou quando um artigo indefinido no enunciado elimina alternativas por incompatibilidade morfológica antes mesmo de qualquer raciocínio clínico. Ambiguidade ocorre quando o enunciado permite mais de uma leitura razoável, de modo que candidatos bem preparados podem discordar sobre qual é a "melhor resposta" por interpretação do texto, e não por domínio do conteúdo. Alternativas implausíveis para o nível testado, como já discutido, funcionam como as opções mortas descritas na regra dos 5%.
| Defeito | Como aparece no item | Como o aluno o explora | Como corrigir |
|---|---|---|---|
| Pista de comprimento | Gabarito perceptivelmente mais longo ou mais qualificado que os distratores | Escolhe a opção mais completa sem necessariamente saber o conteúdo | Equilibrar o número de palavras e o nível de detalhe entre todas as opções |
| Pista gramatical | Concordância de número, gênero ou artigo elimina alternativas antes da leitura clínica | Elimina opções por incompatibilidade textual, não por raciocínio médico | Revisar concordância do enunciado com todas as opções isoladamente |
| Ambiguidade | Enunciado permite mais de uma interpretação razoável | Diverge da banca na leitura do caso, mesmo dominando o conteúdo | Reescrever o enunciado para fechar a interpretação em um único cenário |
| Distrator implausível | Opção que nenhum candidato do nível testado consideraria | Elimina por bom senso, sem exercitar o raciocínio clínico pretendido | Reescrever como erro clínico reconhecível para aquele nível de formação |
B) Insuficiência cardíaca
C) Hipotireoidismo primário com elevação de TSH e queda de T4 livre, associado a fadiga, ganho de peso e intolerância ao frio
D) Depressão
A) o eletrocardiograma
B) a ultrassonografia
C) o raio-x
D) o hemograma
B) Solicitar hemocultura
C) Encaminhar para UTI
D) Prescrever apenas repouso e reavaliar em 30 dias
Esse tipo de defeito é exatamente o que a revisão de redação de item e linguagem, um dos portões de um workflow estruturado de validação, se propõe a capturar antes que o item chegue à sala de prova, e por isso ela é tratada como etapa distinta da revisão clínica de conteúdo e da prontidão psicométrica (Destefani, Ferreira e Destefani, 2026).
Leia tambémSete Portões Antes de uma Questão Gerada por IA Entrar na Prova →
Como rodar análise de distratores no simulado da faculdade?
Rodar análise de distratores exige, como pré-requisito técnico, que o sistema de aplicação do simulado registre a resposta escolhida por alternativa, e não apenas se o candidato acertou ou errou o item. Esse é o ponto onde a maioria dos relatórios de simulado institucional falha por construção: relatórios que mostram somente o percentual de acerto do item escondem exatamente a informação que revelaria onde a questão está quebrada, porque dois itens com o mesmo percentual de acerto podem ter perfis de distrator completamente diferentes, um com as três opções incorretas dividindo o restante dos respondentes de forma equilibrada, outro com duas opções mortas e uma única concentrando quase todo o erro.
Um segundo ponto que precisa ser dito com honestidade metodológica: item novo, recém-escrito, não tem esse dado por definição, porque nenhum respondente ainda passou por ele. Para itens inéditos, a revisão estrutural das opções se apoia apenas nas diretrizes de redação, checando pista de comprimento, plausibilidade de distrator e ambiguidade de forma qualitativa, e o escrutínio empírico baseado na regra dos 5% fica necessariamente adiado para depois do piloto. É por isso que a ordem do processo importa: revisão estrutural primeiro, análise empírica de distrator depois, nunca o contrário, porque não existe dado empírico para revisar antes de o item ser respondido por um número relevante de candidatos.
Na prática operacional de uma coordenação, isso significa que o fluxo do simulado interno precisa gerar, no mínimo, três relatórios integrados: a frequência de escolha por alternativa em cada item, a correlação bisserial pontual corrigida, calculada excluindo o próprio item do escore-resto ao qual é correlacionado para não inflar o coeficiente por dependência parte-todo, e a dificuldade do item expressa como proporção de acertos. Itens com qualquer distrator abaixo de 5% de escolha entram automaticamente numa fila de revisão de redação, independentemente de sua discriminação estar dentro do critério adotado pela instituição, exatamente porque, como mostrou o estudo de farmacoterapia com bisserial 0,41 e 0,39, as duas dimensões não se substituem.
A plataforma da SPR Med automatiza esse cruzamento a partir do banco proprietário de 266.177 questões tagueadas na Matriz Pedagógica 7D, alinhada à Matriz de Referência Comum, permitindo que a coordenação visualize, item a item, tanto o desempenho agregado quanto a distribuição de escolha por alternativa, sem depender de planilhas manuais montadas depois da aplicação do simulado.
[CTA: Agende uma demonstração da plataforma SPR Med e veja como a análise de distratores por alternativa é gerada automaticamente a partir do seu simulado institucional.]
Isso vale para o ENAMED também?
Sim, no sentido de processo, e não no sentido de acesso ao mesmo dado. Na Nota Técnica INEP nº 19/2025, dos 100 itens do ENAMED 2025, 10 foram retirados do cálculo do corte: 7 por via administrativa, sendo 6 recursos deferidos e 1 erro material, e 3 por via psicométrica, especificamente por correlação bisserial inadequada. Restaram 90 itens no cálculo final, e o corte foi normalizado de 58,75% em 100 itens para 57,87% em 90 itens, com desvio padrão de 3,68 pontos percentuais.
Isso demonstra que o INEP aplica um crivo psicométrico sobre os próprios itens da prova oficial, retirando do cálculo aqueles que não sustentam a medida pretendida. O que o INEP publica é o resultado agregado desse crivo, a saber, quantos itens saíram e por qual via, não a análise de distratores item a item que sustentou essa decisão internamente. A analogia que uma instituição de ensino deveria fazer com o simulado interno é, portanto, de processo, disciplina de checar cada item antes de ele contar para uma nota, e não de acesso ao dado psicométrico bruto do exame nacional, que não é publicizado nesse nível de granularidade.
Leia tambémQuestão Anulada ou Desconsiderada? As Duas Portas de Saída do Cálculo do ENAMED →
Vale reforçar, para que a coordenação não estenda a analogia além do que é tecnicamente correto: como o ENAMED usa o modelo de Rasch, de um parâmetro, não existe parâmetro de discriminação do item para revisar no exame oficial nos mesmos termos de um modelo de dois ou três parâmetros. A retirada por "correlação bisserial inadequada" citada na Nota Técnica 19/2025 é um crivo de qualidade aplicado na fase de análise dos dados, distinto da forma como o modelo Rasch estima os parâmetros finais de dificuldade dos itens que permanecem na prova.
Declaração de conflito de interesse
Este artigo cita DESTEFANI, V. C.; FERREIRA, M. F. C.; DESTEFANI, A. C. Human-Governed Validation of Artificial Intelligence-Generated Medical Assessment Artifacts: A Technical Report. Cureus, v. 18, n. 8, e115344, 28 ago. 2026. DOI: 10.7759/cureus.115344. É necessário declarar de forma explícita que os três autores desse estudo são fundadores da SPR Med. A declaração de conflito de interesse publicada no próprio artigo, no formulário padronizado do ICMJE, é a mais completa entre os quatro estudos do mesmo grupo de autores: Vinícius C. Destefani é cofundador e Diretor de Pedagogia e Engajamento da SPR Med, além de consultor médico da Allm Inc., de Tóquio; Matheus Feliciano C. Ferreira é CEO da SPR Med; Afrânio C. Destefani atua como consultor científico da empresa. Os três declaram honorários, vínculo formal e participação acionária na SPR Med, e o próprio artigo afirma literalmente que o banco de itens e a plataforma da SPR Med são produtos comerciais. Nenhum financiamento externo foi recebido para o trabalho submetido.
Essa transparência foi declarada pelos próprios autores na fonte primária, não apenas neste blog, e é isso que torna a citação mais robusta, e não mais frágil: o vínculo comercial está exposto no registro público do artigo, sujeito à mesma revisão por pares que avaliou o conteúdo técnico. O artigo também declara que ferramentas de IA generativa, GPT da OpenAI e Claude da Anthropic, foram usadas estritamente para edição de linguagem e apoio à busca bibliográfica, nunca como coautoras, e que todas as análises, interpretações e conclusões pertencem aos autores humanos.
É igualmente necessário registrar o que esse estudo não prova. Trata-se de um technical report de equipe única, desenvolvido por prática iterativa e não por metodologia formal de consenso; os autores afirmam explicitamente que não usaram método Delphi. O relatório descreve um workflow de governança e não uma implementação empírica dele, e não reporta nenhum dado de confiabilidade entre revisores, o que os próprios autores identificam como a primeira grandeza que uma avaliação prospectiva desse workflow deveria reportar. O artigo não apresenta análise de desfecho, métrica de desempenho de item real, dado de aluno real, nem evidência empírica comparando itens gerados por IA com itens escritos por humanos. Planejar e revisar evidência não são, em si, evidência de que o workflow funciona, e o exemplo da pneumonia comunitária usado neste artigo para ilustrar a mecânica de reformulação de distrator é explicitamente hipotético, sem dado de aluno e com valores placeholder.
Documentos oficiais relacionados
Perguntas frequentes
O que caracteriza um distrator não funcional em uma questão de múltipla escolha?
Um distrator não funcional é uma alternativa incorreta escolhida por menos de 5% dos respondentes que chegaram ao item, segundo o critério estabelecido por Tarrant, Ware e Mohammed (2009). Isso significa que a opção não está capturando nenhum erro de raciocínio plausível, e funciona apenas como preenchimento estrutural, sem contribuir para a medida da habilidade do candidato.
Um item com boa discriminação pode ter distratores quebrados?
Sim. O estudo de Kiyak et al. (2024), publicado no European Journal of Clinical Pharmacology, documentou duas questões com correlação bisserial de 0,41 e 0,39, ambas acima do critério de 0,30, sendo que uma delas mantinha três opções classificadas como não funcionais. Discriminação e qualidade das opções são dimensões independentes de análise do mesmo item.
Uma questão com distrator não funcional deve ser descartada?
Não. A recomendação técnica é devolver o item para revisão das opções, preservando o enunciado e a resposta correta quando estes já foram validados clinicamente. O distrator deve ser reescrito para representar um erro clínico reconhecível e plausível para o nível de formação testado, em vez de uma alternativa implausível.
O ENAMED tem parâmetro de discriminação de item que pode ser revisado como o de uma prova interna?
Não da mesma forma. O ENAMED usa o modelo de Rasch, de um parâmetro, conforme a Nota Técnica INEP nº 42/2025, o que restringe a discriminação a ser igual entre os itens e a torna indisponível como parâmetro de nível de item para revisão individual, diferentemente de modelos de dois ou três parâmetros. Na Nota Técnica INEP nº 19/2025, três dos 100 itens do ENAMED 2025 foram retirados do cálculo do corte por correlação bisserial inadequada, o que indica um crivo de qualidade aplicado na análise dos dados, distinto da estimação final dos parâmetros pelo modelo Rasch.
Qual dado o relatório de simulado precisa ter para permitir análise de distrator?
O relatório precisa registrar a frequência de escolha de cada alternativa, e não apenas o percentual de acerto do item. A maioria dos relatórios de simulado institucional mostra somente acerto agregado, o que esconde exatamente onde a questão está estruturalmente quebrada, já que dois itens com o mesmo percentual de acerto podem ter distribuições de erro completamente diferentes entre os distratores.
É possível analisar distratores em itens recém-criados, antes de qualquer aplicação?
Não de forma empírica. Item novo não tem dado de resposta por definição, porque nenhum respondente ainda o enfrentou. Para itens inéditos, a revisão das opções é necessariamente qualitativa, apoiada em diretrizes de redação como plausibilidade de distrator e ausência de pistas de comprimento, e a análise empírica baseada na regra dos 5% só se torna possível depois do piloto.
Leia tambémDe Onde Vem a Nota de Corte 60 do ENAMED? Angoff Modificado e TS TRI →
Sobre a autoria
Médico, MBA em HealthTech (FIAP) e Gestão em Saúde (FGV). Publicado em Scientific Reports (Nature Portfolio). Liderou conteúdo médico para mais de 145.000 alunos antes de fundar o SPR Med.
Conheça a SPR Med com nossa equipe
Conheça a plataforma e converse sobre as necessidades da sua instituição.
Artigos Relacionados
Delphi no ENAMED: como se escolhe o que a prova avalia
Entenda o Delphi no ENAMED, o significado dos 80% de concordância e como a relação entre competência e instrumento orienta a avaliação na sua faculdade.
Orçamento de proficiência médica 2027: como calcular o custo total
Monte o orçamento institucional de preparação e acompanhamento ao ENAMED com licenças, implantação, horas docentes, operação e cenários de escopo.
Pós-ENAMED 2026: roteiro da coordenação para as primeiras 72 horas
Organize ocorrências, prazos, percepção dos alunos e análise preliminar após o ENAMED. Modelo de ata e plano de trabalho para a coordenação.