Bisserial Corrigida: Por Que a Discriminação de um Item Costuma Ser Superestimada
Correlacionar um item com um total que já contém esse item infla o coeficiente. A correção item-resto e por que limiares da Teoria Clássica não migram para a TRI do ENAMED.
Uma forma de examinar a discriminação de um item é correlacionar sua resposta com o escore das demais questões, excluindo o próprio item. Essa correção item-resto evita a dependência parte-todo que tende a elevar a correlação quando o item compõe os dois lados da análise. É preciso distinguir a correlação ponto-bisserial da bisserial e identificar qual foi calculada. No ENAMED, essas estatísticas podem apoiar a triagem de itens, mas não se tornam um parâmetro de discriminação estimado por questão no modelo Rasch.
Este artigo é o mais técnico do cluster que a SPR Med mantém sobre psicometria aplicada ao ENAMED. Ele endurece um guard-rail que já aparece em textos anteriores do blog: números de discriminação, dificuldade e consistência interna circulam em planilhas de coordenações de curso com uma frequência que não corresponde ao rigor de cálculo exigido. Corrigir essa distância é o objetivo das próximas seções.
O que a discriminação de um item mede?
A discriminação mede se quem sabe mais tende a acertar o item e quem sabe menos tende a errá-lo. Essa é a intuição antes de qualquer fórmula: um item que discrimina bem separa os respondentes de alta proficiência dos de baixa proficiência dentro daquela mesma prova. Um item que todo mundo acerta, independentemente do quanto sabe, não separa ninguém. Um item que todo mundo erra, pelo mesmo motivo, também não separa ninguém.
Essa propriedade é distinta da dificuldade. A dificuldade, na Teoria Clássica dos Testes, é simplesmente a proporção de acertos, calculada como p = c / n, em que c é o número de respostas corretas e n é o número de respondentes que chegaram ao item. Um item pode ser difícil e ainda assim discriminar mal, e um item pode ter dificuldade mediana e discriminar muito bem. São duas perguntas diferentes feitas ao mesmo dado bruto, e tratá-las como se fossem a mesma coisa é um dos erros mais comuns na leitura de relatórios de prova.
Para entender por que a maior parte dos cálculos de discriminação feitos em planilhas de coordenação está tecnicamente errada, é preciso primeiro entender o que a bisserial não corrigida faz de errado.
Leia tambémPor Que % de Acerto Engana: θ, Rasch e a Fórmula da Nota Final →
Por que a bisserial não corrigida engana?
A bisserial não corrigida engana porque correlaciona a resposta ao item com um escore total que já contém esse mesmo item. Isso é uma dependência parte-todo: o item está, em certa medida, sendo correlacionado consigo mesmo, e essa autoconcordância infla o coeficiente. O item concorda com o total em parte porque efetivamente descreve o construto, mas também, artificialmente, porque é um dos componentes que formam o próprio total.
O efeito não é trivial nem simétrico entre provas de tamanhos diferentes. Quanto menor a prova, maior o peso relativo de cada item no escore total, e pior fica a distorção. Numa prova de 100 itens, um item isolado pesa pouco no total, e a inflação, embora presente, tende a ser pequena. Numa prova de 15 ou 20 itens, o mesmo item pode responder por uma fração relevante da variância do escore total, e a inflação passa a ser grande o suficiente para mudar a decisão sobre manter ou descartar o item.
A forma corrigida resolve isso excluindo o item do total antes de correlacionar. Em prosa, a fórmula da bisserial pontual corrigida trabalha com M1 e M0, que são as médias dos escores-resto (o total sem aquele item) de quem acertou e de quem errou o item, respectivamente; com S, o desvio padrão desses escores-resto; e com p, a dificuldade do item. A lógica é comparar o desempenho médio no restante da prova entre quem acertou e quem errou aquele item específico, ponderado pela variabilidade desse restante e pela proporção de acerto. Quando essa comparação corrigida mostra que quem acerta o item também tende a ir bem no resto da prova, e quem erra tende a ir mal, o item está cumprindo sua função discriminante de forma genuína, sem o auxílio artificial da autocorrelação.
Ponto-bisserial e bisserial são a mesma medida?
Não. A ponto-bisserial é a correlação de Pearson entre a resposta binária, acerto ou erro, e um escore numérico. A bisserial utiliza uma transformação adicional, sob a hipótese de uma variável contínua subjacente à resposta dicotômica. A correção item-resto descreve a retirada do item do escore; não torna as duas medidas numericamente iguais.
Na conversão usual, rb = rpb × √(p × q) / φ(Φ⁻¹(p)), em que p é a proporção de acertos, q = 1 − p e φ e Φ são a densidade e a distribuição normal padrão. A NT Inep nº 42/2025, item 5.2.4.1.2, descreve a correlação inicial de Pearson e sua conversão para a escala bisserial na metodologia de 2025. A proporção e a correlação devem se referir às mesmas pessoas elegíveis, com as mesmas regras para respostas ausentes; em itens sem variabilidade, essas correlações não são definidas.
Qual valor de discriminação é aceitável?
A resposta honesta é que depende, e qualquer número apresentado como padrão universal deve ser lido com desconfiança. Isso não é evasão: é a constatação de que os critérios numéricos circulando na literatura foram estabelecidos em contextos específicos, com metodologias de cálculo nem sempre explicitadas, e não devem ser transferidos mecanicamente para qualquer prova.
A literatura publicada traz valores ilustrativos que ajudam a calibrar a intuição, mas que não substituem uma decisão prefixada pelo próprio programa. Dois estudos citam 0,30 como critério de corte para discriminação aceitável. Outro trabalho de referência, o de Tarrant, Ware e Mohammed (2009), que também é a origem da regra dos distratores não funcionais e do índice D dos 27%, trata valores acima de 0,20 como aceitáveis e acima de 0,30 como preferíveis. O ponto crítico é que esses valores publicados nem sempre deixam claro se a bisserial foi calculada na forma corrigida ou não corrigida, e como a forma corrigida tende a produzir coeficientes mais baixos e mais realistas do que a não corrigida, aplicar o mesmo limiar às duas formas indistintamente é comparar coisas diferentes.
A exigência real, portanto, não é decorar um número. É que o programa de avaliação prefixe, antes de rodar qualquer análise, qual critério vai aplicar, e que declare explicitamente que esse critério se refere à formulação corrigida. Sem essa declaração prévia, qualquer limiar citado depois do fato corre o risco de ter sido escolhido para justificar uma decisão já tomada, e não para orientá-la.
Existe alternativa mais simples?
Sim, existe: o índice D, que compara a proporção de acertos entre os 27% de respondentes com maior escore total e os 27% com menor escore total. A origem desse corte de 27% remonta a Tarrant, Ware e Mohammed (2009), e o raciocínio por trás dele é estatístico: esse percentual maximiza a diferenciação entre grupos extremos mantendo tamanho de amostra suficiente em cada grupo, sob distribuições aproximadamente normais.
O índice D tem vantagens práticas relevantes. É mais fácil de calcular à mão ou em planilha simples, sem exigir o cálculo de escores-resto individuais, e é mais fácil de explicar em reunião de colegiado ou comissão de curso, porque a lógica de comparar "os melhores" com "os piores" é intuitiva mesmo para quem não domina estatística. Por outro lado, o índice D usa menos informação do que a bisserial corrigida, porque descarta o terço central dos respondentes e reduz uma distribuição contínua a uma comparação entre dois grupos extremos. Isso o torna um indicador mais grosseiro, adequado para triagem rápida, mas menos preciso para decisões que exigem granularidade fina, como decidir entre manter, revisar ou descartar um item em uma prova de alta consequência.
| Critério | Bisserial pontual corrigida (item-resto) | Índice D (27% superior menos 27% inferior) |
|---|---|---|
| O que compara | Escore no restante da prova entre quem acertou e quem errou o item | Proporção de acerto entre grupos extremos de escore total |
| Uso de dados | Toda a amostra, com peso contínuo | Apenas os 27% superiores e os 27% inferiores |
| Sensibilidade a dependência parte-todo | Corrigida, item excluído do total | Depende de como o escore total foi formado |
| Facilidade de cálculo | Exige médias e desvio padrão de escores-resto | Cálculo direto de diferença de proporções |
| Uso típico | Análise psicométrica formal, revisão de banco de itens | Triagem rápida, comunicação em colegiado |
| Critério ilustrativo citado na literatura | 0,20 aceitável, 0,30 preferível, ou 0,30 como corte único, conforme o estudo | Sem limiar único consolidado na mesma literatura |
Por que dificuldade e discriminação precisam ser distinguidas?
Porque um processo de revisão que inspeciona a dificuldade aparente de um item não está, por isso, inspecionando sua discriminação. Essa é a lição central de um estudo de neurofisiologia conduzido por Laupichler e colaboradores (2024), publicado na Academic Medicine, que comparou 25 questões escritas por humanos e 21 geradas por ChatGPT, respondidas por 161 estudantes em um teste formativo.
O achado foi assimétrico entre as duas grandezas. A dificuldade do item não distinguiu os dois conjuntos: itens humanos e itens gerados por modelo de linguagem tiveram níveis de dificuldade aparente semelhantes. A discriminação, porém, distinguiu com clareza estatística: os itens escritos por humanos tiveram discriminação média de 0,36, com desvio padrão de 0,09, contra 0,24, com desvio padrão de 0,14, para os itens gerados por modelo de linguagem, com P = 0,001. Um segundo achado do mesmo estudo reforça o ponto sobre proveniência: os estudantes identificaram corretamente a origem da questão, humana ou gerada por IA, em apenas 57% dos casos, uma taxa próxima do acaso. O estudo não examinou se revisores especialistas teriam desempenho de identificação superior ao dos estudantes, e essa ausência não deve ser preenchida por suposição.
Duas consequências práticas decorrem daí. A primeira é metodológica: quem revisa apenas se um item "parece" difícil ou fácil, no sentido de dificuldade aparente, não está avaliando se ele separa bem os respondentes por proficiência, e as duas inspeções precisam ser feitas separadamente, com instrumentos separados. A segunda consequência é criterial, e frequentemente esquecida: um item pouco informativo para ordenar candidatos ao longo de toda a escala pode ser exatamente o item desejável perto de uma nota de corte criterial, porque ali o que se quer é um item calibrado na dificuldade da decisão, não um item que maximize a separação em toda a distribuição. Discriminação baixa em termos globais não é, por si só, motivo de descarte quando o uso pretendido do item é local, próximo ao ponto de corte.
Leia tambémDe Onde Vem a Nota de Corte 60 do ENAMED? Angoff Modificado e TS TRI →
E a consistência interna da prova?
A consistência interna, reportada como alfa de Cronbach ou como KR-20 (Fórmula 20 de Kuder-Richardson), é propriedade da prova como um todo, e não do item individual. Não existe "alfa do item": a expressão, quando aparece em relatórios de curso, é sempre um uso incorreto do termo, porque o coeficiente descreve o quanto os itens de uma forma de prova covariam entre si, uma propriedade que só faz sentido no nível do conjunto.
Três exigências acompanham qualquer relato responsável de consistência interna. Primeiro, o programa precisa prefixar qual coeficiente vai reportar, alfa de Cronbach ou KR-20, conforme a natureza dos itens. Segundo, precisa declarar o valor mínimo que considera coerente com o uso pretendido dos escores, porque o padrão exigido para uma decisão de baixa consequência é diferente do exigido para uma decisão de certificação. Terceiro, precisa acompanhar o coeficiente do número de itens da prova e de um intervalo de confiança, porque o alfa é diretamente influenciado pelo tamanho da prova: provas mais longas tendem a produzir alfas mais altos, independentemente de qualquer melhora real na qualidade dos itens, de modo que um alfa isolado, sem a contagem de itens que o acompanha, comunica menos do que parece comunicar.
Por que nada disso se aplica igual ao ENAMED?
Porque, sob a Teoria de Resposta ao Item, as grandezas que descrevem dificuldade e discriminação deixam de ser proporções amostrais e passam a ser parâmetros de um modelo estatístico estimados em escala latente, e os limiares definidos na Teoria Clássica dos Testes simplesmente não se transferem para essas novas grandezas. Essa é a distinção mais importante deste artigo, e a mais frequentemente ignorada em discussões informais sobre o exame.
A dificuldade, na TRI, é o parâmetro de locação b, expresso na mesma métrica de habilidade do respondente. A direção da escala é invertida em relação ao p da Teoria Clássica: um b maior denota um item mais difícil, enquanto um p maior denota um item mais fácil. Confundir as duas direções ao ler um relatório psicométrico é um erro de leitura tão comum quanto silencioso.
A discriminação, nos modelos que a estimam, como os de dois e três parâmetros, é o parâmetro de inclinação a. E aqui chega o ponto decisivo para qualquer leitura séria sobre o ENAMED: sob o modelo de Rasch, que é o modelo de um parâmetro, a discriminação é restrita, por definição matemática do próprio modelo, a ser igual entre todos os itens. Ela não é estimada item a item, e não é, portanto, um parâmetro de nível de item disponível para revisão individual. A Nota Técnica INEP nº 42/2025 descreve esse modelo para o ENAMED. Isso não impede calcular estatísticas clássicas de discriminação para investigar os itens: elas podem participar da triagem, mas não são parâmetros de inclinação individuais usados na estimação Rasch.
Leia tambémTRI no ENAMED: Como Funciona a Teoria de Resposta ao Item →
| Grandeza | Como aparece na Teoria Clássica (TCT) | Como aparece na Teoria de Resposta ao Item (TRI) | O limiar de TCT migra? |
|---|---|---|---|
| Dificuldade | p = c/n, proporção de acertos; p maior = item mais fácil | Parâmetro de locação b, na escala de habilidade; b maior = item mais difícil (direção invertida) | Não |
| Discriminação | Bisserial pontual corrigida (item-resto), ou índice D | Parâmetro de inclinação a, nos modelos de dois e três parâmetros; sob Rasch, restrita a ser igual entre itens, não estimada por item | Não |
| Consistência interna | Alfa de Cronbach ou KR-20, propriedade da forma de prova | Informação do teste ao longo da escala de habilidade, conceito distinto | Não |
Um programa que adote qualquer variante de TRI precisa declarar, no plano de evidência do item, três elementos conjuntos: o modelo escolhido, o método de estimação e as premissas de tamanho amostral assumidas. A razão é que a estabilidade dos parâmetros estimados depende simultaneamente dos três, e declarar apenas um deles, por exemplo dizer que se usa "TRI" sem especificar o modelo, deixa a decisão sobre o item sem base auditável.
Então o que o INEP usa para tirar item da prova?
O INEP usa a correlação bisserial como um crivo de qualidade do item, e não como estimativa de um parâmetro de discriminação a ser reportado por item na escala Rasch. A Nota Técnica INEP nº 19/2025 registra que, dos 100 itens do ENAMED 2025, 10 foram retirados do cálculo do corte antes da divulgação dos resultados: 7 por via administrativa, sendo 6 recursos deferidos e 1 erro material, e 3 especificamente por correlação bisserial inadequada. Restaram 90 itens para o cálculo final, e o corte foi renormalizado de 58,75% em 100 itens para 57,87% em 90 itens, com desvio padrão de 3,68 pontos percentuais (Fonte: NT INEP nº 19/2025).
A correlação bisserial é um sinal de coerência do item com o conjunto da prova. Ela não equivale, isoladamente, a um teste completo de ajuste ao Rasch nem identifica a causa de um resultado inadequado. O manual de 2026 distingue a análise de correlação das etapas posteriores de dificuldade e ajuste; por isso, um coeficiente local baixo não autoriza antecipar a exclusão oficial de uma questão.
Leia tambémQuestão Sinalizada por DIF: o Que Isso Significa e o Que Não Significa →
O que a literatura empírica de terceiros mostra sobre isso
Um conjunto de estudos independentes, conduzidos por grupos diferentes dos autores deste artigo, reforça por que dificuldade, discriminação, funcionamento de distratores e percepção qualitativa precisam ser tratados como dimensões separadas, e não como um único ponto de checagem. A lição agregada é que desempenho aceitável em uma dimensão não garante desempenho aceitável em outra.
Kiyak e colaboradores (2024), na European Journal of Clinical Pharmacology, incorporaram duas questões geradas por ChatGPT, após revisão por painel de especialistas e sem modificação substantiva de conteúdo, a uma prova de farmacoterapia racional respondida por 99 estudantes de quarto ano. Ambas superaram o critério de bisserial pontual de 0,30, com valores de 0,41 e 0,39, e mesmo assim uma delas manteve três opções não funcionais, definidas como opções escolhidas por menos de 5% dos respondentes. Um item pode satisfazer um critério de discriminação e falhar num critério de qualidade das opções, e é exatamente por isso que a estrutura de portões descrita no paper de referência deste artigo trata qualidade de redação e prontidão psicométrica como etapas separadas.
Coşkun, Kiyak e Budakoğlu (2025), na Medical Teacher, conduziram um experimento randomizado controlado com 74 estudantes e, separadamente, aplicaram 15 questões geradas por ChatGPT. Apenas 6 das 15 questões atingiram correlação bisserial pontual de 0,30, enquanto as avaliações dos estudantes sobre os casos clínicos não diferiram significativamente entre grupos gerados por IA e escritos por humanos. Percepção qualitativa favorável e comportamento psicométrico adequado são achados sobre objetos diferentes, e um não substitui o outro.
Kaya e colaboradores (2025), na BMC Medical Education, compararam questões geradas por IA e desenhadas por clínicos em uma prova de medicina de emergência, com achados específicos daquele contexto que não devem ser generalizados sem evidência local equivalente. E uma revisão sistemática de Kiyak, Kaya e Emekli (2026), na Postgraduate Medical Journal, sobre a validade de questões de múltipla escolha geradas por IA, conclui que a evidência agregada permanece heterogênea, sem sustentar que uma dimensão de qualidade deva ser priorizada sobre as demais, nem que o uso não supervisionado seja apropriado em avaliação de alta consequência.
O quadro de sete portões e onde a discriminação entra nele
Um technical report recente propõe uma estrutura de governança para decidir quando um artefato de avaliação, como uma questão de prova, exige evidência empírica mais forte antes de ser usado com escore (DESTEFANI; FERREIRA; DESTEFANI, Cureus, 2026, DOI: 10.7759/cureus.115344). A discriminação entra nessa estrutura no sexto de sete portões, o de prontidão psicométrica, que é visitado duas vezes: uma primeira vez, quando o item ainda não tem dado de resposta e o portão produz apenas um plano de evidência; e uma segunda vez, depois do piloto, quando os dados são revisados contra aquele plano previamente declarado.
O paper é explícito quanto aos números que cita: eles ilustram critérios usados em trabalhos publicados, não valores que o quadro impõe como padrão universal. A exigência do portão é de planejar antes e revisar depois, não de aplicar um limiar fixo importado sem adaptação, precisamente porque, como este artigo já demonstrou, critérios numéricos não são portáveis entre arcabouços de medida diferentes, e às vezes nem entre formas de cálculo diferentes dentro do mesmo arcabouço.
Declaração de conflito de interesse
Os três autores do technical report citado neste artigo, Vinícius C. Destefani, Matheus Feliciano C. Ferreira e Afrânio C. Destefani, são fundadores da SPR Med. Vinícius C. Destefani é cofundador e Diretor de Pedagogia e Engajamento da SPR Med, além de consultor médico da Allm Inc., de Tóquio; Matheus Feliciano C. Ferreira é CEO da SPR Med; Afrânio C. Destefani é consultor científico da empresa. Os três declaram honorários, vínculo formal e participação acionária na SPR Med, e o próprio artigo original afirma que o banco de itens e a plataforma da empresa são produtos comerciais. Nenhum financiamento externo foi recebido para o trabalho submetido. A declaração completa segue o formulário padronizado do ICMJE e consta no artigo original. Ferramentas de inteligência artificial generativa, GPT da OpenAI e Claude da Anthropic, foram usadas estritamente para edição de linguagem e apoio à busca bibliográfica, nunca como coautoras, e todas as análises, interpretações e conclusões são de responsabilidade exclusiva dos autores humanos.
É importante ser preciso sobre o que esse technical report não estabelece. Ele é um relatório de equipe única, desenvolvido por prática iterativa e não por metodologia formal de consenso como Delphi. Não apresenta análise de desfecho, métrica de desempenho de item nem dado de aluno, e não compara empiricamente item gerado por IA com item escrito por humano. O próprio texto afirma que descreve o workflow e não uma implementação dele, e que não reporta nenhum dado de confiabilidade, sendo essa a primeira grandeza que uma avaliação prospectiva deveria reportar. Planejar e revisar evidência não são, em si, evidência de que o workflow funciona. O exemplo de item sobre pneumonia adquirida na comunidade que o paper desenvolve para ilustrar os sete portões é explicitamente hipotético, sem dado real de aluno e sem estatística real de item, e não deve ser lido como caso da SPR Med ou de qualquer instituição.
Leia tambémSete Portões Antes de uma Questão Gerada por IA Entrar na Prova →
Para uma coordenação de curso ou uma equipe de gestão acadêmica, o valor prático desta discussão não está em decorar fórmulas, mas em saber fazer as perguntas certas quando um relatório de análise de item chega à mesa: qual bisserial foi calculada, corrigida ou não; qual critério foi prefixado antes da coleta de dados; e, no caso específico do ENAMED, se o relatório está, sem perceber, aplicando conceitos de discriminação por item a um modelo que não os produz.
A SPR Med organiza o diagnóstico, a prescrição, o controle e a mentoria da proficiência médica a partir de um banco proprietário de 266.177 questões tagueadas na Matriz Pedagógica 7D, alinhada à Matriz de Referência Comum do ENAMED, e calibradas por Teoria de Resposta ao Item. Para coordenações que precisam decidir com rigor técnico, não com planilhas improvisadas, conheça como o M.A.E.S.T.R.O. estima a Nota Final na escala INEP.
Como ler uma bisserial calculada após o ENAMED 2026?
Primeiro, confira caderno, versão do gabarito, população, número de pessoas elegíveis e regra de tratamento de respostas ausentes. Trocar a chave pode modificar acertos, escore-resto e correlações sem entrada de novas respostas. O estudo editorial sobre gabarito e dificuldade estimada no ENAMED 2026 mostra por que preservar versões é parte da interpretação.
Um valor pontual baixo ou negativo em uma amostra local é um sinal para revisar chave, correspondência do item, enunciado, imagem e comportamento dos dados. Examine a incerteza e o número de itens investigados antes de destacar um resultado isolado. Isso não comprova erro clínico, não determina anulação e não substitui a análise nacional descrita no manual do Inep, páginas 12 e 13.
Documentos oficiais relacionados
Perguntas frequentes
O que significa correção item-resto?
Significa retirar o próprio item do escore com o qual sua resposta será correlacionada. A escolha reduz a dependência parte-todo; o relatório ainda precisa informar se utilizou ponto-bisserial ou bisserial.
Ponto-bisserial e bisserial produzem o mesmo número?
Não. A ponto-bisserial correlaciona diretamente a resposta binária com o escore; a bisserial aplica uma transformação baseada em hipótese adicional sobre a variável subjacente. Valores e limiares de uma não devem ser transferidos automaticamente para a outra.
Qual é o valor ideal de discriminação de um item?
Não existe um valor universal aplicável a qualquer prova. O critério depende da estatística, do público, da finalidade e da precisão da estimativa; precisa ser declarado antes da decisão.
O ENAMED tem parâmetro de discriminação por item?
O Rasch adotado pelo ENAMED não estima inclinações diferentes para cada item. Isso é compatível com usar correlações clássicas na triagem, sem inseri-las como parâmetros do cálculo Rasch.
Bisserial negativa em uma análise local significa anulação?
Não. Ela orienta investigação, mas não demonstra isoladamente a causa do problema nem antecipa a decisão do Inep. A triagem oficial considera seus próprios dados, critérios e recálculos.
Sobre a autoria
Médico, MBA em HealthTech (FIAP) e Gestão em Saúde (FGV). Publicado em Scientific Reports (Nature Portfolio). Liderou conteúdo médico para mais de 145.000 alunos antes de fundar o SPR Med.
Conheça a SPR Med com nossa equipe
Conheça a plataforma e converse sobre as necessidades da sua instituição.
Artigos Relacionados
ENAMED 2026: gabarito e dificuldade estimada das questões
Veja como a troca de uma chave de trabalho pelo gabarito preliminar altera a dificuldade estimada e como interpretar esses dados antes do resultado do ENAMED.
O que caiu no ENAMED 2026: mapa das 100 questões
Veja a leitura editorial da SPR Med sobre as 100 questões do ENAMED 2026, com áreas, cenários e caminhos de revisão. Dados preliminares e limites explícitos.
ENAMED 2026: prever temas não é prever toda a prova
Entenda a diferença entre acertar temas de um ranking e cobrir questões do ENAMED 2026. Veja os denominadores e como usar previsões no planejamento de estudos.