Questão Sinalizada por DIF: o Que Isso Significa e o Que Não Significa
DIF verifica se pessoas de mesma habilidade e grupos diferentes têm chances desiguais de acertar um item. Uma questão sinalizada não está provada enviesada: a sinalização abre a investigação.
O funcionamento diferencial do item, conhecido pela sigla DIF, é uma análise estatística que avalia se respondentes com a mesma habilidade medida, mas pertencentes a grupos diferentes, têm probabilidades desiguais de acertar um item. Um item sinalizado por DIF não está, só por isso, demonstrado enviesado: a sinalização é o início de uma revisão de conteúdo, e apenas essa revisão pode estabelecer se a diferença observada é irrelevante ao construto que se pretende medir ou se reflete uma diferença legítima de competência. Tratar toda sinalização como veredito de injustiça é tão equivocado quanto ignorar a análise por completo.
Esse é o ponto que a maior parte do material disponível sobre avaliação educacional erra, em um sentido ou no outro. Quem ignora DIF corre o risco de deixar itens estruturalmente injustos compondo a nota de milhares de candidatos. Quem trata toda sinalização como prova de viés descarta itens tecnicamente bons e transforma um alerta estatístico em acusação. O objetivo deste artigo é segurar as duas pontas dessa tensão com precisão técnica.
O que é funcionamento diferencial do item?
DIF pergunta se, dentro do mesmo nível de habilidade, a probabilidade de acerto de um item ainda difere entre grupos de respondentes. Essa é a característica que separa DIF de uma simples diferença de desempenho: se um grupo tem desempenho geral pior na prova inteira, é esperado, e não problemático, que ele acerte menos itens no total. DIF não olha para o desempenho bruto. Ele controla estatisticamente pelo nível de habilidade de cada respondente e só então compara as probabilidades de acerto entre grupos que estão no mesmo patamar de proficiência.
Pense em dois candidatos com exatamente a mesma proficiência estimada na prova inteira, um pertencente ao grupo A e outro ao grupo B. Se, no item X, a probabilidade de acerto do candidato do grupo A for sistematicamente maior que a do candidato do grupo B, mesmo com os dois no mesmo nível de habilidade, esse item exibe funcionamento diferencial. A comparação não é entre médias de grupos inteiros, é entre indivíduos equiparados em habilidade que respondem ao mesmo item de formas estatisticamente diferentes.
Essa distinção é o alicerce técnico de toda a análise. Sem controle pela habilidade, qualquer diferença de desempenho entre grupos poderia ser confundida com viés de item, quando na verdade pode refletir diferenças reais e legítimas de formação, exposição curricular ou oportunidade de aprendizagem, questões que dizem respeito ao ensino, não ao instrumento de medida.
Leia tambémTRI no ENAMED: Como Funciona a Teoria de Resposta ao Item →
Por que diferença de desempenho não é a mesma coisa que DIF?
A confusão mais comum na leitura de resultados de prova é tratar como equivalentes duas perguntas fundamentalmente diferentes: "um grupo foi pior neste item?" e "um grupo foi pior neste item mesmo entre os igualmente proficientes?". A primeira pergunta descreve impacto, a segunda descreve DIF, e apenas a segunda autoriza uma inferência sobre o funcionamento do item em si.
Um grupo pode ter desempenho geral inferior em uma prova inteira por razões que nada têm a ver com a qualidade dos itens, como diferenças de currículo entre instituições, tempo de formação ou acesso a determinados cenários de prática. Essa diferença agregada é chamada de impacto, e ela é esperada em muitas situações legítimas. DIF é outra coisa: é a pergunta sobre se, controlando pela habilidade, a chance de acerto em um item específico ainda difere entre grupos. Um item pode ter forte impacto (grupos diferentes acertam em proporções muito diferentes) sem exibir DIF algum, porque a diferença é inteiramente explicada pela diferença de habilidade entre os grupos. E, de forma menos intuitiva, um item pode exibir DIF mesmo quando o impacto agregado é pequeno.
| Pergunta feita | O que se compara | O que o achado autoriza concluir |
|---|---|---|
| Impacto: o grupo A teve desempenho pior que o grupo B nesta prova? | Desempenho médio bruto entre grupos, sem controle por habilidade | Nada sobre o item isoladamente; pode refletir diferença real de proficiência entre os grupos |
| DIF: respondentes de mesma habilidade, mas grupos diferentes, têm chance desigual de acertar este item? | Probabilidade de acerto controlada pelo nível de habilidade estimado | Um sinal estatístico que exige investigação de conteúdo, não uma conclusão sobre o item |
| Revisão de conteúdo pós-DIF: a diferença encontrada é irrelevante ao construto? | Conteúdo, redação e contexto do item específico sinalizado | Se sustentada, indica item candidato a revisão ou remoção; se não sustentada, o item é mantido |
A tabela deixa evidente por que um relatório de resultados que só reporta médias por subgrupo não diz nada sobre DIF, e por que uma afirmação do tipo "o grupo X foi pior neste item" não é, isoladamente, evidência de viés de item.
Como o DIF é detectado?
Existem três caminhos metodológicos principais para detectar DIF, e cada um exige um tamanho amostral diferente para produzir uma estimativa confiável. O método Mantel-Haenszel compara as chances de acerto entre grupos dentro de estratos de habilidade definidos pelo escore total; a regressão logística modela a probabilidade de acerto em função da habilidade, do pertencimento a grupo e da interação entre os dois; e a abordagem baseada em Teoria de Resposta ao Item compara diretamente as curvas características do item estimadas separadamente para cada grupo.
Nenhum desses métodos é intrinsecamente superior aos outros em todas as situações. A escolha depende do tamanho dos subgrupos disponíveis, da estrutura dos dados e do modelo de medida já em uso na prova. O ponto crítico de governança é que método e tamanho de amostra precisam ser escolhidos juntos, antes de qualquer inspeção dos dados, porque escolher o método depois de ver o resultado é escolher o resultado.
| Método | O que compara | Exigência típica de amostra |
|---|---|---|
| Mantel-Haenszel | Chances de acerto entre grupos, dentro de estratos definidos pelo escore total | Funciona com amostras moderadas, mas depende de estratos com número suficiente de respondentes em cada grupo |
| Regressão logística | Probabilidade de acerto em função de habilidade, grupo e interação entre ambos | Exige amostra suficiente para estimar termos de interação com precisão, tipicamente maior que Mantel-Haenszel simples |
| Abordagem baseada em TRI | Curvas características do item estimadas separadamente por grupo | Exige amostras substanciais em cada grupo para que os parâmetros do modelo sejam estimados com estabilidade |
Essa diferença de exigência amostral é o motivo pelo qual um programa de avaliação não pode simplesmente "aplicar DIF" como se fosse um procedimento único. É preciso decidir, antes de qualquer coleta de dado, qual método será usado e qual tamanho de subgrupo é necessário para que aquele método específico produza uma estimativa interpretável.
O que o plano precisa declarar antes de olhar o dado?
O plano de detecção de DIF precisa declarar, antes de qualquer inspeção dos dados, quatro elementos: o método de detecção, o tamanho de subgrupo considerado adequado para aquele método específico, a regra de sinalização que define quando um item será marcado, e a revisão substantiva de conteúdo que obrigatoriamente segue qualquer sinalização. Esses quatro elementos formam um pacote indivisível, não uma sequência de decisões independentes.
O motivo para prefixar tudo isso é simples e determinante: escolher o método, o critério ou o limiar depois de já ter visto quais itens seriam sinalizados por qual regra é escolher o resultado, não escolher a metodologia. Um programa que testa vários métodos e vários limiares até encontrar a combinação que sinaliza (ou deixa de sinalizar) os itens que já suspeitava, não está fazendo análise de DIF, está fazendo confirmação de uma hipótese prévia disfarçada de estatística.
Esse é o mesmo princípio de governança que estrutura o Portão 6 do arcabouço descrito por Destefani, Ferreira e Destefani (2026) para artefatos de avaliação gerados por inteligência artificial: o plano de evidência empírica precisa ser produzido na primeira passagem, antes de qualquer dado de piloto existir, e só então os resultados são revisados contra aquele plano previamente declarado. O texto original é explícito ao afirmar que o plano deve prefixar o método de detecção de DIF, o tamanho de subgrupo adequado àquele método, a regra de sinalização e a revisão substantiva que segue uma sinalização, e que as exigências de tamanho amostral diferem apreciavelmente entre métodos, de modo que método e tamanho de amostra precisam ser escolhidos juntos.
Leia tambémErro-Padrão no ENAMED: Por Que a Sua Nota Não É um Número Exato →
Uma questão sinalizada é uma questão injusta?
Não. Uma questão sinalizada por DIF não está, por isso, demonstrada enviesada. A detecção estatística inicia uma revisão de conteúdo, e é apenas essa revisão que pode estabelecer se a diferença encontrada decorre de algo irrelevante ao construto que a prova pretende medir, ou se reflete uma diferença legítima na competência avaliada. Essa é a distinção mais importante deste artigo, e é também a mais frequentemente ignorada em discussões informais sobre equidade em avaliação.
Considere dois cenários hipotéticos de revisão pós-sinalização. No primeiro, um item de farmacologia clínica é sinalizado porque respondentes de um determinado grupo, mesmo com habilidade equiparada, acertam menos que respondentes de outro grupo. A revisão de conteúdo encontra que o enunciado utiliza um termo de vocabulário regional pouco padronizado nacionalmente, criando uma barreira de compreensão que nada tem a ver com o conhecimento farmacológico avaliado. Nesse caso, a diferença é irrelevante ao construto, e o item é candidato a revisão ou remoção. No segundo cenário, um item sobre manejo em determinado cenário de prática é sinalizado, e a revisão de conteúdo encontra que a diferença reflete exposição curricular desigual a esse cenário específico entre instituições, uma diferença que é exatamente o tipo de competência que a prova se propõe a medir. Nesse caso, o item pode ser mantido, porque a diferença captada é substantiva e não espúria.
A distinção entre esses dois cenários não pode ser feita por estatística sozinha. Ela exige julgamento de especialistas em conteúdo, examinando o enunciado, o contexto e a competência pretendida item por item. Descartar automaticamente todo item sinalizado, sem essa revisão, tem um custo real: reduz o banco de itens disponíveis, pode remover itens que efetivamente discriminam uma competência legítima, e transforma uma ferramenta de investigação em um mecanismo de censura estatística. Martinková et al. (2017), citados no corpus normativo desta área, argumentam precisamente que a análise de DIF deveria ser parte rotineira do desenvolvimento de instrumentos, o que pressupõe que ela gera trabalho de revisão, não veredito automático.
Leia tambémBisserial Corrigida: Por Que a Discriminação de um Item Costuma Ser Superestimada →
E quando o subgrupo é pequeno demais?
Quando o tamanho de subgrupo necessário para o método escolhido não é atingido, a exigência de governança é registrar que essa condição não foi cumprida, e não omitir a análise em silêncio. Essa é provavelmente a orientação mais citável e mais prática deste artigo, porque descreve a situação real da maioria das instituições de ensino médico brasileiras, cujos subgrupos por turma, por região ou por outro critério relevante frequentemente não atingem o tamanho amostral exigido por nenhum dos três métodos descritos.
Há uma diferença moral e prática relevante entre duas posturas institucionais. A primeira é "não conseguimos avaliar DIF com confiabilidade estatística adequada neste ciclo, e isso está registrado no relatório de qualidade da prova". A segunda é simplesmente não mencionar o assunto, deixando a impressão, por omissão, de que a ausência de menção significa ausência de problema. A primeira postura é compatível com um programa de avaliação responsável, mesmo com recursos limitados. A segunda constitui uma lacuna de transparência que se torna indistinguível, para qualquer observador externo, de negligência.
Registrar a limitação não é uma admissão de fracasso, é o cumprimento do padrão mínimo de honestidade metodológica. Um programa pequeno que documenta "nosso subgrupo N para o critério Y não atingiu o tamanho mínimo requerido pelo método Z, e portanto a análise de DIF não pôde ser realizada com confiabilidade nesta aplicação" está em uma posição de integridade muito mais defensável do que um programa que dispõe de dados suficientes e simplesmente não analisa, ou analisa e não relata.
O ENAMED faz análise de DIF?
O corpus normativo público do ENAMED, incluindo a Nota Técnica INEP nº 42/2025 e a Nota Técnica INEP nº 19/2025, documenta o modelo de Rasch, o procedimento de estimação e o crivo de itens aplicado ao exame, mas não afirma publicamente, nesses documentos, que o INEP realiza análise de DIF de forma rotineira sobre os itens do ENAMED. O que se sabe, com base nas notas técnicas disponíveis, é que dos 100 itens do ENAMED 2025, 10 saíram do cálculo do corte: 7 por via administrativa, sendo 6 recursos deferidos e 1 erro material, e 3 por propriedades psicométricas inadequadas, especificamente correlação bisserial inadequada. O corte foi então normalizado de 58,75% em 100 itens para 57,87% em 90 itens, com desvio padrão de 3,68 pontos percentuais.
É importante não confundir essa exclusão documentada, motivada por correlação bisserial, com uma análise de DIF, que é uma pergunta diferente e usa métodos distintos. As notas técnicas públicas não mencionam DIF como critério de exclusão de item no ciclo de 2025. Isso não significa necessariamente que a análise não seja realizada internamente, apenas que ela não está documentada nos textos normativos disponíveis publicamente, e este artigo se restringe deliberadamente ao que os documentos registram, sem especular sobre procedimentos não declarados.
O que pode ser afirmado com segurança, independentemente de qualquer prova específica, é que qualquer instituição de ensino médico que compare desempenho entre grupos de estudantes, seja por turma, por unidade, por região ou por qualquer outro critério, deveria ter um plano de análise de funcionamento diferencial de item, prefixado nos termos descritos anteriormente, antes de fazer qualquer comparação que possa impactar decisões pedagógicas ou institucionais.
Leia tambémSete Portões Antes de uma Questão Gerada por IA Entrar na Prova →
Uma nota sobre a origem técnica deste arcabouço
A estrutura de governança descrita neste artigo, incluindo a exigência de prefixar método, tamanho de subgrupo, regra de sinalização e revisão substantiva antes de qualquer inspeção de dado, é detalhada no relatório técnico de Destefani, Ferreira e Destefani, publicado na revista Cureus. A referência completa é: DESTEFANI, V. C.; FERREIRA, M. F. C.; DESTEFANI, A. C. Human-Governed Validation of Artificial Intelligence-Generated Medical Assessment Artifacts: A Technical Report. Cureus, v. 18, n. 8, e115344, 28 ago. 2026. DOI: 10.7759/cureus.115344. O artigo é revisado por pares, publicado em acesso aberto sob licença CC-BY 4.0 pela Springer Nature, e indexado no PubMed, com datas de revisão declaradas no próprio texto: revisão iniciada em 12 de agosto de 2026 e encerrada em 25 de agosto de 2026.
É preciso ser preciso sobre o que esse relatório estabelece e o que não estabelece. Ele descreve um arcabouço de governança, um conjunto de sete portões sequenciais de decisão humana documentada, para artefatos de avaliação gerados por inteligência artificial. O relatório é de equipe única, desenvolvido por prática iterativa e não por metodologia formal de consenso como Delphi, e os próprios autores afirmam isso explicitamente. O texto não apresenta análise de desfecho, métrica de desempenho de item nem dado de aluno real. Na formulação literal dos autores, o relatório descreve o workflow e não uma implementação dele, e não reporta nenhum dado de confiabilidade, sendo essa a primeira grandeza que uma avaliação prospectiva deveria reportar. Planejar e revisar evidência não são, em si, evidência de que o arcabouço funciona na prática.
Declaração de conflito de interesse
Os três autores do estudo citado (Destefani, Ferreira e Destefani) são fundadores da SPR Med, e essa relação está declarada no formulário padronizado do ICMJE dentro do próprio artigo publicado, não apenas neste blog. Vinícius C. Destefani é cofundador e Diretor de Pedagogia e Engajamento da SPR Med, além de consultor médico da Allm Inc., de Tóquio. Matheus Feliciano C. Ferreira é CEO da SPR Med. Afrânio C. Destefani atua como consultor científico. Os três declaram honorários, vínculo e participação acionária na empresa, e o artigo afirma literalmente que o banco de itens e a plataforma da SPR Med são produtos comerciais. Nenhum financiamento externo foi recebido para o trabalho submetido. O fato de a declaração constar na própria fonte primária, e não apenas em material institucional, reforça a transparência da citação, em vez de enfraquecê-la.
Vale registrar ainda que o próprio artigo declara o uso de inteligência artificial generativa (GPT, da OpenAI, e Claude, da Anthropic) estritamente para edição de linguagem e apoio à busca bibliográfica, nunca como coautora, com todas as análises, interpretações e conclusões atribuídas explicitamente aos autores humanos, uma aplicação do próprio Portão 2 do arcabouço ao processo de escrita do artigo.
Leia tambémDistrator Não Funcional: a Regra dos 5% e o Que Ela Revela da Sua Prova →
Síntese: o que fica deste artigo
DIF é uma ferramenta de investigação estatística, não um instrumento de julgamento moral automático sobre um item. Ela compara probabilidades de acerto entre grupos de respondentes de mesma habilidade, e uma sinalização positiva abre um processo de revisão de conteúdo, que é o único procedimento capaz de determinar se a diferença encontrada é irrelevante ao construto medido ou se reflete competência legítima. Instituições que dispõem de dados suficientes para essa análise deveriam prefixar método, tamanho de subgrupo, regra de sinalização e revisão substantiva antes de examinar qualquer resultado, e instituições cujos subgrupos são pequenos demais deveriam registrar essa limitação explicitamente, em vez de simplesmente silenciar o assunto.
Documentos oficiais relacionados
Perguntas frequentes
O que significa uma questão ser sinalizada por DIF?
Significa que, entre respondentes de mesma habilidade estimada, mas pertencentes a grupos diferentes, a probabilidade de acertar aquele item específico foi estatisticamente desigual. A sinalização é um alerta que inicia uma revisão de conteúdo, não uma conclusão sobre a qualidade ou a justiça do item.
DIF é o mesmo que um grupo ter nota mais baixa na prova?
Não. Ter nota mais baixa na prova inteira é uma diferença de desempenho agregado, chamada impacto, e pode refletir diferenças reais de formação entre grupos. DIF controla estatisticamente pela habilidade de cada respondente e pergunta se, mesmo entre igualmente proficientes, a chance de acerto naquele item específico ainda difere.
Toda questão sinalizada por DIF deve ser removida da prova?
Não necessariamente. A sinalização inicia uma revisão de conteúdo conduzida por especialistas na área. Se a revisão encontrar que a diferença decorre de algo irrelevante ao construto avaliado, como um problema de redação ou vocabulário, o item é candidato a revisão ou remoção. Se a revisão concluir que a diferença reflete competência legítima que a prova pretende medir, o item pode ser mantido.
Quais métodos existem para detectar DIF?
Os três principais são Mantel-Haenszel, regressão logística e abordagens baseadas em Teoria de Resposta ao Item. Eles diferem na forma de comparação e, principalmente, no tamanho amostral necessário para produzir estimativas confiáveis, razão pela qual método e tamanho de amostra precisam ser definidos em conjunto, antes de qualquer análise dos dados.
O ENAMED analisa DIF nos itens da prova?
As notas técnicas públicas do ENAMED, incluindo a NT INEP nº 42/2025 e a NT INEP nº 19/2025, documentam o modelo de Rasch e o crivo de exclusão de itens por via administrativa e por propriedades psicométricas, como correlação bisserial inadequada, mas não mencionam análise de DIF como critério documentado de exclusão. Este artigo se limita ao que os documentos oficiais registram publicamente.
O que uma instituição deve fazer se o subgrupo de alunos for pequeno demais para análise de DIF?
Deve registrar formalmente que o tamanho amostral necessário para o método de detecção escolhido não foi atingido naquele ciclo, em vez de simplesmente omitir a análise sem qualquer menção. Essa transparência é o padrão mínimo de integridade metodológica, mesmo quando a análise completa não é viável.
Sobre a autoria
Médico, MBA em HealthTech (FIAP) e Gestão em Saúde (FGV). Publicado em Scientific Reports (Nature Portfolio). Liderou conteúdo médico para mais de 145.000 alunos antes de fundar o SPR Med.
Conheça a SPR Med com nossa equipe
Conheça a plataforma e converse sobre as necessidades da sua instituição.
Artigos Relacionados
ENAMED 2026: gabarito e dificuldade estimada das questões
Veja como a troca de uma chave de trabalho pelo gabarito preliminar altera a dificuldade estimada e como interpretar esses dados antes do resultado do ENAMED.
O que caiu no ENAMED 2026: mapa das 100 questões
Veja a leitura editorial da SPR Med sobre as 100 questões do ENAMED 2026, com áreas, cenários e caminhos de revisão. Dados preliminares e limites explícitos.
ENAMED 2026: prever temas não é prever toda a prova
Entenda a diferença entre acertar temas de um ranking e cobrir questões do ENAMED 2026. Veja os denominadores e como usar previsões no planejamento de estudos.