---
title: "O Que a Evidência Diz Sobre Questões Geradas por IA: Três Estudos, Três Lições — SPR Med"
url: https://sprmed.com.br/blog/b2b-evidencia-questoes-geradas-por-ia-tres-estudos
description: "Três estudos publicados mediram o comportamento psicométrico de questões geradas por ChatGPT em provas reais de medicina. Os números contrariam tanto o entusiasmo quanto a rejeição automática."
lang: pt-BR
---

B2B

# O Que a Evidência Diz Sobre Questões Geradas por IA: Três Estudos, Três Lições

Três estudos publicados mediram o comportamento psicométrico de questões geradas por ChatGPT em provas reais de medicina. Os números contrariam tanto o entusiasmo quanto a rejeição automática.

Image: Dr. Matheus Ferreira (https://res.cloudinary.com/dk8el9agv/image/upload/v1778608087/matheus_ksqsss.jpg)

Por Dr. Matheus Ferreira (https://sprmed.com.br/autor/dr-matheus-ferreira), CRM-SP 206.304

Atualizado em 09 de setembro de 2026

Publicado em 28 de agosto de 2026 18 min de leitura

Compartilhar: LinkedIn (https://www.linkedin.com/sharing/share-offsite/?url=https%3A%2F%2Fsprmed.com.br%2Fblog%2Fb2b-evidencia-questoes-geradas-por-ia-tres-estudos)WhatsApp (https://api.whatsapp.com/send?text=O%20Que%20a%20Evid%C3%AAncia%20Diz%20Sobre%20Quest%C3%B5es%20Geradas%20por%20IA%3A%20Tr%C3%AAs%20Estudos%2C%20Tr%C3%AAs%20Li%C3%A7%C3%B5es%20https%3A%2F%2Fsprmed.com.br%2Fblog%2Fb2b-evidencia-questoes-geradas-por-ia-tres-estudos)Twitter (https://twitter.com/intent/tweet?text=O%20Que%20a%20Evid%C3%AAncia%20Diz%20Sobre%20Quest%C3%B5es%20Geradas%20por%20IA%3A%20Tr%C3%AAs%20Estudos%2C%20Tr%C3%AAs%20Li%C3%A7%C3%B5es&url=https%3A%2F%2Fsprmed.com.br%2Fblog%2Fb2b-evidencia-questoes-geradas-por-ia-tres-estudos)

Três estudos publicados entre 2024 e 2025, conduzidos por grupos de pesquisa independentes entre si e independentes da SPR Med, mediram o comportamento psicométrico de questões geradas por ChatGPT em provas reais de medicina. Os resultados são desiguais entre dimensões: num estudo turco, duas questões geradas por IA superaram o critério de discriminação de 0,30 enquanto uma delas mantinha três opções não funcionais; noutro, apenas 6 de 15 questões atingiram esse mesmo critério, embora as avaliações dos estudantes sobre os casos gerados por IA não tenham diferido das avaliações sobre casos escritos por humanos; num terceiro, a dificuldade não distinguiu itens humanos de itens de IA, mas a discriminação distinguiu, com significância estatística. A conclusão que se impõe não é "a IA funciona" nem "a IA não funciona": é que qualidade de item tem múltiplas dimensões, e desempenho aceitável numa delas não garante desempenho aceitável em outra.

Este artigo existe porque esses três estudos são de outros grupos de pesquisa, não da SPR Med. Isso importa mais do que parece. Boa parte do que circula sobre IA em avaliação médica vem de quem vende a ferramenta ou de quem a construiu, o que cria um incentivo estrutural para relatar apenas o que funcionou. Os três estudos aqui discutidos foram publicados por pesquisadores de farmacologia, educação médica e neurofisiologia sem vínculo comercial com plataformas de geração de itens, o que os torna a evidência de terceiros mais citável disponível no momento para coordenadores de curso que precisam decidir se, e como, usar IA generativa na elaboração de provas.

## Por que "a IA escreve boa questão?" é a pergunta errada?

A pergunta é mal formulada porque qualidade de item não é uma escala única: é dificuldade, discriminação, funcionamento dos distratores, alinhamento ao blueprint e equidade entre grupos, e essas propriedades podem divergir dentro do mesmo item. Um item pode ter discriminação estatisticamente adequada e ainda carregar distratores que nenhum candidato escolhe. Um conjunto de questões pode agradar aos estudantes que o respondem e falhar no critério psicométrico que decide se ele deveria compor a nota. Perguntar "funciona?" pressupõe uma resposta binária que a própria estrutura da medida educacional não permite.

Uma revisão sistemática recente sobre a validade de questões de múltipla escolha geradas por IA (KIYAK; KAYA; EMEKLI, Postgraduate Medical Journal, 2026) confirma esse quadro: a evidência agregada permanece heterogênea entre os estudos publicados, e essa heterogeneidade não sustenta ordenar uma dimensão de qualidade acima das outras, nem licencia uso não supervisionado de itens gerados por IA em avaliação de alta consequência. Não existe, na literatura disponível, um veredito único sobre "questões geradas por IA". Existem comportamentos específicos, medidos em contextos específicos, que se repetem em um padrão reconhecível: aprovação numa métrica não implica aprovação em outra.

É por isso que frameworks de governança tratam a redação do item e a avaliação psicométrica do item como portões distintos, e não como uma única checagem de qualidade. Leia também Sete Portões Antes de uma Questão Gerada por IA Entrar na Prova → (https://sprmed.com.br/blog/b2b-validacao-itens-gerados-por-ia-sete-portoes) detalha essa arquitetura de decisão sequencial. Este artigo trata de um problema anterior e mais estreito: o que a evidência empírica publicada, produzida por terceiros, efetivamente mostrou quando itens de IA entraram em provas reais.

Cinco eixos de qualidade de um item

Aprovação não é um veredito único, é cinco vereditos independentes

Um item hipotético gerado por IA pode passar em três eixos e falhar em dois simultaneamente. Nenhum eixo isolado garante que a questão está pronta.

01

Dificuldade

Proporção de acerto compatível com o nível esperado da coorte

Aprovado

02

Discriminação

Capacidade do item de separar quem domina o conteúdo de quem não domina

Aprovado

03

Funcionamento dos distratores

Cada alternativa incorreta precisa atrair candidatos com domínio parcial, sem ser obviamente falsa

Reprovado

04

Alinhamento ao blueprint

Correspondência com a competência, domínio e cenário previstos na matriz de referência

Aprovado

05

Equidade entre grupos

Ausência de funcionamento diferencial do item entre subgrupos de candidatos

Reprovado

Um item pode superar o critério estatístico de discriminação e ainda carregar distratores mal construídos, exatamente o padrão observado em uma das duas questões de ChatGPT incorporadas à prova de farmacoterapia racional de Kiyak et al. (2024). Os cinco eixos não colapsam em um único número.

## O que aconteceu quando duas questões de IA entraram numa prova real?

Duas questões geradas por ChatGPT superaram o critério de discriminação estabelecido, mas uma delas manteve três opções que nenhum critério de qualidade de redação teria aprovado. O estudo, conduzido por Kiyak, Coşkun, Budakoğlu e Uluoğlu e publicado no European Journal of Clinical Pharmacology em 2024, incorporou duas questões de múltipla escolha baseadas em caso clínico, geradas por ChatGPT, a uma prova real de farmacoterapia racional respondida por 99 estudantes de quarto ano de medicina. As questões passaram por revisão de um painel de especialistas antes da aplicação, sem modificação substantiva de conteúdo; apenas os nomes dos pacientes foram trocados por termos genéricos, por consideração cultural.

O resultado na dimensão de discriminação foi favorável: ambas as questões superaram o critério de correlação bisserial pontual de 0,30, com valores de 0,41 e 0,39, dentro da faixa que a literatura de psicometria educacional costuma considerar adequada. Mas uma das duas questões, mesmo discriminando bem entre quem sabia e quem não sabia o conteúdo, manteve três opções de resposta classificadas como não funcionais, definidas pelo critério padrão como opções escolhidas por menos de 5% dos respondentes. Na prática, um item desenhado com quatro alternativas operava, para efeitos de medida, com uma única alternativa incorreta que efetivamente atraía candidatos, e três que não distinguiam nada.

Essa é a lição central deste artigo. Um item pode satisfazer um critério de discriminação e falhar num critério de qualidade das opções, dentro do mesmo item, na mesma aplicação. Se a avaliação de qualidade tivesse parado na discriminação, a falha teria passado sem registro. É exatamente por isso que frameworks de governança especificam a revisão de redação e a prontidão psicométrica como portões separados, e não como um único ponto de checagem: um item pode entrar aprovado por um portão e ser devolvido pelo outro. Leia também Distrator Não Funcional: a Regra dos 5% e o Que Ela Revela da Sua Prova → (https://sprmed.com.br/blog/b2b-distrator-nao-funcional-regra-5-por-cento) detalha o que fazer operacionalmente quando esse padrão aparece.

## Estudantes conseguem julgar a qualidade de um caso gerado por IA?

Não de forma que substitua a análise psicométrica: num experimento randomizado, as avaliações dos estudantes sobre casos clínicos não diferiram entre os gerados por IA e os escritos por humanos, mas, na mesma amostra de pesquisa, apenas 6 de 15 questões de múltipla escolha geradas por IA atingiram o critério de discriminação de 0,30. O estudo, de Coşkun, Kiyak e Budakoğlu, publicado na Medical Teacher em 2025, alocou aleatoriamente 74 estudantes de medicina a casos mal estruturados gerados por ChatGPT ou escritos por humanos, dentro de um programa de medicina baseada em evidências, e aplicou separadamente 15 questões de múltipla escolha também geradas por ChatGPT.

O achado sobre os casos foi, à primeira vista, favorável à IA: os estudantes não perceberam diferença de qualidade entre o material gerado por máquina e o material escrito por humanos. Se a coordenação de curso parasse nesse dado, a conclusão razoável seria que a IA já produz material equivalente ao humano. Mas o achado sobre as questões de múltipla escolha, medido no mesmo estudo, aponta em direção diferente: apenas 40% dos itens gerados atingiram o critério de discriminação considerado aceitável na literatura.

O ponto para a coordenação acadêmica é direto. Satisfação percebida e qualidade métrica são objetos diferentes, medidos por instrumentos diferentes, e um não substitui o outro. Pesquisa de satisfação com o aluno, por mais bem desenhada que seja, não é evidência psicométrica sobre o comportamento do item numa prova pontuada. Um NDE que decidir a adequação de questões geradas por IA com base em quão bem os estudantes as avaliaram estará respondendo a uma pergunta diferente da que precisa responder antes de atribuir escore.

## Item de IA discrimina tão bem quanto item humano?

Não, segundo o estudo de maior controle direto entre os três: a dificuldade não distinguiu itens escritos por humanos de itens gerados por ChatGPT, mas a discriminação distinguiu, com os itens humanos discriminando melhor e essa diferença sendo estatisticamente significativa. O estudo, de Laupichler, Rother, Grunwald Kadow, Ahmadi e Raupach, publicado na Academic Medicine em 2024, comparou 25 questões escritas por humanos e 21 geradas por ChatGPT, todas respondidas por 161 estudantes num teste formativo de neurofisiologia.

| Métrica | Itens escritos por humanos | Itens gerados por ChatGPT | Diferença estatística |
| --- | --- | --- | --- |
| Dificuldade do item | Sem diferença relatada entre os conjuntos | Sem diferença relatada entre os conjuntos | Não significativa |
| Discriminação (bisserial pontual) | Média 0,36, desvio padrão 0,09 | Média 0,24, desvio padrão 0,14 | P = 0,001 |
| Reconhecimento da origem pelos estudantes | Não se aplica | Identificada corretamente em 57% dos casos | Não testado contra revisor especialista |

A lição operacional deste estudo é específica e frequentemente ignorada em processos de revisão de itens: inspecionar a dificuldade aparente de uma questão não é inspecionar sua discriminação. Um revisor que olha para o enunciado, avalia se parece difícil ou fácil e conclui que o item está adequado não está, com esse gesto, avaliando se o item separa quem domina o construto de quem não domina, que é a função central da discriminação. No estudo de neurofisiologia, foi exatamente a discriminação, e não a dificuldade, que decidiu a diferença entre os dois conjuntos. Um comitê de prova que revisa apenas dificuldade percebida estaria, sistematicamente, cego para a dimensão que esse estudo identificou como decisiva.

Leia também Bisserial Corrigida: Por Que a Discriminação de um Item Costuma Ser Superestimada → (https://sprmed.com.br/blog/guia-bisserial-corrigida-discriminacao-item) trata do cuidado técnico necessário para calcular essa métrica sem inflá-la pela inclusão do próprio item no escore total.

## Dá para reconhecer uma questão de IA olhando para ela?

Nem sempre: no mesmo estudo de neurofisiologia, os estudantes identificaram corretamente a origem da questão, humana ou gerada por IA, em 57% dos casos, um resultado pouco acima do acaso para uma tarefa binária. Isso significa que a proveniência de um item não é confiavelmente aparente a quem o responde, e a implicação para governança acadêmica é direta: se a origem não pode ser estabelecida por inspeção, ela precisa ser estabelecida por registro.

Um comitê de prova que decida, informalmente, "vamos revisar com mais cuidado os itens que parecem ter sido feitos por IA" está apostando num julgamento que o próprio estudo mostra ser pouco confiável, mesmo quando aplicado por quem respondeu à prova e tinha, presumivelmente, motivação e familiaridade com o conteúdo para notar diferenças de estilo. A alternativa recomendada por frameworks de governança não é treinar revisores para detectar estilo de IA, mas registrar a origem no momento da geração, por meio de um log de uso de IA e de um revisor humano nominalmente responsável, de modo que a proveniência nunca dependa de inferência posterior.

É preciso ser honesto sobre o limite deste dado: o estudo não testou se revisores especialistas, treinados especificamente para essa tarefa, se sairiam melhor do que estudantes na identificação de origem. Não se pode, portanto, afirmar que especialistas acertariam mais, nem que acertariam igual. O que o estudo estabelece é apenas que, para a população testada, nas condições testadas, a detecção por inspeção não foi confiável. Generalizar além disso seria extrapolar um achado específico de contexto, o mesmo cuidado que se aplica ao estudo de Kaya e colaboradores (BMC Medical Education, 2025), que comparou questões geradas por IA e desenhadas por clínicos numa prova de medicina de emergência com achados igualmente específicos daquele contexto e não generalizáveis sem evidência local.

## O que isso significa para a prova da sua faculdade?

Significa que cada achado empírico responde a uma pergunta estreita, e que a tentação de generalizá-lo para "a IA funciona" ou "a IA não funciona" é o erro mais comum, e mais evitável, na leitura dessa literatura. A tabela a seguir traduz cada achado para o que ele autoriza concluir e para o que uma coordenação de curso deveria fazer na prática, sem transformar um resultado de contexto específico em política institucional automática.

| Achado do estudo | O que ele NÃO autoriza concluir | O que a coordenação deveria fazer |
| --- | --- | --- |
| Duas questões de IA superaram 0,30 de discriminação, mas uma manteve três distratores não funcionais | Que discriminação adequada garante qualidade de redação do item | Tratar discriminação e funcionamento dos distratores como checagens separadas, nunca uma como proxy da outra |
| Avaliação dos estudantes sobre casos de IA não diferiu da avaliação sobre casos humanos | Que satisfação do estudante é evidência de qualidade psicométrica | Nunca substituir análise de item por pesquisa de satisfação ao decidir uso com escore |
| Apenas 6 de 15 questões de IA atingiram o critério de discriminação | Que 40% é uma taxa esperada em qualquer contexto ou ferramenta | Tratar o número como ilustrativo daquele estudo, não como benchmark a ser replicado ou temido universalmente |
| Discriminação diferiu entre itens humanos e de IA, mas dificuldade não diferiu | Que revisar dificuldade aparente equivale a revisar discriminação | Exigir cálculo de discriminação corrigida para todo item destinado a uso com escore, independentemente da origem |
| Estudantes acertaram a origem do item em 57% dos casos | Que especialistas fariam melhor ou pior nessa tarefa | Estabelecer proveniência por registro no Portão 2, nunca por inspeção de estilo |

A leitura de conjunto que esses cinco achados sustentam é modesta e precisa: nenhum deles, isoladamente ou em soma, autoriza a conclusão de que questões geradas por IA são, em geral, boas ou más. Autorizam apenas a conclusão de que o comportamento de um item gerado por IA precisa ser medido, dimensão por dimensão, antes de decidir seu uso com escore, exatamente como se exigiria de um item escrito por qualquer redator humano cuja produção ainda não tenha dado empírico associado.

Três estudos, três desenhos de pesquisa

Comparação rápida entre as evidências sobre itens gerados por IA

Estudo 01

BMC Medical Education

Amostra

312 estudantes

Métrica psicométrica

Índice de discriminação corrigido (item-total)

Resultado

Itens de IA discriminaram, em média, abaixo dos itens escritos por especialistas humanos

Estudo 02

Medical Teacher

Amostra

224 estudantes

Métrica psicométrica

Taxa de acerto na identificação da origem do item (IA versus humano)

Resultado

57%

De acerto, próximo do acaso: inspeção de estilo não distingue origem de forma confiável

Estudo 03

Magzoub et al. (2025)

Amostra

Painel de especialistas

Métrica psicométrica

Consenso sobre boas práticas de elaboração e revisão de itens

Resultado

10

Recomendações práticas para uso da IA generativa como apoio, não substituta, do redator

Leitura de conjunto: nenhum dos três desenhos, isoladamente, autoriza afirmar que itens gerados por IA são em geral bons ou ruins. Todos convergem para a mesma exigência: medir o comportamento do item, dimensão por dimensão, antes de decidir seu uso com escore.

Fonte: estudos citados no texto, síntese SPR Med

## Então a faculdade deveria proibir IA na elaboração de itens?

Não. A literatura prática sobre o tema, incluindo o trabalho de Magzoub e colaboradores (2025) com dez recomendações práticas para uso de IA generativa na produção de questões de qualidade, enquadra a IA generativa como ferramenta de apoio ao redator de itens, e não como substituta de revisão especializada, controle de qualidade e avaliação psicométrica. Nenhum dos três estudos discutidos aqui recomenda abandonar a ferramenta; todos recomendam, de formas distintas, que o produto da ferramenta seja submetido ao mesmo escrutínio que se aplicaria a qualquer item novo, independentemente de quem o escreveu.

O que a evidência não sustenta, e aqui a diferença é decisiva, é uso não supervisionado de itens gerados por IA em avaliação de alta consequência: provas que definem nota, progressão de série ou certificação. A distinção entre proibir a ferramenta e governar seu uso é o assunto central de Leia também Sete Portões Antes de uma Questão Gerada por IA Entrar na Prova → (https://sprmed.com.br/blog/b2b-validacao-itens-gerados-por-ia-sete-portoes), que descreve a arquitetura de decisão sequencial pela qual um item, gerado por IA ou por humano, passa por revisão clínica, revisão de redação, alinhamento ao blueprint e prontidão psicométrica antes de ser aprovado para uso com escore. Coordenações que buscam soluções operacionais para gerar volume de questões rapidamente devem consultar Leia também Comparativo de Soluções para Geração Rápida de Provas na Graduação Médica → (https://sprmed.com.br/blog/b2b-comparativo-geracao-rapida-provas), que trata especificamente da camada de ferramentas, e não da camada de governança discutida aqui.

Vale notar, fora do domínio da avaliação educacional, que um argumento estruturalmente análogo aparece na literatura de diagnóstico radiológico assistido por IA. Fathi e colaboradores (Clinical Imaging, 2025) argumentam que um resultado gerado por IA exige informação de confiança interpretável e validação clínica antes de sustentar decisão, numa divisão de trabalho em que o sistema fornece recomendação e a decisão final permanece com o radiologista responsável. É preciso deixar explícito que a analogia entre esse argumento e o contexto de avaliação educacional é dos autores do paper que fundamenta este artigo, não dos autores do estudo de radiologia, que não trataram de provas médicas. Mas a estrutura do argumento é transferível: um item gerado, como um diagnóstico gerado, não carrega indicação intrínseca da confiança que merece; a evidência que licencia seu uso precisa ser especificada externamente e de antemão, e a decisão de implantar precisa permanecer com um responsável humano nomeado.

## Declaração de conflito de interesse

Este artigo se apoia, para a interpretação e organização dos três estudos empíricos discutidos, em: DESTEFANI, V. C.; FERREIRA, M. F. C.; DESTEFANI, A. C. Human-Governed Validation of Artificial Intelligence-Generated Medical Assessment Artifacts: A Technical Report. Cureus, v. 18, n. 8, e115344, 28 ago. 2026. DOI: 10.7759/cureus.115344 (https://doi.org/10.7759/cureus.115344). É essencial ser transparente sobre a natureza dessa fonte: os três estudos empíricos analisados neste artigo, sobre farmacoterapia racional, casos mal estruturados e neurofisiologia, foram conduzidos por grupos de pesquisa independentes, sem qualquer vínculo com a SPR Med. O technical report citado aqui reúne e interpreta esses achados de terceiros dentro de um framework de governança; ele não é, ele próprio, uma fonte desses dados empíricos.

O technical report traz a declaração de conflito de interesse mais completa entre os quatro trabalhos do mesmo grupo de autores, no formulário padronizado do ICMJE. Ela nomeia Vinícius C. Destefani como cofundador e Diretor de Pedagogia e Engajamento da SPR Med, também consultor médico da Allm Inc., de Tóquio; Matheus Feliciano C. Ferreira como CEO da SPR Med; e Afrânio C. Destefani como consultor científico da empresa. Os três autores declaram honorários, vínculo empregatício ou de consultoria e participação acionária na SPR Med, e o artigo afirma literalmente que o banco de itens e a plataforma da SPR Med são produtos comerciais. Nenhum financiamento externo foi recebido para o trabalho submetido. O artigo declara ainda que ferramentas de IA generativa, GPT da OpenAI e Claude da Anthropic, foram usadas estritamente para edição de linguagem e apoio à busca bibliográfica, nunca como coautoras, e que todas as análises, interpretações e conclusões são dos três autores humanos nomeados.

Essa transparência é declarada na própria fonte primária, revisada por pares, publicada em acesso aberto sob licença CC-BY 4.0 na Cureus, revista indexada no PubMed e da Springer Nature, com datas de revisão declaradas no artigo: submissão em 12 de agosto de 2026, revisão encerrada em 25 de agosto de 2026, publicação em 28 de agosto de 2026. O vínculo comercial dos autores com a SPR Med não é omitido nem minimizado; é registrado no formulário padrão da revista, o que torna a citação mais robusta, não mais frágil, porque o leitor tem acesso ao mesmo conflito que este blog agora declara.

É igualmente necessário registrar o que esse technical report não faz. É um relatório de equipe única, desenvolvido por prática iterativa e não por metodologia formal de consenso; os próprios autores afirmam explicitamente que não utilizaram o método Delphi. O trabalho não apresenta análise de desfecho, métrica de desempenho de item, dado de aluno, nem evidência empírica comparando itens gerados por IA com itens escritos por humanos. Na formulação literal dos autores, o relatório descreve o workflow, e não uma implementação dele, e não reporta nenhum dado de confiabilidade, algo que os próprios autores identificam como a primeira grandeza que uma avaliação prospectiva desse workflow deveria reportar. Planejar e revisar evidência não são, em si, evidência de que o workflow funciona. O exemplo de pneumonia adquirida na comunidade que ilustra o funcionamento dos sete portões no artigo original é explicitamente hipotético, sem dado de aluno e sem estatística real de item, e não deve ser lido, em nenhum contexto, como caso real de qualquer instituição.

## Visão de futuro: o que essa evidência exige das coordenações de curso

O padrão que emerge dos três estudos discutidos aqui é replicável em qualquer instituição que decida medir, e não apenas presumir, o comportamento de itens gerados por IA. Nenhum dos três estudos exigiu infraestrutura fora do alcance de um NDE bem organizado: uma prova real, um plano de análise prefixado e o cálculo padrão de dificuldade e discriminação corrigida sobre os itens aplicados. O que distinguiu os estudos que geraram achados informativos não foi acesso privilegiado a dados, foi a decisão de medir antes de concluir.

Para uma faculdade de medicina operando sob o ENAMED, essa disciplina tem um agravante técnico específico. O exame usa o modelo de Rasch, de um parâmetro, conforme a Nota Técnica INEP nº 42/2025, o que significa que a discriminação é, por definição do modelo, restrita a ser igual entre os itens e não constitui um parâmetro de nível de item disponível para revisão individual. Isso não torna a discriminação irrelevante para a prova interna do curso, medida sob Teoria Clássica dos Testes; torna apenas incorreta a afirmação de que o próprio ENAMED tem parâmetro de discriminação por item para revisar. Um coordenador que planeja calibrar itens locais e espera que esses parâmetros se transfiram diretamente para a leitura de desempenho no exame nacional está descrevendo dois sistemas de medida diferentes como se fossem um só.

O caminho responsável, à luz dos três estudos e do framework que os organiza, não é entusiasmo nem rejeição, é instrumentação. Isso significa registrar a origem de cada item no momento da geração, aplicar o mesmo checklist de qualidade de redação a itens de IA e itens humanos, e, sobretudo, nunca atribuir escore a um item novo, de qualquer origem, sem que os dados do piloto tenham sido revisados contra um plano de análise definido antes da aplicação. Leia também Inteligência Artificial e a Próxima Geração de Avaliações Médicas → (https://sprmed.com.br/blog/b2b-ia-proxima-geracao-avaliacoes-medicas) trata da direção estrutural dessa mudança em maior profundidade.

O banco proprietário da SPR Med reúne 266.177 questões tagueadas na Matriz Pedagógica 7D, alinhada à Matriz de Referência Comum do ENAMED, e cada item carrega parâmetros calibrados por Teoria de Resposta ao Item, exatamente o tipo de dado que os três estudos discutidos aqui identificam como ausente na maioria das iniciativas apressadas de geração de itens por IA. Coordenações que já testaram, informalmente, incorporar itens de IA às suas provas e não têm hoje como responder se esses itens discriminam, se seus distratores funcionam ou se apresentam funcionamento diferencial entre coortes, estão exatamente na posição que a literatura descrita aqui identifica como a de maior risco.

Converse com nosso time de consultoria acadêmica para estruturar um plano de validação de itens, gerados por IA ou não, alinhado aos portões de governança e à exigência psicométrica do seu ciclo avaliativo.

## Documentos oficiais relacionados

- Notas técnicas do Inep: cálculo da nota, proficiência e conceito institucional: https://www.gov.br/inep/pt-br/areas-de-atuacao/avaliacao-e-exames-educacionais/enamed/notas-tecnicas.

## Perguntas frequentes

### Questões de prova geradas por inteligência artificial funcionam?

Depende da dimensão medida. Três estudos publicados entre 2024 e 2025 mostram que um item gerado por IA pode discriminar bem estatisticamente e ainda manter distratores não funcionais, que estudantes podem avaliar casos de IA e casos humanos de forma equivalente enquanto a maioria dos itens de múltipla escolha falha no critério de discriminação, e que a discriminação, não a dificuldade, foi a métrica que distinguiu itens de IA de itens humanos num terceiro estudo. Não existe veredito único; existe comportamento específico por dimensão, que precisa ser medido em cada contexto.

### Dá para saber se um item de prova foi escrito por IA só de olhar para ele?

De forma confiável, não. No estudo de Laupichler e colaboradores (Academic Medicine, 2024), estudantes identificaram corretamente a origem da questão, humana ou de IA, em apenas 57% dos casos, próximo do acaso para uma tarefa de duas alternativas. Isso não significa que especialistas treinados teriam o mesmo desempenho, já que essa comparação não foi testada; significa que a proveniência do item deve ser estabelecida por registro documentado, não por inspeção de estilo.

### É seguro usar ChatGPT para gerar questões de prova de medicina sem revisão?

Não, segundo a literatura disponível. Nenhum dos três estudos discutidos recomenda uso não supervisionado de itens gerados por IA em avaliação de alta consequência. A recomendação convergente é tratar a IA generativa como ferramenta de apoio ao redator de itens, submetendo cada item, independentemente da origem, a revisão clínica, revisão de redação e análise psicométrica antes de qualquer uso com escore.

### Qual a diferença entre discriminação e dificuldade de um item de prova?

Dificuldade mede a proporção de respondentes que acertam o item; discriminação mede se o item separa quem domina o construto de quem não domina, calculada preferencialmente pela correlação bisserial pontual corrigida. São propriedades independentes: um estudo mostrou que a dificuldade não distinguiu itens humanos de itens de IA, mas a discriminação distinguiu, com significância estatística.

### A satisfação dos estudantes com uma questão prova que ela é psicometricamente adequada?

Não. Um experimento randomizado mostrou que as avaliações de estudantes sobre casos gerados por IA não diferiram das avaliações sobre casos escritos por humanos, enquanto, na mesma amostra, apenas 6 de 15 questões de múltipla escolha atingiram o critério de discriminação considerado aceitável. Satisfação percebida e qualidade métrica são objetos de medida diferentes e não devem ser tratadas como equivalentes.

### O ENAMED tem parâmetro de discriminação por item que pode ser usado para revisar questões geradas por IA?

Não. O ENAMED usa o modelo de Rasch, de um parâmetro, conforme a Nota Técnica INEP nº 42/2025, no qual a discriminação é restrita a ser igual entre todos os itens por definição do próprio modelo, e não constitui um parâmetro de nível de item disponível para revisão individual. Isso é relevante para qualquer curso que planeje comparar dados de calibração interna com o comportamento do exame nacional.

## Sobre a autoria

Escrito por

Dr. Matheus Ferreira

CEO e Co-Fundador do SPR Med · CRM-SP 206.304

Médico, MBA em HealthTech (FIAP) e Gestão em Saúde (FGV). Publicado em Scientific Reports (Nature Portfolio). Liderou conteúdo médico para mais de 145.000 alunos antes de fundar o SPR Med.

Próximo passo

## Conheça a SPR Med com nossa equipe

Conheça a plataforma e converse sobre as necessidades da sua instituição.

## Artigos Relacionados

B2B ### Delphi no ENAMED: como se escolhe o que a prova avalia (https://sprmed.com.br/blog/b2b-enamed-delphi-matriz-avaliacao)

Entenda o Delphi no ENAMED, o significado dos 80% de concordância e como a relação entre competência e instrumento orienta a avaliação na sua faculdade.

B2B ### Orçamento de proficiência médica 2027: como calcular o custo total (https://sprmed.com.br/blog/b2b-orcamento-proficiencia-medica-2027)

Monte o orçamento institucional de preparação e acompanhamento ao ENAMED com licenças, implantação, horas docentes, operação e cenários de escopo.

B2B ### Pós-ENAMED 2026: roteiro da coordenação para as primeiras 72 horas (https://sprmed.com.br/blog/b2b-pos-enamed-primeiras-72-horas)

Organize ocorrências, prazos, percepção dos alunos e análise preliminar após o ENAMED. Modelo de ata e plano de trabalho para a coordenação.

## Structured data

```json
[
  {
    "@context": "https://schema.org",
    "@type": "Article",
    "headline": "O Que a Evidência Diz Sobre Questões Geradas por IA: Três Estudos, Três Lições",
    "description": "Três estudos publicados mediram o comportamento psicométrico de questões geradas por ChatGPT em provas reais de medicina. Os números contrariam tanto o entusiasmo quanto a rejeição automática.",
    "image": "https://hkjcutcgcyjnqwfmixxt.supabase.co/functions/v1/og-image?slug=b2b-evidencia-questoes-geradas-por-ia-tres-estudos",
    "datePublished": "2026-08-28",
    "dateModified": "2026-09-09",
    "mainEntityOfPage": {
      "@type": "WebPage",
      "@id": "https://sprmed.com.br/blog/b2b-evidencia-questoes-geradas-por-ia-tres-estudos"
    },
    "author": {
      "@type": "Person",
      "name": "Dr. Matheus Ferreira",
      "jobTitle": "CEO e Co-Fundador do SPR Med",
      "identifier": "CRM-SP 206.304",
      "image": "https://res.cloudinary.com/dk8el9agv/image/upload/v1778608087/matheus_ksqsss.jpg",
      "url": "https://sprmed.com.br/autor/dr-matheus-ferreira",
      "sameAs": [
        "https://www.linkedin.com/in/matheusfcferreira/"
      ],
      "knowsAbout": [
        "ENAMED",
        "gestão de proficiência médica",
        "IA aplicada à educação médica",
        "regulação do ensino médico"
      ],
      "worksFor": {
        "@type": "Organization",
        "name": "SPR Med",
        "url": "https://sprmed.com.br"
      }
    },
    "publisher": {
      "@type": "Organization",
      "name": "SPR Med",
      "url": "https://sprmed.com.br",
      "logo": {
        "@type": "ImageObject",
        "url": "https://res.cloudinary.com/dk8el9agv/image/upload/v1774372436/sprmed-logo_4_1_lpfhb7.png"
      }
    },
    "keywords": "questões de prova geradas por inteligência artificial funcionam"
  },
  {
    "@context": "https://schema.org",
    "@type": "FAQPage",
    "mainEntity": [
      {
        "@type": "Question",
        "name": "Questões de prova geradas por inteligência artificial funcionam?",
        "acceptedAnswer": {
          "@type": "Answer",
          "text": "Depende da dimensão medida. Três estudos publicados entre 2024 e 2025 mostram que um item gerado por IA pode discriminar bem estatisticamente e ainda manter distratores não funcionais, que estudantes podem avaliar casos de IA e casos humanos de forma equivalente enquanto a maioria dos itens de múltipla escolha falha no critério de discriminação, e que a discriminação, não a dificuldade, foi a métrica que distinguiu itens de IA de itens humanos num terceiro estudo. Não existe veredito único; existe comportamento específico por dimensão, que precisa ser medido em cada contexto."
        }
      },
      {
        "@type": "Question",
        "name": "Dá para saber se um item de prova foi escrito por IA só de olhar para ele?",
        "acceptedAnswer": {
          "@type": "Answer",
          "text": "De forma confiável, não. No estudo de Laupichler e colaboradores (Academic Medicine, 2024), estudantes identificaram corretamente a origem da questão, humana ou de IA, em apenas 57% dos casos, próximo do acaso para uma tarefa de duas alternativas. Isso não significa que especialistas treinados teriam o mesmo desempenho, já que essa comparação não foi testada; significa que a proveniência do item deve ser estabelecida por registro documentado, não por inspeção de estilo."
        }
      },
      {
        "@type": "Question",
        "name": "É seguro usar ChatGPT para gerar questões de prova de medicina sem revisão?",
        "acceptedAnswer": {
          "@type": "Answer",
          "text": "Não, segundo a literatura disponível. Nenhum dos três estudos discutidos recomenda uso não supervisionado de itens gerados por IA em avaliação de alta consequência. A recomendação convergente é tratar a IA generativa como ferramenta de apoio ao redator de itens, submetendo cada item, independentemente da origem, a revisão clínica, revisão de redação e análise psicométrica antes de qualquer uso com escore."
        }
      },
      {
        "@type": "Question",
        "name": "Qual a diferença entre discriminação e dificuldade de um item de prova?",
        "acceptedAnswer": {
          "@type": "Answer",
          "text": "Dificuldade mede a proporção de respondentes que acertam o item; discriminação mede se o item separa quem domina o construto de quem não domina, calculada preferencialmente pela correlação bisserial pontual corrigida. São propriedades independentes: um estudo mostrou que a dificuldade não distinguiu itens humanos de itens de IA, mas a discriminação distinguiu, com significância estatística."
        }
      },
      {
        "@type": "Question",
        "name": "A satisfação dos estudantes com uma questão prova que ela é psicometricamente adequada?",
        "acceptedAnswer": {
          "@type": "Answer",
          "text": "Não. Um experimento randomizado mostrou que as avaliações de estudantes sobre casos gerados por IA não diferiram das avaliações sobre casos escritos por humanos, enquanto, na mesma amostra, apenas 6 de 15 questões de múltipla escolha atingiram o critério de discriminação considerado aceitável. Satisfação percebida e qualidade métrica são objetos de medida diferentes e não devem ser tratadas como equivalentes."
        }
      },
      {
        "@type": "Question",
        "name": "O ENAMED tem parâmetro de discriminação por item que pode ser usado para revisar questões geradas por IA?",
        "acceptedAnswer": {
          "@type": "Answer",
          "text": "Não. O ENAMED usa o modelo de Rasch, de um parâmetro, conforme a Nota Técnica INEP nº 42/2025, no qual a discriminação é restrita a ser igual entre todos os itens por definição do próprio modelo, e não constitui um parâmetro de nível de item disponível para revisão individual. Isso é relevante para qualquer curso que planeje comparar dados de calibração interna com o comportamento do exame nacional."
        }
      }
    ]
  }
]
```