---
title: "Sete Portões Antes de uma Questão Gerada por IA Entrar na Prova — SPR Med"
description: "Technical report publicado na Cureus propõe sete portões com decisão humana documentada antes de um artefato gerado por IA virar item de prova. O que cada portão exige e onde o processo para."
lang: pt-BR
json-ld: |
  [
    {
      "@context": "https://schema.org",
      "@type": "Article",
      "headline": "Sete Portões Antes de uma Questão Gerada por IA Entrar na Prova",
      "description": "Technical report publicado na Cureus propõe sete portões com decisão humana documentada antes de um artefato gerado por IA virar item de prova. O que cada portão exige e onde o processo para.",
      "image": "https://hkjcutcgcyjnqwfmixxt.supabase.co/functions/v1/og-image?slug=b2b-validacao-itens-gerados-por-ia-sete-portoes",
      "datePublished": "2026-08-28",
      "dateModified": "2026-09-09",
      "mainEntityOfPage": {
        "@type": "WebPage",
        "@id": "https://sprmed.com.br/blog/b2b-validacao-itens-gerados-por-ia-sete-portoes"
      },
      "author": {
        "@type": "Person",
        "name": "Dr. Matheus Ferreira",
        "jobTitle": "CEO e Co-Fundador do SPR Med",
        "identifier": "CRM-SP 206.304",
        "image": "https://res.cloudinary.com/dk8el9agv/image/upload/v1778608087/matheus_ksqsss.jpg",
        "url": "https://sprmed.com.br/autor/dr-matheus-ferreira",
        "sameAs": [
          "https://www.linkedin.com/in/matheusfcferreira/"
        ],
        "knowsAbout": [
          "ENAMED",
          "gestão de proficiência médica",
          "IA aplicada à educação médica",
          "regulação do ensino médico"
        ],
        "worksFor": {
          "@type": "Organization",
          "name": "SPR Med",
          "url": "https://sprmed.com.br"
        }
      },
      "publisher": {
        "@type": "Organization",
        "name": "SPR Med",
        "url": "https://sprmed.com.br",
        "logo": {
          "@type": "ImageObject",
          "url": "https://res.cloudinary.com/dk8el9agv/image/upload/v1774372436/sprmed-logo_4_1_lpfhb7.png"
        }
      },
      "keywords": "validação de questões geradas por inteligência artificial"
    },
    {
      "@context": "https://schema.org",
      "@type": "FAQPage",
      "mainEntity": [
        {
          "@type": "Question",
          "name": "Uma questão gerada por IA pode ser usada direto em prova, sem revisão?",
          "acceptedAnswer": {
            "@type": "Answer",
            "text": "Não. O technical report é explícito ao tratar todo artefato gerado por IA como candidato, nunca como item pronto. A aprovação para uso com escore exige ter passado pelos sete portões, incluindo revisão clínica, revisão de redação, alinhamento ao blueprint e duas passagens pelo portão psicométrico, com evidência empírica revisada na segunda."
          }
        },
        {
          "@type": "Question",
          "name": "Como saber se uma questão foi gerada por IA só de olhar para ela?",
          "acceptedAnswer": {
            "@type": "Answer",
            "text": "Não é possível de forma confiável. No estudo de Laupichler et al. (2024), estudantes identificaram corretamente a origem da questão em apenas 57% dos casos. Por isso, o Portão 2 do workflow exige que proveniência seja estabelecida por registro, log de uso de IA e atestação de revisor humano, e não por inspeção do item."
          }
        },
        {
          "@type": "Question",
          "name": "Qual a diferença entre \"aprovado para pilotagem\" e \"aprovado para uso com escore\"?",
          "acceptedAnswer": {
            "@type": "Answer",
            "text": "São status distintos e não intercambiáveis. Aprovado para pilotagem autoriza aplicação experimental para coleta de dado empírico, mas não vale nota. Aprovado para uso com escore só é atingido depois que os resultados do piloto são revisados contra o plano psicométrico prefixado no Portão 6 e considerados satisfatórios."
          }
        },
        {
          "@type": "Question",
          "name": "Item clinicamente correto pode ainda assim ser rejeitado como questão de prova?",
          "acceptedAnswer": {
            "@type": "Answer",
            "text": "Sim, e o exemplo hipotético do próprio paper ilustra isso. Um item pode passar integralmente na revisão clínica, confirmando acurácia médica, e falhar na revisão de redação por pista de comprimento ou distratores implausíveis, ou falhar no portão psicométrico por distrator não funcional identificado no piloto. Acurácia clínica não estabelece, por si só, qualidade de medida."
          }
        },
        {
          "@type": "Question",
          "name": "O ENAMED usa discriminação de item para revisar questões?",
          "acceptedAnswer": {
            "@type": "Answer",
            "text": "Não nos termos da Teoria Clássica dos Testes. O ENAMED usa modelo de Rasch, de um parâmetro (Nota Técnica INEP nº 42/2025), no qual a discriminação é restrita a ser igual entre todos os itens e não constitui parâmetro de nível de item disponível para revisão individual. Descrever \"discriminação do item\" como algo revisável no ENAMED é impreciso."
          }
        },
        {
          "@type": "Question",
          "name": "Este workflow de sete portões tem eficácia comprovada?",
          "acceptedAnswer": {
            "@type": "Answer",
            "text": "Não, e essa é uma limitação que os próprios autores declaram sem eufemismo. O relatório descreve o workflow, não uma implementação dele, e não reporta nenhum dado de confiabilidade ou de reprodutibilidade entre revisores. Planejar evidência e revisar dado contra um plano prefixado não constituem, por si mesmos, prova de que o processo funciona em escala institucional."
          }
        }
      ]
    }
  ]
---

[

![SPR Med](https://res.cloudinary.com/dk8el9agv/image/upload/v1772545825/sprmed-logo_4_mvfyui.png)Sistema de Proficiência Médica 

](/)

[Para sua IES](/#para-sua-ies)[Como funciona](/#como-funciona)[Conteúdos](/blog)

[Acessar plataforma](https://plataforma.sprmed.com.br/)Agendar demonstração

[Acessar plataforma Acessar ](https://plataforma.sprmed.com.br/)

[Home](/)[Blog](/blog)

B2B

# Sete Portões Antes de uma Questão Gerada por IA Entrar na Prova

Technical report publicado na Cureus propõe sete portões com decisão humana documentada antes de um artefato gerado por IA virar item de prova. O que cada portão exige e onde o processo para.

![Dr. Matheus Ferreira](https://res.cloudinary.com/dk8el9agv/image/upload/v1778608087/matheus_ksqsss.jpg)

Por [Dr. Matheus Ferreira](/autor/dr-matheus-ferreira), CRM-SP 206.304 

Atualizado em 09 de setembro de 2026

Publicado em 28 de agosto de 2026 18 min de leitura 

Compartilhar: [](https://www.linkedin.com/sharing/share-offsite/?url=https%3A%2F%2Fsprmed.com.br%2Fblog%2Fb2b-validacao-itens-gerados-por-ia-sete-portoes)[](https://api.whatsapp.com/send?text=Sete%20Port%C3%B5es%20Antes%20de%20uma%20Quest%C3%A3o%20Gerada%20por%20IA%20Entrar%20na%20Prova%20https%3A%2F%2Fsprmed.com.br%2Fblog%2Fb2b-validacao-itens-gerados-por-ia-sete-portoes)[](https://twitter.com/intent/tweet?text=Sete%20Port%C3%B5es%20Antes%20de%20uma%20Quest%C3%A3o%20Gerada%20por%20IA%20Entrar%20na%20Prova&url=https%3A%2F%2Fsprmed.com.br%2Fblog%2Fb2b-validacao-itens-gerados-por-ia-sete-portoes)

Neste artigo 

Um technical report revisado por pares, publicado na Cureus em 28 de agosto de 2026, propõe que artefatos de avaliação gerados por inteligência artificial passem por sete portões antes de qualquer uso com escore: taxonomia do artefato, proveniência e responsabilidade humana, revisão clínica, revisão de redação do item, alinhamento ao blueprint, prontidão psicométrica e aprovação final. Cada portão exige uma decisão humana documentada e carrega uma condição explícita de parada. O documento não testa se o fluxo funciona, ele descreve como uma instituição de ensino médico deveria decidir, portão a portão, quando um rascunho gerado por máquina pode se tornar item de prova valendo nota (DESTEFANI; FERREIRA; DESTEFANI, 2026, DOI: [10.7759/cureus.115344](https://doi.org/10.7759/cureus.115344)).

Para o corpo docente e o NDE que já usam ferramentas generativas na construção do banco de itens, a pergunta prática não é "a IA pode escrever questões de prova". A pergunta é qual evidência, e revisada por quem, autoriza que um rascunho vire item valendo nota no ciclo avaliativo do curso. É essa pergunta que os sete portões respondem, e é essa a diferença entre um workflow de governança e uma checagem informal de "parece boa, manda".

## Por que uma questão bem escrita por IA ainda não é uma questão válida?

Porque fluência linguística não é evidência de validade de medida. Um modelo generativo produz um enunciado bem construído, gramaticalmente correto e clinicamente plausível na superfície, mas isso responde apenas à pergunta "o texto está bem escrito", não à pergunta "este item mede o construto que pretendemos avaliar, com precisão suficiente para sustentar uma decisão sobre o examinando". Kane (2013) chama essa segunda pergunta de validação da interpretação e do uso do escore, e ela não se resolve por leitura.

O paper nomeia cinco riscos que separam plausibilidade de validade em um artefato gerado por IA. O primeiro é a imprecisão clínica, quando o conteúdo do item contradiz diretriz vigente ou apresenta informação desatualizada. O segundo é a estrutura de item falha, presente em pistas de comprimento, ambiguidade de enunciado ou opções que não seguem paralelismo gramatical. O terceiro é o distrator fraco, opção implausível que nenhum examinando competente escolheria, esvaziando a função discriminativa do item. O quarto é o descompasso com o blueprint, quando o item, mesmo correto e bem escrito, não mapeia para a competência ou domínio que a matriz pretendia avaliar. O quinto é a variância irrelevante ao construto, quando o desempenho no item é influenciado por algo além da competência-alvo, como familiaridade com o formato ou pista textual.

O erro que o relatório nomeia sem eufemismo é tratar fluência como se fosse evidência. Um item pode estar clinicamente correto, gramaticalmente impecável e ainda assim ser psicometricamente inútil, porque nenhuma dessas qualidades de superfície garante que ele discrimine examinandos proficientes de não proficientes na direção e na magnitude que o uso pretendido exige.

Fluxo de validação

Sete portões entre a geração e a prova

Entrada

Questão gerada por IA

↓

01

Taxonomia do artefato

Definir o que foi gerado e para que uso. Condição de parada: família do artefato ou caso de uso indefinido.

reprova, retorna à geração 

↓

02

Proveniência de IA e responsabilidade humana

Preservar transparência e responsabilização. Condição de parada: origem da geração ou responsável humano indefinido.

reprova, retorna ao portão 01 

↓

03

Revisão clínica e de conteúdo

Garantir segurança factual e consistência com diretrizes. Condição de parada: reprovação do especialista da área clínica.

reprova, retorna ao portão 02 

↓

04

Alinhamento com o blueprint

Checar o mapeamento para a competência e o domínio pretendidos na matriz. Condição de parada: descompasso com o blueprint.

reprova, retorna ao portão 03 

↓

05

Análise de sensibilidade e viés

Isolar pistas textuais, familiaridade com formato e outras fontes de variância irrelevante ao construto. Condição de parada: influência estranha à competência-alvo.

reprova, retorna ao portão 04 

↓

06

Piloto e evidência psicométrica

Testar em amostra real e calibrar parâmetros de discriminação e dificuldade. Condição de parada: item não discrimina examinandos na direção esperada.

reprova, retorna ao portão 05 

↓

07

Aprovação editorial final

Consolidar todas as evidências anteriores em decisão de uso. Condição de parada: qualquer dossiê de evidência incompleto.

reprova, retorna ao portão 06 

↓

Saída

Aprovado para uso com escore

Processo iterativo: reprovação em qualquer portão devolve o item ao estágio anterior, não descarta o artefato de imediato.

## Quais são os sete portões?

São sete etapas sequenciais na avaliação, cada uma com finalidade própria, evidência exigida e condição de parada declarada. A tabela a seguir reproduz a lógica do Quadro 1 do paper.

Portão

Finalidade

Evidência produzida

Condição de parada

1\. Taxonomia do artefato

Definir o que foi gerado e para que uso

Registro de artefatos, campo de taxonomia

Família do artefato ou caso de uso indefinido

2\. Proveniência de IA e responsabilidade humana

Preservar transparência e responsabilização

Log de uso de IA, atestação do revisor humano

Origem da geração ou responsável humano indefinido

3\. Revisão clínica e de conteúdo

Garantir segurança factual e consistência com diretrizes

Aprovação de especialista da área clínica

Conteúdo inseguro, incorreto ou desatualizado

4\. Revisão de redação de item e linguagem

Detectar pistas, ambiguidade, distratores falhos e desvio de linguagem

Checklist de redação, análise de distratores quando houver dados

Variância irrelevante ao construto ou opções não funcionais

5\. Alinhamento ao blueprint

Mapear o artefato a um domínio de aprendizagem específico

Mapa curricular ou tag do item

Descompasso com a competência pretendida

6\. Prontidão psicométrica

Documentar plano de evidência na 1ª passagem; revisar resultados do piloto contra esse plano na 2ª

Plano de teste, plano de análise, resultados do piloto revisados

Item destinado a escore sem plano psicométrico, ou piloto ainda não revisado

7\. Aprovação final

Registrar status de implantação e responsabilidade humana

Sinalizador de aprovação com categoria de desfecho

Falta qualquer portão anterior exigido

Vale registrar dois detalhes de cada linha que raramente aparecem em discussões informais sobre uso de IA na produção de itens. No Portão 1, o paper insiste que artefatos gerados por IA na educação médica não são homogêneos: podem ser questões completas, distratores isolados, vinhetas clínicas, explicações de resposta, tags de blueprint, prompts de feedback ou prompts de tutoria, e cada família carrega ônus de validação diferente. Um prompt de feedback pode exigir revisão de segurança clínica sem exigir calibração psicométrica; uma questão destinada a avaliação somativa exige o padrão mais alto de evidência. No Portão 3, a parada é dura, mas o paper avisa que acurácia clínica não estabelece qualidade de medida. Um item pode estar medicamente correto e, ainda assim, falhar em discriminar examinandos.

[Leia também Construção de Banco de Questões de Medicina: O Desafio da Redação de Itens Inéditos → ](/blog/b2b-redacao-itens-ineditos-banco-questoes)

## Por que a ordem dos portões importa?

Porque revisão clínica e revisão de redação do item respondem a perguntas diferentes, e fundir as duas etapas produz dois erros simétricos. O primeiro erro é aprovar prematuramente um item que é clinicamente correto, mas psicometricamente frágil, porque o especialista de conteúdo confirmou a precisão médica e ninguém verificou pista de comprimento, distrator implausível ou ambiguidade estrutural. O segundo erro é rejeitar um rascunho útil ao atribuir a ele o ônus de evidência errado, por exemplo, exigir dado psicométrico de um item que ainda está na primeira revisão de redação, quando item recém-criado, por definição, não tem dado de resposta algum.

A arquitetura em sete portões separados existe justamente para impedir esses dois erros. Cada portão produz um tipo de evidência que nenhum outro portão produz, e a decisão de um portão não substitui a decisão de outro: aprovação clínica não implica aprovação estrutural, e aprovação estrutural não implica prontidão psicométrica.

O ponto que sustenta toda a utilidade prática do workflow, e que o distingue de uma simples lista de checagem linear, é que os portões são sequenciais na avaliação, mas iterativos no efeito. Um artefato que falha em um portão, ou que se revela deficiente quando o dado empírico chega, não é descartado: ele volta ao portão anterior apropriado para correção, e reentra no fluxo a partir daquele ponto. Falhar devolve, não elimina. Essa é a diferença entre um funil de aprovação e um ciclo de revisão governado.

## O que muda no portão de proveniência?

No Portão 2, muda o método de verificação de origem: de inspeção visual para registro obrigatório. O dado que torna essa mudança necessária, e não apenas recomendável, vem de Laupichler et al. (2024): estudantes identificaram corretamente a origem, humana ou gerada por modelo de linguagem, em apenas 57% dos casos ao responder um teste formativo de neurofisiologia com 25 questões escritas por humanos e 21 geradas por ChatGPT. Em outras palavras, olhar para uma questão não permite saber de forma confiável se ela foi escrita por um médico redator ou por um modelo generativo.

É por isso que o Portão 2 exige log de uso de IA e atestação de revisor humano, não uma tentativa de "detectar" IA pela leitura do item. O paper é explícito ao citar essa convergência normativa: o ICMJE, a COPE e a própria política editorial da revista Cureus estabelecem que ferramentas de IA não podem ser autoras e não podem assumir responsabilidade pelo uso avaliativo de um artefato. Um revisor humano responsável precisa estar explicitamente vinculado ao artefato, da geração à aprovação final, com nome, papel e decisão registrados.

Essa exigência de registro é a mesma que o próprio paper aplica a si: os autores declaram que IA generativa, especificamente GPT da OpenAI e Claude da Anthropic, foi usada estritamente para edição de linguagem e apoio à busca bibliográfica, nunca como coautora, e que todas as análises, interpretações e conclusões são de responsabilidade dos três autores humanos. O Portão 2 aplicado ao próprio relatório.

[Leia também Governança de IA na Preparação para o ENAMED: 5 Prioridades para a Faculdade → ](/blog/b2b-governanca-ia-preparacao-enamed)

## Por que o portão psicométrico é visitado duas vezes?

Porque um item recém-gerado não tem dado de resposta, e um item pilotado tem dado que precisa ser julgado contra um plano definido antes de existir. A primeira passagem pelo Portão 6 produz um plano de evidência, não um julgamento, simplesmente porque não há amostra de respondentes para analisar ainda. A segunda passagem, depois da pilotagem, julga os dados coletados contra exatamente aquele plano que foi fixado de antemão.

Aspecto

Primeira passagem (antes do piloto)

Segunda passagem (depois do piloto)

O que existe

Nenhum dado de resposta

Dificuldade, discriminação, funcionamento dos distratores, DIF se aplicável

O que é produzido

Plano de teste e plano de análise, com critérios prefixados

Resultados revisados contra o plano prefixado

Decisão que autoriza

Aprovação para pilotagem, nunca para uso com escore

Aprovado para uso com escore, ou "requer modificação" com retorno à redação

Esse desenho impede um erro comum: julgar entusiasmo de especialista como se fosse evidência empírica. O paper é direto ao afirmar que entusiasmo de especialista não substitui evidência empírica, e que qualquer item destinado a afetar pontuação, progressão ou certificação exige plano documentado de avaliação, ainda que artefatos de rascunho não pontuados possam seguir com ônus de evidência mais leve.

Os critérios numéricos que o paper cita, e que valem reproduzir aqui com a ressalva que o próprio documento faz, são ilustrativos de trabalhos publicados, não valores que o quadro impõe como limiar universal. Para dificuldade em Teoria Clássica dos Testes, p é a proporção de respostas corretas, e p maior significa item mais fácil; o quadro não prescreve faixa universal, porque a faixa defensável depende da decisão que o escore sustenta, e um item pouco informativo para ordenação normativa pode ser exatamente o item adequado perto de uma nota de corte criterial. Para discriminação, o quadro exige a correlação bisserial pontual corrigida, também chamada item-resto, em que o item é excluído do total ao qual é correlacionado, porque incluí-lo infla o coeficiente por dependência parte-todo. Valores publicados como referência, sempre ilustrativos, giram em torno de 0,30 em alguns estudos e de faixas de 0,20 a 0,30 em outros, mas como esses valores foram obtidos sob formulações que nem sempre correspondem à forma corrigida, não devem ser transferidos mecanicamente.

Um distrator é classificado como não funcional quando é escolhido por menos de 5% dos respondentes (TARRANT; WARE; MOHAMMED, 2009), e um item que mantém várias dessas opções opera, na prática, com menos alternativas funcionais do que declara ter. A consequência no fluxo é devolver o item para revisão das opções, não rejeitá-lo. Já o funcionamento diferencial do item, o DIF, pergunta se respondentes de mesma habilidade, mas de grupos diferentes, têm probabilidade desigual de responder corretamente (MARTINKOVÁ et al., 2017); o plano precisa prefixar método de detecção, tamanho de subgrupo adequado a esse método, regra de sinalização e revisão substantiva subsequente. Um ponto que o paper marca como crítico e que nunca deve ser omitido: um item sinalizado por DIF não está, por isso, demonstrado enviesado. A sinalização apenas inicia uma revisão de conteúdo, e só essa revisão substantiva pode estabelecer se a diferença observada é irrelevante ao construto ou reflete viés real.

Um ponto relevante para qualquer programa que avalie migrar de TCT para Teoria de Resposta ao Item: sob TRI, dificuldade é o parâmetro de locação b na escala de habilidade, com direção invertida em relação a p, e discriminação é o parâmetro de inclinação a, disponível apenas em modelos de dois ou três parâmetros. Sob o modelo de Rasch, de um parâmetro, a discriminação é restrita a ser igual entre os itens e não é um parâmetro de nível de item disponível para revisão. Como o ENAMED usa o modelo de Rasch (Nota Técnica INEP nº 42/2025), não existe "discriminação do item" para revisar no ENAMED nos termos em que a TCT a define. Qualquer análise que descreva o ENAMED como tendo parâmetro de discriminação por item está descrevendo outro exame.

[Leia também Como Contratar IA Educacional: Padrões de Evidência e Piloto com Regra de Parada → ](/blog/b2b-contratar-ia-educacional-evidencia-e-piloto)

## Quais são os cinco desfechos possíveis?

São cinco categorias mutuamente exclusivas, registradas no Portão 7, e apenas uma delas autoriza uso em prova valendo nota.

Categoria de desfecho

O que autoriza

O que proíbe

Rejeitado

Nenhum uso avaliativo

Qualquer reaproveitamento do artefato como está

Requer modificação

Retorno ao portão apropriado para correção

Uso em qualquer prova antes da correção revisada

Aprovado apenas para rascunho ou apoio ao ensino

Uso em material didático, sem pontuação

Uso como item de prova valendo nota

Aprovado para pilotagem

Aplicação experimental para coleta de dado empírico

Uso como item valendo nota antes da revisão do Portão 6

Aprovado para uso com escore

Uso em avaliação somativa, valendo nota

Nenhum uso adicional é restrito, é o status final

A distinção mais importante dessa tabela, e a que mais frequentemente se perde em fluxos informais de revisão, é que "aprovado para pilotagem" não é aprovação para prova valendo nota. São dois status diferentes, com consequências institucionais diferentes. Um item aprovado para pilotagem ainda precisa retornar ao Portão 6 depois de coletar dado real, e só a revisão desse dado, contra o plano fixado anteriormente, pode elevá-lo a "aprovado para uso com escore". A única categoria que exige evidência empírica já revisada é essa última, e é justamente por isso que ela vem depois de duas passagens pelo portão psicométrico.

## Como o exemplo do artigo percorre os portões?

O exemplo é explicitamente hipotético: o próprio paper afirma que se trata de uma ilustração sem dado de aprendiz e sem estatística real de item, com valores de placeholder usados apenas para mostrar onde cada decisão ocorre no fluxo. Não é caso real de nenhuma instituição, nem da SPR Med.

A questão hipotética é de melhor resposta única sobre manejo inicial de pneumonia adquirida na comunidade em adulto ambulatorial. No Portão 1, é registrada como questão completa destinada a uso com escore, o que fixa o ônus de evidência no nível mais alto desde o início. No Portão 2, são registrados a ferramenta geradora, o prompt utilizado e o revisor humano responsável. No Portão 3, o item passa: o especialista clínico confirma que o enunciado é acurado, que a resposta correta segue a orientação vigente e que nenhuma recomendação insegura está presente.

No Portão 4, o item falha. Duas das quatro opções são implausíveis para o nível de examinando testado, e a resposta correta é perceptivelmente mais longa que as alternativas, uma pista de comprimento clássica que introduz variância irrelevante ao construto. O item é classificado como "requer modificação" e volta à redação: os distratores são reescritos para representar erros clínicos reconhecíveis, em vez de opções implausíveis, e as quatro alternativas são equilibradas em extensão. Na segunda passagem pelo Portão 4, o item passa.

No Portão 5, o item é mapeado a uma competência definida de infecção respiratória no blueprint institucional. No Portão 6, primeira passagem, registra-se que, por ser destinado a uso com escore, o item exige pilotagem com análise de dificuldade, discriminação e funcionamento de distratores, e que o DIF será examinado porque os escores serão comparados entre coortes de ingresso diferentes. Não existe dado ainda, o que existe é o plano. No Portão 7, o item é, portanto, aprovado apenas para pilotagem, não para uso com escore.

Depois do piloto, o item retorna ao Portão 6. Dificuldade e discriminação caem dentro da faixa que o plano havia definido como aceitável, mas um dos distratores é selecionado por quase nenhum respondente e é julgado não funcional. Isso não é motivo de rejeição: o item volta, uma vez mais, para "requer modificação", o distrator é substituído e o item reentra no ciclo de piloto. Somente quando o segundo conjunto de resultados é revisado e aceito no Portão 6 o item chega ao Portão 7 como aprovado para uso com escore.

Três propriedades ficam evidentes nesse caminho. A primeira é que acurácia clínica isolada não levou o item adiante, já que ele passou na revisão de especialista e ainda assim falhou na revisão estrutural imediatamente depois. A segunda é que falhar em um portão devolveu o artefato para revisão, em vez de encerrar sua existência no banco. A terceira é que o portão psicométrico foi decisivo duas vezes: uma para exigir evidência antes de existir dado, outra para julgar essa evidência quando ela chegou.

Trajetória de um item

Questão sobre pneumonia adquirida na comunidade, dos sete portões ao escore

01

Ancoragem  
curricular

02

Geração  
por IA

03

Revisão de  
especialista

acurácia clínica: ✓

04

Revisão  
estrutural

falha: distrator

05

Piloto  
(1ª passagem)

06

Julgamento  
psicométrico

1ª passagem: reprova

07

Aprovado  
com escore

retorno 04 → 02  Falha estrutural devolve o item para revisão de redação; distrator é substituído. 

retorno 06 → 04  Reprovação na 1ª passagem psicométrica reabre o item como "requer modificação"; reentra no ciclo de piloto. 

avanço 06 → 07  Somente a 2ª passagem, revisada e aceita no Portão 6, libera o item como aprovado para uso com escore. 

Três propriedades do caminho

Acurácia clínica isolada não avança o item, pois ele passou no Portão 3 e falhou logo depois no Portão 4. Falhar em um portão devolve o artefato para revisão, não encerra sua existência no banco. O portão psicométrico decide duas vezes: exige evidência antes de existir dado, depois julga essa evidência quando ela chega.

## O que este artigo não afirma?

O relatório descreve o workflow, e não uma implementação dele, e essa é a frase mais importante da seção de limitações. Os próprios autores afirmam que não reportam nenhum dado de confiabilidade, e classificam essa ausência como a primeira grandeza que uma avaliação prospectiva do workflow deveria reportar. Planejar um plano de evidência e revisar dado empírico contra esse plano não são, em si, evidência de que o workflow funciona na prática.

É preciso ser específico sobre o que falta. O documento é produzido por uma equipe única, desenvolvido por prática iterativa dos próprios autores, e não por metodologia formal de consenso: não houve painel Delphi, nem qualquer procedimento estruturado de consulta a especialistas externos. Não há análise de desfecho de aluno, não há métrica de desempenho de item coletada em implementação real, e não há comparação empírica entre item gerado por IA e item escrito por redator humano dentro deste estudo. O exemplo da pneumonia é ilustrativo, com valores de placeholder, não estatística medida.

Quanto à reprodutibilidade das próprias decisões dos portões, o paper reconhece que quatro dos sete, a revisão clínica, a revisão de redação, o alinhamento ao blueprint e a aprovação final, repousam em julgamento de especialista. Sem reprodutibilidade demonstrada, o workflow registra julgamento, mas não estabelece a consistência desse julgamento entre revisores diferentes. O documento especifica um desenho de reprodutibilidade, não uma estatística: uma proporção de artefatos fixada de antemão, avaliada independentemente por dois revisores cegos entre si, com concordância calculada antes de qualquer adjudicação, usando kappa de Cohen ponderado para categorias ordinais entre dois avaliadores, sempre com intervalo de confiança de 95%. Mas essa é uma especificação de como medir reprodutibilidade, não um dado de reprodutibilidade obtido.

A literatura empírica de terceiros, que o paper cita e que não é autocitação, reforça por que essa cautela é necessária. Kiyak et al. (2024) incorporaram duas questões geradas por ChatGPT a uma prova de farmacoterapia respondida por 99 estudantes do quarto ano: ambas superaram o critério de bisserial pontual de 0,30, mas uma delas manteve três opções não funcionais. Coşkun, Kiyak e Budakoğlu (2025), em ensaio randomizado com 74 estudantes, encontraram que apenas 6 das 15 questões geradas por ChatGPT atingiram correlação bisserial de 0,30. Laupichler et al. (2024), comparando 25 itens humanos e 21 gerados por modelo de linguagem entre 161 estudantes, encontraram discriminação média de 0,36 para itens humanos contra 0,24 para itens de IA (p = 0,001), embora a dificuldade não tenha distinguido os dois grupos. A revisão sistemática de Kiyak, Kaya e Emekli (2026) descreve essa evidência agregada como heterogênea, insuficiente para ordenar uma dimensão de qualidade acima de outra ou para justificar uso não supervisionado em avaliação de alta consequência.

[Leia também O Que a Evidência Diz Sobre Questões Geradas por IA: Três Estudos, Três Lições → ](/blog/b2b-evidencia-questoes-geradas-por-ia-tres-estudos)

## Declaração de conflito de interesse

Este é um ponto que precisa estar visível e sem ambiguidade. Vinícius C. Destefani é cofundador e Diretor de Pedagogia e Engajamento da SPR Med, e também consultor médico da Allm Inc., de Tóquio. Matheus Feliciano C. Ferreira é CEO da SPR Med. Afrânio C. Destefani atua como consultor científico da empresa. Os três autores do paper declaram honorários, vínculo empregatício ou de consultoria, e participação acionária na SPR Med, no formulário padronizado do ICMJE, a declaração mais completa entre os quatro papers deste cluster. O próprio artigo afirma literalmente que o banco de itens e a plataforma da SPR Med são produtos comerciais. Nenhum financiamento foi recebido para o trabalho submetido.

Essa transparência não fragiliza a citação do paper, fortalece. A empresa declarou o vínculo comercial na própria fonte primária revisada por pares, não apenas em material de marketing institucional. Isso é exatamente o que o Portão 2 exige de qualquer artefato: proveniência e responsabilidade estabelecidas por registro, não por inferência de quem lê.

[Leia também Quatro Artigos Revisados por Pares Sobre o ENAMED: O Que Publicamos e o Que Não Afirmamos → ](/blog/b2b-producao-cientifica-sprmed-enamed)

## O que muda a partir daqui para a gestão acadêmica

Nenhuma faculdade de medicina precisa reinventar sete portões do zero. O que o technical report oferece, nas palavras dos próprios autores, é uma estrutura de governança para decidir quando evidência empírica mais forte é exigida antes de um item afetar a nota de um estudante. Para uma instituição que já usa geração assistida por IA na produção de itens para o banco interno, ou que avalia contratar essa capacidade de um fornecedor, a decisão relevante para o NDE não é "permitir ou proibir IA", é registrar em qual portão cada rascunho está, quem decidiu, e qual condição de parada foi ou não satisfeita.

Isso também demarca uma fronteira que vale reforçar. Este artigo trata de governança na produção do item, quem decide se um rascunho gerado por máquina pode virar prova valendo nota. É um objeto diferente da governança de uso de IA por estudantes durante a preparação para o ENAMED, tratada separadamente, e diferente também da redação manual de itens inéditos do zero, que segue outro fluxo de trabalho de autoria humana.

O banco proprietário da SPR Med, com 266.177 questões tagueadas na Matriz Pedagógica 7D e calibradas por TRI, opera sob lógica de portões análoga: nenhum item entra em prova simulada de instituição parceira sem passar por revisão clínica, revisão estrutural e validação de alinhamento ao blueprint. Converse com nosso time de consultoria acadêmica para entender como o M.A.E.S.T.R.O aplica prontidão psicométrica a itens do banco antes de qualquer uso com escore em simulados institucionais.

## Documentos oficiais relacionados

-   [Notas técnicas do Inep: cálculo da nota, proficiência e conceito institucional](https://www.gov.br/inep/pt-br/areas-de-atuacao/avaliacao-e-exames-educacionais/enamed/notas-tecnicas).

## Perguntas frequentes

### Uma questão gerada por IA pode ser usada direto em prova, sem revisão?

Não. O technical report é explícito ao tratar todo artefato gerado por IA como candidato, nunca como item pronto. A aprovação para uso com escore exige ter passado pelos sete portões, incluindo revisão clínica, revisão de redação, alinhamento ao blueprint e duas passagens pelo portão psicométrico, com evidência empírica revisada na segunda.

### Como saber se uma questão foi gerada por IA só de olhar para ela?

Não é possível de forma confiável. No estudo de Laupichler et al. (2024), estudantes identificaram corretamente a origem da questão em apenas 57% dos casos. Por isso, o Portão 2 do workflow exige que proveniência seja estabelecida por registro, log de uso de IA e atestação de revisor humano, e não por inspeção do item.

### Qual a diferença entre "aprovado para pilotagem" e "aprovado para uso com escore"?

São status distintos e não intercambiáveis. Aprovado para pilotagem autoriza aplicação experimental para coleta de dado empírico, mas não vale nota. Aprovado para uso com escore só é atingido depois que os resultados do piloto são revisados contra o plano psicométrico prefixado no Portão 6 e considerados satisfatórios.

### Item clinicamente correto pode ainda assim ser rejeitado como questão de prova?

Sim, e o exemplo hipotético do próprio paper ilustra isso. Um item pode passar integralmente na revisão clínica, confirmando acurácia médica, e falhar na revisão de redação por pista de comprimento ou distratores implausíveis, ou falhar no portão psicométrico por distrator não funcional identificado no piloto. Acurácia clínica não estabelece, por si só, qualidade de medida.

### O ENAMED usa discriminação de item para revisar questões?

Não nos termos da Teoria Clássica dos Testes. O ENAMED usa modelo de Rasch, de um parâmetro (Nota Técnica INEP nº 42/2025), no qual a discriminação é restrita a ser igual entre todos os itens e não constitui parâmetro de nível de item disponível para revisão individual. Descrever "discriminação do item" como algo revisável no ENAMED é impreciso.

### Este workflow de sete portões tem eficácia comprovada?

Não, e essa é uma limitação que os próprios autores declaram sem eufemismo. O relatório descreve o workflow, não uma implementação dele, e não reporta nenhum dado de confiabilidade ou de reprodutibilidade entre revisores. Planejar evidência e revisar dado contra um plano prefixado não constituem, por si mesmos, prova de que o processo funciona em escala institucional.

## Sobre a autoria

![Dr. Matheus Ferreira](https://res.cloudinary.com/dk8el9agv/image/upload/v1778608087/matheus_ksqsss.jpg)

Escrito por

Dr. Matheus Ferreira

CEO e Co-Fundador do SPR Med · CRM-SP 206.304

Médico, MBA em HealthTech (FIAP) e Gestão em Saúde (FGV). Publicado em Scientific Reports (Nature Portfolio). Liderou conteúdo médico para mais de 145.000 alunos antes de fundar o SPR Med.

Compartilhar: [](https://www.linkedin.com/sharing/share-offsite/?url=https%3A%2F%2Fsprmed.com.br%2Fblog%2Fb2b-validacao-itens-gerados-por-ia-sete-portoes)[](https://api.whatsapp.com/send?text=Sete%20Port%C3%B5es%20Antes%20de%20uma%20Quest%C3%A3o%20Gerada%20por%20IA%20Entrar%20na%20Prova%20https%3A%2F%2Fsprmed.com.br%2Fblog%2Fb2b-validacao-itens-gerados-por-ia-sete-portoes)[](https://twitter.com/intent/tweet?text=Sete%20Port%C3%B5es%20Antes%20de%20uma%20Quest%C3%A3o%20Gerada%20por%20IA%20Entrar%20na%20Prova&url=https%3A%2F%2Fsprmed.com.br%2Fblog%2Fb2b-validacao-itens-gerados-por-ia-sete-portoes)

Próximo passo

## Conheça a SPR Med com nossa equipe

Conheça a plataforma e converse sobre as necessidades da sua instituição.

Agendar demonstração

## Artigos Relacionados

B2B [

### Delphi no ENAMED: como se escolhe o que a prova avalia

](/blog/b2b-enamed-delphi-matriz-avaliacao)

Entenda o Delphi no ENAMED, o significado dos 80% de concordância e como a relação entre competência e instrumento orienta a avaliação na sua faculdade.

B2B [

### Orçamento de proficiência médica 2027: como calcular o custo total

](/blog/b2b-orcamento-proficiencia-medica-2027)

Monte o orçamento institucional de preparação e acompanhamento ao ENAMED com licenças, implantação, horas docentes, operação e cenários de escopo.

B2B [

### Pós-ENAMED 2026: roteiro da coordenação para as primeiras 72 horas

](/blog/b2b-pos-enamed-primeiras-72-horas)

Organize ocorrências, prazos, percepção dos alunos e análise preliminar após o ENAMED. Modelo de ata e plano de trabalho para a coordenação.

Neste artigo

-   [Por que uma questão bem escrita por IA ainda não é uma questão válida?](#por-que-uma-questao-bem-escrita-por-ia-ainda-nao-e-uma-questao-valida)
-   [Quais são os sete portões?](#quais-sao-os-sete-portoes)
-   [Por que a ordem dos portões importa?](#por-que-a-ordem-dos-portoes-importa)
-   [O que muda no portão de proveniência?](#o-que-muda-no-portao-de-proveniencia)
-   [Por que o portão psicométrico é visitado duas vezes?](#por-que-o-portao-psicometrico-e-visitado-duas-vezes)
-   [Quais são os cinco desfechos possíveis?](#quais-sao-os-cinco-desfechos-possiveis)
-   [Como o exemplo do artigo percorre os portões?](#como-o-exemplo-do-artigo-percorre-os-portoes)
-   [O que este artigo não afirma?](#o-que-este-artigo-nao-afirma)
-   [Declaração de conflito de interesse](#declaracao-de-conflito-de-interesse)
-   [O que muda a partir daqui para a gestão acadêmica](#o-que-muda-a-partir-daqui-para-a-gestao-academica)
-   [Documentos oficiais relacionados](#documentos-oficiais-relacionados)
-   [Perguntas frequentes](#perguntas-frequentes)
-   [Uma questão gerada por IA pode ser usada direto em prova, sem revisão?](#uma-questao-gerada-por-ia-pode-ser-usada-direto-em-prova-sem-revisao)
-   [Como saber se uma questão foi gerada por IA só de olhar para ela?](#como-saber-se-uma-questao-foi-gerada-por-ia-so-de-olhar-para-ela)
-   [Qual a diferença entre "aprovado para pilotagem" e "aprovado para uso com escore"?](#qual-a-diferenca-entre-aprovado-para-pilotagem-e-aprovado-para-uso-com-escore)
-   [Item clinicamente correto pode ainda assim ser rejeitado como questão de prova?](#item-clinicamente-correto-pode-ainda-assim-ser-rejeitado-como-questao-de-prova)
-   [O ENAMED usa discriminação de item para revisar questões?](#o-enamed-usa-discriminacao-de-item-para-revisar-questoes)
-   [Este workflow de sete portões tem eficácia comprovada?](#este-workflow-de-sete-portoes-tem-eficacia-comprovada)
-   [Sobre a autoria](#sobre-a-autoria)

![SPR Med, Sistema de Proficiência Médica](https://res.cloudinary.com/dk8el9agv/image/upload/f_auto,q_auto,h_96/v1775330590/sprmed_branco_vekkvi.png)

Sistema de Proficiência Médica. O sistema operacional da proficiência médica, do 1º ano ao egresso. Estruturado a partir da Matriz de Referência do ENAMED.

### Produto

[Plataforma](/#plataforma)[Diferenciais](/#diferenciais)[Pesquisa](/pesquisa)[Blog](/blog)

### Recursos

[Dossiê ENAMED](https://dossie.sprmed.com.br/)[Portal institucional gratuito](https://dossie.sprmed.com.br/para-ies)[Acessar plataforma](https://plataforma.sprmed.com.br/)

### Contato

[contato@sprmed.com.br](mailto:contato@sprmed.com.br)

WhatsApp Comercial

[(11) 94107-3157](https://wa.me/5511941073157?text=Olá!%20Vim%20do%20site%20SPR%20Med%20e%20gostaria%20de%20agendar%20uma%20conversa)

WhatsApp Suporte

[(11) 93620-4984](https://wa.me/5511936204984?text=Olá!%20Sou%20cliente%20SPR%20Med%20e%20preciso%20de%20suporte)

Proficiência médica deixa de ser aposta .

© 2026 SPR Med. Todos os direitos reservados. ·  [Termos de Uso](/termos) ·  [Privacidade](/termos#privacidade)

Usamos cookies para melhorar sua experiência. [Política de Privacidade](/termos#privacidade)

AceitarRecusarSó essenciais