Standard Setting in the Era of Workplace-Based Assessment: A Pilot Exploration
Este estudo piloto demonstra que três métodos estabelecidos de definição de padrões (Angoff, Bookmark e Mapeamento de Construto) podem ser adaptados de forma viável e confiável para dados longitudinais de avaliação baseada no local de trabalho para definir um padrão de graduação em cirurgia geral defensável, com uma nota de corte proposta de 582 sustentada pela convergência de resultados e percepções qualitativas.
Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você é um chef executivo tentando decidir quando um estudante de culinária está pronto para deixar a cozinha e abrir seu próprio restaurante. No passado, você poderia apenas observar o aluno preparar um prato específico (como um suflê) e decidir: "Sim, ele consegue lidar com isso". Mas hoje, as escolas de medicina estão migrando para um sistema onde observam os alunos cozinharem muitos pratos diferentes ao longo de vários anos, coletando uma quantidade massiva de dados sobre como eles se saem na cozinha real (o centro cirúrgico).
O problema? Ninguém sabia como transformar todos esses dados de longo prazo em uma linha única e clara de "Aprovado" ou "Reprovado".
Este artigo é como um teste piloto onde um grupo de 10 chefs especialistas (educadores cirúrgicos) tentou descobrir como traçar essa linha usando três ferramentas de medição diferentes. Aqui está o que eles fizeram e o que descobriram, explicado de forma simples:
O Objetivo: Encontrar a "Linha de Graduação"
Os pesquisadores queriam encontrar uma pontuação específica que diga: "Este estudante está pronto para praticar por conta própria". Eles usaram uma ferramenta digital chamada SIMPL, que dá aos estudantes uma pontuação entre 372 e 628 com base no seu desempenho na cirurgia. O objetivo era encontrar o número exato nessa escala onde um estudante se torna "pronto para a prática".
As Três Ferramentas de Medição
Os especialistas testaram três maneiras diferentes de definir essa linha, de forma semelhante a como você poderia tentar adivinhar o preço de uma casa usando métodos diferentes:
O Método "Angoff" (O Palpite Mental):
- Como funciona: Os especialistas foram solicitados a imaginar um estudante "limiar de aprovação" (que mal passa). Então, para cada cirurgia em uma lista, eles tiveram que adivinhar: "Quais são as chances de este estudante que mal passa realizar esta cirurgia bem?".
- A Analogia: É como pedir a um grupo de juízes para imaginar um corredor que é apenas rápido o suficiente para entrar na equipe olímpica e, então, adivinhar quantos obstáculos esse corredor conseguiria superar.
- O Resultado: Foi muito difícil para os especialistas. Eles sentiram que era complicado demais e que seus cérebros ficavam cansados tentando imaginar esse estudante "limiar de aprovação" para cada cirurgia individual.
O Método "Bookmark" (A Escada):
- Como funciona: Eles pegaram uma lista de cirurgias e as organizaram da "mais fácil" para a "mais difícil" com base nos dados. Os especialistas foram então solicitados a colocar um "marcador de página" (bookmark) na lista onde um estudante começaria a falhar.
- A Analogia: Imagine uma escada onde os degraus são as cirurgias. Os especialistas tinham que dizer: "Ok, um estudante pode subir até este degrau, mas se ele subir mais alto, ele cairá".
- O Resultado: Os especialistas não concordaram sobre como ordenar os degraus da escada. Algumas cirurgias não pareciam se encaixar na ordem sugerida pelo computador, o que os deixou inseguros quanto às suas respostas.
O Método "Construct Mapping" (O Mapa de Calor):
- Como como funciona: Este foi o favorito. Os especialistas olharam para um "mapa de calor" colorido (um gráfico com cores mostrando probabilidades). Este mapa mostrava exatamente qual era a probabilidade de um estudante com determinada pontuação passar em cirurgias específicas. Eles podiam ver o quadro geral de uma só vez.
- A Analogia: Em vez de adivinhar ou subir uma escada, isso é como olhar para um mapa meteorológico. Você pode ver as nuvens de tempestade (cirurgias difíceis) e os pontos ensolarados (fáceis) de uma só vez e dizer: "Ok, se a temperatura (pontuação) está aqui, o estudante está seguro para sair".
- O Resultado: Os especialistas adoraram este método. Foi rápido, utilizou dados reais e ajudou-os a ver como uma única pontuação se aplicava a muitas cirurgias diferentes.
A Grande Descoberta
Quando os especialistas terminaram, compararam as linhas de "Aprovação" que desenharam usando as três ferramentas diferentes.
- Angoff sugeriu uma linha em torno de 577.
- Bookmark sugeriu uma linha em torno de 588.
- Construct Mapping sugeriu uma linha em torno de 582.
A Surpresa: Embora as ferramentas fossem totalmente diferentes, as linhas que eles desenharam eram quase as mesmas. Estatisticamente, não houve diferença real entre elas. Isso deu aos pesquisadores confiança de que 582 é um número sólido e justo para usar como ponto de partida para a graduação.
O Que os Especialistas Disseram (O Lado "Humano")
Embora os números estivessem próximos, os especialistas tiveram algumas considerações sobre o processo:
- Definindo "Pronto": Foi difícil para eles concordarem sobre como é um estudante "minimamente competente". Eles querem dizer alguém que é apenas bom o suficiente para se formar, ou alguém que está pronto para ser um cirurgião amanhã? Eles lutaram para parar de pensar em cirurgiões "perfeitos" e focar em cirurgiões "bons o suficiente".
- Complexidade: Eles acharam difícil levar em conta a dificuldade de uma cirurgia específica. Eles concordaram em estabelecer o padrão para casos "simples/diretos", não para os mais difíceis.
- O Vencedor: Eles preferiram o Mapa de Calor (Construct Mapping) porque foi o mais eficiente e ajudou a visualizar o padrão entre muitas cirurgias ao mesmo tempo.
A Conclusão
Este estudo prova que você pode pegar uma montanha de dados de desempenho de longo prazo e transformá-los em um padrão de graduação claro e justo. Eles descobriram que três formas diferentes de medir levam ao mesmo resultado, o que torna o resultado confiável.
Eles propõem uma pontuação de 582 como o novo padrão. Se um estudante atinge essa pontuação, os dados sugerem que ele tem 88–90% de chance de estar pronto para realizar uma apendicectomia laparoscópica, 83–85% de chance para uma remoção de vesícula e 76–80% de chance para uma cirurgia de cólon.
Em resumo: Eles encontraram uma maneira confiável de medir quando um estudante de cirurgia está pronto para voar sozinho, e descobriram que olhar para o "quadro geral" (o mapa de calor) é a melhor maneira de fazer isso.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.