A pesquisa mostra, de forma consistente, que tentar responder consolida a memória mais do que reler o conteúdo. Isso muda a pergunta que toda escola deveria estar fazendo sobre avaliação.
Dois grupos estudam o mesmo texto. O primeiro relê o material mais uma vez. O segundo fecha o texto e tenta escrever tudo o que lembra — sem nota, sem correção, só para si mesmo. Uma semana depois, qual dos dois lembra mais?
A resposta, replicada em dezenas de estudos ao longo de décadas, é sempre a mesma: quem foi testado lembra mais. Não por uma margem pequena — por uma diferença grande o suficiente para colocar em xeque como a maioria das escolas pensa avaliação.
Em 2006, os psicólogos Henry Roediger e Jeffrey Karpicke, da Washington University in St. Louis, publicaram uma revisão que batizou esse fenômeno de testing effect — o efeito do teste. A descoberta central: fazer um teste sobre um conteúdo melhora a retenção mais do que estudar esse mesmo conteúdo de novo, mesmo quando o teste é feito sem qualquer feedback sobre o que estava certo ou errado.
Isso contraria a intuição de praticamente todo mundo — inclusive de professores experientes. A crença mais comum é que reler, resumir ou reestudar é a forma mais eficiente de fixar conteúdo. A pesquisa mostra o oposto: reler é um processo passivo, a informação simplesmente passa pelos olhos de novo. Tentar responder — mesmo com esforço, mesmo errando — é um processo ativo, e é esse esforço de busca que fortalece a memória.
O efeito cresce ainda mais com testes repetidos. Em outro experimento dos mesmos autores, o grupo que passou por ciclos de teste — em vez de reestudo repetido — esqueceu apenas 13% do que sabia depois de alguns dias. Quem só reestudou esqueceu 56%. A prática de recuperar a informação, e não a exposição repetida a ela, é o que protege contra o esquecimento.
O estudo de 2006 é, em boa parte, um trabalho de laboratório — controlado, com adultos, em condições artificiais. A pergunta natural de qualquer educador é se o efeito sobrevive ao caos de uma sala de aula real, com adolescentes, currículo apertado e nota no boletim.
A resposta veio nos anos seguintes, com os próprios autores levando a pesquisa para dentro da escola. Em uma sala de ciências do ensino fundamental, quizzes espaçados ao longo de uma unidade — de baixo peso, quase informais — produziram ganhos de 13% a 25% nas provas finais da unidade. E o ganho não se limitava a perguntas idênticas às do quiz: apareceu também em perguntas de transferência, que exigiam aplicar o conceito em um contexto novo. Isso é importante — significa que o efeito não é decoreba disfarçada, é compreensão real sendo reforçada pelo ato de recuperar.
Um segundo estudo, de dois anos, acompanhou turmas de estudos sociais do 6º ano com quizzes que de fato valiam nota — não um experimento isolado, mas parte da rotina real da disciplina. Os ganhos de longo prazo se confirmaram. O efeito não é um artefato de laboratório: ele sobrevive, e às vezes até se fortalece, no ambiente bagunçado de uma sala de aula de verdade.
O testing effect explica o mecanismo cognitivo — por que recuperar informação fixa mais do que reestudar. Mas há uma segunda camada, institucional, que decide se esse mecanismo é aproveitado ou desperdiçado na escola: a diferença entre avaliação somativa e avaliação formativa.
Avaliação somativa mede o que já foi aprendido — geralmente com peso na nota, no final de um ciclo. É a prova bimestral, o vestibular, o ENEM. Avaliação formativa é qualquer atividade, do professor ou do próprio aluno, cujo resultado é usado como retroalimentação para ajustar o ensino e a aprendizagem enquanto elas ainda estão acontecendo — não para julgar o que já passou.
Em 1998, os pesquisadores britânicos Paul Black e Dylan Wiliam revisaram cerca de 250 estudos sobre o tema e chegaram a uma conclusão que se tornou uma das mais citadas da área.
"Usar avaliação constante e de baixo risco para ajustar o ensino em tempo real é uma das alavancas mais fortes já documentadas para elevar o desempenho dos alunos — mais forte do que boa parte das reformas estruturais de currículo."
Isso é uma afirmação forte. Não é "avaliação formativa ajuda". É: entre tudo que já foi tentado para melhorar resultado escolar — trocar currículo, mudar carga horária, reformar metodologia — pouca coisa tem tanta evidência quanto simplesmente usar a avaliação com mais frequência, com menos peso, e de forma que sirva ao ensino em andamento.
Em geral, sim — mas com uma condição importante que evita a resposta fácil demais. Testes de baixo risco e frequentes tendem a reduzir a ansiedade ao longo do tempo, por dois motivos prováveis: o aluno se acostuma com a condição de ser testado, e chega mais preparado — logo mais confiante — na prova que realmente conta. Um estudo de 2025 com estudantes de medicina, em um teste deliberadamente de risco quase nulo, mediu queda real na ansiedade autorreportada dos participantes.
Mas um estudo com alunos do ensino médio encontrou o oposto em algumas semanas: mais testes de baixo risco associados a mais ansiedade. O fator decisivo não era a quantidade de testes — era se o aluno sentia, naquela semana, que sua competência estava sendo frustrada ou julgada. Ou seja: chamar um teste de "baixo risco" no papel não neutraliza a ansiedade se, na prática, o aluno ainda sente que está sendo avaliado como pessoa, e não como processo.
A conclusão honesta é a mesma do artigo anterior desta série, sobre o erro: não é o rótulo do teste que determina o efeito. É o clima que o professor constrói em volta dele.
Referências: Ito, T. et al. (2025). Medical Science Educator. Estudo sobre ansiedade e frequência de testes de baixo risco no ensino médio, ScienceDirect (análise multinível).
O sistema escolar brasileiro não tem escassez de provas. Tem escassez de provas que ensinam. Da prova bimestral ao vestibular, passando pelo ENEM, a lógica dominante é quase inteiramente somativa: um evento de alto risco, no final do ciclo, que mede o que já ficou pra trás — e cujo resultado pesa tanto que o próprio formato da prova acaba ditando o que é ensinado em sala, o efeito que a linguística aplicada chama de washback.
Isso cria um paradoxo. O ENEM e o vestibular são, estruturalmente, o tipo de avaliação que menos aproveita o que a pesquisa mostra sobre como a memória funciona: alto risco, pouca frequência, feedback tardio ou inexistente sobre o processo. E, ainda assim, dominam de tal forma o imaginário escolar que "avaliação" virou sinônimo de "prova que vale nota no fim do ano" — não de ferramenta que ajuda o aluno a aprender enquanto ainda há tempo de corrigir o rumo.
A saída não é abolir a prova de peso alto — ENEM e vestibular vão continuar existindo, e cumprem uma função de seleção que este artigo não discute. A saída é o que acontece antes dela: um professor pode, dentro do mesmo currículo apertado, inserir quizzes curtos e frequentes, sem grande peso na nota, cujo único objetivo é fazer o aluno recuperar o conteúdo ativamente — não medi-lo, prepará-lo. É exatamente o desenho que Black e Wiliam encontraram como uma das alavancas mais fortes já documentadas, e que Roediger e Karpicke explicam em nível cognitivo.
Nenhum desses estudos foi feito no Brasil, e a cultura escolar aqui tem particularidades que merecem pesquisa própria. Mas o mecanismo cognitivo por trás do testing effect não é cultural — é como a memória humana funciona. O que muda de país para país é se a estrutura escolar dá espaço para esse mecanismo ser usado a favor do aluno, ou se ele fica soterrado sob a pressão de uma única prova no fim do ano.
foi o esquecimento de quem passou por ciclos de teste repetido — contra 56% de quem só reestudou o mesmo conteúdo. A avaliação, usada da forma certa, não mede o aprendizado. Ela é o aprendizado.
"A pergunta não é se o aluno deve ser avaliado. É se a avaliação está sendo usada para ensinar, ou só para registrar quem já sabia."
Todos os artigos citados são peer-reviewed e publicados em periódicos científicos. O artigo central desta edição pode ser consultado na íntegra na fonte oficial, linkada abaixo.
Black, P., & Wiliam, D. (1998). Inside the black box: Raising standards through classroom assessment. Phi Delta Kappan, 80(2), 139–148.
Ito, T., Nomura, O., Hirai, K., Ushikoshi, H., & Saiki, T. (2025). Reduced test anxiety among medical students in an extremely low-stakes examination. Medical Science Educator.
McDaniel, M. A., Agarwal, P. K., Huelser, B. J., McDermott, K. B., & Roediger, H. L. (2011). Test-enhanced learning in a middle school science classroom: The effects of quiz frequency and placement. Journal of Educational Psychology, 103(2), 399–414.
Roediger, H. L., Agarwal, P. K., McDaniel, M. A., & McDermott, K. B. (2011). Test-enhanced learning in the classroom: Long-term improvements from quizzing. Journal of Experimental Psychology: Applied, 17(4), 382–395.
Roediger, H. L., & Karpicke, J. D. (2006). The power of testing memory: Basic research and implications for educational practice. Perspectives on Psychological Science, 1(3), 181–210. Artigo completo: doi.org/10.1111/j.1745-6916.2006.00012.x