Psicometria
Aula em tópicos, na ordem dos capítulos de livros-texto de psicologia, e as afirmações da disciplina. Para responder e ver as explicações, jogue esta disciplina: as primeiras afirmações de cada dia são grátis.
Medida em psicologia e escalas
Medir é atribuir números a atributos segundo regras, e em psicologia os atributos são construtos latentes, como ansiedade ou inteligência, acessados por indicadores observáveis. As escalas de medida de Stevens definem o que os números permitem: a nominal só classifica, a ordinal ordena sem intervalos iguais, a intervalar tem intervalos iguais mas zero arbitrário, e a de razão tem zero verdadeiro. A maioria dos escores psicológicos fica entre ordinal e intervalar, o que condiciona as análises adequadas. Formatos de resposta comuns incluem escalas Likert, em que a pessoa indica o grau de concordância com afirmações, e escalas de frequência. O erro comum é tratar qualquer número como se tivesse as propriedades de uma régua.
Afirmações deste tópico
- “Numa escala Likert, a pessoa indica o quanto concorda ou discorda de cada afirmação, em geral em cinco pontos.”Responder
- “A classificação clássica dos níveis de medida distingue escalas nominais, ordinais, intervalares e de razão.”Responder
- “Uma pessoa com QI 140 tem exatamente o dobro da inteligência de uma pessoa com QI 70.”Responder
- “Construtos como ansiedade ou inteligência não são observados diretamente, mas inferidos a partir de respostas e comportamentos.”Responder
- “Quanto mais pontos uma escala de resposta tiver, mais precisa ela fica, por isso o ideal é usar cem opções de resposta.”Responder
- “A ordem em que as perguntas aparecem num questionário pode alterar as respostas que as pessoas dão.”Responder
- “A tendência de concordar com afirmações independentemente do conteúdo pode inflar os escores de uma escala cujos itens estão todos na mesma direção.”Responder
- “A desejabilidade social afeta apenas inventários de personalidade e nunca escalas de sintomas clínicos.”Responder
Construção de testes e normas
Construir um teste começa pela definição do construto e de uma tabela de especificações, seguida da redação de itens, revisão por juízes, estudo piloto e seleção dos itens que funcionam. Padronizar significa fixar instruções, materiais, tempo e correção para que todos sejam avaliados nas mesmas condições. Como um escore bruto nada diz sozinho, ele é interpretado comparando-o com um grupo de referência, a amostra normativa, que deve ser representativa da população de uso; daí surgem percentis, escores padrão e escores T. Normas envelhecem e precisam ser atualizadas. O erro comum é ler um número bruto como se tivesse significado absoluto, ou comparar alguém com normas de outra população.
Afirmações deste tópico
- “Para interpretar o escore de alguém num teste, ele é comparado com os resultados de um grupo de referência.”Responder
- “Um escore no percentil 80 indica que a pessoa ficou acima de cerca de 80% do grupo normativo.”Responder
- “As normas de um teste continuam válidas indefinidamente, não importa quantas décadas tenham passado desde a coleta.”Responder
- “Converter escores brutos em escores z ou T transforma qualquer distribuição em uma distribuição normal.”Responder
- “Estar no percentil 60 de um teste significa que a pessoa acertou 60% das questões.”Responder
- “A construção de um teste começa pela definição do construto e pela especificação do que ele deve cobrir, antes da redação dos itens.”Responder
- “Uma amostra normativa muito grande garante normas representativas, mesmo que tenha sido coletada apenas entre estudantes universitários.”Responder
- “Em testes referenciados a critério, o escore é interpretado em relação a um padrão de domínio do conteúdo, e não à posição da pessoa no grupo.”Responder
Fidedignidade e erro de medida
Fidedignidade é a consistência dos escores: quanto do resultado reflete o atributo e quanto é erro aleatório. Na teoria clássica, o escore observado é a soma do escore verdadeiro com o erro, e a fidedignidade é a proporção de variância verdadeira. Estima-se por teste-reteste, aplicando o mesmo instrumento duas vezes e correlacionando; por formas paralelas; por consistência interna, como alfa de Cronbach, que tende a subir ao acrescentar itens que medem o mesmo construto; e por concordância entre avaliadores. O erro padrão de medida traduz a fidedignidade em intervalo ao redor do escore. Duas consequências pouco intuitivas: escores extremos tendem a regredir à média na reaplicação, e a correlação entre dois testes é limitada pela precisão de cada um. Um teste fidedigno pode, ainda assim, não ser válido.
Afirmações deste tópico
- “Um teste pode ser confiável sem ser válido.”Responder
- “Acrescentar itens que medem o mesmo construto tende a aumentar a consistência interna de um teste.”Responder
- “A fidedignidade teste-reteste é estimada aplicando o mesmo teste duas vezes às mesmas pessoas e correlacionando os escores.”Responder
- “O erro padrão de medida permite construir um intervalo em torno do escore observado em vez de tratá-lo como valor exato.”Responder
- “A correlação observada entre dois testes é limitada pela precisão de cada um deles.”Responder
- “Quem tira um escore extremo num teste tende a tirar um escore menos extremo ao refazê-lo.”Responder
- “Um coeficiente de fidedignidade de 0,90 significa que 90% das pessoas receberam o escore correto e 10% receberam um escore errado.”Responder
Validade: conteúdo, critério e construto
Validade é o grau em que as evidências sustentam a interpretação pretendida dos escores; não é propriedade do teste em si, mas do uso. Evidência de conteúdo mostra que os itens cobrem o domínio de forma representativa, avaliada por juízes. Evidência de critério relaciona o teste a um desfecho externo, concorrente ou preditivo, como escores de inteligência prevendo desempenho no trabalho; correlações em torno de 0,30 são comuns e têm utilidade prática real quando as decisões envolvem muitas pessoas. Evidência de construto reúne convergência com medidas do mesmo atributo e divergência de medidas de atributos diferentes, além da estrutura interna. O erro comum é perguntar se um teste é válido sem perguntar válido para quê.
Afirmações deste tópico
- “Escores em testes de inteligência não têm nenhuma relação com o desempenho no trabalho.”Responder
- “Se um teste parece medir o que promete, essa aparência já é a evidência de validade mais importante.”Responder
- “A validade se refere às interpretações e usos dos escores, e não é uma propriedade fixa que o teste tem ou não tem.”Responder
- “Quando os escores de um teste se correlacionam com um critério medido meses depois, fala-se em validade preditiva.”Responder
- “Se um grupo de especialistas aprova o conteúdo dos itens, o teste não precisa de nenhum estudo empírico de validade.”Responder
- “Uma escala de ansiedade que se correlaciona mais com outras medidas de ansiedade do que com medidas de inteligência mostra evidência de validade de construto.”Responder
- “Uma correlação de 0,30 entre um teste e um critério é tão pequena que não tem nenhuma utilidade prática.”Responder
- “A matriz multitraço-multimétodo compara correlações de vários traços medidos por vários métodos para avaliar validade convergente e discriminante.”Responder
Análise de itens, TCT e TRI
A análise de itens verifica como cada pergunta funciona. Na teoria clássica dos testes, olha-se a dificuldade, a proporção de acertos, e a discriminação, a correlação do item com o total: itens que quase todos acertam não separam as pessoas mais capazes das demais. A análise fatorial revela quantas dimensões um conjunto de itens mede e quais itens carregam em cada uma; alfa de Cronbach alto indica itens correlacionados, não unidimensionalidade, que é questão de estrutura. A teoria de resposta ao item modela a probabilidade de resposta em função do traço latente e de parâmetros do item, como dificuldade e discriminação, e permite comparar pessoas que responderam a itens diferentes. O erro comum é usar um único coeficiente como prova de qualidade.
Afirmações deste tópico
- “Na teoria clássica dos testes, o escore observado é entendido como a soma de um escore verdadeiro e de um erro de medida.”Responder
- “Na análise clássica de itens, o índice de dificuldade é a proporção de pessoas que acertam o item, de modo que valores altos indicam itens fáceis.”Responder
- “Se quase todos os examinandos acertam todos os itens, o teste discrimina bem entre as pessoas mais capazes.”Responder
- “A análise fatorial é usada para descobrir quantas dimensões um conjunto de itens está medindo.”Responder
- “Na teoria de resposta ao item, o escore de uma pessoa é simplesmente o número de itens que ela acertou.”Responder
- “Um alfa de Cronbach alto prova que o teste mede um único construto.”Responder
- “Modelos de TRI exigem que todos os examinandos respondam exatamente aos mesmos itens para que seus escores sejam comparáveis.”Responder
- “Um item com correlação item-total negativa deve ser mantido na escala porque aumenta a variabilidade dos escores.”Responder
Testes de inteligência
Testes de inteligência nasceram com Binet para identificar crianças que precisavam de apoio escolar e evoluíram para escalas como Stanford-Binet e Wechsler, com escores padronizados de média 100 e desvio 15. Spearman observou que desempenhos em tarefas diversas se correlacionam e propôs um fator geral, g, ao lado de habilidades específicas; modelos atuais distinguem inteligência fluida e cristalizada. Os escores são bastante estáveis da adolescência à vida adulta, mas não são fixos: educação, nutrição e ambiente os alteram, e as médias populacionais subiram ao longo do século XX em muitos países, o efeito Flynn. Escores de QI preveem desempenho escolar e profissional de forma moderada. O erro comum é tratar o QI como quantidade inata e imutável.
Afirmações deste tópico
- “Os escores de QI são bastante estáveis da adolescência à vida adulta.”Responder
- “A inteligência é fixada ao nascer e nenhuma experiência de vida altera o escore num teste de QI.”Responder
- “Nos testes de inteligência atuais, o QI é um escore de desvio com média 100 e desvio padrão 15 dentro de cada faixa etária.”Responder
- “O escore de QI mede toda a capacidade mental de uma pessoa, incluindo criatividade, sabedoria prática e habilidades sociais.”Responder
- “Os escores médios em testes de inteligência subiram ao longo do século XX em muitos países.”Responder
- “Desempenhos em tarefas cognitivas muito diferentes tendem a se correlacionar positivamente, o que deu origem à ideia de um fator geral de inteligência.”Responder
- “O QI medido aos quatro anos de idade prevê com precisão quase perfeita o QI que a pessoa terá na vida adulta.”Responder
- “O primeiro teste de inteligência de Binet e Simon foi criado para identificar crianças que precisavam de ensino especial, não para classificar toda a população.”Responder
Testes de personalidade, projetivos e pseudotestes
Inventários de personalidade por autorrelato, como os baseados no modelo dos cinco grandes fatores, derivam de análise fatorial de descrições de pessoas em várias línguas e apresentam boa fidedignidade e validade preditiva moderada. Técnicas projetivas, como as manchas de tinta de Rorschach e o desenho da figura humana, supõem que respostas a estímulos ambíguos revelem o inconsciente; as evidências de validade para diagnóstico são fracas ou inconsistentes, salvo alguns índices específicos. Tipologias populares como o MBTI têm fidedignidade teste-reteste baixa, categorias artificiais e pouco valor para prever desempenho no trabalho. Grafologia e astrologia não têm apoio empírico. O erro comum é confundir a sensação de que o resultado descreve bem a pessoa, o efeito Barnum, com validade.
Afirmações deste tópico
- “O MBTI é um bom preditor de desempenho no trabalho.”Responder
- “A análise da letra (grafologia) revela traços de personalidade.”Responder
- “O mapa astral de nascimento prevê traços de personalidade medidos por inventários psicológicos.”Responder
- “O teste das manchas de tinta de Rorschach diagnostica com precisão a maioria dos transtornos mentais.”Responder
- “O desenho de uma figura humana feito pela pessoa permite diagnosticar transtornos mentais com precisão.”Responder
- “Os cinco grandes fatores de personalidade foram identificados pela análise fatorial de adjetivos usados para descrever pessoas, em várias línguas.”Responder
- “As autodescrições de personalidade nos inventários dos cinco grandes fatores concordam de forma substancial com as descrições feitas por pessoas próximas.”Responder
Adaptação cultural e uso responsável
Um teste criado em outro país não pode ser apenas traduzido: adaptar exige tradução e retrotradução, revisão por especialistas, ajuste de itens que não fazem sentido na cultura de destino, estudo piloto e nova coleta de evidências de fidedignidade, validade e normas locais, porque equivalência linguística não garante equivalência de medida. Viés de item e funcionamento diferencial podem favorecer um grupo sem relação com o atributo. No Brasil, o uso profissional de testes é regulado pelo Conselho Federal de Psicologia por meio do SATEPSI, que lista os instrumentos com parecer favorável. Uso responsável inclui qualificação do aplicador, sigilo, devolutiva compreensível e decisões nunca baseadas num único escore. O erro comum é supor que uma boa tradução basta.
Afirmações deste tópico
- “A adaptação de um teste para outra língua costuma incluir tradução, tradução reversa e revisão por um comitê de especialistas.”Responder
- “Um teste composto apenas por figuras, sem nenhuma palavra, é totalmente livre de influência cultural.”Responder
- “Um teste psicológico estrangeiro pode ser usado no Brasil sem estudos de adaptação, desde que seja bem traduzido.”Responder
- “Um item que é mais fácil para um grupo do que para outro, mesmo entre pessoas com o mesmo nível no construto, apresenta funcionamento diferencial do item.”Responder
- “Se dois grupos têm médias diferentes num teste, isso por si só prova que o teste é enviesado contra o grupo de média menor.”Responder
- “Um único escore de teste é base suficiente para decisões importantes sobre uma pessoa, como diagnóstico ou seleção, sem outras fontes de informação.”Responder
- “Depois de traduzido e adaptado, um teste pode usar as normas do país de origem para interpretar os escores da nova população.”Responder
- “Para comparar médias de grupos num construto latente, é preciso evidência de que o instrumento mede o construto de modo equivalente nos grupos.”Responder