Gerenciar dados em falta é um dos desafios mais comuns em grandes pesquisas psicológicas.Quando os participantes não completam todos os itens da pesquisa, ignoram questões sensíveis ou desistem de estudos longitudinais, os pesquisadores enfrentam decisões críticas que podem impactar significativamente a validade e confiabilidade de seus achados.O tratamento adequado de respostas incompletas não é meramente uma consideração técnica – é fundamental garantir que as conclusões da pesquisa reflitam com precisão os fenômenos estudados.Este guia abrangente fornece estratégias práticas e baseadas em evidências para pesquisadores e estudantes que lidam com dados em falta em conjuntos de dados de pesquisas extensas.

Compreender os Mecanismos de Dados em Falta

Antes de implementar qualquer estratégia de dados em falta, os pesquisadores devem entender os mecanismos subjacentes que geram falta. Rubin (1976) classificou os problemas de dados em três categorias, cada uma com implicações distintas para análise e interpretação. O mecanismo que regula por que os dados estão faltando – conhecido como o mecanismo de dados em falta ou mecanismo de resposta – determina quais métodos estatísticos produzirão inferências válidas.

Faltando Completamente em Aleatório (MCAR)

Se a probabilidade de estar faltando é a mesma para todos os casos, então os dados são ditos estar faltando completamente ao acaso (MCAR). Isto representa a suposição mais restritiva sobre dados faltando. Isto efetivamente implica que as causas dos dados faltando não estão relacionadas com os dados. Em pesquisas psicológicas, MCAR pode ocorrer quando as respostas do questionário são perdidas aleatoriamente devido a erros técnicos, como uma falha no servidor que afeta um subconjunto aleatório de participantes, ou quando os materiais de pesquisa são acidentalmente danificados durante a coleta de dados.

Quando os dados são MCAR, o fato de os dados estarem faltando é independente dos dados observados e não observados. Isto significa que não existem diferenças sistemáticas entre os participantes com dados em falta e aqueles com dados completos. Quando os dados são MCAR, os dados que permanecem podem ser considerados uma amostra aleatória simples do conjunto de dados completo de interesse. Embora esta característica torne os dados MCAR relativamente simples de lidar, MCAR é geralmente considerado como uma suposição forte e muitas vezes irrealista na maioria dos contextos de pesquisa psicológica.

Faltando completamente ao acaso (MCAR) é o único mecanismo de dados em falta que pode ser verificado. Esta suposição pode ser testada separando os casos em falta e os casos completos e examinando as características do grupo. Se estes grupos diferem significativamente sobre as variáveis observadas, a suposição MCAR não se mantém.

Faltando em Aleatório (MAR)

Se a probabilidade de estar faltando é a mesma apenas dentro de grupos definidos pelos dados observados, então os dados estão faltando ao acaso (MAR). MAR é uma classe muito mais ampla do que MCAR. Sob MAR, o faltamento pode ser sistematicamente relacionado com variáveis observadas no conjunto de dados, mas não com os próprios valores não observados.

Em inquéritos psicológicos, o MAR ocorre frequentemente quando certos grupos demográficos têm mais ou menos probabilidade de responder a questões específicas. Por exemplo, um registro examinando a depressão pode encontrar dados que são MAR se os participantes do sexo masculino têm menos probabilidade de completar um inquérito sobre a gravidade da depressão do que as participantes do sexo feminino. A distinção chave é que se a probabilidade de conclusão do inquérito está relacionada com o seu sexo (que é totalmente observado), mas não com a gravidade da sua depressão, então os dados podem ser considerados como MAR.

Como a MAR é uma suposição impossível de verificar estatisticamente, devemos contar com sua razoabilidade substantiva, pois os pesquisadores devem utilizar seu conhecimento do contexto de pesquisa e do comportamento dos participantes para avaliar se a suposição da MAR é plausível, e a plausibilidade da MAR é melhorada, incluindo no modelo de imputação qualquer variável que possa estar relacionada à chance de falta.

Não Faltando ao Aleatório (MNAR)

O MNAR significa que a probabilidade de estar faltando varia por razões que não conhecemos, e quando os dados são MNAR, o fato de os dados estarem faltando está sistematicamente relacionado aos dados não observados, ou seja, o desfalecimento está relacionado a eventos ou fatores que não são medidos pelo pesquisador, o que representa o cenário mais desafiador para a análise dos dados perdidos.

Um exemplo de MNAR em pesquisa de opinião pública ocorre se aqueles com opiniões mais fracas responderem menos frequentemente. Em pesquisas psicológicas, MNAR ocorre frequentemente com tópicos sensíveis. O registro de depressão pode encontrar dados que são MNAR se os participantes com depressão grave são mais propensos a recusar-se a completar o inquérito sobre a gravidade da depressão. Da mesma forma, indivíduos com maior renda podem ser menos propensos a relatar seus ganhos, ou aqueles com problemas de abuso de substâncias mais graves podem pular questões sobre seus padrões de uso.

O MNAR é o caso mais complexo. Como o omisso depende de valores não observados, não pode ser completamente abordado através de técnicas estatísticas padrão. O fato de as fontes de dados em falta serem elas mesmas não medidas significa que (em geral) esta questão não pode ser tratada em análise e a estimativa de efeito provavelmente será enviesada.

Realizar uma análise de dados abrangente e em falta

Antes de selecionar um método de tratamento de dados em falta, os pesquisadores devem realizar uma análise aprofundada da extensão, padrão e mecanismos potenciais de falta em seu conjunto de dados, sendo essa fase diagnóstica crucial para tomar decisões metodológicas informadas.

Quantificando os Dados em Falta

Comece calculando a porcentagem de dados em falta para cada variável em sua pesquisa. Documente tanto o desconhecimento do nível de itens (a proporção de respostas em falta para perguntas individuais) quanto o desfalque do nível de casos (a proporção de participantes com quaisquer dados em falta). Compreender a distribuição de faltas entre variáveis ajuda a identificar quais itens são particularmente problemáticos e pode exigir o redimensionamento em futuros esforços de coleta de dados.

Criar padrões de dados em falta para identificar se o faltas ocorre em combinações sistemáticas. Por exemplo, os participantes que ignoram uma questão sensível tendem a ignorar outros? Alguns grupos demográficos são mais propensos a ter dados incompletos? Pacotes de software estatísticos como R, SPSS e Stata oferecem ferramentas de visualização que podem exibir esses padrões graficamente, facilitando a identificação de tendências sistemáticas.

Testes de Mecanismos de Dados em Falta

Embora não se possa provar definitivamente que os dados são MAR ou MNAR, pode-se testar se os dados são MCAR. O teste MCAR de Little é um teste multivariado, que avalia os subgrupos dos dados que compartilham o mesmo padrão de dados em falta. Um teste de distribuição qui-quadrado é utilizado para testar a hipótese nula de que os dados são MCAR. Um resultado significativo sugere que os dados não são MCAR, indicando mecanismos de MNAR ou MAR.

Além disso, comparar os participantes com dados completos versus incompletos em todas as variáveis observadas.Usar testes t para variáveis contínuas e testes qui-quadrado para variáveis categóricas para determinar se aqueles com dados perdidos diferem sistematicamente daqueles sem. Diferenças significativas sugerem que os dados não são MCAR e que métodos de dados perdidos mais sofisticados são necessários.

Documentando os Padrões de Falta

Mantenha documentação detalhada da análise de dados em falta, incluindo a porcentagem de falta para cada variável, os resultados dos testes MCAR e quaisquer padrões ou relações observadas entre falta e outras variáveis. Esta documentação serve para vários propósitos: informa sua escolha do método de manipulação de dados em falta, fornece transparência para revisores e leitores e ajuda a identificar potenciais fontes de viés em seus resultados.

Métodos de imputação para dados em falta

A imputação envolve a substituição de valores em falta por valores estimados com base nas informações disponíveis, cuja sofisticação e adequação dos métodos de imputação variam consideravelmente, com implicações importantes para a validade das análises subsequentes.

Métodos de imputação simples

Métodos de imputação simples substituem cada valor em falta por um único valor estimado. Embora seja fácil de implementar, esses métodos têm limitações significativas que os pesquisadores devem entender antes de usá-los.

[[FLT: 0]]Imputação média ou mediana substitui os valores em falta pela média (para variáveis contínuas) ou mediana (para distribuições distorcidas) dos valores observados. Este método só é apropriado quando os dados são MCAR e falta é mínima (tipicamente inferior a 5%). O inconveniente primário é que a imputação média reduz artificialmente a variância da variável imputada, distorce as correlações com outras variáveis e subestima os erros padrão, levando a inferências estatísticas excessivamente confiantes.

Regressão Imputação usa modelos de regressão para prever valores em falta com base em outras variáveis no conjunto de dados. Para cada variável com dados em falta, um modelo de regressão é ajustado usando casos com dados completos, e este modelo é então usado para predizer valores em falta. Embora mais sofisticado do que a média de imputação, a imputação de regressão única ainda subestima a variância e incerteza porque trata valores imputados como se fossem realmente observados.

A imputação do Hot Deck substitui os valores em falta por valores observados de respondentes semelhantes (doadores). A similaridade pode ser definida por correspondência em características demográficas, padrões de resposta ou outras variáveis relevantes. Este método preserva a distribuição da variável que está sendo imputada, mas não tem em conta a incerteza de imputação.

Imputação Múltipla

A imputação múltipla (MI) é uma ferramenta útil para lidar com dados em falta, dada a sua atrativa propriedades teóricas, a sua capacidade de lidar com qualquer padrão de dados em falta, e as inúmeras plataformas de computação que estão disponíveis na prática. Ao contrário de métodos de imputação simples, a imputação múltipla reconhece a incerteza inerente à estimativa de valores em falta.

Com o IM, os valores em falta são imputados a partir da distribuição preditiva bayesiana dos dados em falta, dada a dados observados, para criar conjuntos de dados imputados por K. Normalmente, os pesquisadores criam entre 5 e 20 conjuntos de dados imputados, embora as recomendações recentes sugiram que mais imputações podem ser benéficas quando a proporção de dados em falta é elevada. O modelo de análise substantiva é então ajustado a cada um destes por sua vez, dando K estimativas diferentes dos parâmetros do modelo. Estas estimativas são então combinadas usando as regras de Rubin para produzir estimativas de parâmetros finais e erros padrão que refletem adequadamente tanto a variabilidade amostral quanto a incerteza de imputação.

Vantagens de múltiplas imputações:

  • Produz estimativas de parâmetros não enviesadas segundo os pressupostos do MAR
  • Fornece erros padrão válidos que respondem pela incerteza de imputação
  • Pode lidar com padrões de dados complexos em falta
  • Permite aos pesquisadores usar métodos de análise de dados completos padrão após imputação
  • Amplamente suportado por pacotes de software estatístico

Apesar da popularidade da imputação múltipla de dados em falta, sua aceitação e aplicação ainda defasam em estudos em grande escala com conjuntos de dados complicados. A imputação múltipla de regressão sequencial, implementada em software público disponível, pode lidar com a não resposta em pesquisas e construir um banco de dados centralizado completo.

Implementação de múltiplas imputações em pesquisas psicológicas

Ao implementar múltiplas imputações para dados de levantamento psicológico, os pesquisadores devem seguir estes passos fundamentais:

1. Especifique o Modelo de Imputação: Incluir todas as variáveis que serão usadas em análises subsequentes, mais variáveis auxiliares que estão correlacionadas com dados em falta ou falta. O modelo de imputação deve ser mais geral do que o modelo de análise, e MI facilita análises de dados completas com fins gerais. Incluir variáveis que predizem falta mesmo que não façam parte do seu modelo de análise substantivo.

2. Escolha um Método de Imputação: Para conjuntos de dados com múltiplas variáveis contendo dados em falta, a imputação multivariada por equações encadeadas (MICE), também conhecida como regressão sequencial imputação múltipla, é muitas vezes a abordagem mais flexível. MICE imputa valores em falta variável por variável, utilizando modelos de regressão apropriados para cada tipo de variável (regressão linear para variáveis contínuas, regressão logística para variáveis binárias, regressão multinomial para variáveis categóricas).

3. Determinar o Número de Imputações: Embora as diretrizes mais antigas sugerissem que 5-10 imputações eram suficientes, as recomendações atuais sugerem usar mais imputações quando a proporção de dados em falta é alta. Uma regra prática é usar pelo menos tantas imputações quanto a porcentagem de casos incompletos (por exemplo, se 30% dos casos têm dados em falta, use pelo menos 30 imputações).

4. Verifique Convergence:] Examine traçados e outros diagnósticos para garantir que o algoritmo de imputação convergiu. A maioria dos pacotes de software fornecem ferramentas diagnósticas para avaliar se o processo de imputação se estabilizou.

5. Validar Valores Imputados: Compare as distribuições de valores imputados com valores observados para garantir que sejam plausíveis. Examine se valores imputados preservam relações entre variáveis que existem nos dados observados.

Considerações para dados complexos da pesquisa

Métodos de imputação múltipla (MI) são bem adequados para uma variedade de padrões de falta, mas não são tão facilmente adaptados a projetos de amostragem complexos. Grandes pesquisas psicológicas muitas vezes empregam projetos de amostragem complexos com estratificação, agrupamento e probabilidade desigual de seleção. Ao implementar múltiplas imputações com tais projetos, os pesquisadores devem incorporar características de desenho de pesquisa no modelo de imputação.

Incluir variáveis de design (indicadores de estratos, identificadores de clusters) e pesos amostrais no modelo de imputação para garantir que os valores imputados reflitam a estrutura complexa da pesquisa. Alguns pacotes de software oferecem procedimentos especializados para imputação múltipla com dados de pesquisa que automaticamente respondem por essas características.

Informação completa Probabilidade máxima (FIML)

Informação completa O máximo de probabilidade representa uma alternativa aos métodos baseados em imputação para lidar com dados em falta. Em vez de preencher valores em falta, o FIML estima parâmetros do modelo diretamente usando todas as informações disponíveis de cada caso.

Como funciona o FIML

O FIML constrói uma função de verossimilhança para cada caso com base nas variáveis observadas para esse caso, e os casos com dados completos contribuem com informações sobre todos os parâmetros, enquanto os casos com dados em falta contribuem com informações sobre parâmetros que podem ser estimados a partir de suas variáveis observadas, maximizando a soma dessas contribuições individuais de verossimilhança para obtenção de estimativas de parâmetros.

Como a imputação múltipla, o FIML produz estimativas de parâmetros sem distorções sob os pressupostos do MAR. Sob o MAR, os MDTs sofisticados retornaram estimativas mais próximas de seus valores originais, referindo-se a métodos incluindo o FIML. O método é particularmente adequado para modelagem de equações estruturais e outras análises baseadas em modelos.

Vantagens e Limitações do FIML

Vantagens:

  • Não necessita de criar vários conjuntos de dados
  • Produz estimativas não enviesadas no âmbito do MAR
  • Computacionalmente eficiente para muitos modelos
  • Fornece erros padrão que respondem por dados em falta
  • Bem integrado em software de modelagem de equações estruturais

Limitações:

  • Requer que o modelo de análise possa ser especificado como uma função de probabilidade
  • Menos flexível do que a imputação múltipla para modelos de análise complexos
  • Não é possível incorporar facilmente variáveis auxiliares que não fazem parte do modelo substantivo
  • Pode ser computacionalmente intensivo para conjuntos de dados muito grandes ou modelos complexos

O FIML é particularmente apropriado quando se realiza modelagem de equações estruturais, modelagem de curvas de crescimento ou outras análises onde o modelo substantivo pode ser diretamente estimado usando a máxima verossimilhança.Para pesquisadores que usam softwares como Mplus, lavaan em R ou AMOS, o FIML é frequentemente o método padrão para lidar com dados em falta e requer especificação adicional mínima.

Métodos de exclusão: Quando e como usá-los

Os métodos de exclusão envolvem a remoção de casos ou variáveis com dados em falta da análise, embora conceitualmente simples, esses métodos têm limitações importantes que os pesquisadores devem entender.

Supressão Listal (Análise de Casos Completa)

A exclusão listada remove qualquer caso que tenha dados em falta sobre qualquer variável incluída na análise. A exclusão listada requer que os dados sejam MCAR para não introduzir viés nos resultados.Quando os pesquisadores realizam análises utilizando esta 'amostra aleatória' de registros completos, as análises não levarão a estimativas de parâmetros enviesados, embora testes de significância estatística tenham menor poder devido à perda de observações.

No entanto, Na prática, os dados MCAR são muito raros. É por isso que não recomendamos métodos de exclusão – devido à perda de poder estatístico resultante, restrições na generalização dos resultados, e a probabilidade de que a suposição MCAR não seja cumprida. Quando os dados não são MCAR, a exclusão listwise pode produzir estimativas enviesadas e reduzir a generalização dos achados.

Quando a exclusão em lista pode ser adequada:

  • Os dados em falta são verdadeiramente MCAR (verificados através de testes estatísticos)
  • A proporção de dados em falta é muito pequena (tipicamente inferior a 5%)
  • O tamanho da amostra é suficientemente grande para que a eliminação não reduza substancialmente o poder estatístico
  • Métodos mais sofisticados não são viáveis devido a limitações de software ou experiência

Deleção emparelhada (Análise de Casos Disponíveis)

A exclusão emparelhada utiliza todos os dados disponíveis para cada análise, calculando-se a estatística com base em casos com dados completos para as variáveis específicas envolvidas. Por exemplo, ao calcular uma matriz de correlação, a correlação entre as variáveis A e B utiliza todos os casos com dados tanto de A quanto de B, enquanto a correlação entre A e C utiliza todos os casos com dados de A e C.

Embora a exclusão em par use mais dados do que a deleção em lista, ela pode produzir resultados inconsistentes. Diferentes análises podem ser baseadas em diferentes subconjuntos da amostra, as matrizes de correlação podem não ser definidas e erros padrão podem estar incorretos. Por estas razões, a exclusão em par geralmente não é recomendada para pesquisas psicológicas.

Manuseamento de Tipos Específicos de Dados Desaparecidos em Pesquisas Psicológicas

Padrões de Padrões e Perguntas Condicionais

Muitos inquéritos psicológicos incluem padrões de skip onde determinadas perguntas são feitas apenas de participantes que atendem a critérios específicos. Por exemplo, perguntas sobre estresse parental são relevantes apenas para os participantes que têm filhos. Variáveis de Skip-padrão são comuns em inquéritos. Para modelos de MI, quando variáveis skip-pattern com dados faltando, é necessário cuidado extra.

Ao lidar com variáveis de padrão de salto, distinguir entre falta estrutural (dados que não estão em falta por design porque a questão não era aplicável) e não resposta do item (dados que estão em falta porque um participante elegível não respondeu). O falta estrutural deve ser normalmente codificado de forma diferente do item não resposta e pode exigir tratamento especial em modelos de imputação.

Perguntas Sensíveis

Perguntas sobre renda, uso de substâncias, sintomas de saúde mental, histórico de trauma e outros temas sensíveis muitas vezes têm maiores índices de dados perdidos. Esse desaparecimento é frequentemente MNAR, pois indivíduos com valores mais extremos podem ser menos propensos a responder.

  • Incluir variáveis que possam prever tanto a variável sensível quanto a vontade de responder em seu modelo de imputação
  • Considerar a realização de análises de sensibilidade para avaliar como os resultados podem mudar sob diferentes pressupostos MNAR
  • Seja transparente sobre as limitações da sua abordagem de manipulação de dados em falta para variáveis sensíveis
  • Considere se a alta taxa de falta sugere problemas com o desenho de perguntas ou administração de inquéritos que devem ser abordados na futura coleta de dados

Dados em Falta Longitudinal

Os inquéritos psicológicos longitudinais enfrentam desafios adicionais em falta, incluindo a não resposta à onda (participantes que faltam ondas inteiras de recolha de dados) e a fadiga (participantes que abandonam permanentemente).

  • Incluir preditores variáveis no tempo e invariantes no tempo de falta em modelos de imputação
  • Considere se falta em um ponto temporal prediz falta em pontos temporais posteriores
  • Use métodos especificamente projetados para dados longitudinais, como modelos de curva de crescimento com FIML ou imputação múltipla que representem a estrutura temporal dos dados
  • Analisar se o atrito está relacionado à trajetória do desfecho, o que sugere MNAR

Software e ferramentas para análise de dados em falta

Os pacotes de software estatístico modernos fornecem amplas capacidades para análise de dados em falta. Compreender os pontos fortes e limitações de diferentes ferramentas ajuda os pesquisadores a selecionar métodos adequados para suas necessidades específicas.

Pacotes R

O pacote ] mice (Multivariate Imputation by Chained Equations) é amplamente utilizado para imputação múltipla e oferece flexibilidade na especificação de modelos de imputação para diferentes tipos variáveis. O pacote Amelia[ implementa múltiplas imputações usando um algoritmo de maximização de expectativa e é particularmente eficiente para grandes conjuntos de dados. O pacote MissForest[[] usa algoritmos florestais aleatórios para imputação e pode lidar com relações complexas não lineares. Os pacotes naniar[ e VIM[] fornecem excelentes ferramentas de visualização para explorar padrões de dados em falta.

SPSS

O SPSS inclui várias capacidades de imputação através do módulo Análise de Valores Desaparecidos. O software fornece especificação automática de modelo de imputação, embora os pesquisadores devam revisar e modificar cuidadosamente esses padrões com base em seu conhecimento substantivo. O SPSS também oferece o teste MCAR de Little e várias visualizações de padrões de dados em falta.

Stata

O conjunto de comandos mi do Stata oferece capacidades de imputação múltiplas abrangentes, incluindo suporte para projetos complexos de pesquisas. O Stata integra múltiplas imputações com muitos procedimentos de análise padrão, tornando-se simples analisar conjuntos de dados imputados.

Mplus e outros softwares SEM

Software de modelagem de equações estruturais como Mplus, lavaan (R) e AMOS normalmente implementam o FIML como o método padrão para o manuseio de dados em falta. Esses programas facilitam a obtenção de estimativas válidas sob MAR sem imputar explicitamente valores em falta.

Prevenção de dados em falta através do projeto de pesquisa

Embora os métodos estatísticos possam atenuar o impacto da falta de dados, a prevenção por meio de levantamento pensativo é sempre preferível. Os pesquisadores devem implementar estratégias para minimizar a falta de dados durante as fases de planejamento e coleta de dados.

Estratégias de Desenho de Questionários

Instruções claras e palavras de perguntas: Questões ambíguas ou confusas aumentam a probabilidade de os participantes pularem itens. Pilot teste todas as perguntas de pesquisa com membros da sua população alvo para identificar palavras confusas, opções de resposta pouco claras ou outros problemas que podem levar a dados em falta.

Opções de resposta apropriadas: Certifique-se de que as opções de resposta são exaustivas e mutuamente exclusivas. Inclua opções como "preferir não responder" ou "não aplicável" quando apropriado, pois estas permitem aos participantes fornecer respostas significativas em vez de deixar itens em branco.

Flow Lógico e Padrões de Pular: Design pulam padrões que são fáceis de seguir para os participantes. Em pesquisas on-line, implementem lógica de skip automática para que os participantes vejam apenas questões relevantes para eles. Em pesquisas de papel, use pistas visuais claras e instruções para orientar os participantes através de padrões de skip.

Pergunta Order: Coloque questões sensíveis ou potencialmente onerosas mais tarde na pesquisa, após a relação ter sido estabelecida. No entanto, equilibre isso contra o risco de falta de dados relacionados com fadiga no final de longas pesquisas.

Considerações sobre interface de usuário para pesquisas online

Para pesquisas psicológicas online, a interface do usuário impacta significativamente a completude dos dados:

  • Indicadores de Progresso: Mostrar aos participantes até onde progrediram através da pesquisa para manter a motivação
  • Otimização móvel:Garanta que as pesquisas sejam exibidas corretamente em smartphones e tablets, pois as experiências móveis pobres aumentam as taxas de abandono
  • Campos Obrigatórios: Usar campos obrigatórios criteriosamente— forçar respostas a cada pergunta pode aumentar a evasão, mas permitir que muitas perguntas opcionais aumentem a não resposta do item
  • Salvar e retomar: Permitir que os participantes salvem o seu progresso e regressem mais tarde, especialmente para longas pesquisas
  • Mensagens de erro: Fornecer mensagens de erro claras e não julgados quando os participantes ignorarem os itens necessários ou fornecerem respostas inválidas

Participação no engajamento e na retenção

Manter o engajamento dos participantes reduz tanto a não resposta do item quanto o atrito do estudo:

  • Comprimento do inquérito: Mantenha as pesquisas o mais breve possível durante a coleta de dados necessários. Considere se todos os itens planejados são realmente essenciais
  • Incentivos: Fornecer uma compensação adequada para o tempo e esforço dos participantes.A pesquisa sugere que os incentivos podem melhorar as taxas de resposta e reduzir o atrito em estudos longitudinais
  • Comunicação: Em estudos longitudinais, manter contato regular com participantes entre as ondas de coleta de dados. Envie lembretes, boletins informativos ou atualizações sobre o progresso do estudo
  • Flexibilidade: Oferecer múltiplos modos de participação (online, telefone, papel) quando possível, pois isso acomoda diferentes preferências e circunstâncias participantes

Coletando Variáveis Auxiliares

Inclua variáveis em seu inquérito que podem ajudar a prever o omisso e melhorar modelos de imputação, mesmo que essas variáveis não sejam centrais para suas questões primárias de pesquisa. Variáveis demográficas, construtos psicológicos relacionados e indicadores comportamentais podem servir como variáveis auxiliares que fortalecem o manuseio de dados em falta.

Reportando Dados Desaparecidos em Publicações de Pesquisa

A comunicação transparente dos dados em falta e como foi tratada é essencial para a integridade e reprodutibilidade da pesquisa. Editores de periódicos, revisores e leitores necessitam dessas informações para avaliar a validade dos achados da pesquisa.

Elementos essenciais a relatar

Extensão de Dados em Falta: Relate a porcentagem de dados em falta para cada variável incluída em suas análises. Forneça estatísticas de falta tanto de nível de item quanto de caso. Se usar a exclusão em lista, informe quantos casos foram excluídos e qual a porcentagem da amostra original que isso representa.

Padrões de Dados em Falta: Descrever padrões de falta. Algumas variáveis são mais prováveis de estarem faltando juntas? Grupos demográficos particulares têm taxas mais elevadas de dados em falta? Existem diferenças sistemáticas entre participantes com dados completos versus incompletos?

Mecanismo de dados em falta: Relatório de resultados de testes para MCAR (como o teste MCAR de Little) e descrever a sua avaliação de se os dados são provavelmente MAR ou MNAR. Explique o raciocínio por trás das suas conclusões sobre o mecanismo de dados em falta.

Método de dados em falta:]Descrição clara do método usado para lidar com dados em falta.Se usando múltiplas imputações, especifique o modelo de imputação (que variáveis foram incluídas, quais tipos de modelos de regressão foram usados para diferentes tipos de variáveis), o número de imputações criadas e o software utilizado.Se usando o FIML, descreva como o modelo de análise foi especificado. Se usando métodos de exclusão, justifique por que essa abordagem foi escolhida.

Análises de sensibilidade: Quando possível, conduzir e relatar análises de sensibilidade que examinam se os resultados são robustos a diferentes pressupostos ou métodos de dados em falta. Isto é particularmente importante quando os dados podem ser MNAR ou quando a proporção de dados em falta é substancial.

Seguir as Orientações relativas à comunicação de informações

Várias diretrizes de relatórios abordam dados em falta. As diretrizes STROBE (Fortalecimento do Relatório de Estudos Observacionais em Epidemiologia) recomendam relatar o número de participantes com dados em falta para cada variável de interesse e explicar como os dados em falta foram abordados. As normas de relato de artigos da APA Journal (JARS) enfatizam de forma similar a importância de descrever dados em falta e os métodos usados para lidar com isso.

Tópicos Avançados e Considerações Especiais

Análise de sensibilidade para dados MNAR

Quando os dados podem ser MNAR, métodos padrão como imputação múltipla e FIML podem produzir estimativas tendenciosas.A análise de sensibilidade envolve examinar como os resultados mudam sob diferentes pressupostos sobre o mecanismo de dados em falta.Modelos de mistura de padrões e modelos de seleção fornecem frameworks para a realização de tais análises, embora eles exijam fazer suposições intestáveis sobre a relação entre falta e valores não observados.

Uma abordagem prática para análise de sensibilidade envolve a realização de múltiplas imputações em diferentes cenários. Por exemplo, se você suspeitar que participantes com sintomas de depressão mais graves eram menos propensos a completar um questionário de depressão, você pode criar conjuntos de dados imputados onde os escores de depressão ausentes são sistematicamente mais elevados do que seria previsto sob MAR. Comparando resultados em todos esses cenários ajuda a avaliar a robustez de suas conclusões.

Dados em Falta em Modelos Multinível

Pesquisas psicológicas geralmente têm estruturas multinível, como estudantes aninhados dentro de escolas ou medições repetidas aninhadas dentro de indivíduos. Dados em falta em contextos multinível podem ocorrer em diferentes níveis (por exemplo, variáveis de nível individual ausentes, variáveis de nível de cluster ausentes ou clusters inteiros ausentes). A imputação múltipla para dados multinível requer abordagens especializadas que respondem pela estrutura hierárquica. Pacotes de software como o pacote de mouses em comandos mi do R e do Stata suportam imputação múltipla multinível.

Desenhos de Dados em Falta Planejados

Os pesquisadores às vezes criam intencionalmente dados em falta através de projetos de dados em falta planejados. O desfalque planejado é uma estratégia de desenho de pesquisa, empregada em pesquisas de pesquisa, em que os dados são intencionalmente deixados de lado para reduzir a carga, preservando a capacidade de estimar parâmetros para o conjunto completo de itens em toda a amostra. Esses projetos podem reduzir a carga participante e os custos da pesquisa, mantendo o poder estatístico para análises-chave. No entanto, a não resposta de itens pode comprometer a qualidade das estimativas após a imputação múltipla, especialmente quando a quantidade total de dados em falta de ambas as fontes é alta.

Métodos de aprendizagem de máquina para imputação

Os recentes desenvolvimentos no aprendizado de máquina introduziram novos métodos de imputação que podem capturar relações complexas não lineares entre variáveis. Os resultados indicam que a imputação de MissForest foi melhor realizada, seguida pela MICE em um estudo comparativo de técnicas de imputação. Impputação baseada em florestas aleatórias, imputação de rede neural e outros métodos de aprendizagem de máquinas mostram promessa, particularmente para grandes conjuntos de dados com relações variáveis complexas. No entanto, esses métodos podem ser mais difíceis de implementar e interpretar do que abordagens tradicionais.

Erros comuns e como evitá - los

Erro 1: Ignorar dados em falta

Alguns pesquisadores procedem com análises sem reconhecer ou abordar dados em falta, usando implicitamente a exclusão listada sem justificação. Esta abordagem arrisca resultados enviesados e poder estatístico reduzido. Sempre conduza uma análise de dados em falta e escolha explicitamente um método de tratamento de dados em falta com base nas características de seus dados.

Erro 2: Usar a simples imputação sem reconhecer limitações

A imputação média e outros métodos simples de imputação simples ainda são comumente usados apesar de suas limitações bem documentadas. Se você precisa usar imputação simples devido a restrições de software ou experiência, reconheça as limitações em seu relatório e interprete os resultados com cautela.

Erro 3: Implantar e Apagar

Alguns pesquisadores imputam dados em falta, mas então excluem casos com valores imputados de certas análises. Isto derrota o propósito da imputação e pode introduzir viés. Uma vez que você criou conjuntos de dados imputados, use-os consistentemente em todas as análises.

Erro 4: Modelos de Imputação Inadequados

Usando modelos de imputação que incluem apenas as variáveis do seu modelo de análise, sem variáveis auxiliares, pode reduzir a qualidade das imputações. Incluir variáveis que predizem o omisso e variáveis que estão correlacionadas com variáveis que contêm dados em falta, mesmo que essas variáveis auxiliares não façam parte de sua análise substantiva.

Erro 5: Falha em Verificar a Qualidade da Imputação

Examine sempre as distribuições dos valores imputados e compare- os com os valores observados. Verifique se existem valores imputados implausíveis (por exemplo, valores negativos para variáveis que devem ser positivas, valores fora do intervalo possível). Verifique se as relações entre variáveis são preservadas em conjuntos de dados imputados.

Fluxo de trabalho prático para gerenciar dados em falta

Aqui está um fluxo de trabalho passo a passo que integra as estratégias discutidas ao longo deste artigo:

Passo 1: Explorar e documentar dados em falta

  • Calcular a percentagem de dados em falta para cada variável
  • Identificar os padrões de dados em falta usando ferramentas de visualização
  • Comparar os participantes com dados completos versus incompletos sobre as variáveis observadas
  • Realizar o teste MCAR de Little
  • Documentar todas as conclusões num relatório de análise de dados em falta

Passo 2: Avaliar o mecanismo de dados em falta

  • Com base em testes estatísticos e conhecimentos substantivos, determinar se os dados são prováveis MCAR, MAR ou MNAR
  • Identificar variáveis que predizem o desaparecimento
  • Considere se diferentes variáveis podem ter diferentes mecanismos de dados em falta

Passo 3: Selecione um método de dados em falta apropriado

  • Se os dados forem MCAR e o omisso for mínimo (<5%), a eliminação em lista pode ser aceitável
  • Se os dados forem MAR, use imputação múltipla ou FIML
  • Se os dados puderem ser MNAR, planeie análises de sensibilidade
  • Considere a complexidade do seu modelo de análise e software disponível ao escolher entre imputação múltipla e FIML

Passo 4: Implementar o método de dados em falta

  • Para imputação múltipla: especificar o modelo de imputação, determinar o número de imputações, executar o algoritmo de imputação, verificar convergência e validar valores imputados
  • Para o FIML: especificar o modelo de análise para usar todos os dados disponíveis e verificar se o software está implementando corretamente o FIML

Passo 5: Análises de conduta

  • Realize suas análises planejadas usando os conjuntos de dados imputados ou a estimativa FIML
  • Combinar os resultados corretamente entre conjuntos de dados imputados usando as regras de Rubin
  • Comparar resultados com análise de caso completa para avaliar o impacto do tratamento de dados em falta

Etapa 6: Análises de Sensibilidade de Conduta

  • Se os dados podem ser MNAR, examinar como os resultados mudam sob diferentes pressupostos
  • Tente métodos alternativos de dados em falta para avaliar robustez
  • Examinar se os resultados diferem para subgrupos com diferentes padrões de falta

Etapa 7: Relatar os Resultados Transparentemente

  • Descrever a extensão e os padrões dos dados em falta
  • Relate a sua avaliação do mecanismo de dados em falta
  • Explicar o método de dados em falta utilizado e justificar esta escolha
  • Apresentar resultados de análises de sensibilidade
  • Discutir limitações relacionadas com dados em falta

Recursos para uma aprendizagem mais aprofundada

Para pesquisadores que buscam aprofundar sua compreensão dos métodos de dados em falta, vários recursos excelentes estão disponíveis:

Livros: "Flexible Imputation of Missing Data" de Stef van Buuren fornece cobertura abrangente de múltiplas imputações com exemplos práticos em R. "Análise estatística com dados em falta" de Roderick Little e Donald Rubin oferece a base teórica para métodos de dados em falta modernos. "Aplicada Análise de Dados em falta" de Craig Enders apresenta explicações acessíveis com exemplos relevantes para a pesquisa em ciências sociais.

Recursos on-line: O Imputação flexível do livro online de dados em falta por Stef van Buuren está disponível gratuitamente e inclui exemplos de código R. O Site de dados em falta mantido por pesquisadores da Universidade de Bristol fornece tutoriais, guias de software e trabalhos de pesquisa recentes.

Documentação de Software: A documentação para o pacote de camundongos em R, comandos do Stata e Análise de Valores Desaparecidos do SPSS incluem tutoriais e exemplos que podem ajudar os pesquisadores a implementar esses métodos.

Obras e Cursos: Muitas universidades e organizações profissionais oferecem oficinas sobre análise de dados em falta.O Instituto de Verão em Métodos de Pesquisa Social da Universidade de Michigan, o Programa de Verão ICPSR, e várias plataformas on-line oferecem cursos especificamente focados em dados em falta.

Conclusão

Gerenciar dados em falta em grandes pesquisas psicológicas requer atenção cuidadosa tanto à metodologia estatística quanto ao desenho da pesquisa. Compreender os mecanismos que geram dados em falta – MCAR, MAR e MNAR – é fundamental para selecionar métodos de manuseio apropriados. Embora abordagens simples como a deleção em listwise permaneçam comuns, métodos modernos como a imputação múltipla e a FIML oferecem vantagens substanciais em termos de redução de viés e preservação do poder estatístico.

A escolha do método de dados em falta deve ser guiada pelas características dos seus dados, pelos pressupostos que está disposto a fazer e pela complexidade das suas análises. A imputação múltipla oferece flexibilidade e pode lidar com padrões de dados em falta complexos, tornando-o adequado para a maioria das pesquisas psicológicas. O FIML fornece uma alternativa eficiente na realização de análises baseadas em modelos, como a modelagem de equações estruturais. Independentemente do método escolhido, a transparência na comunicação de como os dados em falta foram tratados é essencial para a integridade da pesquisa.

A prevenção através de um design de pesquisa pensativo continua a ser a melhor estratégia para gerenciar dados em falta. Textos claros de perguntas, interfaces amigáveis, incentivos adequados e estratégias para manter o engajamento dos participantes podem reduzir substancialmente a ocorrência de dados em falta. Quando dados em falta ocorrem, os métodos estatísticos discutidos neste artigo fornecem ferramentas para realizar análises válidas que respondem adequadamente à incerteza.

À medida que a pesquisa psicológica se baseia cada vez mais em pesquisas em larga escala para compreender fenômenos complexos, o desenvolvimento de conhecimentos especializados em métodos de dados em falta torna-se cada vez mais importante. Ao combinar abordagens estatísticas rigorosas com um design cuidadoso e relatórios transparentes, os pesquisadores podem garantir que dados em falta não comprometam a validade e o impacto de seu trabalho.As estratégias descritas neste artigo fornecem um quadro abrangente para enfrentar este desafio onipresente na pesquisa de levantamento psicológico.