2  Escolhas inteligentes

O presente tutorial retoma o contexto de aplicações discutido por Rogers (2024): modelos de fator comum, com estrutura multifatorial definida e propriedades psicométricas previamente investigadas, frequentemente empregados como etapa de uma pesquisa mais ampla. A diferença está no caminho analítico aqui recomendado: planejar a escolha de instrumentos cujos itens permitam o tratamento contínuo, utilizando ML robusto como estratégia de estimação. A fundamentação dessa escolha exige distinguir o formato de resposta, o objeto da análise e os pressupostos do modelo.

Itens individuais e escores agregados de uma escala não são intercambiáveis nessa discussão. A possibilidade de analisar uma soma ou média de itens como contínua não basta para justificar o mesmo tratamento de cada indicador em uma AFC. Harpe (2015) faz essa distinção e recomenda que itens individuais com formatos numéricos de pelo menos cinco categorias podem, em geral, ser tratados como contínuos. Norman (2010) complementa essa perspectiva ao mostrar que a avaliação de procedimentos paramétricos deve considerar sua robustez, em vez de rejeitá-los automaticamente pela classificação ordinal dos dados. Essas contribuições apoiam a discussão geral; a justificativa específica para a AFC vem dos estudos sobre seus modelos e estimadores.

Nessa direção, Rhemtulla et al. (2012) encontrou desempenho aceitável de ML robusto com cinco a sete categorias em diversas condições, embora a assimetria dos limiares e a magnitude das cargas fatoriais influenciassem os resultados. Com sete categorias e limiares aproximadamente simétricos, a abordagem contínua frequentemente apresentou desempenho tão bom quanto ou melhor que a alternativa categórica estudada. Esses resultados oferecem suporte à nossa preferência prática, sem estabelecer cinco categorias como um limiar que garanta bom desempenho em qualquer aplicação.

Por outra perspectiva, Robitzsch (2020) e Robitzsch (2022) argumentam que a escolha entre modelar as relações entre os escores observados e modelar respostas contínuas subjacentes envolve diferentes definições dos parâmetros de interesse. A modelagem ordinal não é universalmente superior apenas porque os itens apresentam categorias ordenadas. Assim, nossa recomendação combina a possibilidade de defender o modelo contínuo com evidências de desempenho e vantagens operacionais. Recomendamos esse caminho desde o planejamento, mantendo a adequação do instrumento ao objetivo da pesquisa como critério prioritário.

As seções seguintes verbalizam analiticamente alguns tópicos discorridos na literatura (Crede & Harms, 2019; Flake et al., 2017; Flake & Fried, 2020; Jackson et al., 2009; Nye, 2022; Rogers, 2024), que foram apenas sintetizado por Rogers (2024) no contexto de uma AFC com itens ordinais. Os mesmos assuntos são abordados sob a perspectiva do que fazer (Flake et al., 2017; Nye, 2022; Rogers, 2024), o que não fazer (Crede & Harms, 2019; Rogers, 2024), e o que reportar (Flake & Fried, 2020; Jackson et al., 2009; Rogers, 2024), para escolhas de modelos de medidas cujos dados possam ser tratados como contínuos.

Partimos da hipótese que o leitor possui algum conhecimento introdutório sobre o assunto, e por isso, deixamos certas nuances para alguns bons manuais (Brown, 2015; Kline, 2023) ou artigos científicos que oferecem uma boa introdução à CB-SEM (Davvetas et al., 2020; Shek & Yu, 2014). O contexto é da AFC dentro do arcabouço da CB-SEM (Brown, 2015; Jackson et al., 2009; Kline, 2023; Nye, 2022). Não abordaremos ajustes de modelos de medidas na SEM baseada em variâncias (VB-SEM), que podem ser encontradas, principalmente, na literatura sobre Partial Least Squares SEM (PLS-SEM) (J. F. Hair et al., 2017, 2022; Henseler, 2021).

2.1 Seleção do Modelo de Medida

Na seleção do modelo de medida, recomendamos privilegiar instrumentos cujos itens tenham cinco ou mais categorias de resposta, preferencialmente sete, entre as alternativas com evidências de validade para o construto, a língua e a população de interesse. A preferência por sete categorias decorre do desempenho favorável observado em condições estudadas de AFC e da possibilidade de maior diferenciação das respostas; não representa uma garantia de maior poder ou de melhor mensuração em qualquer contexto (Harpe, 2015; Rhemtulla et al., 2012). Essa orientação se aplica à escolha entre instrumentos apropriados e não autoriza alterar arbitrariamente o formato de resposta de uma escala validada, pois modificações podem exigir nova avaliação de suas propriedades psicométricas (Harpe, 2015).

O número de categorias oferecidas também deve ser confrontado com a forma como elas são utilizadas. Um item com cinco ou sete opções pode apresentar respostas concentradas em apenas duas ou três categorias, como destaca Harpe (2015). Por isso, recomendamos examinar, no planejamento, evidências de aplicações anteriores na população-alvo e, após a coleta, as frequências das categorias e a distribuição de cada item. A descrição dos indicadores no pré-processamento permitirá documentar essas características e informar a avaliação da estratégia de estimação. As correções robustas não dispensam essa análise nem corrigem automaticamente uma especificação inadequada do modelo de medida (Rhemtulla et al., 2012).

Ao selecionar um modelo de medida, é importante dar prioridade para escalas que já foram validadas na língua de aplicação e utilizadas na população-alvo da pesquisa (Flake et al., 2017). Além disso, é crucial confirmar se essas escalas não são proprietárias ou privativas de uma profissão. Uma varredura inicial no Sistema de Avaliação de Testes Psicológicos do seu país pode ser útil, e se não encontrar o que procura, busque por escalas financiadas por entidades públicas ou não governamentais, grupos/centros de pesquisas ou universidades que, geralmente, empreendem maior esforço (recursos humanos, tempo e dinheiro) para validar modelos de medidas para fins de políticas públicas.

Esgote seu esforço de pesquisa para a seleção do modelo de medida, consultando periódicos especializados, livros, relatórios técnicos e dissertações ou teses. Schumacker et al. (2021) fornecem uma lista extensa para busca de testes e medidas como ponto de partida. Existem diversas revisões sistemáticas (ou meta-análise) da literatura de modelos de medida sobre um tema, área ou construto. Nunca deixe de conferir os artigos originais da escala e relevantes aplicações subsequentes. Kline (2016, p. 29) apresenta um interessante checklist para avaliar modelos de medidas potenciais.

Evite se aventurar em modelos de medida construídos para propósitos específicos e sem rigor psicométrico (Flake & Fried, 2020; Kline, 2016). A simples existência de uma escala não indica que ela é válida (Flake et al., 2017). Além disso, não confie indiscriminadamente em escalas utilizadas pouquíssimas vezes ou construídas há muito tempo, pois isso pode ser um indicativo de fracas propriedades psicométricas. Evite também pegar uma escala aplicada em outra língua e fazer um processo de tradução/retradução “rápido”, aplicando-a em uma única amostra. Não oculte estruturas fatoriais alternativas (modelos de ordem superior ou bifactor) para um mesmo modelo de medida, pois se o pesquisador acha que terá mais “trabalho”, essas estruturas alternativas, com alguma relevância e justificativa teórica, pode ser a salvação da pesquisa (Crede & Harms, 2019).

Justifique as boas propriedades psicométricas da escala selecionada, indicando as evidências empíricas anteriores de emprego na população almejada, medidas de confiabilidade e validade (Flake & Fried, 2020; Jackson et al., 2009; Kline, 2016). Se para uma mesma escala existir diferentes estruturas fatoriais esperadas (modelos de ordem superior ou bifactor), justifique as comparações que serão empreendidas para não utilizar a AFC para fins exploratórios (Jackson et al., 2009).

Especifique seu modelo preferido e apoie sua escolha discutindo os méritos de seu modelo preferido em relação a modelos teóricos equivalentes e concorrentes (Jackson et al., 2009). Represente graficamente os modelos testados (Jackson et al., 2009). Defina e descreva, a priori, a partir das evidências empíricas anteriores, as suspeitas de cross-loadings (Brown, 2023; Nye, 2022).

Considerando que a escala selecionada poderá estar no contexto de um questionário de pesquisa mais amplo, em linha com as propostas de triagem procedimental da literatura de Careless/ Insufficient Effort Responsing (C/IER) (Curran, 2016; Huang et al., 2026; Ward & Meade, 2023), como detalharemos adiante, recomenda-se planejar desde o desenho do instrumento a inclusão de itens de atenção explícita (por exemplo, instructed response items e, quando apropriado, bogus/infrequency items) e o registro do tempo de resposta do questionário, se possível em nível de página, de modo a permitir, em um nível mínimo de triagem, a identificação de respondentes que não leram os itens ou que completaram o questionário em velocidade incompatível com um processamento cuidadoso das perguntas (Ward & Meade, 2023).

2.2 Análise de Poder

Primeiramente, uma das questões mais importantes a se ressaltar sobre a Análise de Poder (AP) é o que não fazer: não justifique a decisão de tamanho amostral com base em regras de bolso. Existem regras de bolso que vão ao encontro das mais diversas demandas: i) alguns estudos indicam tamanho mínimo (n) de 50, 100, 200, 300, 400, 500 e 1.000; outros estudos indicam ii) critérios número de observações/quantidade de parâmetros (n/p): 20/1, 10/1, 5/1 (Kline, 2023; Kyriazos, 2018). Essas sugestões são baseadas em situações específicas, estudos de simulação com design particular, e podem não estar de acordo com o cenário da sua pesquisa.

É importante ressaltar que não se deve confiar em tamanhos amostrais de limite inferior para substituir a AP para detectar efeitos-alvo (Westland, 2010). Esse tamanho de amostra representa o n mínimo necessário para qualquer modelo, e praticamente garantirá poder inadequado para detectar efeitos-alvo de tamanho equivalente no modelo em estudo (Wang, 2023). Nesse sentido, deveria ser evitada a calculadora de Soper (2026), disponível em: https://www.danielsoper.com/statcalc; e muito utilizada nos estudos empíricos (em 14/09/2026, com cerca de quatro anos de existência, acumulava mais de 2.000 citações no Google Scholar).

Regras gerais para requerimentos de tamanho amostral no contexto da SEM, devido ser uma técnica complexa, são impraticáveis (Kyriazos, 2018), e uma estratégia mais produtiva e moderna tem sido adaptar o poder amostral para cada estudo, acomodando o contexto específico da pesquisa e considerando suas questões focais (Feng & Hancock, 2023; Moshagen & Bader, 2024). Não existe “regra-de-ouro” sobre tamanho amostral ou tamanho mínimo de amostra para todos os estudos (Kline, 2023).

Apesar da opção de se executar a AP a posteriori, sugere-se que o planejamento amostral seja realizado antes de coletar os dados (a priori) (Feng & Hancock, 2023). Procedendo dessa forma, naturalmente, o pesquisador adquirirá maior entendimento sobre sua pesquisa (Leite et al., 2023). Isso porque, como veremos, algumas decisões devem levar em conta algum conhecimento sobre a literatura subjacente e parâmetros populacionais conhecidos sobre o modelo de medida em avaliação (Feng & Hancock, 2023). Se o pesquisador levou a primeira etapa a sério, a AP a priori torna-se um trabalho menos árduo.

A AP a priori garante que o pesquisador tenha uma amostra suficientemente grande para detectar os efeitos que se está interessado em estudar (minimização de erros do tipo II). Isso aumenta a confiabilidade de obter resultados válidos, replicáveis e comparáveis com outras pesquisas na área, facilitando as metas-análises, por exemplo. Também evita o desperdício de tempo e recursos, coletando dados de uma amostra maior do que o necessário, e ajuda a definir o orçamento para a coleta de dados, otimizando o planejamento da pesquisa (Feng & Hancock, 2023).

Dentro da SEM a AP pode ser realizada analiticamente, com base na teoria assintótica, ou por meio de simulação. A abordagem analítica requer a definição do efeito de interesse em termos de uma medida que mostre uma relação direta com o parâmetro de não centralidade. A AP simulada obtêm uma estimativa empírica do poder através de um modelo populacional ou considerado verdadeiro (Moshagen & Bader, 2024). Existem duas avaliações principais para as quais o poder é relevante: o ajuste global do modelo e os parâmetros do modelo. Em qualquer uma dessas avaliações podemos utilizar tanto métodos analíticos quanto de simulação (Feng & Hancock, 2023).

Geralmente, numa AFC, estamos procedendo a validação de um modelo de medida para um passo posterior e nesse sentido recomenda-se, no mínimo, que se avalie o poder relevante de um ajuste global do modelo de medida (Nye, 2022; Wang, 2023). Apesar das limitações das soluções analíticas (Feng & Hancock, 2023), podemos utilizá-las como ponto de partida e complementar aos métodos de simulação (Moshagen & Bader, 2024).

Existem formas acessíveis de se proceder as soluções analíticas para a AP do ajuste global (Wang, 2023): 1) baseada no teste qui-quadrado não central (solução Saris-Satorra); ou 2) baseada na estatística RMSEA de um modelo corretamente/incorretamente especificado (solução de MacCallum e outros). Como exemplos dessas opções temos os ShinyApps: i) https://sjak.shinyapps.io/power4SEM/ de Jak et al. (2021); ii) https://sempower.shinyapps.io/sempower/ de Moshagen & Bader (2024); iii) https://yilinandrewang.shinyapps.io/pwrSEM/ de Wang & Rhemtulla (2021); e o aplicativo WebPower (https://webpower.psychstat.org/) de Zhang & Yuan (2018).

Esse último é o mais completo e apresenta soluções baseadas na Simulação de Monte Carlo (SMC), nos permite contemplar valores missing e dados não-normais, e principalmente, podemos fazer tudo através de diagramas, sem necessidade de script. A solução de Wang & Rhemtulla (2021) também tem a opção de utilizar simulação, e todas elas também incorporam a AP de um efeito específico (parâmetro do modelo). Para uma visão geral sobre essas soluções e revisão dos métodos analíticos veja Feng & Hancock (2023), Jak et al. (2021), Nye (2022) e Wang (2023).

No entanto, uma escolha inteligente é executar uma SMC para a AP de seu modelo AFC a partir de soluções que sejam condizentes com a reprodutibilidade e replicabilidade dos resultados. Nesse sentido, até mesmo as soluções analíticas, que o pesquisador pode tomar como ponto de partida, sugere-se o ambiente R através dos pacotes semTools (Jak et al., 2021) e semPower 2 (Jobst et al., 2023; Moshagen & Bader, 2024).

Para a SMC no contexto da SEM a escolha inteligente seria utilizar o pacote simsem (Pornprasertmanit et al., 2022). Na sequência se pontua um misto de razões pragmáticas e teóricas para essa sugestão:

  • A abordagem analítica depende fortemente das distribuições de amostragem conhecidas e propriedades assintóticas da estatística de teste. Entretanto, muitas dessas suposições podem ser facilmente relaxadas ao usar a SMC, que se mostra cada vez mais popular devido à sua flexibilidade para se adaptar a vários cenários de pesquisa (dados categóricos, valores ausentes, estudos longitudinais, ajuste local e global, etc.) (Feng & Hancock, 2023), inclusive, com a possibilidade de se utilizar as versões robustas do estimador ML, como veremos adiante;

  • A SMC exige que o pesquisador forme a base de conhecimento do seu modelo de medida populacional, no qual os verdadeiros valores dos parâmetros são conhecidos, e ajuda apoiar a validade das inferências obtidas de suas análises (Leite et al., 2023). Por exemplo, os resultados obtidos com a SMC podem indicar os pontos de cortes dos índices de ajustes globais utilizados nas etapas posteriores;

  • A desvantagem que a SMC exige substancial poder de computação e tempo, para modelos complicados (Nye, 2022), se sustenta parcialmente na prática (Byrne, 2016). Primeiro, porque na maioria das aplicações empíricas os modelos AFC não são tão complexos. Segundo, porque o poder computacional atual e a computação em nuvem oferecem soluções escaláveis e acessíveis para pesquisas que demandam alto poder computacional. Diversos caminhos podem ser utilizados para otimizar a SMC, tal como a seleção de parâmetros eficientes, algoritmos de estimação avançados e dividir o estudo em etapas (Leite et al., 2023). E por último, somente a SMC produz uma solução realista para modelos complexos (Moshagen & Bader, 2024);

  • Por mais que possa ressoar contraintuitivo e/ou alguns cientistas sociais encarar com ceticismo: a SMC é fácil de aprender (Nye, 2022; Wang, 2023; Wang & Rhemtulla, 2021) ou tão difícil quanto a abordagem analítica Saris-Satorra para analisar o efeito de um parâmetro específico. A lógica por trás da SMC é relativamente simples (Leite et al., 2023), e o conhecimento básico de estatística é suficiente para compreender os princípios da técnica. Tutorais e documentações completas facilitam o aprendizado e a utilização da SMC no contexto da SEM, como é o caso do pacote simsem (https://simsem.org/), cujos exemplos são variados e didáticos. Esse pacote faz uso da syntax do lavaan, e caso o cientista social já o utilize ou pretende seguir os passos desse manuscrito executável, estará bem adiante na curva de aprendizado. Nesse sentido, se considerar as habilidades necessárias para o entendimento das soluções analíticas, e o conforto de funções predefinidas para calcular o poder estatístico para diferentes tipos de modelos e designs de pesquisa, a partir de uma syntax conhecida, a flexibilidade da SMC mais do que compensa qualquer esforço marginal que possa existir (Feng & Hancock, 2023).

Cremos que a prática de reportar o planejamento amostral para o(s) modelo(s) de medida auxilia na replicabilidade e reprodutibilidade da ciência (Flake et al., 2017; Flake et al., 2022), contribuindo para acumular evidências de validade da estrutura interna (Flake & Fried, 2020) e externa (Leite et al., 2023). No contexto da AFC, um baixo poder porventura que deixamos passar, pode acender um sinal de alerta para as inferências procedidas a partir do modelo completo (modelo de medida + estrutural). A SMC é uma escolha inteligente para avaliar o poder do modelo de medida, pois a validade externa muitas vezes supera a precisão: informações precisas sobre um resultado irrelevante são muitas vezes menos úteis do que informações imprecisas sobre um resultado relevante (Leite et al., 2023).

2.3 Pré-processamento

A qualidade dos dados é condição necessária, embora não suficiente, para que os parâmetros estimados numa AFC sejam válidos e interpretáveis. Além das inconsistências técnicas (e.g., vide Whittaker & Schumacker (2022)) e do Common Method Bias (CMB, vide Podsakoff et al. (2012)), a etapa de pré-processamento deve considerar sistematicamente as Respostas com Insuficiência de Esforço (C/IER). C/IER designa as respostas fornecidas sem atenção ou esforço suficiente ao conteúdo dos itens, abrangendo padrões aleatórios e não aleatórios, como straightlining, respostas concentradas no meio da escala e padrões repetitivos (Curran, 2016; Huang et al., 2015).

É importante distinguir C/IER de outros fenômenos de resposta: a Desejabilidade Social e a Aquiescência, por exemplo, constituem ameaças à validade baseada nos processos de resposta, conforme discutido na introdução deste artigo. O C/IER opera em nível distinto: quando respostas desatentas contaminam múltiplas medidas autorrelatadas na mesma direção, elas introduzem variância compartilhada não substantiva que funciona como uma fonte de Common Method Variance (CMV) e pode gerar CMB, distorcendo correlações, cargas fatoriais e inferências (Huang et al., 2015). Assim, C/IER pode ser entendido como um caso particular e contingente de CMV/CMB, distinguindo-se da simples noção de erro aleatório de medição. A revisão de Huang et al. (2026) evidencia que a triagem de C/IER ainda carece de padronização, reforçando a necessidade de incorporá-la formalmente ao workflow de pré-processamento.

Uma vez os dados originais tabulados, de preferência em arquivos não binários (.csv, .txt, .json, etc.), a primeira ação a se tomar é excluir as respostas dos entrevistados que, efetivamente, abandonaram a pesquisa. Às vezes acontece desse indivíduo ficar na base de dados e somente ao final do pré-processamento nos darmos conta. Enquanto isso, ele serviu de informação para o tratamento dos missings, outliers e a multicolinearidade.

Se o pesquisador colocou questões de controle no questionário e consegue mensurar o tempo de resposta, nesse momento também deve excluir observações de respondentes que escolheram as questões de controle incorretamente e terminaram o questionário em tempo consideravelmente menor do que o esperado (Collier, 2020). Na terminologia C/IER, esses correspondem aos métodos procedurais de detecção: os itens de controle (instructed response items ou infrequency items) e o tempo de resposta do questionário ou por página (page time) são os procedimentos a priori mais recomendados pela literatura (Curran, 2016; Huang et al., 2026) e devem ser planejados prospectivamente, desde a concepção do instrumento.

No âmbito dos métodos post hoc de detecção de C/IER, calcule o índice Intraindividual Response Variability (IRV) de cada indivíduo para avaliar a variabilidade das respostas aos itens. O IRV representa o desvio-padrão das respostas do indivídulo, e valores iguais a zero ou muito perto de zero correspondem, na literatura C/IER, a straightlining, uma forma sistemática de C/IER que pode inflar artificialmente a consistência interna da escala. Complementarmente, o Long String (LS) quantifica a maior sequência de respostas idênticas consecutivas, sendo especialmente sensível a respondentes que selecionam repetidamente a mesma opção (Curran, 2016; Hong et al., 2020). Em casos que o IRV é alto há indicíos de padrões de resposta aleatórios, inconsistente com respostas esperadas de itens dentro de um mesmo constructo (Curran, 2016; Hong et al., 2020).

A detecção de outliers deve ser integrada ao protocolo de triagem C/IER e tratada como etapa do pré-processamento. Padrões de resposta aberrantes comprometem a estrutura de covariância dos dados e podem distorcer a solução fatorial antes mesmo de qualquer ajuste de modelo. A Distância de Mahalanobis (MD) é o indicador multivariado mais utilizado: estima a distância entre o vetor de respostas de cada indivíduo e o vetor médio da amostra, sendo sensível a padrões de resposta aleatórios (Curran, 2016; Hong et al., 2020).

A recomendação consolidada é empregar um subconjunto complementar de índices, tal como, por exemplo: algum método procedural, IRV e MD (best subset approach); pois cada indicador captura manifestações distintas de C/IER; a combinação de todos os índices disponíveis (kitchen sink approach) tende a reduzir a especificidade sem ganho equivalente de sensibilidade (Hong et al., 2020).

O pesquisador pode optar por ser mais leniente em cada um dos critérios post hoc, examinando os casos suspeitos (perfil de resposta) antes de proceder à exclusão: a presença concomitante de IRV baixo, LS elevado e MD atípica oferece evidência mais robusta de C/IER do que qualquer indicador isolado (Curran, 2016; Hong et al., 2020; Huang et al., 2026). No entanto, pode optar por não desistir de excluir os indivíduos que gastaram menos de 2 segundos por item (Huang et al., 2026) ou não passaram em todos instructed items.

Sobre a multicolinearidade, calcule o fator de inflação de variância (VIF) de cada um dos itens e considere a exclusão daqueles com alta multicolinearidade (VIF > 10) (Whittaker & Schumacker, 2022). Na AFC, cujo foco reside em constructos reflexivos, a correlação entre os itens é desejável (Grewal et al., 2004), mas nem tanto ao ponto de causar problemas de convergência dos modelos (Flora et al., 2012; Kline, 2023; Whittaker & Schumacker, 2022). A alta colinearidade ou multicolinearidade entre as variáveis observadas é uma das principais causas de uma matriz não-positiva definida (Flora et al., 2012; Kline, 2023), e mesmo se o modelo convergir com sua presença, pode acarretar em interpretações equivocadas (Marsh et al., 2004) e/ou indicar falta de validade discriminante (Grewal et al., 2004).

O tratamento dos missings, não necessariamente, precisa ser considerado na etapa inicial de data screening. No caso, evite a imputação única (listwise, pairwise, mean-substitution, regression substitution e pattern matching). Todos os métodos de imputação única tendem a subestimar a variância do erro, especialmente se a proporção de observações ausentes for relativamente alta, e algumas dessas técnicas podem causar problemas de identificação (Enders, 2023). Poucos valores faltantes, como 5% no conjunto total de dados, podem ser pouco preocupantes (Kline, 2023), mas devem ser tratados por imputação múltipla (MI) ou Full Information ML (FIML).

A escolha inteligente em grande parte das aplicações empíricas de AFC reside em optar por FIML, na etapa de estimação: na maioria dos casos representa a melhor e mais fácil maneira de tratar os missings (Brown, 2023). Na MI os resultados podem ser alterados sempre que o método é aplicado ao mesmo modelo e dados, dificultando a replicabilidade; em contraste, há uma única solução para o FIML. Há mais decisões potenciais a serem tomadas na abordagem MI do que na FIML (Kline, 2023). Quando os estimadores são direcionados para ML ou suas variações robustas MLR ou MLM, a escolha pragmática reside em optar por FIML (Brown, 2023).

A transformação dos dados para linearização ou normalização não se mostra uma estratégia inteligente, tendo em vista a disponibilidade e facilidade de procedimentos de estimativa robustos (Brown, 2023). Outra recomendação é não parcelar os itens, pois (i) existem muitas estratégias de fazer isso e (ii) pode mascarar a multidimensionalidade (Brown, 2023; Crede & Harms, 2019).

Inspeções visuais e descritivas dos itens do modelo de medida estão implícitas, recomendadas e salutares em qualquer análise estatística. Existem várias formas para isso, mas debruçar sobre esses procedimentos, assim como outras questões do pré-processamento abordadas na literatura (Brown, 2023; Collier, 2020; Flora et al., 2012; J. Hair et al., 2019; Kline, 2023; Whittaker & Schumacker, 2022), considera-se desnecessário para os fins desse manuscrito.

Em suma, reporte todos os procedimentos para limpar os dados. Seja transparente em relação aos missings. Todo pesquisador enfrenta esse problema, e em doses pequenas, é possível de tratamento e não invalida o estudo (Crede & Harms, 2019). Execute e reporte estratégias para avaliar o engajamento dos respondentes e a triagem de C/IER, incluindo os índices utilizados, os pontos de corte adotados e a proporção de casos removidos (Huang et al., 2026). Reporte indícios de multicolinearidade mesmo antes de começar a AFC. Reporte o software e/ou pacotes utilizados com suas devidas versões (Flake & Fried, 2020; Jackson et al., 2009). Disponibilize os dados brutos ou a matriz de covariância/correlação dos itens (Crede & Harms, 2019; Flake et al., 2022; Flake & Fried, 2020).

2.4 Processo de Estimação

Numa AFC cujos itens são ordinais, ou seja, com opções de resposta do tipo Likert de até cinco pontos, Rogers (2024) argumenta, através de uma extensa literatura, que devemos utilizar os estimadores da família OLS (Ordinary Least Squared), preferencialmente ULS (Unweighted LS) na sua versão robusta (RULS), para amostras menores, ou DWLS (Diagonally Weighted LS) na sua versão robusta (RDWLS), para amostras maiores.

No entanto, conforme argumentado da introdução, algumas evidências empíricas (Rhemtulla et al., 2012; Robitzsch, 2022) e argumentos teóricos (Robitzsch, 2020) sugerem que metodologia contínua na presença de dados ordinais produzirá resultados aceitáveis quando o número de categorias for cinco ou mais. Com 6-7 categorias, os estudos (Rhemtulla et al., 2012) encontram semelhanças entre os métodos para muitas condições e recomendam o uso de um grande número de alternativas de resposta (≥5) para aumentar o poder de detectar modelos incorretos (Maydeu-Olivares et al., 2017).

Apesar do estimador ML ser robusto a pequenos desvios de normalidade (Brown, 2015), nessas condições: presença de assimetria e excesso de curtose, ou seja, onde a falta de normalidade (moderada ou severa) é a regra e não exceção; alguns argumentos (Robitzsch, 2020) são direcionados para se utilizar as versões robustas do estimador ML, particularmente o MLR (Huber-White standard errors and Yuan-Bentler scaled χ2).

Existem vários métodos para gerar erros-padrão robustos e estatísticas de teste ajustadas com propriedades semelhantes (Kline, 2023), mas o MLR tem aplicações mais amplas, como a estimativa de modelos com dados faltantes (RFIML) ou modelos onde os dados violam a suposição de independência de observações (Brown, 2015; Rosseel, 2012). Adicionalmente, acumulam algumas evidências empíricas favoráveis, ou que não desabonam o MLR, comparativamente às outras opções de estimadores (Bandalos, 2014; Holgado-Tello et al., 2016; Li, 2016; Nalbantoğlu-Yılmaz, 2019; Yang & Liang, 2013; Yang-Wallentin et al., 2010).

De qualquer forma, reporte e justifique o método de estimação utilizado a partir das características dos dados disponíveis e modelo a ser ajustado (Crede & Harms, 2019). Reporte todos os problemas ocorridos com a estimação, tal como não convergência dos algoritmos e modelos não identificados (Nye, 2022). Caso haja problemas nesse sentido, um plano B seria optar pelos estimadores MLM (robust standard errors and Satorra-Bentler scaled χ2) ou ML default com bootstrapping não paramétrico modificado por Bollen-Stine (Brown, 2015; Kline, 2023). Essa última solução pode englobar dados missings (Kline, 2023). Além disso, indique se fixou a variância ou uma variável marcadora (=1) para definir a escala da variável latente (Jackson et al., 2009) e reporte os parâmetros padronizados e não padronizados (Nye, 2022).

2.5 Ajuste do Modelo

Nessa seção também nos parece sensato começar com a indicação do que não fazer: não utilize os cutoffs tradicionais, seja aqueles mais conservadores (SRMR ≤.06, RMSEA ≤.06 e CFI ≥.95) ou menos conservadores (RMSEA ≤.08, CFI ≥.90 e SRMR ≤.08). Ultrapassar um conjunto de valores de corte não deve ser a principal justificativa para aceitar um modelo (Xia & Yang, 2019). Os cutoffs tradicionais foram concebidos a partir de estudos de simulação que levaram em conta no máximo uma estrutura com 3 fatores, 15 itens e cargas fatoriais entre 0.7 e 0.8 (West et al., 2023). Os cutoffs tradicionais são sensíveis ao número de itens e fatores, graus de liberdade do modelo, magnitude das cargas fatoriais, tipo de desajuste e missing data (Groskurth et al., 2024; Niemand & Mai, 2018; West et al., 2023).

Todos os índices globais têm suas limitações e vantagens (West et al., 2023). Analise os principais índices globais (SRMR, RMSEA e CFI) em conjunto e não tome um em particular (Mai et al., 2021; Niemand & Mai, 2018). Se algum índice global indicar um desajuste, mesmo que pequenos desvios dos cutoffs tradicionais (SRMR ≤.06, RMSEA ≤.06 e CFI ≥.95), pode ser necessária uma investigação mais aprofundada para demonstrar que o desajuste se deve às características dos dados ou a uma limitação do índice em vez de uma especificação incorreta do modelo (Nye, 2022).

Nesse sentido, trate os índices convencionais de ajuste global mais como um tamanho de efeito, como originalmente foram concebidos (McNeish & Wolf, 2023b), do que um teste de hipótese ad hoc em que se toma uma decisão de rejeitar/não rejeitar o modelo (McNeish, 2023b). O SRMR parece ser mais robusto sob a uma variedade maior de situações (Mai et al., 2021), como a falta de normalidade e/ou nível de mensuração dos itens (Maydeu-Olivares et al., 2017; Shi et al., 2020; Shi & Maydeu-Olivares, 2020). No mais, utilizar o par SRMR/CFI parece ser suficiente para balancear os erros Tipo I/Tipo II, e empregar diversos índices poder inflar o erro do Tipo I (Mai et al., 2021; Niemand & Mai, 2018).

O Dynamic Fit Index (DFI) parece ser um bom método para avaliar o índice de ajuste global (McNeish, 2023a). Trata de uma proposta baseada em simulação em que temos pontos de corte específico para o modelo em questão. A lógica dessa estratégia é que ela imite a estratégia usada para derivar os cutoffs tradicionais, mas adapta o design da simulação ao subespaço do modelo que corresponde ao modelo empírico em avaliação (McNeish, 2023a, 2023b; McNeish & Wolf, 2023a; McNeish & Wolf, 2023b). Visto dessa forma, essa sugestão também pode ser abordada na etapa 2 (Seção 2.2), tendo como base de conhecimento o modelo de medida populacional (ou não, dependendo da abordagem), pois trata de incorporar as ideias da AP nas avaliações de índices de ajuste (McNeish & Wolf, 2023a).

Outra sugestão de simulação customizada é a proposta Flexible Cutoffs (FCO) (Mai et al., 2021; Niemand & Mai, 2018). A despeito do FCO não exigir que os pesquisadores identifiquem um modelo mal especificado, assim como o DFI, essa abordagem define um modelo mau especificado de forma conservadora, e altera o foco de ajuste aproximado para ajuste exato (McNeish & Wolf, 2023a).

De qualquer forma, mesmo sem informações aproximadas do tamanho do efeito, Mai et al. (2021) e Niemand & Mai (2018) apresentam evidências favoráveis que a proposta FCO permite o equilíbrio entre erros do Tipo I e Tipo II, além de que essa abordagem ‘sui generis’, desenvolve valores de corte que atendem de forma flexível às características dos dados e do modelo, é particularmente eficaz na área cinza (crítica) de especificação incorreta (erro Tipo I), melhora a detecção de erro tanto no modelo estrutural quanto no modelo de medição, e leva em conta a não normalidade dos dados (Niemand & Mai, 2018). Particularmente, nas situações enfatizadas no presente manuscrito, modelo de medida (AFC) estabelecido na literatura, o equilíbrio entre erros do Tipo I/Tipo II é mais importante do que o erro Tipo II num modelo de medida novo (Mai et al., 2021).

Caso seja uma barreira (McNeish & Wolf, 2023a) e o pesquisador não pretenda aventurar no “mundo” da simulação, uma outra opção seria o Equivalence Testing (EQT). A ideia por trás do EQT é a mesma das soluções analíticas da AP (Seção 2.2), e incorpora a lógica do DFI, quando adota a visão de que a o método convencional de teste de hipóteses (NHT) não é interessante, pois uma estatística de teste não significativa não implica, necessariamente, que o modelo está corretamente especificado, ou que o tamanho da especificação incorreta seja adequadamente controlada (Yuan et al., 2016).

Em vez de usar os cutoffs tradicionais para orientar uma avaliação aproximada do ajuste, o EQT pode ser uma alternativa (McNeish, 2023b), pois refere-se a limites como tamanho de tolerância (ou valor T-Size), que inclui a variabilidade amostral no índice de ajuste em vez de usar a estimativa pontual estimada. O valor T-Size é, portanto, o valor que é comparado com os diferentes valores de referência ajustados [por exemplo, os pontos de corte tanto para o RMSEA (0,01; 0,05; 0,08 e 0,10) quanto para o CFI (0,99; 0,95; 0,92 e 0,90) têm sido comumente utilizados para distinguir entre modelos excelentes, bons, regulares e medíocres/ruins, respectivamente] para determinar qual grau de ajuste pode ser endossado (Marcoulides & Yuan, 2017).

O EQT é uma maneira inteligente de trazer raciocínio inferencial para a avaliação aproximada do ajuste, incorporar a variabilidade amostral na avaliação do ajuste, permitir aos pesquisadores a capacidade de endossar um determinado nível de ajuste, e de implementar porque não depende da simulação de benchmarks (McNeish, 2023b). Apesar de melhor do que os cutoffs tradicionais, o EQT ainda retém algumas de suas propriedades indesejáveis, como não se aplicar em uma ampla gama de características de modelos (McNeish, 2023b).

Complementando o que não fazer: não utilize o Alfa de Cronbach como medida de confiabilidade (Bell et al., 2023; Cho, 2022; Dunn et al., 2014; Flora, 2020; Goodboy & Martin, 2020; Green & Yang, 2015; Hayes & Coutts, 2020; Kalkbrenner, 2023; McNeish, 2018; Trizano-Hermosilla & Alvarado, 2016). Não utilize o χ2 sem o devido ajuste (Yuan-Bentler scaled χ2, por exemplo) (Crede & Harms, 2019).

Dito isso, inicialmente, inspecione se existem casos Heywood: cargas fatoriais padronizadas > 1 ou variâncias negativas (Nye, 2022). Avalie os índices de ajuste local: baixa carga fatorial, cross-loadings, correlação residual (>0,10), índices de modificação (>3,84) e estimated parameter change (EPC) (Nye, 2022). Use como medida de confiabilidade o Ômega de McDonald e/ou o GLB (greatest lower bound) no contexto do modelo AFC ajustado (Bell et al., 2023; Cho, 2022; Dunn et al., 2014; Flora, 2020; Goodboy & Martin, 2020; Green & Yang, 2015; Hayes & Coutts, 2020; Kalkbrenner, 2023; McNeish, 2018; Trizano-Hermosilla & Alvarado, 2016).

Calcule e reporte antes de iniciar o ajuste do modelo (Jackson et al., 2009) os cutoffs que serão utilizados como ancoras. Se utilizar a metodologia DFI (McNeish & Wolf, 2023b), para modelos mais simples de AFC, como unifatorial e multifatorial sob a hipótese de normalidade, o pesquisador pode acessar os valores DFI’s via ShinyApp: https://www.dynamicfit.app/connect/ (acesso em 21/02/2024). Para situações mais complexas: como abordar não normalidade, modelos bifactor e de segunda-ordem; e se enseja a replicabilidade e reprodutibilidade, faz-se necessário o pacote dynamic (Wolf & McNeish, 2023) do R, cujas funções fazem uso de objetos lavaan (Rosseel, 2012). Nesse pacote também podemos calcular o EQT, apesar da existência de outras soluções (Yuan et al., 2016), até mesmo incorporadas nativamente em softwares point-and-click, como o JASP (Rogers, 2024). Para implementar o FCO podemos utilizar o pacote FCO do R (Mai et al., 2021; Niemand & Mai, 2018).

Reporte o χ2 ajustado e os graus de liberdade (df) (Crede & Harms, 2019). Reporte no mínimo os seguintes índices de ajuste global: RMSEA, CFI e SRMR. Note que, como utilizará o scaled χ2, essas medidas também devem ser ajustadas tendo em vista o método empregado (Nye, 2022). Reporte, no mínimo, o Ômega de McDonald, mas preferencialmente, acompanhado do GLB ou outra medida de confiabilidade compósita (Trizano-Hermosilla & Alvarado, 2016). Reporte todas as decisões de ajuste do modelo (Flake & Fried, 2020), condizentes com a avaliação das medidas de ajuste local (baixa carga fatorial, cross-loadings, correlação residual, índices de modificação e EPC). Reporte o tamanho das correlações residuais e índices de modificação (Crede & Harms, 2019).

2.6 Comparações e Modificações dos Modelos

Já na primeira etapa sugerimos aos pesquisadores não ocultar estruturas fatoriais alternativas para um mesmo modelo de medida. Uma boa prática seria considerá-las na pesquisa desde o início (planejamento da pesquisa) e compará-las. O pesquisador pode ter um modelo preferido, mas selecione-o discutindo seus méritos em relação a modelos teóricos equivalentes e concorrentes (Jackson et al., 2009). Nenhum modelo pode refletir perfeitamente a verdade, então consideramos os modelos como aproximações da realidade (Preacher & Yaremych, 2023).

Para que o conhecimento nas ciências sociais se acumule de forma genuína, é crucial que as diferentes teorias sejam comparadas e testadas ao longo do tempo, construindo um histórico de acertos e erros. Diversas características definem um bom modelo, como interpretabilidade, simplicidade e capacidade de generalização. No entanto, o mais importante é que ele apresente desempenho superior a seus rivais em aspectos relevantes. Dessa forma, a teoria escolhida se torna uma "melhor hipótese de trabalho" até que uma alternativa mais eficiente surja (Preacher & Yaremych, 2023).

Os índices de ajuste são mais uteis para avaliar a qualidade de um único modelo isoladamente. Um bom ajuste transmite que o modelo é apenas uma representação plausível da estrutura real subjacente. Assumindo que os modelos concorrentes foram selecionados a priori, baseados em teorias reais, a comparação de vários modelos é uma abordagem preferível à avaliação de modelos individuais (Preacher & Yaremych, 2023).

Na seleção de modelos, o pesquisador ajusta um conjunto de modelos ao mesmo conjunto de dados, utilizando o mesmo software e tamanho de amostra. Isso garante que os graus de liberdade do pesquisador sejam mantidos relativamente constantes, mitigando o risco de manipulação dos resultados. Essa padronização promove uma abordagem mais honesta e científica para a investigação (Preacher & Yaremych, 2023).

Ao comparar o desempenho de diferentes modelos em aspectos relevantes, a seleção de modelos identifica a melhor opção para explicar o fenômeno em estudo. Essa abordagem não se limita à escolha de um único modelo, permitindo descartar aqueles com desempenho ruim e manter um conjunto de modelos de bom desempenho para análises posteriores. Essa flexibilidade garante uma investigação mais profunda e completa do problema em questão (Preacher & Yaremych, 2023).

Em suma, a seleção de modelos é uma ferramenta valiosa para o avanço do conhecimento nas ciências sociais. Ela promove a honestidade científica, incentiva práticas rigorosas e oferece flexibilidade na análise de dados, contribuindo para a construção de um conhecimento científico mais sólido e confiável (Preacher & Yaremych, 2023).

De qualquer forma, se um modelo individual não apresentar boas medidas de ajuste, modificações podem ser necessárias: certifique que elas são teoricamente sustentáveis, por exemplo, pesquise se o mesmo que está acontecendo na pesquisa aconteceu em pesquisas anteriores (Nye, 2022).

Achar que nenhum ajuste deve ser feito num determinado modelo de medida validado em pesquisas anteriores, e seguir a pesquisa com desajuste substancial, pode ser um problema: as falhas de ajuste na AFC podem proliferar para o modelo estrutural (Brown, 2023), e em certa extensão, alguns ajustes na AFC podem dirimir problemas na estimação das relações estruturais (Flake et al., 2017; Jackson et al., 2009).

No entanto, não considere mudanças drásticas nos modelos de medida (Brown, 2023): cogite voltar um ou dois passos atrás, empregar uma AFE ou considerar outra escala, por exemplo, ou seguir um passo à frente: buscar ajustar modelos ESEM (Exploratory SEM) para modelar eficientemente os cross-loadings (Crede & Harms, 2019).

Em tese, o pesquisador pode modificar o modelo até alcançar um ajuste perfeito (modelo saturado), porém sem nenhuma generalização (validade externa): lembre-se que as modificações mudará o status epistemológico de confirmatório para exploratório (West et al., 2023). No bojo das principais modificações temos a previsão de correlações entre os itens do modelo de medida, que devem ser encorajadas se: i) os itens fazem parte do mesmo construto; ii) há justificativa teórica; iii) os itens são antônimos; e iv) há itens inversos. De uma forma geral, quando a correlação se justifica para dirimir o problema de CMB (Brown, 2023; Nye, 2022).

Nesse sentido, apesar de questionável (West et al., 2023), toda e qualquer mudança no modelo de medida deve ser relatada (Flake & Fried, 2020). Como se falou, o ideal é que esses potenciais ajustes sejam conhecidos a priori (Flake & Fried, 2020), para evitar embates epistemológicos (confirmatório versus exploratório), mas a verdade é que, na prática, as modificações nos modelos de medidas são regras e não exceções (Flake et al., 2017; Nye, 2022). Apenas seja transparente (Flake et al., 2022; Flake & Fried, 2020). Exclusões de itens podem ser facilmente identificadas a partir dos outputs da pesquisa, no entanto, contemplar correlações entre itens não: relate toda e qualquer correlação entre itens que foi prevista para melhorar o ajuste do modelo e descreva a justificativa teórica (Nye, 2022).

Seja transparente e reporte o máximo de informações que puder sobre o ajuste do modelo de medida (Flake et al., 2022; Flake & Fried, 2020). Atualmente, não mais se sustenta a desculpa de limitação de espaço dos periódicos, pois o pesquisador pode deixar disponível, permanentemente, qualquer tipo de arquivo em um dos diversos repositórios Open Access existentes, e citá-lo no corpo do artigo. Esse artigo-tutorial é prova disso.

Porém, quais medidas se ancorar para comparar e selecionar modelos alternativos? Como relatado, os índices de ajuste discutidos na etapa anterior (SRMR, RMSEA e CFI) são limitados para comparar modelos (Preacher & Yaremych, 2023), apesar de algumas evidências favoráveis, seja para comparações aninhadas (aqueles pares para os quais os parâmetros livres de um modelo são um subconjunto daqueles do outro modelo) ou não-aninhadas (P.-H. Huang, 2017), dados com desvio de normalidade (Lai, 2020) e/ou categóricos (Lai, 2021a). Essas evidências sugerem pontos de cortes para variações de SRMR, RMSEA ou CFI (Preacher & Yaremych, 2023).

No caso de modelos aninhados podemos utilizar o χ2 ajustado para comparações entre modelos (Brown, 2015). O teste de diferença do χ2 ajustado pode ser realizado com as estatísticas produzidas pelo MLM (Satorra-Bentler scaled χ2), ou como sugerido, pelo estimador MLR (Yuan-Bentler scaled χ2). Não utilize o χ2 sem o devido ajuste para comparar modelos (Brown, 2015). Ao contrário da análise baseada em ML, esses testes não podem ser realizados simplesmente calculando a diferença nos valores de χ2 produzidos pelos modelos aninhados e de comparação. Isso ocorre porque uma diferença entre dois valores de χ2 para modelos aninhados estimados por MLM ou MLR não é distribuída como χ2. Assim, deve-se utilizar um teste de diferença escalonada (Brown, 2015).

Para comparar modelos não aninhados (ou aninhados) a recomendação seria utilizar os critérios de informação AIC (Akaike Information Criterion) e BIC (Bayesian IC) (Preacher & Yaremych, 2023). Existem algumas formulações diferentes desses dois critérios, mas são assintoticamente equivalentes (Preacher & Yaremych, 2023). Esses dois critérios equilibram o ajuste e a parcimônia de diferentes maneiras, são baseados na log-verossimilhança (função discrepância) originadas na estimação ML, e por isso, herdam alguns dos aspectos problemáticos dos índices de ajuste absoluto, como falta de robustez para violações distribucionais, sensibilidade a diferentes tipos de má especificação, e pressupõe dados completos (Preacher & Yaremych, 2023). O AIC e BIC não devem ser usados para comparar modelos estimados por FIML (Lai, 2021b).

Em amostras relativamente pequenas, a penalidade por complexidade do AIC tem uma influência maior e modelos mais simples são selecionados. O BIC é similar ao AIC, mas com uma penalidade mais forte para a complexidade na maioria das situações, o que significa que tende a selecionar modelos mais parcimoniosos do que o AIC. O BIC enfatiza a consistência: se um modelo verdadeiro existe e está no conjunto a ser comparado, o BIC o seleciona medida que n aumenta (P.-H. Huang, 2017). O BIC selecionará o modelo no conjunto que fica mais próximo do verdadeiro processo gerador dos dados. Consistência e eficiência não podem ser maximizadas simultaneamente. O AIC é um critério que enfatize a eficiência. Assim, geralmente é sensato relatar e interpretar o BIC e AIC (Preacher & Yaremych, 2023).

Considerando a literatura ainda incipiente sobre a seleção de modelos na SEM (Preacher & Yaremych, 2023) e as limitações das opções disponíveis, a recomendação principal é que a decisão seja baseada na experiência e conhecimento do pesquisador (Preacher & Yaremych, 2023). Sem um julgamento teórico, a aplicação de qualquer critério de seleção de modelo se torna ineficaz. Antes de iniciar a análise, é essencial usar a teoria subjacente para estabelecer um conjunto limitado de modelos defensáveis, conforme sugerimos desde o início. Além da adequação do modelo, a teoria e o julgamento são necessários durante a seleção do modelo para decidir quais modelos devem ser descartados ou mantidos, levando em consideração a interpretabilidade. Por fim, a teoria é empregada para guiar a interpretação dos resultados com base no(s) modelo(s) escolhido(s). Os critérios de seleção de modelos servem como ferramentas de apoio à decisão, mas não são os decisores finais (Preacher & Yaremych, 2023).

Mesmo com evidências acumuladas que validam o(s) modelo(s) de medida em estudo, se ainda existirem dúvidas significativas sobre a estrutura fatorial teórica e/ou nível de desajuste, o pesquisador tem a opção de prosseguir para a comparação de alternativas usando a SMC (Leite et al., 2023). Caso o pesquisador já tenha navegado pela SMC na fase de Análise de Poder (etapa 2), avançar na comparação dos modelos não exigirá esforços adicionais. Esse argumento torna-se ainda mais plausível se o pesquisador utilizou a abordagem FCO na etapa anterior, que também pode ser utilizada para comparar modelos aninhados (Mai et al., 2021; Niemand & Mai, 2018).