1 Introdução
A Análise Fatorial Confirmatória (AFC) é uma das principais ferramentas para se coletar evidências de validade de um instrumento de medida baseada na estrutura interna (Bandalos, 2018; Hughes, 2018; Sireci & Sukin, 2013). A validade é sem dúvida a qualidade mais importante de um modelo de medida (Furr, 2021), pois está relacionada com a questão de medição fundamental: o que os instrumentos de medida estão realmente medindo (Bandalos, 2018). Inclusive, esse aspecto se entrelaça com o próprio conceito clássico de validade: grau em que um teste mede o que ele pretende medir (Bandalos, 2018; Furr, 2021; Sireci & Sukin, 2013; Urbina, 2014); condizente com o modelo tripartite e ainda utilizado por muitos pesquisadores (Widodo, 2018).
A visão tripartite de validade é uma forma de conceber a validade de um teste ou instrumento de medida baseada em três tipos de evidência: conteúdo, critério e construto (Bandalos, 2018). A validade de conteúdo se refere à adequação e representatividade dos itens do teste em relação ao domínio ou objetivo que se pretende medir (Cohen et al., 2022). A validade de critério se refere à relação entre os escores do teste e algum critério externo relevante, como o desempenho em outra medida ou em alguma situação futura (Cohen et al., 2022). A validade de construto se refere à capacidade do teste de mensurar o construto teórico que se propõe a medir, considerando as hipóteses e evidências empíricas sobre esse construto (Cohen et al., 2022).
A visão tripartite de validade foi proposta no “Standards for Educational and Psychological Testing” da American Psychological Association (APA) em 1966, considerada a maior autoridade sobre padrões de medição nas ciências sociais (Bandalos, 2018), e foi amplamente aceita por décadas. No entanto, essa visão veio recebendo severas críticas por ser limitada, fragmentada e confusa (Sireci & Sukin, 2013) e já não mais prevalece: vários tipos de validade dessa visão tradicional foram substituídos por uma nova visão (Widodo, 2018).
O lançamento dos standards de 1999 (AERA et al., 1999), seguidos pelos standards de 2014 (AERA et al., 2014), marcou uma mudança substancial no conceito de validade dos testes, que passou a ser associado à interpretação e uso dos escores dos testes (Furr, 2021). Com a nova estrutura, a validação passou a exigir várias evidências teóricas e empíricas. Atualmente, a visão prevalecente é da validade como um conceito unitário (validade de construto) e a existência de várias fontes de evidência que podem ser usadas para avaliar possíveis interpretações de escores de testes para fins específicos (Furr, 2021; Urbina, 2014).
Assim, de acordo com as principais autoridades em avaliação psicológica, validade refere-se ao grau que as evidências e a teoria apoiam a interpretação das pontuações dos testes para o propósito que foi concebido (AERA et al., 2014). Validade é um julgamento avaliativo integrado do grau em que as evidências empíricas e os fundamentos teóricos apoiam a adequação e apropriação das inferências e ações baseadas em pontuações de testes ou outros modos de avaliação (Bandalos, 2018; Furr, 2021; Urbina, 2014).
De acordo com os standards da APA (AERA et al., 2014), existem cinco fontes de evidências de validade para testes e medidas: baseadas no conteúdo, no processo de resposta, na relação com variáveis externas, nas consequências do uso do teste e na estrutura interna. A primeira tem a ver com o grau em que o conteúdo incluído em um teste fornece uma representação adequada do domínio a ser medido e somente o domínio mensurado (Furr, 2021). A segunda se refere ao ajuste entre o construto e a natureza detalhada do desempenho ou resposta dos examinados (Sireci & Sukin, 2013). A validade baseada na relação com variáveis externas se refere à correlação do teste com outros testes ou construtos que se espera que estejam relacionados ou não com o construto medido (Furr, 2021). A validade baseada nas consequências do uso do teste se refere aos efeitos positivos ou negativos que o uso do teste pode ter para os indivíduos ou grupos avaliados (Bandalos, 2018).
As evidências com base na estrutura interna estão relacionadas com o grau em que as relações entre os itens do teste e seus componentes estão em conformidade com o construto no qual as interpretações dos escores do instrumento de medida são baseadas (AERA et al., 2014; Rios & Wells, 2014). A evidência de validade baseada na estrutura interna pode vir de muitas fontes diferentes (Rios & Wells, 2014), incluindo a análise da (a) confiabilidade, (b) dimensionalidade e (c) invariância de medida.
A confiabilidade pode ser mensurada através da consistência interna, sendo representada pela i) a reprodutibilidade dos escores dos testes em administrações repetidas, realizadas nas mesmas condições e ii) também definida como a proporção da variância do escore verdadeiro em relação à variância do escore total observado (Rios & Wells, 2014). Na avaliação da dimensionalidade se está interessado, principalmente, em determinar se as inter-relações entre os itens suportam as inferências que serão produzidas pelo escore do modelo de medida proposto (Rios & Wells, 2014), que deve ser, essencialmente, unidimensional. Para análise da invariância torna-se útil fornecer evidências de que as características do item são comparáveis entre grupos conhecidos, como sexo ou raça.
Através da AFC podemos atacar essas três diferentes fontes para obter evidências da validade da estrutura interna (Bandalos, 2018; Flora & Flake, 2017; Hughes, 2018; Reeves & Marbach-Ad, 2016; Rios & Wells, 2014). Na maioria das situações em ciências sociais aplicadas o pesquisador tem uma estrutura dimensional teórica em mente (Sireci & Sukin, 2013), e o emprego da AFC torna-se recomendado para comparar a estrutura do modelo de medida hipotético ao observado (Rios & Wells, 2014).
A AFC é uma das principais ferramentas dentro do arcabouço da Modelagem de Equações Estruturais (SEM) baseada em covariâncias (CB-SEM) (Brown, 2023; Harrington, 2009; Jackson et al., 2009; Kline, 2023; Nye, 2022). A SEM é uma das ferramentas estatísticas mais utilizadas nas ciências sociais aplicadas (Hoyle, 2023; Kline, 2023). Ela é uma generalização da regressão múltipla e análise fatorial (Hoyle, 2023) e permite que os componentes dessas técnicas sejam integrados analiticamente. A SEM busca resolver problemas de pesquisa que envolvam mais de uma relação entre variáveis e que podem conter erros de mensuração (Hoyle, 2023), condizente com a necessidade para validações de modelos de medida.
As aplicações da AFC envolvem escolhas metodológicas que dependem da estrutura dos dados, do formato de resposta dos itens e dos objetivos do estudo (Crede & Harms, 2019; Flake et al., 2017; Flake & Fried, 2020; Jackson et al., 2009; Nye, 2022; Rogers, 2024). Essas escolhas também afetam a viabilidade da análise: a complexidade do modelo, a quantidade e a distribuição das categorias de resposta e o tamanho amostral podem influenciar a precisão das estimativas e o desempenho dos procedimentos de estimação (Rhemtulla et al., 2012). Por isso, considerar as implicações analíticas dos instrumentos ainda no planejamento da pesquisa pode evitar dificuldades nas etapas subsequentes.
Nesse sentido, surge o seguinte questionamento: existem escolhas numa aplicação AFC que podem “facilitar a vida” do cientista social para acessar evidências de validade da estrutura interna de um modelo de medida? Com esse questionamento não estamos de forma alguma sugerindo que se paute os objetivos da pesquisa a partir dos métodos quantitativos empregados. Objetivos da pesquisa são o norte da investigação científica, pois definem o que se quer descobrir e o que se considera relevante. O método quantitativo é um meio para atingir esses objetivos, mas não é o fim em si mesmo. O método quantitativo é apenas uma das muitas ferramentas disponíveis para os cientistas, e o objetivo da pesquisa é o que deve orientar a escolha do método (Pilcher & Cortazzi, 2023).
Na Psicometria, diversas questões metodológicas admitem mais de uma abordagem defensável. Nesses casos, a escolha deve considerar os objetivos da pesquisa e as consequências da modelagem para a interpretação dos resultados. Nesse artigo, adotamos uma recomendação prática: entre instrumentos adequados ao construto e à população de interesse, privilegiar aqueles cujos itens possam ser tratados como contínuos. Essa decisão deve ser planejada e justificada, pois oferece acesso às possibilidades analíticas da máxima verossimilhança (ML) sem exigir que o formato ordinal das respostas seja considerado, por si só, um impedimento (Rhemtulla et al., 2012; Robitzsch, 2020, 2022).
Para esse propósito, recomendamos instrumentos com itens de cinco ou mais categorias de resposta, preferencialmente sete, quando houver alternativas apropriadas e com evidências de validade para o uso pretendido. Estudos de simulação em AFC sustentam o emprego de ML robusta com cinco a sete categorias em diversas condições, com resultados particularmente favoráveis quando os limiares das categorias são aproximadamente simétricos (Rhemtulla et al., 2012).
O tratamento contínuo permite utilizar a ML e suas correções robustas, além de articular a estimação a procedimentos de avaliação e comparação de modelos e ao tratamento de dados ausentes (Rhemtulla et al., 2012; Robitzsch, 2020). A modelagem ordinal, por sua vez, também envolve pressupostos: a abordagem usual baseada em correlações policóricas pressupõe respostas contínuas subjacentes com distribuição normal. Portanto, não se trata de escolher entre uma abordagem com pressupostos e outra livre deles, mas de justificar qual representação é adequada aos objetivos da pesquisa (Robitzsch, 2020, 2022).
Essas vantagens tornam o tratamento contínuo uma escolha prática para o artigo. Na presença de dados ausentes, por exemplo, a ML com informação completa (FIML) permite incorporá-los à estimação, observadas as condições relativas ao modelo e ao mecanismo de ausência. A literatura também identifica cenários em que ML robusto apresenta desempenho favorável em amostras menores (Rhemtulla et al., 2012).
O presente artigo tem como proposta guiar os cientistas sociais aplicados sobre escolhas que eles podem tomar, desde a seleção do modelo de medida até a comparação e modificação dos modelos, e que pode aumentar a flexibilidade de sua AFC. O artigo ainda discorre sobre análise de poder, pré-processamento dos dados, processo de estimação e ajuste dos modelos de medidas. Esses assuntos são abordados sob a perspectiva do que fazer (Flake et al., 2017; Nye, 2022; Rogers, 2024), o que não fazer (Crede & Harms, 2019; Rogers, 2024), e o que reportar (Flake & Fried, 2020; Jackson et al., 2009; Rogers, 2024).
Essas sugestões têm a intenção de orientar aqueles que necessitam acessar a estrutura interna de modelos de medida através de uma AFC, para não caírem em armadilhas em nenhuma das etapas do processo de análise dos dados. Boas escolhas nas etapas iniciais podem evitar restrições em etapas subsequentes. Más escolhas em etapas iniciais podem lhe direcionar para um estudo exploratório, e/ou exigir maiores esforços nas etapas subsequentes.
Do ponto de vista prático, pretendemos apresentar um exemplo na forma de tutorial no R/Quarto, principalmente pelo uso do ecossistema baseado no pacote lavaan (Rosseel, 2023), seguindo todas as diretrizes para reprodutibilidade, replicabilidade e transparência preconizadas pelo movimento Ciência Aberta (CA) (Gilroy & Kaplan, 2019; Kathawalla et al., 2021; Klein et al., 2018).
Para além das práticas recomendadas de fluxo de trabalho de projetos de pesquisa, preprints, código reproduzível, compartilhamento de dados, redação transparente e relatórios registrados (Kathawalla et al., 2021), que foram delineadas e estão presentes nesse artigo, cremos que artigos-tutoriais como esse podem cumprir um papel importante para o ensino de métodos quantitativos em ciências sociais aplicadas (Martins, 2021; Mendes-Da-Silva, 2023).
Um artigo-tutorial tem como objetivo descrever uma técnica importante ou uma área de aplicação para leitores que não são especialistas no campo (Martins, 2021; Mendes-Da-Silva, 2023). Na medida que os leitores espelham as melhores práticas de pesquisadores experientes, a partir de protocolos claros, códigos e dados abertos e reutilizáveis, a comunidade científica passará ser menos afetada pelo viés positivo de publicação (P-hacking e HARKing).
Artigos-tutoriais que praticam os princípios FAIR (Findable, Accessible, Interoperable, and Reusable) (Wilkinson et al., 2016) e explicam de uma maneira didática (direta e simples), porém sem perder a profundidade e qualidade da execução, podem ajudar sobremaneira pesquisadores a aplicar uma técnica relevante para o campo (Martins, 2021; Mendes-Da-Silva, 2023). Acreditamos que esse seja o caso da presente proposta, que além de aplicar as práticas de CA (Gilroy & Kaplan, 2019; Kathawalla et al., 2021; Klein et al., 2018), discute uma técnica vastamente utilizada nas ciências sociais aplicadas (Crede & Harms, 2019).
Nessa perspectiva, a adoção da CA envolve incorporar seus princípios à rotina de pesquisa, mediante práticas de documentação, compartilhamento e formação de pesquisadores (Limongi & Rogers, 2025a). A articulação dessas práticas em um fluxo de trabalho requer organizar os materiais, registrar as alterações e conectar as análises à redação dos resultados (Limongi & Rogers, 2025b). Para operacionalizar essa articulação, adotamos como referência o ARTE (Article Reproducibility Template & Environment), um template que integra a organização do projeto, o controle de versões, a gestão de dependências computacionais e a elaboração de documentos dinâmicos (Rogers & Limongi, 2025).
O ARTE propõe uma adoção gradual dessas práticas, desde a organização e o compartilhamento dos materiais até o controle do ambiente computacional por meio de contêineres, conforme as necessidades do projeto e a familiaridade do pesquisador com as ferramentas (Rogers & Limongi, 2025). No presente tutorial, essa proposta orienta a organização dos dados e scripts e sua articulação com a narrativa em Quarto, permitindo vincular as decisões analíticas aos procedimentos que produzem as tabelas, figuras e estatísticas apresentadas. Essa organização também atende à finalidade didática do artigo: oferecer ao leitor uma estrutura que possa examinar, executar e adaptar às suas próprias aplicações de AFC.
O presente artigo-tutorial está organizado em uma seção de fundamentação, seis etapas aplicadas e uma conclusão, além desta introdução. Seguindo a proposta de Martins (2021) para artigos-tutoriais, a próxima seção apresenta uma revisão sólida da AFC, baseada em destacadas compilações de boas práticas (Crede & Harms, 2019; Flake et al., 2017; Flake & Fried, 2020; Jackson et al., 2009; Nye, 2022; Rogers, 2024), e os capítulos seguintes desenvolvem um exemplo de aplicação de pesquisa real (Rogers, 2022, 2024) no ecossistema do R e Quarto (https://quarto.org/), fornecendo os protocolos para estimar o método ou usar a técnica. Esses capítulos buscam seguir de perto a proposta do ARTE (Limongi & Rogers, 2025a, 2025b; Rogers & Limongi, 2025) e geram diversos materiais suplementares (https://phdpablo.github.io/smart-cfa/). Por último, apresentamos as considerações finais a título de conclusão.