Artigo

05 de outubro de 2026

Custos assistenciais referentes ao autismo na Saúde Suplementar: Uma abordagem com algoritmos não supervisionados

Custos Assistenciais Referentes ao Autismo na Saúde Suplementar: uma Abordagem com Algoritmos Não Supervisionados

Gustavo Guedes Alberto; Daniel Alvarez Firmino

DOI: 10.22167/2675-6528-202602973

Artigo derivado de Trabalho de Conclusão de Curso (TCC), com conteúdo baseado no trabalho original do aluno e adaptado ao formato editorial da Revista E&S com apoio da ferramenta ResumeAI, solução de inteligência artificial desenvolvida pelo Instituto Pecege para síntese e organização textual.

Resumo

O crescimento dos casos de Transtorno do Espectro Autista (TEA) e a ampliação da cobertura assistencial na saúde suplementar têm gerado impactos relevantes nos custos das operadoras, tornando necessária a compreensão dos padrões associados a esses gastos. Identificou-se e caracterizou-se perfis distintos de custos ambulatoriais relacionados ao tratamento do TEA em operadoras de planos privados de saúde no estado de São Paulo, utilizando dados de 2023 e algoritmos de aprendizado não supervisionado. A metodologia empregou a construção e tratamento de uma base de mais de quatro milhões de registros, aplicou o algoritmo k-means para identificar agrupamentos e utilizou a Análise de Correspondência Múltipla para explorar associações entre variáveis categóricas. Os resultados revelaram a existência de diferentes perfis de custo, com padrões distintos na intensidade de utilização dos serviços, composição dos procedimentos e modelos de remuneração. Observou-se grupos associados a atendimentos mais simples e padronizados, e outros a maior complexidade assistencial e volume de procedimentos. Identificaram-se associações entre os clusters e características demográficas e estruturais do sistema de saúde, indicando diferenças entre perfis etários e padrões de utilização, sem evidência de relação causal direta com redução de custos. Concluiu-se que a aplicação de técnicas de análise de dados aprimorou a compreensão da dinâmica dos custos assistenciais, oferecendo subsídios para análises e decisões na saúde suplementar.

Palavras-chave: Análise de Correspondência Múltipla; Análise Exploratória; K-means; Padrões de Custos; Segmentação de Dados.

1. Introdução

O Transtorno do Espectro Autista (TEA) é uma condição neurológica complexa, caracterizada por desafios na interação social e comunicação, bem como por padrões restritos e repetitivos de comportamentos e interesses, manifestando-se geralmente nos primeiros anos de vida (APA, 2025). Nas últimas décadas, a prevalência do TEA tem demonstrado um aumento significativo em escala global. Borges et al. (2024) indicam que as taxas, que eram de quatro a cinco casos por 10.000 indivíduos nas décadas de 1960 e 1970, atualmente se situam entre 1% e 1,5%. Nos Estados Unidos, a prevalência passou de 6,7 por 1.000 crianças em 2000 para 27,6 por 1.000 em 2020 (CDC, 2024). Esse cenário crescente sublinha a importância do diagnóstico e da intervenção precoce, tanto para a melhoria da qualidade de vida das pessoas com TEA quanto para a otimização dos sistemas de saúde.

No Brasil, a saúde é um direito constitucionalmente assegurado, envolvendo tanto o Sistema Único de Saúde (SUS) quanto a atuação complementar da iniciativa privada (BRASIL, 1988; BRASIL, 1990). A legislação brasileira tem evoluído para fortalecer o direito ao diagnóstico e tratamento do TEA (BRASIL, 2015), o que tem ampliado a demanda por serviços especializados. Nesse contexto, a saúde suplementar desempenha um papel crucial na oferta desses serviços, sendo regulada e fiscalizada pela Agência Nacional de Saúde Suplementar (ANS, 2022a; ANS, 2022b; ANS, 2025). A crescente demanda por terapias relacionadas ao TEA também intensificou sua relevância econômica. Bouder et al. (2010) já apontavam que os gastos médicos de crianças com autismo podiam ser de três a dez vezes maiores do que os de crianças sem o transtorno. No Brasil, a ampliação da cobertura obrigatória de sessões com psicólogos, terapeutas ocupacionais e fonoaudiólogos pela ANS (ANS, 2022c) levou a um aumento expressivo dos custos. Em 2023, os gastos com terapias para TEA e Transtornos Globais do Desenvolvimento (TGD) representaram 9% de todas as despesas médicas dos planos de saúde no país, superando os tratamentos oncológicos (Cunha, 2024).

Apesar da notável relevância econômica e assistencial do Transtorno do Espectro Autista na saúde suplementar, existe uma lacuna na literatura e na prática analítica brasileira. As análises disponíveis frequentemente se limitam a estimativas agregadas de gastos ou a recortes específicos de uso, sem explorar a heterogeneidade dos padrões assistenciais e financeiros entre os atendimentos. Essa limitação impede uma compreensão aprofundada dos fatores que influenciam os custos e dificulta o desenvolvimento de estratégias eficazes de regulação, gestão e planejamento no setor de saúde suplementar.

Diante dessa lacuna, este trabalho se justifica pela necessidade de uma compreensão mais granular dos custos assistenciais do TEA, o que pode subsidiar a tomada de decisões mais informadas por operadoras e gestores. A pesquisa buscou segmentar beneficiários e procedimentos em grupos homogêneos, analisando custos médios e variáveis associadas, e investigando a vantagem financeira de tratamentos precoces. Assim, este trabalho teve como objetivo identificar e caracterizar perfis distintos de custos ambulatoriais relacionados ao tratamento do TEA nas operadoras de planos privados de saúde no estado de São Paulo, com base em dados de 2023, por meio da aplicação de algoritmos de aprendizado de máquina não supervisionados.

2. Material e Métodos

O presente trabalho caracterizou-se como uma pesquisa exploratória e aplicada, com abordagem metodológica quantitativa. O estudo buscou aprofundar a compreensão dos custos assistenciais do Transtorno do Espectro Autista (TEA) na saúde suplementar, integrando técnicas estatísticas e de aprendizado de máquina não supervisionado (Gil, 2022). O objetivo foi identificar e caracterizar perfis distintos de custos ambulatoriais relacionados ao tratamento do TEA em operadoras de planos privados de saúde no estado de São Paulo, com base em dados de 2023.

A pesquisa utilizou dados secundários da Agência Nacional de Saúde Suplementar (ANS), referentes à produção ambulatorial de 2023, com granularidade transacional de eventos assistenciais. A coleta e montagem do banco de dados envolveu a obtenção de vinte e quatro arquivos “csv” do portal de dados abertos da ANS (ANS, 2023a) para o estado de São Paulo. Uma aplicação em Python foi desenvolvida para estruturar a base, filtrando procedimentos por vinte e quatro códigos ambulatoriais da Tabela TUSS (ANS, 2023b) associados ao tratamento de transtornos do neurodesenvolvimento, excluindo procedimentos hospitalares e de fisioterapia.

Os códigos TUSS incluíram seis para fonoaudiologia, onze para terapia ocupacional e sete para psicologia. Após a junção das bases detalhada e consolidada, a base inicial resultou em 4.339.856 observações e vinte e oito variáveis. Uma limitação identificada foi a ausência de identificação diagnóstica direta (CID), o que exigiu o uso de procedimentos como critério indireto para a identificação de atendimentos relacionados ao TEA.

A etapa de tratamento e preparação dos dados visou garantir consistência e reduzir ruídos. Variáveis pouco relevantes ou com elevado volume de dados ausentes, como ID_EVENTO_ATENCAO_SAUDE, ID_PLANO, UF_PRESTADOR, IND_TABELA_PROPRIA, IND_PACOTE, CD_TABELA_REFERENCIA, CD_MODALIDADE, UNIDADE_MEDIDA e SAUDE_OCUPACIONAL, foram removidas, reduzindo o conjunto para vinte variáveis. Ajustes foram realizados nas categorias de variáveis como FAIXA_ETARIA e PORTE, com remoção de acentos e substituição de valores numéricos por descrições textuais conforme tabelas TUSS. FAIXA_ETARIA foi reagrupada em cinco classes, e PORTE foi agregada.

Valores faltantes foram removidos das variáveis QT_ITEM_EVENTO_INFORMADO, VL_ITEM_EVENTO_INFORMADO, VL_ITEM_PAGO_FORNECEDOR, CD_MUNICIPIO_BENEFICIARIO e FAIXA_ETARIA. O tratamento de valores extremos nas variáveis monetárias foi realizado pelo método do intervalo interquartil (IQR). As variáveis quantitativas foram padronizadas por z-score, e a variável qualitativa perfil_procedimento foi transformada em variáveis binárias pela técnica de one-hot encoding. Após todas as etapas de tratamento, a base final para as análises continha 4.080.542 observações.

A clusterização buscou identificar padrões de comportamento associados à estrutura de custos dos procedimentos ambulatoriais, agrupando observações com características semelhantes (Fávero e Belfiore, 2025). Para isso, foram selecionadas as variáveis quantitativas QT_ITEM_EVENTO_INFORMADO, VL_ITEM_EVENTO_INFORMADO e VL_ITEM_PAGO_FORNECEDOR, além da variável qualitativa perfil_procedimento, incorporada como variáveis binárias. O algoritmo K-means foi empregado devido à sua eficiência computacional e adequação a bases de grande volume.

A definição do número de clusters utilizou métodos exploratórios complementares: o método do cotovelo (Elbow Method) (Fávero e Belfiore, 2025), a análise da silhueta (Rousseeuw, 1987) e a técnica t-SNE para visualização. A escolha final de cinco clusters baseou-se na análise conjunta desses métodos e na interpretabilidade dos agrupamentos. Uma análise de variância de um fator (ANOVA) verificou a capacidade das variáveis em diferenciar os grupos.

Após a clusterização, aplicou-se a Análise de Correspondência Múltipla (ACM) para caracterizar os clusters a partir de variáveis qualitativas e analisar associações entre os agrupamentos e as características dos beneficiários e operadoras. A ACM é uma técnica exploratória multivariada para relações entre variáveis categóricas (Fávero e Belfiore, 2025). Foram incluídas as variáveis NM_MODALIDADE, faixa etária agrupada, porte agregado, SEXO e Cluster. Variáveis com alta cardinalidade ou redundância, como CD_MUNICIPIO_BENEFICIARIO e CBO, foram excluídas.

3. Resultados e Discussão

A análise dos dados, precedendo a aplicação dos algoritmos de clusterização e Análise de Correspondência Múltipla (ACM), revelou padrões significativos na distribuição dos registros assistenciais e nos procedimentos relacionados ao Transtorno do Espectro Autista (TEA). Essa etapa exploratória foi fundamental para contextualizar as variáveis e identificar tendências que influenciariam a formação dos agrupamentos e a interpretação dos perfis de custo. A base de dados, composta por mais de quatro milhões de registros de atendimentos ambulatoriais no estado de São Paulo em 2023, permitiu uma visão abrangente da dinâmica assistencial.

No que se refere ao perfil dos procedimentos, observou-se uma forte predominância de atendimentos classificados como Psico, que representaram 73,43% do total das observações. Os procedimentos de Fonoaudiologia corresponderam a 19,09%, enquanto os de Terapia Ocupacional (TO) totalizaram 7,48% dos registros. Essa concentração em procedimentos psicológicos sugere um volume elevado de intervenções terapêuticas dessa natureza. Quanto ao sexo dos beneficiários, a distribuição indicou uma maior proporção de atendimentos para o sexo feminino, com 57,2% das ocorrências, em contraste com 42,8% para o sexo masculino. Esse achado pode refletir particularidades no acesso ou registro dos serviços.

A distribuição por faixa etária dos beneficiários mostrou que a maior concentração de procedimentos ocorreu na faixa de 5 a 14 anos, correspondendo a 29,14% dos registros. Em seguida, destacaram-se as faixas de 30 a 49 anos (26,95%) e 15 a 29 anos (21,21%). As faixas de 0 a 4 anos e 50 anos ou mais apresentaram participações menores, com 11,78% e 10,91%, respectivamente. Esse padrão etário é compatível com a maior demanda por acompanhamento terapêutico em idades escolares e em adultos jovens, o que pode influenciar a estrutura de custos dos serviços de saúde suplementar.

Em relação ao porte das operadoras, a categoria “Grande” concentrou aproximadamente 75,05% dos registros avaliados, indicando que a maior parte dos procedimentos assistenciais foi realizada em estabelecimentos de maior porte, que geralmente possuem maior capacidade operacional. As modalidades de operadoras também apresentaram uma distribuição notável, com a Medicina de Grupo respondendo por 44,16% das ocorrências. Cooperativas Médicas, Seguradoras Especializadas em Saúde, Autogestão e Filantropia apresentaram participações menores. Esse cenário reflete a predominância do modelo empresarial no mercado de saúde suplementar brasileiro.

A análise das variáveis quantitativas revelou características importantes sobre os custos. A variável `QT_ITEM_EVENTO_INFORMADO`, que mede a quantidade de procedimentos por evento, apresentou uma média de 1,42 e mediana de 1, indic indicando que a maioria dos eventos envolvia apenas um procedimento. Embora houvesse valores máximos elevados, como 264, sugerindo eventos com múltiplos itens assistenciais, a distribuição manteve uma assimetria à direita, comum em dados administrativos de saúde, mesmo após o tratamento de outliers pelo método IQR.

Para a variável `VL_ITEM_EVENTO_INFORMADO`, que representa o valor do procedimento, a média foi de R$87,15 e a mediana de R$45,46. Isso aponta para uma distribuição assimétrica, com valores mais altos concentrados em uma parcela menor dos registros. O desvio padrão de R$85,55 reforçou a dispersão significativa, e os quartis indicaram que 50% das observações tinham valores inferiores a R$45, enquanto 75% estavam abaixo de R$114. Esses dados sugerem a predominância de procedimentos de menor valor unitário no conjunto analisado.

A variável `VL_ITEM_PAGO_FORNECEDOR`, que corresponde ao valor pago pela operadora ao prestador, apresentou uma média de R$1,25 e uma mediana de R$0,00. Essa característica indicou uma forte concentração de registros sem pagamento direto ao fornecedor, o que pode estar associado a diferentes formas de remuneração ou registro dos procedimentos. O desvio padrão de R$12,76 e o valor máximo de R$340 revelaram a existência de eventos com pagamentos substanciais, apesar da maioria dos registros ser nula, evidenciando uma elevada assimetria na distribuição.

De maneira geral, as variáveis quantitativas demonstraram distribuições assimétricas e uma concentração em valores baixos, com a presença de caudas longas à direita. Esse comportamento ressaltou a necessidade de técnicas robustas de tratamento e modelagem, como as empregadas neste estudo, e indicou que a estrutura de custos pode ser significativamente influenciada por um subconjunto de eventos de maior valor. A análise exploratória inicial, portanto, forneceu um panorama essencial para as etapas subsequentes de clusterização e interpretação dos perfis de custo.

Clusterização

A etapa de clusterização teve como propósito identificar padrões de comportamento associados à estrutura de custos dos procedimentos ambulatoriais, agrupando observações com características semelhantes. Inicialmente, a análise da matriz de correlação de Pearson entre as variáveis quantitativas e as variáveis binárias de perfil de procedimento revelou uma correlação moderada de 0,55 entre `QT_ITEM_EVENTO_INFORMADO` e `VL_ITEM_EVENTO_INFORMADO`. As demais correlações foram baixas, e as correlações negativas entre as variáveis “dummies” de perfil de procedimento eram esperadas, dada a exclusividade mútua das categorias. Esses resultados confirmaram a adequação da base para a aplicação do algoritmo de clusterização, indicando ausência de multicolinearidade relevante.

Para determinar o número ideal de clusters, foram empregados métodos exploratórios complementares. O método do cotovelo (Elbow Method) indicou uma redução acentuada da variabilidade intra-grupo até aproximadamente cinco clusters. A partir desse ponto, os ganhos na redução da soma dos quadrados dentro dos clusters (WCSS) tornaram-se marginais, sugerindo que cinco grupos seriam suficientes para capturar uma parcela significativa da variabilidade dos dados (Fávero e Belfiore, 2025). Este ponto de inflexão na curva é frequentemente interpretado como o número mínimo de clusters para representar adequadamente a estrutura dos dados.

A métrica da silhueta, que avalia a coesão interna e a separação entre os clusters, foi o segundo método utilizado. Os resultados obtidos por meio de diferentes abordagens, incluindo o algoritmo K-means em amostras representativas, indicaram valores relativamente elevados da silhueta média para números de clusters superiores a quatro, com um desempenho máximo próximo a nove clusters. Contudo, a escolha final não se baseou apenas na maximização dessa métrica, mas também em critérios de interpretabilidade, conforme sugerido por Hair et al. (2019) para estudos exploratórios.

A visualização dos agrupamentos em espaço bidimensional, utilizando a técnica de redução de dimensionalidade t-SNE (t-Distributed Stochastic Neighbor Embedding), complementou a avaliação. A comparação entre as soluções com quatro e cinco clusters evidenciou que a solução com cinco clusters proporcionou uma separação mais equilibrada e revelou padrões adicionais na estrutura dos dados, subdividindo um agrupamento anteriormente dominante. A definição de k=5, portanto, resultou da análise conjunta do método do cotovelo, da qualidade de separação da silhueta, da estrutura visual do t-SNE e da interpretabilidade dos perfis, buscando um equilíbrio entre qualidade estatística, parcimônia e utilidade analítica.

Como etapa adicional de validação, realizou-se uma Análise de Variância (ANOVA) para verificar se as variáveis utilizadas no modelo apresentavam diferenças estatisticamente significativas entre os grupos identificados. Os resultados da ANOVA indicaram que todas as variáveis analisadas apresentaram diferenças estatisticamente significativas entre pelo menos dois clusters, com um p-valor inferior a 0,001 ao nível de significância de 5%. A análise do tamanho de efeito (eta quadrado parcial – np²) revelou que as variáveis quantitativas `QT_ITEM_EVENTO_INFORMADO` (np² = 0,7816), `VL_ITEM_EVENTO_INFORMADO` (np² = 0,7473) e `VL_ITEM_PAGO_FORNECEDOR` (np² = 0,7815) apresentaram elevada capacidade discriminatória.

Entre as variáveis qualitativas, `perfil_procedimento_Psico` (np² = 0,8306) e `perfil_procedimento_fono` (np² = 0,5487) também demonstraram forte poder de diferenciação, enquanto `perfil_procedimento_TO` apresentou contribuição moderada (np² = 0,1809). Esses resultados confirmaram que as variáveis relacionadas à estrutura de custos e à natureza dos procedimentos desempenharam um papel central na diferenciação dos clusters. Isso reforçou a consistência dos perfis de custo identificados, indicando que os agrupamentos refletiam diferenças reais nos padrões de utilização dos serviços e nos níveis de gasto assistencial, e não apenas variações aleatórias nos dados.

Interpretação dos Clusters

A síntese das características de cada cluster permitiu uma compreensão aprofundada dos padrões assistenciais e financeiros que os diferenciam. Os clusters apresentaram tamanhos distintos, com o Cluster 4 concentrando a maior parte da base (54,63%), seguido pelos Clusters 1 (22,43%), 3 (13,13%), 2 (9,35%) e 0 (0,47%). Para auxiliar na interpretação, utilizou-se o conceito de perfil dominante, que indica o tipo de procedimento mais frequente, e a força da dominância, que representa o grau de concentração desse perfil. O indicador lift mediu a presença de um perfil de procedimento em um cluster em relação à base total, com valores acima de 1 indicando representação elevada.

O Cluster 4 foi caracterizado pela predominância absoluta de procedimentos psicológicos (100%), com valores informados de nível médio na distribuição da base. Os atendimentos eram realizados de forma individual, sem pagamento direto ao fornecedor, e os valores unitários eram baixos, com mediana de R$40. Esse perfil sugere sessões ambulatoriais rotineiras e padronizadas. O Cluster 1, por sua vez, concentrou procedimentos fonoaudiológicos (72%), com cerca de 28% de terapia ocupacional. Os valores informados também eram de nível médio, com mediana de R$39,82, e os procedimentos eram individuais, sem pagamento direto ao fornecedor, indicando atendimentos ambulatoriais padronizados.

O Cluster 3 foi predominantemente composto por procedimentos psicológicos (86%), com valores informados de nível alto na distribuição da base. Caracterizou-se por procedimentos individuais, sem pagamento direto ao fornecedor, mas com valores unitários mais elevados (mediana de R$200) em comparação com os clusters anteriores. Esse padrão sugeriu a presença de atendimentos mais especializados ou modalidades específicas de intervenção. O Cluster 2 também foi predominantemente psicológico (76%), mas associado a uma maior quantidade de itens por registro e valores informados elevados (mediana de R$227), embora ainda sem pagamento direto ao fornecedor. Com uma mediana de quatro itens por registro, esse cluster indicou eventos assistenciais mais complexos, possivelmente envolvendo agrupamento de procedimentos ou maior intensidade de utilização de serviços.

O Cluster 0, embora o de menor representatividade na base (0,47%), destacou-se por características distintas. Composto majoritariamente por procedimentos psicológicos (55%), mas com menor grau de concentração, indicando heterogeneidade. Economicamente, apresentou valores informados (mediana de R$159) e pagos ao fornecedor (mediana de R$159) de nível alto, além de uma maior quantidade de itens por registro (mediana de dois procedimentos). A presença relevante de pagamento direto ao fornecedor, diferentemente dos demais clusters, sugeriu a ocorrência de procedimentos mais complexos ou modelos de remuneração diferenciados.

Análise de Correspondência Múltipla

A Análise de Correspondência Múltipla (ACM) foi empregada para interpretar os clusters a partir de variáveis qualitativas, complementando a clusterização. Testes de independência qui-quadrado entre a variável “Cluster” e as demais variáveis categóricas (`NM_MODALIDADE`, `Faixa etária agrupada`, `SEXO`, `Porte agregado`) confirmaram que todas as associações foram estatisticamente significativas (p < 0,05), justificando a aplicação da técnica. A decomposição da inércia revelou que as duas primeiras dimensões da ACM explicaram conjuntamente 23,22% da variabilidade total dos dados, com 13,27% atribuídos à primeira dimensão e 9,95% à segunda. Embora esse percentual possa parecer reduzido, é um comportamento esperado em análises de correspondência com múltiplas categorias, onde a variabilidade se dispersa entre diversas dimensões (Fávero e Belfiore, 2025).

A análise do mapa perceptual indicou que a dimensão 1 representou um eixo de diferenciação entre perfis etários e modalidades assistenciais. Observou-se uma oposição entre faixas etárias mais jovens (0 a 4 anos e 5 a 14 anos), posicionadas no lado positivo da dimensão, e faixas etárias adultas (15 a 49 anos), posicionadas no lado negativo. A dimensão 2 foi associada ao perfil assistencial e à intensidade do uso dos serviços, com categorias de maior demanda assistencial e determinados clusters apresentando valores positivos, enquanto perfis de menor intensidade ou maior dispersão se posicionaram no lado negativo.

A terceira dimensão, responsável por cerca de 8,16% da inércia total, acrescentou uma camada interpretativa relacionada à estrutura organizacional do sistema de prestação de serviços de saúde. Observou-se a oposição entre categorias como porte pequeno, autogestão e filantropia, no extremo positivo, e estruturas mais tradicionais e consolidadas do mercado, como seguradoras especializadas, no extremo negativo. Dessa forma, a ACM permitiu uma compreensão integrada dos fatores demográficos, assistenciais e estruturais na formação dos agrupamentos.

O Cluster 0 apresentou associação com o sexo masculino e com faixas etárias mais jovens (5 a 14 anos), situando-se no quadrante positivo das dimensões 1 e 2. Sua posição negativa na dimensão 3 sugeriu proximidade com estruturas mais formalizadas do sistema de saúde, como seguradoras especializadas. Esse resultado, em conjunto com a clusterização, que mostrou equivalência entre valores informados e pagos ao fornecedor, indicou um padrão assistencial possivelmente baseado em repasse direto de custos, característico de modelos mais estruturados e intermediados.

O Cluster 1 apresentou forte associação com a faixa etária de 0 a 4 anos, posicionando-se no extremo positivo da dimensão 1, o que indicou um perfil claramente infantil. Sua proximidade com a modalidade filantrópica sugeriu associação com esse tipo de prestador de serviços de saúde. A posição na dimensão 2 indicou diferenciação no perfil assistencial em relação aos demais clusters, podendo refletir maior especificidade no tipo de atendimento. Na dimensão 3, o Cluster 1 apresentou coordenada próxima de zero, indicando baixa associação com os polos estruturais identificados nessa dimensão, sugerindo que o cluster não é significativamente influenciado pelo tipo de organização do sistema de saúde, sendo sua caracterização mais fortemente explicada por fatores demográficos e assistenciais.

O Cluster 2 posicionou-se no lado negativo da dimensão 1, afastando-se das faixas etárias mais jovens, especialmente de 0 a 4 anos, e aproximando-se de categorias que representam perfis etários intermediários. Sua proximidade com a modalidade “Seguradora Especializada em Saúde” indica associação com estruturas mais formalizadas do sistema de saúde. A posição no eixo positivo da dimensão 2 sugere diferenciação no perfil assistencial em relação aos demais clusters. Quando analisado em conjunto com os resultados da clusterização, esse grupo apresentou características associadas a padrões de utilização mais estruturados dos serviços de saúde, embora não seja possível inferir diretamente a existência de continuidade ou recorrência dos atendimentos a partir das variáveis analisadas.

O Cluster 3 posicionou-se no lado positivo da dimensão 3, indicando associação com estruturas organizacionais menos tradicionais do sistema de saúde, como autogestão, filantropia e prestadores de menor porte. Nas dimensões 1 e 2, apresentou distribuição mais dispersa, sem forte associação com faixas etárias extremas ou modalidades específicas, sugerindo um perfil assistencial mais heterogêneo. Esse comportamento indicou que o cluster é menos definido por características demográficas e mais influenciado por aspectos estruturais do sistema de saúde. Em conjunto com a clusterização, esse grupo pode refletir padrões diferenciados de organização da oferta de serviços, embora sem evidência de predominância de um perfil assistencial específico.

O Cluster 4 apresentou posicionamento próximo ao centro da dimensão 3, indicando baixa influência de fatores estruturais do sistema de saúde. Nas dimensões 1 e 2, situou-se em região oposta aos clusters associados ao público infantil, sugerindo associação com faixas etárias mais elevadas ou menos concentradas nas idades iniciais. Esse padrão indicou um perfil assistencial mais generalista, sem forte concentração em modalidades específicas. A análise conjunta com a clusterização reforçou essa interpretação, evidenciando a presença de procedimentos de menor valor unitário e menor complexidade relativa, possivelmente relacionados a atendimentos mais padronizados.

Em síntese, os resultados da clusterização e da ACM evidenciaram que os custos assistenciais relacionados ao TEA não seguem um padrão homogêneo, mas se organizam em perfis distintos, influenciados por múltiplos fatores assistenciais, demográficos e organizacionais. Observou-se a coexistência de grupos caracterizados por atendimentos mais simples e padronizados, com baixo valor unitário, e outros associados a maior volume de procedimentos e valores mais elevados, indicando maior intensidade de cuidado. Esses achados demonstram que a análise agregada dos custos pode mascarar diferenças importantes entre perfis assistenciais, reforçando a necessidade de abordagens segmentadas para compreensão e gestão dos gastos na saúde suplementar, respondendo ao objetivo do estudo de identificar e caracterizar perfis de custos.

A análise dos dados, precedendo a aplicação dos algoritmos de clusterização e Análise de Correspondência Múltipla (ACM), revelou padrões significativos na distribuição dos registros assistenciais e nos procedimentos relacionados ao Transtorno do Espectro Autista (TEA). Essa etapa exploratória foi fundamental para contextualizar as variáveis e identificar tendências que influenciariam a formação dos agrupamentos e a interpretação dos perfis de custo. A base de dados, composta por mais de quatro milhões de registros de atendimentos ambulatoriais no estado de São Paulo em 2023, permitiu uma visão abrangente da dinâmica assistencial.

No que se refere ao perfil dos procedimentos, observou-se uma forte predominância de atendimentos classificados como Psico, que representaram 73,43% do total das observações. Os procedimentos de Fonoaudiologia corresponderam a 19,09%, enquanto os de Terapia Ocupacional (TO) totalizaram 7,48% dos registros. Esta distribuição indicou uma elevada concentração da base em procedimentos psicológicos, sugerindo um maior volume de atendimentos relacionados a este tipo de intervenção terapêutica. Quanto ao sexo dos beneficiários, a distribuição indicou uma maior proporção de atendimentos para o sexo feminino, com 57,2% das ocorrências, em contraste com 42,8% para o sexo masculino. Esse achado pode refletir particularidades no acesso ou registro dos serviços.

A distribuição por faixa etária dos beneficiários mostrou que a maior concentração de procedimentos ocorreu na faixa de 5 a 14 anos, correspondendo a 29,14% dos registros. Em seguida, destacaram-se as faixas de 30 a 49 anos, com 26,95%, e 15 a 29 anos, com 21,21% das observações. As faixas de 0 a 4 anos e 50 anos ou mais apresentaram participações menores, com 11,78% e 10,91%, respectivamente. Esse padrão etário é compatível com a maior demanda por acompanhamento terapêutico em idades escolares e em adultos jovens, o que pode influenciar diretamente a estrutura de custos dos serviços de saúde suplementar.

Em relação ao porte das operadoras, a categoria “Grande” concentrou aproximadamente 75,05% dos registros avaliados, indicando que a maior parte dos procedimentos assistenciais foi realizada em estabelecimentos de maior porte, os quais tendem a possuir maior capacidade operacional. As modalidades de operadoras também apresentaram uma distribuição notável, com a Medicina de Grupo respondendo por 44,16% das ocorrências. As demais modalidades, como Cooperativa Médica, Seguradora Especializada em Saúde, Autogestão e Filantropia, apareceram com participações menores. Esse cenário reflete a predominância do modelo empresarial no mercado de saúde suplementar brasileiro.

A análise das variáveis quantitativas revelou características importantes sobre os custos. A variável `QT_ITEM_EVENTO_INFORMADO`, que mede a quantidade de procedimentos por evento, apresentou uma média de 1,42 e mediana igual a 1, indicando predominância de eventos com apenas um procedimento. Embora houvesse valores máximos elevados (até 264), sugerindo eventos com múltiplos itens assistenciais, a distribuição manteve uma elevada assimetria à direita, característica comum em dados administrativos de saúde, mesmo após a aplicação do método IQR para remoção de valores extremos.

Para a variável `VL_ITEM_EVENTO_INFORMADO`, que indica o valor do procedimento ou grupo de procedimentos assistenciais informados, a média foi de R$87,15 e a mediana de R$45,46. Isso aponta para uma distribuição assimétrica, com valores mais elevados concentrados em uma parcela menor dos registros. O desvio padrão relativamente alto (R$85,55) reforçou a presença de dispersão significativa. Os quartis indicaram que 50% das observações apresentaram valores inferiores a aproximadamente R$45, enquanto 75% dos procedimentos possuíam valores inferiores a R$114. Esses dados sugerem a predominância de procedimentos de menor valor unitário no conjunto analisado.

A variável `VL_ITEM_PAGO_FORNECEDOR`, que representa o valor pago pela operadora diretamente ao prestador do serviço, apresentou média de R$1,25 e mediana de R$0,00. Esta característica indicou forte concentração de registros sem pagamento direto ao fornecedor, possivelmente associada a diferentes formas de remuneração ou registro dos procedimentos assistenciais. O desvio padrão de R$12,76 e o valor máximo de R$340 indicaram que, embora a maior parte dos registros apresentasse valores nulos, existiam eventos com pagamentos bastante superiores, sugerindo elevada assimetria na distribuição dessa variável.

De maneira geral, as variáveis quantitativas demonstraram distribuições assimétricas e uma concentração em valores baixos, com a presença de caudas longas à direita. Esse comportamento reforçou a necessidade de utilização de técnicas robustas de tratamento e modelagem, como as adotadas neste estudo, além de indicar que a estrutura de custos pode ser fortemente influenciada por um subconjunto reduzido de eventos de maior valor. A análise exploratória inicial, portanto, forneceu um panorama essencial para as etapas subsequentes de clusterização e interpretação dos perfis de custo.

Clusterização

A etapa de clusterização teve como propósito identificar padrões de comportamento associados à estrutura de custos dos procedimentos ambulatoriais, por meio do agrupamento de observações com características semelhantes. Inicialmente, a análise da matriz de correlação de Pearson entre as variáveis quantitativas e as variáveis binárias de perfil de procedimento revelou uma correlação moderada de 0,55 entre `QT_ITEM_EVENTO_INFORMADO` e `VL_ITEM_EVENTO_INFORMADO`. As demais correlações apresentaram valores baixos, e as correlações negativas observadas entre as variáveis “dummies” de perfil de procedimento são esperadas, uma vez que representam categorias mutuamente exclusivas. Esses resultados confirmaram a adequação da base para a aplicação do algoritmo de clusterização, indicando ausência de multicolinearidade relevante.

Para determinar o número adequado de clusters, foram empregados métodos exploratórios complementares. O método do cotovelo (Elbow Method) indicou uma redução acentuada da variabilidade intra-grupo até aproximadamente cinco clusters. A partir desse ponto, os ganhos na redução da soma dos quadrados dentro dos clusters (WCSS) tornaram-se marginais, sugerindo que cinco grupos já capturavam uma parcela significativa da variabilidade presente no conjunto de dados (Fávero e Belfiore, 2025). Este comportamento caracteriza o ponto de inflexão na curva, frequentemente interpretado na literatura como o número mínimo de clusters necessário para representar adequadamente a estrutura de dados.

A métrica da silhueta, que avalia simultaneamente a coesão interna e a separação entre os clusters, foi o segundo método utilizado. Os resultados obtidos por meio de três abordagens distintas, incluindo o algoritmo K-means em amostras representativas, indicaram valores relativamente elevados da silhueta média para diferentes números de clusters, com desempenho máximo próximo a nove clusters. Contudo, a escolha final não se baseou exclusivamente na maximização dessa métrica, mas considerou também critérios de interpretabilidade, especialmente em estudos exploratórios (Hair et al., 2019).

A visualização dos agrupamentos em espaço bidimensional, utilizando a técnica de redução de dimensionalidade t-SNE (t-Distributed Stochastic Neighbor Embedding), complementou a avaliação. A projeção realizada em uma amostra de 100.000 observações permitiu observar a distribuição espacial dos clusters. A comparação entre as soluções com quatro e cinco clusters evidenciou que a solução com cinco clusters proporcionou uma separação mais equilibrada e revelou padrões adicionais na estrutura dos dados, subdividindo um agrupamento anteriormente dominante.

A definição de k=5, portanto, resultou da análise conjunta do comportamento do método do cotovelo, da qualidade de separação indicada pela silhueta, da estrutura visual observada pelo t-SNE e da interpretabilidade dos perfis obtidos, buscando equilibrar qualidade estatística, parcimônia e utilidade analítica. Este processo de validação adicional conferiu maior robustez à estrutura dos clusters obtidos, reforçando a confiança nos agrupamentos identificados como representativos dos padrões de custo assistencial.

Como etapa adicional de validação, realizou-se uma Análise de Variância (ANOVA) com o objetivo de verificar se as variáveis utilizadas no modelo apresentavam diferenças estatisticamente significativas entre os grupos identificados. Os resultados da ANOVA indicaram que todas as variáveis analisadas apresentaram diferenças estatisticamente significativas entre pelo menos dois clusters, com um p-valor inferior a 0,001 ao nível de significância de 5%. Isso confirmou que os agrupamentos não eram resultado de variações aleatórias, mas sim de distinções reais nos dados.

Além da significância estatística, a análise do tamanho de efeito (eta quadrado parcial – np²) revelou que as variáveis quantitativas relacionadas à quantidade e valores dos eventos apresentaram elevada capacidade discriminatória. Destacaram-se `QT_ITEM_EVENTO_INFORMADO` (np² = 0,7816), `VL_ITEM_EVENTO_INFORMADO` (np² = 0,7473) e `VL_ITEM_PAGO_FORNECEDOR` (np² = 0,7815). Entre as variáveis qualitativas, `perfil_procedimento_Psico` (np² = 0,8306) e `perfil_procedimento_fono` (np² = 0,5487) também demonstraram forte poder de diferenciação, enquanto `perfil_procedimento_TO` apresentou contribuição moderada (np² = 0,1809).

Esses resultados indicaram que as variáveis relacionadas à estrutura de custos e à natureza dos procedimentos desempenharam papel central na diferenciação dos clusters. Do ponto de vista prático, isso evidenciou que os agrupamentos identificados refletiram diferenças reais nos padrões de utilização dos serviços e nos níveis de gasto assistencial, e não apenas variações aleatórias nos dados, reforçando a consistência dos perfis de custo identificados. A validação estatística, portanto, fortaleceu a interpretabilidade e a utilidade analítica dos clusters formados.

Interpretação dos Clusters

A síntese das características de cada cluster permitiu uma compreensão aprofundada dos padrões assistenciais e financeiros que os diferenciam. Os clusters apresentaram tamanhos distintos, indicando uma forte heterogeneidade nas distribuições dos registros assistenciais. O Cluster 4 concentrou a maior parte da base (54,63%), seguido pelos Clusters 1 (22,43%), 3 (13,13%), 2 (9,35%) e 0 (0,47%). Para auxiliar na interpretação, utilizou-se o conceito de perfil dominante, que indica o tipo de procedimento mais frequente, e a força da dominância, que representa o grau de concentração desse perfil. O indicador lift mediu a presença de um perfil de procedimento em um cluster em relação à base total, com valores acima de 1 indicando representação elevada.

O Cluster 4 foi identificado como sendo aquele contendo predominantemente procedimentos psicológicos, com uma predominância absoluta desse perfil (100%) e valores informados de nível médio na distribuição da base. Caracterizou-se por atendimentos realizados de forma individual, sem pagamento direto ao fornecedor. Apesar da classificação relativa, os valores corresponderam, em termos absolutos, a procedimentos de baixo valor unitário (mediana de R$40), possivelmente associados a sessões ambulatoriais rotineiras ou sessões individuais com valores padronizados.

O Cluster 1 apresentou características de ser um grupo contendo os procedimentos fonoaudiológicos, com valores informados de nível médio na distribuição da base. Apresentou forte concentração deste perfil (72%), porém cerca de 28% corresponderam a procedimentos de terapia ocupacional. Do ponto de vista econômico e operacional, os procedimentos são realizados de forma individual e, em sua grande maioria, sem pagamento direto a fornecedor. Assim como observado no Cluster 4, os valores corresponderam, em termos absolutos, a procedimentos de baixo valor unitário (mediana de R$39,82), sugerindo atendimentos ambulatoriais padronizados.

O Cluster 3 foi identificado como sendo predominantemente composto por procedimentos psicológicos, com valores informados de nível alto na distribuição da base. O grupo mostrou forte concentração desse perfil (86%), indicando alta homogeneidade. Do ponto de vista econômico, caracterizou-se por procedimentos individuais, sem pagamento direto a fornecedor, porém com valores unitários mais elevados (mediana de R$200) quando comparados aos dois clusters anteriores. Este padrão sugeriu a presença de atendimentos mais especializados ou modalidades específicas de intervenção.

O Cluster 2 foi identificado como sendo predominantemente composto por procedimentos psicológicos, com valores informados de nível alto na distribuição da base, associados a maior quantidade de itens por registro. Apresentou predominância deste perfil (76%), com a presença de outros tipos de procedimentos. Do ponto de vista econômico e operacional, destacou-se por apresentar registros com múltiplos procedimentos (mediana de quatro itens por registro) e valores informados elevados (mediana de R$227), embora ainda sem pagamento direto a fornecedor. Este comportamento sugeriu eventos assistenciais mais complexos, possivelmente envolvendo agrupamento de procedimentos ou maior intensidade de utilização de serviços.

O Cluster 0 foi identificado como sendo o grupo de menor representatividade na base, porém com características distintas dos demais. É composto majoritariamente por procedimentos psicológicos, embora com menor grau de concentração (55%), indicando heterogeneidade. Do ponto de vista econômico, apresenta valores informados (mediana de R$159) e pagos ao fornecedor (mediana de R$159) de nível alto na distribuição da base, além de maior quantidade de itens por registro (mediana de dois procedimentos por registro). Diferentemente dos demais clusters, observou-se a presença relevante de pagamento direto ao fornecedor, o que sugeriu a ocorrência de procedimentos mais complexos ou modelos de remuneração diferenciados.

Análise de Correspondência Múltipla

Antes da aplicação da ACM, foram realizados testes de independência do tipo qui-quadrado entre a variável “Cluster” e as demais variáveis categóricas. Conforme apresentado na Tabela 7 do TCC original, todas as associações foram estatisticamente significativas (p < 0,05), justificando a utilização da técnica para explorar as relações entre os agrupamentos e características como modalidade assistencial, faixa etária, sexo e porte do prestador. A decomposição da inércia revelou que as duas primeiras dimensões da ACM explicaram conjuntamente aproximadamente 23,22% da variabilidade total dos dados, sendo 13,27% atribuídos à primeira dimensão e 9,95% à segunda. Embora esse percentual possa parecer reduzido, trata-se de um comportamento esperado em análises de correspondência com múltiplas categorias, nas quais a variabilidade tende a se dispersar entre diversas dimensões (Fávero e Belfiore, 2025).

A análise do mapa perceptual indicou que a dimensão 1 representa um eixo de diferenciação entre perfis etários e modalidades assistenciais. Observou-se oposição entre faixas etárias mais jovens, como 0 a 4 anos e 5 a 14 anos, posicionadas no lado positivo da dimensão, e faixas etárias adultas, especialmente 15 a 49 anos, posicionadas no lado negativo. A dimensão 2 está associada ao perfil assistencial e à intensidade do uso dos serviços. Categorias associadas a maior demanda assistencial, como faixas etárias mais jovens e determinados clusters, apresentaram valores positivos nessa dimensão, enquanto perfis associados a menor intensidade ou maior dispersão de atendimentos se posicionaram no lado negativo.

Embora a representação bidimensional capturasse os principais padrões, a terceira dimensão, responsável por cerca de 8,16% da inércia total, acrescentou uma camada interpretativa relacionada à estrutura organizacional do sistema de prestação de serviços de saúde. Observou-se a oposição entre categorias como porte pequeno, autogestão e filantropia, no extremo positivo, e categorias relacionadas a estruturas mais tradicionais e consolidadas do mercado, como seguradoras especializadas, no extremo negativo. Desta forma, a ACM permitiu compreender de forma integrada fatores demográficos, assistenciais e estruturais na formação dos agrupamentos.

A parte final da discussão dos resultados concentrou-se na interpretação de cada um dos clusters dentro dos resultados da ACM. O Cluster 0 apresentou associação com o sexo masculino e com faixas etárias mais jovens (5 a 14 anos), situando-se no quadrante positivo das dimensões 1 e 2. Sua posição negativa na dimensão 3 sugeriu proximidade com estruturas mais formalizadas do sistema de saúde, como seguradoras especializadas. Esse resultado, quando analisado em conjunto com a clusterização, na qual se observou equivalência entre valores informados e pagos ao fornecedor, indicou um padrão assistencial possivelmente baseado em repasse direto de custos, característico de modelos mais estruturados e intermediados.

O Cluster 1 apresentou forte associação com a faixa etária de 0 a 4 anos, posicionando-se no extremo positivo da dimensão 1, o que indicou um perfil claramente infantil. Sua proximidade com a modalidade filantrópica sugeriu associação com esse tipo de prestador de serviços de saúde. A posição na dimensão 2 indicou diferenciação em relação ao padrão assistencial dos demais clusters, podendo refletir maior especificidade no tipo de atendimento. Em conjunto com os resultados da clusterização, esse padrão é compatível com perfis que demandam acompanhamento contínuo e multiprofissional, embora não seja possível afirmar diretamente a presença de condições clínicas específicas. Na dimensão 3, o Cluster 1 apresentou coordenada próxima de zero, indicando baixa associação com os polos estruturais identificados nessa dimensão.

Esse resultado sugeriu que o Cluster 1 não é significativamente influenciado pelo tipo de organização do sistema de saúde, sendo sua caracterização mais fortemente explicada por fatores demográficos e assistenciais observados nas duas primeiras dimensões. Isso reforça a ideia de que, para este grupo específico, as características do beneficiário e a natureza do atendimento são mais determinantes do que o modelo de gestão da operadora ou prestador.

O Cluster 2 posicionou-se no lado negativo da dimensão 1, afastando-se das faixas etárias mais jovens, especialmente de 0 a 4 anos, e aproximando-se de categorias que representam perfis etários intermediários. Sua proximidade com a modalidade “Seguradora Especializada em Saúde” indica associação com estruturas mais formalizadas do sistema de saúde. A posição no eixo positivo da dimensão 2 sugere diferenciação no perfil assistencial em relação aos demais clusters. Quando analisado em conjunto com os resultados da clusterização, esse grupo apresentou características associadas a padrões de utilização mais estruturados dos serviços de saúde, embora não seja possível inferir diretamente a existência de continuidade ou recorrência dos atendimentos a partir das variáveis analisadas.

O Cluster 3 posicionou-se no lado positivo da dimensão 3, indicando associação com estruturas organizacionais menos tradicionais do sistema de saúde, como autogestão, filantropia e prestadores de menor porte. Nas dimensões 1 e 2, apresentou distribuição mais dispersa, sem forte associação com faixas etárias extremas ou modalidades específicas, sugerindo um perfil assistencial mais heterogêneo. Esse comportamento indicou que o cluster é menos definido por características demográficas e mais influenciado por aspectos estruturais do sistema de saúde. Em conjunto com a clusterização, esse grupo pode refletir padrões diferenciados de organização da oferta de serviços, embora sem evidência de predominância de um perfil assistencial específico.

O Cluster 4 apresentou posicionamento próximo ao centro da dimensão 3, indicando baixa influência de fatores estruturais do sistema de saúde. Nas dimensões 1 e 2, situou-se em região oposta aos clusters associados ao público infantil, sugerindo associação com faixas etárias mais elevadas ou menos concentradas nas idades iniciais. Esse padrão indicou um perfil assistencial mais generalista, sem forte concentração em modalidades específicas. A análise conjunta com a clusterização reforçou essa interpretação, evidenciando a presença de procedimentos de menor valor unitário e menor complexidade relativa, possivelmente relacionados a atendimentos mais padronizados.

Esses resultados reforçam que os padrões de custo assistencial estão associados não apenas à intensidade dos serviços utilizados, mas também a características demográficas e estruturais do sistema de saúde. Dessa forma, a análise evidencia que os gastos relacionados ao TEA são determinados por múltiplos fatores interdependentes, contribuindo para uma compreensão mais abrangente da dinâmica dos custos na saúde suplementar. Nesse sentido, os resultados obtidos respondem ao objetivo do estudo ao demonstrar que os custos ambulatoriais relacionados ao TEA são estruturados em perfis distintos, influenciados por múltiplos fatores assistenciais, demográficos e organizacionais.

Do ponto de vista prático, os resultados deste estudo oferecem subsídios relevantes para a tomada de decisão no contexto da saúde suplementar. A identificação de perfis distintos de custo assistencial permite que operadoras e gestores adotem estratégias mais direcionadas de acompanhamento e gestão dos beneficiários, especialmente nos grupos associados a maior intensidade de utilização dos serviços. Além disso, a segmentação dos padrões de atendimento possibilita o desenvolvimento de modelos diferenciados de remuneração e organização da rede assistencial, mais aderentes às características de cada perfil identificado.

Esses achados também podem apoiar ações regulatórias e de planejamento, ao evidenciar a heterogeneidade dos custos relacionados ao TEA e a necessidade de abordagens mais específicas para sua gestão. A aplicação combinada de técnicas de clusterização e ACM permitiu identificar padrões assistenciais relevantes e oferecer uma leitura estruturada de um fenômeno complexo, pouco explorado em bases de grande escala no contexto brasileiro. Embora tenham sido identificadas diferenças entre perfis etários e padrões de atendimento, não foi possível estabelecer relação causal direta entre o início precoce do tratamento e a redução de custos, o que reforça o caráter exploratório dos achados e a necessidade de cautela em sua interpretação.

4. Conclusão

O presente estudo buscou identificar e caracterizar perfis distintos de custos ambulatoriais relacionados ao tratamento do Transtorno do Espectro Autista (TEA) em operadoras de planos privados de saúde no estado de São Paulo, utilizando dados de 2023 e algoritmos de aprendizado não supervisionado. Verificou-se que os custos assistenciais não se distribuem de forma homogênea, mas se organizam em cinco perfis distintos, influenciados por múltiplos fatores assistenciais, demográficos e organizacionais. Observou-se a predominância de procedimentos psicológicos e uma concentração de atendimentos em faixas etárias específicas, com a maioria dos registros em operadoras de grande porte. A clusterização revelou grupos que variam desde atendimentos mais simples e padronizados, com baixo valor unitário e sem pagamento direto ao fornecedor, até perfis de maior complexidade assistencial, com maior volume de procedimentos e valores mais elevados, e até mesmo um grupo com pagamento direto ao fornecedor, indicando modelos de remuneração diferenciados. A Análise de Correspondência Múltipla complementou essa compreensão, associando os clusters a características como faixa etária, sexo e modalidade da operadora, evidenciando que os gastos são determinados por fatores interdependentes. A principal contribuição reside na oferta de subsídios para que operadoras e gestores adotem estratégias mais direcionadas de acompanhamento e gestão dos beneficiários, permitindo o desenvolvimento de modelos de remuneração e organização da rede assistencial mais aderentes à heterogeneidade dos padrões de custo.

Contudo, este trabalho apresenta limitações importantes, como a ausência de identificação diagnóstica direta, que exigiu o uso de códigos TUSS como critério indireto, podendo introduzir vieses. Os dados analisados restringiram-se ao ambiente ambulatorial de um único ano e unidade federativa, o que impede a generalização dos resultados e a inferência de relações causais, como a ausência de evidência de relação causal direta entre o início precoce do tratamento e a redução de custos. Do ponto de vista metodológico, o uso do K-means pressupõe estruturas específicas de agrupamento e a Análise de Correspondência Múltipla apresentou explicação parcial da inércia total. Sugere-se para estudos futuros a incorporação de variáveis clínicas, a ampliação do horizonte temporal da análise e a exploração de outras abordagens metodológicas, a fim de aprofundar a compreensão dos custos associados ao TEA no contexto da saúde suplementar.

Referências Bibliográficas

Agência Nacional de Saúde [ANS]. 2022a. Resolução Normativa nº 527, de 29 de abril de 2022. Dispõe sobre a versão XML (Extensible Markup Language) do Documento de Informações Periódicas das Operadoras de Planos de Assistência à Saúde – DIOPS/ANS. Diário Oficial da União, Brasília, 01 jun. 2022. N° 103, pág 471 a 472.

Agência Nacional de Saúde [ANS]. 2022b. Resolução Normativa nº 501, de 30 de março de 2022. Esta Resolução estabelece o Padrão obrigatório para Troca de Informações na Saúde Suplementar – Padrão TISS dos dados de atenção à saúde dos beneficiários de Plano Privado de Assistência à Saúde; revoga as Resoluções Normativas nº 305, de 09 de outubro de 2012, e nº 341, de 27 de novembro de 2013. Diário Oficial da União, Brasília, 23 mai. 2022. N° 96.

Agência Nacional de Saúde [ANS]. 2022c. Resolução Normativa nº 465, de 24 de fevereiro de 2021. Atualiza o Rol de Procedimentos e Eventos em Saúde que estabelece a cobertura assistencial obrigatória a ser garantida nos planos privados de assistência à saúde contratados a partir de 1º de janeiro de 1999 e naqueles adaptados conforme previsto no artigo 35 da Lei n.º 9.656, de 3 de junho de 1998; fixa as diretrizes de atenção à saúde; e revoga a Resolução Normativa – RN nº 428, de 7 de novembro de 2017, a Resolução Normativa – RN n.º 453, de 12 de março de 2020, a Resolução Normativa – RN n.º 457, de 28 de maio de 2020 e a RN n.º 460, de 13 de agosto de 2020. Diário Oficial da União, Brasília, 02 mar. 2021. Seção 1, Nº 40.

Agência Nacional de Saúde [ANS]. 2023a. Dados Abertos. Disponível em: <https://dadosabertos.ans.gov.br/FTP/PDA/TISS/AMBULATORIAL/2023/>. Acesso em: 30 mar. 2025.

Agência Nacional de Saúde [ANS]. 2023b. Dados Abertos. Disponível em: <https://dados.gov.br/dados/conjuntos-dados/terminologia-unificada-da-saude-suplementar-tuss/>. Acesso em: 02 mar. 2026.

Agência Nacional de Saúde [ANS]. 2025. Quem somos. Disponível em: <https://www.gov.br/ans/pt-br/acesso-a-informacao/institucional/quem-somos-1>. Acesso em: 27 fev. 2025.

AMERICAN PSYCHOLOGICAL ASSOCIATION [APA]. 2025. Psychology Topics. Disponível em: <https://www.apa.org/topics/autism-spectrum-disorder>. Acesso em: 24 fev. 2025.

Borges, L.A.F.S.; Yamamoto, I.R.; Lopes, A.P.S.; Melo, A.A.; Siqueira, B.O.; Pereira, B.L; Souza, C.M.T; 2024. Aumento nos casos de Transtorno do Espectro Autista em crianças: fatores e implicações. Revista: Brazilian Journal of Implantology and Health Sciences 6(11): 3697-3705.

Bouder, J.N.; Spielman, S.; Mandell, D.S. 2010. Brief Report: Quantifying the Impact of Autism Coverage on Private Insurance Premiums. Disponível em: <https://pmc.ncbi.nlm.nih.gov/articles/PMC2862974/#R7>. Acesso em: 02 mar. 2025.

Brasil. 1988. Constituição da República Federativa do Brasil de 1988. Diário Oficial da União, Brasília, 5 out. 1988. Seção 1, p. 1.

Brasil. 1990. Lei nº 8.080, de 19 de setembro de 1990. Dispõe sobre as condições para a promoção, proteção e recuperação da saúde, a organização e o funcionamento dos serviços correspondentes e dá outras providências. Diário Oficial da União, Brasília, 20 set. 1990. Seção 1, p. 18055.

Brasil. 2015. Lei nº 13.146, de 6 de julho de 2015. Institui a Lei Brasileira de Inclusão da Pessoa com Deficiência (Estatuto da Pessoa com Deficiência). Diário Oficial da União, Brasília, 7 jul. 2015. Seção 1, p. 2.

Cunha, J. 2024. Autismo supera câncer em custos de planos de saúde, diz setor. Estado de Minas, Belo Horizonte, 08 jan. 2024. Disponível em: <https://www.em.com.br/saude/2024/01/6782012-autismo-supera-cancer-em-custos-de-planos-de-saude-diz-setor.html>. Acesso em: 23 mar. 2025.

Fávero, L. P.; Belfiore, P. 2025. Manual de análise de dados – estatística e machine learning com Excel®, SPSS®, Stata®, R® e Python®. 2. ed. Livros Técnicos e Científicos Editora, Rio de Janeiro, RJ, Brasil.

Gil, A. C. 2022. Como elaborar projetos de pesquisa. Atlas, São Paulo, SP, Brasil.

Hair, J.F.; Black, W.C.; Babin, B.J.; Anderson, R.E. 2019. Análise multivariada de dados. 6. ed. Bookman, Porto Alegre, RS, Brasil.

Rousseeuw, P.J. 1987. Silhouettes: a graphical aid to the interpretation and validation of cluster analysis. Journal of Computational and Applied Mathematics 20: 53-65.

U.S CENTERS FOR DISEASE CONTROL AND PREVENTION [CDC]. 2024. Data and Statistics On Autism Spectrum Disorder. Disponível em: <https://www.cdc.gov/autism/data-research/?CDC_AAref_Val=https://www.cdc.gov/ncbddd/autism/data.html>. Acesso em: 24 fev. 2025.

Artigo oriundo de Trabalho de Conclusão de Curso da Especialização em Data Science e Analytics do MBA USP/Esalq

Para saber mais sobre o curso, clique aqui e acesse a plataforma MBX Academy

Você também pode gostar

Neurociência E Aprendizagem Na Educação

05 de outubro de 2026

Elaboração de material educativo sobre higiene do sono para cuidadores de crianças com Transtorno do Espectro Autista

O sono exerce papel fundamental nos processos de aprendizagem e no funcionamento cognitivo, e evidências indicam que crianças com Transtorno do Espectro Autista (TEA) apresentam alterações significativas na arquitetura do sono, com possíveis repercussões no comportamento e no desempenho escolar. Diante desses desafios, objetivou-se elaborar um material educativo direcionado a cuidadores, contendo orientações práticas sobre higiene do sono em crianças com TEA, considerando seus impactos cognitivos, comportamentais e educacionais. O estudo caracterizou-se como um relato de experiência de natureza aplicada, com abordagem qualitativa, descritiva e reflexiva. O desenvolvimento do material baseou-se em dois eixos: a experiência clínica fonoaudiológica do pesquisador, por meio de observações e registros reflexivos, e o embasamento em evidências científicas, através de revisão da literatura sobre a neurociência do sono e o desenvolvimento neurocognitivo no TEA. A análise dos registros clínicos possibilitou a identificação de padrões recorrentes relacionados às dificuldades na higiene do sono em crianças com TEA, como resistência ao adormecer e despertares noturnos. A partir desses achados, elaborou-se uma cartilha educativa com orientações práticas sobre higiene do sono. Espera-se que o material contribua para a orientação de cuidadores na promoção de hábitos de sono adequados, favorecendo melhorias no comportamento, na aprendizagem e na qualidade de vida das crianças, além de auxiliar na redução da sobrecarga parental e na condução mais efetiva da rotina de sono.

Palavras-chave: Aprendizagem; Neurociências; Sono; Transtorno do Espectro Autista.

05 de outubro de 2026

Aplicação do método de compressão de cronograma em projeto logístico e-commerce

Um estudo analisou a aplicação de técnicas de compressão de cronograma em um projeto de implantação logística de e-commerce, com o objetivo de avaliar seus impactos sobre prazo, custos, riscos e execução operacional. A pesquisa foi conduzida como um estudo de caso qualitativo, utilizando dados de cronogramas, estimativas, registros de projeto e participação direta na execução. Inicialmente, elaborou-se o planejamento do projeto com ferramentas estruturadas, como Estrutura Analítica do Projeto (EAP), sequenciamento de atividades, estimativa de duração por três pontos e alocação de recursos. Posteriormente, aplicou-se um método de priorização para definir as entregas críticas. A compressão do cronograma foi implementada por meio das técnicas de crashing e fast-tracking, focando nas atividades do caminho crítico. Como resultado, a duração total do projeto foi reduzida de seis para três meses, mantendo o escopo original. A análise indicou um aumento de custos, devido à intensificação do uso de recursos, e uma ampliação dos riscos operacionais, decorrente da execução paralela de atividades e da maior complexidade na coordenação. Observou-se que a aplicação dessas técnicas exige avaliação prévia da viabilidade operacional e definição de critérios de aceitação para custo e risco. O estudo contribuiu ao apresentar evidências empíricas da aplicação dessas técnicas em um contexto logístico, ressaltando a importância do alinhamento entre planejamento, execução e controle.

Palavras-chave: Compressão de cronograma; E-commerce; Gerenciamento de projetos; Logística; Riscos operacionais.

05 de outubro de 2026

Infraestrutura Sanitária e Saúde Pública com Modelo de Dados em Painel

O acesso ao saneamento básico é um fator determinante para a saúde comunitária, influenciando a incidência de doenças de veiculação hídrica e relacionadas ao saneamento ambiental inadequado. Este estudo objetivou estimar a relação entre a expansão da infraestrutura de saneamento básico e os casos de diarreia em municípios paulistas entre 2010 e 2020. Utilizou-se um painel balanceado de 371 municípios e estimou-se um modelo de contagem com efeitos fixos (Poisson QMLE) para controlar especificidades locais. Os resultados indicaram que o aumento das ligações de esgoto no ano anterior associou-se à redução das internações (IRR = 0,9952; p = 0,003), enquanto o aumento das ligações de água não apresentou significância estatística (IRR = 1,0035; p = 0,144). Como desenvolvimento adicional, construiu-se uma variável de déficit de esgoto (GAP) em relação às ligações de água, e simulou-se o impacto da equalização desses volumes. A eliminação do déficit de esgoto evitaria aproximadamente 12.650 internações no período, representando uma redução de 17,96%. Uma análise de robustez com modelo binomial negativo confirmou a direção dos coeficientes, mas sem significância estatística para o GAP. Concluiu-se que a universalização dos serviços de esgotamento sanitário é uma estratégia efetiva de saúde pública para a redução das internações por diarreia.

Palavras-chave: Diarreia; Efeitos Fixos; Saneamento básico.

05 de outubro de 2026

Índices de desempenho por posição em jogadores de futebol mediante análise de componentes principais

A crescente disponibilidade de dados no futebol impulsionou a necessidade de métodos para sintetizar indicadores de desempenho em medidas objetivas e interpretáveis. O estudo objetivou construir índices sintéticos de desempenho para jogadores de futebol, aplicando a Análise de Componentes Principais (PCA) a estatísticas individuais da Premier League 2024/2025. Utilizaram-se dados públicos de jogadores de linha da Premier League 2024/2025, excluindo-se goleiros e adotando-se um mínimo de 30% de participação nos minutos da temporada. As variáveis de contagem foram normalizadas por 90 minutos, as percentuais mantidas e todas padronizadas pelo método z-score. A PCA foi aplicada separadamente para defensores, meio-campistas e atacantes, com verificação de adequação pelo teste de esfericidade de Bartlett, retenção de fatores pelo critério de Kaiser e rotação ortogonal Varimax. Os resultados demonstraram a adequação da técnica para os três grupos posicionais, permitindo reter fatores interpretáveis que explicaram parcela expressiva da variância total dos dados. Os índices construídos revelaram que o desempenho posicional resultou da combinação de múltiplas dimensões, como participação defensiva, circulação, progressão com bola, produção ofensiva e objetividade nas ações de ataque. A abordagem adotada sintetizou o desempenho de forma coerente com as funções exercidas em campo, constituindo uma alternativa útil para análises comparativas entre atletas de uma mesma posição.

Palavras-chave: Análise multivariada; Avaliação posicional; Estatística aplicada; Premier League; Redução de dimensionalidade.

05 de outubro de 2026

Detecção de novas disfuncionalidades em políticas públicas utilizando monitoramento de anomalias sobre manifestações de usuários

A plataforma Fala.BR consolidou-se como o principal canal de comunicação entre a sociedade e a Administração Pública Federal, registrando milhões de manifestações anualmente. Reconheceu-se a oportunidade de utilizar as percepções dos usuários para verificar a qualidade dos serviços públicos e identificar disfunções. O objetivo foi desenvolver e implantar um sistema de detecção de anomalias para identificar novos problemas ou agravamentos atípicos na prestação de serviços públicos, analisando séries históricas de manifestações no Fala.BR. Realizou-se um estudo exploratório e quantitativo, utilizando dados secundários extraídos diretamente do sistema Fala.BR, abrangendo 421 entidades de 2014 a 2025. Implementou-se um sistema em Python com um ensemble de 15 detectores de anomalias, com decisão por Votação Não Ponderada (EVNP), e métricas de priorização, como a DS_1M, além de uma ferramenta de identificação de temas baseada em LLM. O sistema demonstrou ser eficaz ao capturar problemas relevantes, como impactos de alterações regulatórias e interrupções de serviços, que geraram aumentos atípicos nas manifestações. Concluiu-se que o sistema implementado atingiu seu objetivo, sendo capaz de identificar disfuncionalidades novas e relevantes, e pode servir como base para um sistema de monitoramento permanente, auxiliando a Administração Pública na atuação tempestiva.

Palavras-chave: Eficiência institucional; Fala.BR; Ouvidoria; Serviços públicos; Tomada de decisão.

05 de outubro de 2026

Web Scraping e NLP aplicados à análise de reclamações de seguradoras no site Reclame Aqui

O mercado segurador desempenha um papel crucial na economia, mas enfrenta desafios relacionados à satisfação do consumidor. Buscou-se analisar e categorizar as principais fontes de insatisfação dos consumidores no mercado segurador brasileiro. Para isso, aplicaram-se técnicas de Web Scraping e Processamento de Linguagem Natural (NLP) a dados textuais não estruturados, extraídos da plataforma Reclame Aqui, referentes a reclamações contra cinco seguradoras independentes. Realizou-se a coleta de aproximadamente 2.500 reclamações, que foram pré-processadas e submetidas à análise exploratória de dados, classificação temática e análise de sentimentos para mensurar a gravidade da insatisfação. Os resultados revelaram que temas como cancelamento, cobrança indevida e vendas irregulares concentram a maior parte das insatisfações, com alta frequência e elevada gravidade. A análise de Pareto confirmou que seis temas prioritários abrangem 81% das reclamações graves. Concluiu-se que a metodologia empregada gerou insights valiosos para a gestão da qualidade, permitindo a identificação de vulnerabilidades operacionais e a formulação de recomendações estratégicas para aprimorar a experiência do cliente e fortalecer a reputação corporativa.

Palavras-chave: Análise de dados textuais; Mercado segurador; Processamento de linguagem natural; Satisfação do consumidor.

05 de outubro de 2026

Previsão da cobertura vacinal de hepatite A infantil no Paraná: rumo à meta ODS 2030

A vacinação infantil contra a hepatite A é uma ferramenta essencial de saúde pública, com crianças sendo as principais transmissoras silenciosas da doença. No contexto da Agenda 2030, a Meta 3.b dos Objetivos de Desenvolvimento Sustentável (ODS) promove inovações tecnológicas no Sistema Único de Saúde para prevenir doenças transmissíveis. Contudo, o declínio da cobertura vacinal no Brasil após 2015 impôs desafios. Diante desse cenário, o estudo objetivou desenvolver modelos estatísticos clássicos de séries temporais para prever a cobertura vacinal contra a hepatite A infantil nos municípios do Paraná até 2030. Adicionalmente, a pesquisa contemplou a visualização das predições em dashboards de Business Intelligence para monitoramento estratégico dos indicadores municipais. A metodologia compreendeu o processamento de grandes volumes de dados, seguido por uma abordagem comparativa entre os modelos de Suavização Exponencial Simples (SES) e Médias Móveis Integradas Autorregressivas (ARIMA). Os resultados revelaram que o modelo ARIMA(1,0,1) obteve a melhor acurácia para a projeção estadual, indicando uma tendência de estabilização da cobertura em 90,3%, patamar inferior à meta ideal de 95%. A análise municipal identificou 180 cidades (45%) como Pontos de Atenção, com riscos de não conformidade com as metas globais. Concluiu-se que o uso de ferramentas preditivas atua como um sistema de alerta antecipado crucial para o fortalecimento das políticas de imunização e a redução de desigualdades regionais.

Palavras-chave: Análise preditiva; Cobertura vacinal; Hepatite A; Modelos estatísticos clássicos; Séries temporais.

05 de outubro de 2026

Contextualização de sentimentos em chats de transmissão ao vivo por LLMs

A proliferação de plataformas de transmissão ao vivo gerou fluxos contínuos de mensagens curtas em português brasileiro, cujas características linguísticas, como gírias e “emotes”, dificultam a classificação automática de sentimentos. Motivou-se esta investigação pelo interesse em processar dados localmente sem dependência de serviços proprietários. Avaliaram-se modelos de linguagem de grande escala (LLMs) de código aberto, com parâmetros reduzidos, para a classificação de sentimentos em três classes (Positivo, Neutro e Negativo) em mensagens de chat ao vivo do YouTube em português. Aplicaram-se três estratégias de “prompting” (zero-shot, ICL e CoT) em múltiplas execuções independentes, sobre um conjunto de referência rotulado manualmente. Toda a inferência foi executada via plataforma Colab, buscando a viabilidade de LLMs de código aberto para análise de sentimentos em ambientes com infraestrutura de média capacidade. As características do modelo, como forma de treinamento, responderam pela maior parcela da variância de desempenho, superando o efeito da estratégia de “prompting”. O melhor resultado foi obtido por um modelo da família Qwen 2.5 com ICL. Modelos treinados para raciocínio matemático e de código apresentaram desempenho abaixo do esperado, revelando incompatibilidade entre regime de treinamento e classificação de texto curto. A classe Neutro permaneceu o principal gargalo em todos os modelos, e o consenso entre modelos não se mostrou um substituto válido para a anotação humana. Os resultados indicaram a viabilidade de LLMs de código aberto de pequena escala para análise de sentimentos em português, com implicações para aplicações que exigem processamento local ou restrições de custo computacional, embora não sustentem o uso autônomo como substitutos da interpretação humana.

Palavras-chave: Aprendizado em contexto; Cadeia de raciocínio; Classificação de texto curto; Inferência local; Variabilidade de modelo.

05 de outubro de 2026

Modelo de negócio e viabilidade econômica de produção e comercialização de Crisântemo em Uberlândia-MG

O setor de flores e plantas ornamentais apresentou relevância econômica e crescimento estável no Brasil, com concentração produtiva regional. Observou-se que o atendimento de crisântemos à região do Triângulo Mineiro ocorria principalmente via distribuidores, o que aumentava custos e comprometia a qualidade do produto. Diante desse cenário, desenvolveu-se um modelo de negócio para a produção e comercialização de crisântemos destinados ao mercado de flores de corte, e analisou-se sua viabilidade econômica no município de Uberlândia (MG). O estudo classificou-se como um estudo de caso de natureza aplicada, utilizando métodos mistos (qualitativo e quantitativo). A pesquisa foi estruturada em três etapas: criação do modelo de negócio com Business Model Canvas, estudo de mercado por meio de questionários com potenciais clientes da região, e análise de viabilidade econômica. A avaliação econômica considerou Índice de Lucratividade, Valor Presente Líquido, Taxa Interna de Retorno e Payback, com horizonte de dez anos. Os resultados indicaram que a produção local de crisântemos apresentou potencial de viabilidade econômica, com redução de custos logísticos e melhoria na qualidade do produto. Os indicadores econômicos analisados apresentaram resultados favoráveis, indicando um retorno atrativo. Concluiu-se que a implantação de uma unidade produtiva de crisântemos na região estudada configura-se como uma alternativa promissora, com potencial para contribuir para o desenvolvimento econômico local e para o fortalecimento da cadeia produtiva da floricultura.

Palavras-chave: Análise econômica; Chrysanthemum morifolium; Cultivo protegido; Flor de corte.

Inscreva-se em nossa newsletter!

Receba conteúdos e fique sempre atualizado sobre as novidades em gestão, liderança e carreira com a Revista E&S.

Ao preencher o formulário você está ciente de que podemos enviar comunicações e conteúdos da Revista E&S. Confira nossa Política de Privacidade