05 de outubro de 2026
Custos assistenciais referentes ao autismo na Saúde Suplementar: Uma abordagem com algoritmos não supervisionados
Custos Assistenciais Referentes ao Autismo na Saúde Suplementar: uma Abordagem com Algoritmos Não Supervisionados
Gustavo Guedes Alberto; Daniel Alvarez Firmino
DOI: 10.22167/2675-6528-202602973
Artigo derivado de Trabalho de Conclusão de Curso (TCC), com conteúdo baseado no trabalho original do aluno e adaptado ao formato editorial da Revista E&S com apoio da ferramenta ResumeAI, solução de inteligência artificial desenvolvida pelo Instituto Pecege para síntese e organização textual.
Resumo
O crescimento dos casos de Transtorno do Espectro Autista (TEA) e a ampliação da cobertura assistencial na saúde suplementar têm gerado impactos relevantes nos custos das operadoras, tornando necessária a compreensão dos padrões associados a esses gastos. Identificou-se e caracterizou-se perfis distintos de custos ambulatoriais relacionados ao tratamento do TEA em operadoras de planos privados de saúde no estado de São Paulo, utilizando dados de 2023 e algoritmos de aprendizado não supervisionado. A metodologia empregou a construção e tratamento de uma base de mais de quatro milhões de registros, aplicou o algoritmo k-means para identificar agrupamentos e utilizou a Análise de Correspondência Múltipla para explorar associações entre variáveis categóricas. Os resultados revelaram a existência de diferentes perfis de custo, com padrões distintos na intensidade de utilização dos serviços, composição dos procedimentos e modelos de remuneração. Observou-se grupos associados a atendimentos mais simples e padronizados, e outros a maior complexidade assistencial e volume de procedimentos. Identificaram-se associações entre os clusters e características demográficas e estruturais do sistema de saúde, indicando diferenças entre perfis etários e padrões de utilização, sem evidência de relação causal direta com redução de custos. Concluiu-se que a aplicação de técnicas de análise de dados aprimorou a compreensão da dinâmica dos custos assistenciais, oferecendo subsídios para análises e decisões na saúde suplementar.
Palavras-chave: Análise de Correspondência Múltipla; Análise Exploratória; K-means; Padrões de Custos; Segmentação de Dados.
1. Introdução
O Transtorno do Espectro Autista (TEA) é uma condição neurológica complexa, caracterizada por desafios na interação social e comunicação, bem como por padrões restritos e repetitivos de comportamentos e interesses, manifestando-se geralmente nos primeiros anos de vida (APA, 2025). Nas últimas décadas, a prevalência do TEA tem demonstrado um aumento significativo em escala global. Borges et al. (2024) indicam que as taxas, que eram de quatro a cinco casos por 10.000 indivíduos nas décadas de 1960 e 1970, atualmente se situam entre 1% e 1,5%. Nos Estados Unidos, a prevalência passou de 6,7 por 1.000 crianças em 2000 para 27,6 por 1.000 em 2020 (CDC, 2024). Esse cenário crescente sublinha a importância do diagnóstico e da intervenção precoce, tanto para a melhoria da qualidade de vida das pessoas com TEA quanto para a otimização dos sistemas de saúde.
No Brasil, a saúde é um direito constitucionalmente assegurado, envolvendo tanto o Sistema Único de Saúde (SUS) quanto a atuação complementar da iniciativa privada (BRASIL, 1988; BRASIL, 1990). A legislação brasileira tem evoluído para fortalecer o direito ao diagnóstico e tratamento do TEA (BRASIL, 2015), o que tem ampliado a demanda por serviços especializados. Nesse contexto, a saúde suplementar desempenha um papel crucial na oferta desses serviços, sendo regulada e fiscalizada pela Agência Nacional de Saúde Suplementar (ANS, 2022a; ANS, 2022b; ANS, 2025). A crescente demanda por terapias relacionadas ao TEA também intensificou sua relevância econômica. Bouder et al. (2010) já apontavam que os gastos médicos de crianças com autismo podiam ser de três a dez vezes maiores do que os de crianças sem o transtorno. No Brasil, a ampliação da cobertura obrigatória de sessões com psicólogos, terapeutas ocupacionais e fonoaudiólogos pela ANS (ANS, 2022c) levou a um aumento expressivo dos custos. Em 2023, os gastos com terapias para TEA e Transtornos Globais do Desenvolvimento (TGD) representaram 9% de todas as despesas médicas dos planos de saúde no país, superando os tratamentos oncológicos (Cunha, 2024).
Apesar da notável relevância econômica e assistencial do Transtorno do Espectro Autista na saúde suplementar, existe uma lacuna na literatura e na prática analítica brasileira. As análises disponíveis frequentemente se limitam a estimativas agregadas de gastos ou a recortes específicos de uso, sem explorar a heterogeneidade dos padrões assistenciais e financeiros entre os atendimentos. Essa limitação impede uma compreensão aprofundada dos fatores que influenciam os custos e dificulta o desenvolvimento de estratégias eficazes de regulação, gestão e planejamento no setor de saúde suplementar.
Diante dessa lacuna, este trabalho se justifica pela necessidade de uma compreensão mais granular dos custos assistenciais do TEA, o que pode subsidiar a tomada de decisões mais informadas por operadoras e gestores. A pesquisa buscou segmentar beneficiários e procedimentos em grupos homogêneos, analisando custos médios e variáveis associadas, e investigando a vantagem financeira de tratamentos precoces. Assim, este trabalho teve como objetivo identificar e caracterizar perfis distintos de custos ambulatoriais relacionados ao tratamento do TEA nas operadoras de planos privados de saúde no estado de São Paulo, com base em dados de 2023, por meio da aplicação de algoritmos de aprendizado de máquina não supervisionados.
2. Material e Métodos
O presente trabalho caracterizou-se como uma pesquisa exploratória e aplicada, com abordagem metodológica quantitativa. O estudo buscou aprofundar a compreensão dos custos assistenciais do Transtorno do Espectro Autista (TEA) na saúde suplementar, integrando técnicas estatísticas e de aprendizado de máquina não supervisionado (Gil, 2022). O objetivo foi identificar e caracterizar perfis distintos de custos ambulatoriais relacionados ao tratamento do TEA em operadoras de planos privados de saúde no estado de São Paulo, com base em dados de 2023.
A pesquisa utilizou dados secundários da Agência Nacional de Saúde Suplementar (ANS), referentes à produção ambulatorial de 2023, com granularidade transacional de eventos assistenciais. A coleta e montagem do banco de dados envolveu a obtenção de vinte e quatro arquivos “csv” do portal de dados abertos da ANS (ANS, 2023a) para o estado de São Paulo. Uma aplicação em Python foi desenvolvida para estruturar a base, filtrando procedimentos por vinte e quatro códigos ambulatoriais da Tabela TUSS (ANS, 2023b) associados ao tratamento de transtornos do neurodesenvolvimento, excluindo procedimentos hospitalares e de fisioterapia.
Os códigos TUSS incluíram seis para fonoaudiologia, onze para terapia ocupacional e sete para psicologia. Após a junção das bases detalhada e consolidada, a base inicial resultou em 4.339.856 observações e vinte e oito variáveis. Uma limitação identificada foi a ausência de identificação diagnóstica direta (CID), o que exigiu o uso de procedimentos como critério indireto para a identificação de atendimentos relacionados ao TEA.
A etapa de tratamento e preparação dos dados visou garantir consistência e reduzir ruídos. Variáveis pouco relevantes ou com elevado volume de dados ausentes, como ID_EVENTO_ATENCAO_SAUDE, ID_PLANO, UF_PRESTADOR, IND_TABELA_PROPRIA, IND_PACOTE, CD_TABELA_REFERENCIA, CD_MODALIDADE, UNIDADE_MEDIDA e SAUDE_OCUPACIONAL, foram removidas, reduzindo o conjunto para vinte variáveis. Ajustes foram realizados nas categorias de variáveis como FAIXA_ETARIA e PORTE, com remoção de acentos e substituição de valores numéricos por descrições textuais conforme tabelas TUSS. FAIXA_ETARIA foi reagrupada em cinco classes, e PORTE foi agregada.
Valores faltantes foram removidos das variáveis QT_ITEM_EVENTO_INFORMADO, VL_ITEM_EVENTO_INFORMADO, VL_ITEM_PAGO_FORNECEDOR, CD_MUNICIPIO_BENEFICIARIO e FAIXA_ETARIA. O tratamento de valores extremos nas variáveis monetárias foi realizado pelo método do intervalo interquartil (IQR). As variáveis quantitativas foram padronizadas por z-score, e a variável qualitativa perfil_procedimento foi transformada em variáveis binárias pela técnica de one-hot encoding. Após todas as etapas de tratamento, a base final para as análises continha 4.080.542 observações.
A clusterização buscou identificar padrões de comportamento associados à estrutura de custos dos procedimentos ambulatoriais, agrupando observações com características semelhantes (Fávero e Belfiore, 2025). Para isso, foram selecionadas as variáveis quantitativas QT_ITEM_EVENTO_INFORMADO, VL_ITEM_EVENTO_INFORMADO e VL_ITEM_PAGO_FORNECEDOR, além da variável qualitativa perfil_procedimento, incorporada como variáveis binárias. O algoritmo K-means foi empregado devido à sua eficiência computacional e adequação a bases de grande volume.
A definição do número de clusters utilizou métodos exploratórios complementares: o método do cotovelo (Elbow Method) (Fávero e Belfiore, 2025), a análise da silhueta (Rousseeuw, 1987) e a técnica t-SNE para visualização. A escolha final de cinco clusters baseou-se na análise conjunta desses métodos e na interpretabilidade dos agrupamentos. Uma análise de variância de um fator (ANOVA) verificou a capacidade das variáveis em diferenciar os grupos.
Após a clusterização, aplicou-se a Análise de Correspondência Múltipla (ACM) para caracterizar os clusters a partir de variáveis qualitativas e analisar associações entre os agrupamentos e as características dos beneficiários e operadoras. A ACM é uma técnica exploratória multivariada para relações entre variáveis categóricas (Fávero e Belfiore, 2025). Foram incluídas as variáveis NM_MODALIDADE, faixa etária agrupada, porte agregado, SEXO e Cluster. Variáveis com alta cardinalidade ou redundância, como CD_MUNICIPIO_BENEFICIARIO e CBO, foram excluídas.
3. Resultados e Discussão
A análise dos dados, precedendo a aplicação dos algoritmos de clusterização e Análise de Correspondência Múltipla (ACM), revelou padrões significativos na distribuição dos registros assistenciais e nos procedimentos relacionados ao Transtorno do Espectro Autista (TEA). Essa etapa exploratória foi fundamental para contextualizar as variáveis e identificar tendências que influenciariam a formação dos agrupamentos e a interpretação dos perfis de custo. A base de dados, composta por mais de quatro milhões de registros de atendimentos ambulatoriais no estado de São Paulo em 2023, permitiu uma visão abrangente da dinâmica assistencial.
No que se refere ao perfil dos procedimentos, observou-se uma forte predominância de atendimentos classificados como Psico, que representaram 73,43% do total das observações. Os procedimentos de Fonoaudiologia corresponderam a 19,09%, enquanto os de Terapia Ocupacional (TO) totalizaram 7,48% dos registros. Essa concentração em procedimentos psicológicos sugere um volume elevado de intervenções terapêuticas dessa natureza. Quanto ao sexo dos beneficiários, a distribuição indicou uma maior proporção de atendimentos para o sexo feminino, com 57,2% das ocorrências, em contraste com 42,8% para o sexo masculino. Esse achado pode refletir particularidades no acesso ou registro dos serviços.
A distribuição por faixa etária dos beneficiários mostrou que a maior concentração de procedimentos ocorreu na faixa de 5 a 14 anos, correspondendo a 29,14% dos registros. Em seguida, destacaram-se as faixas de 30 a 49 anos (26,95%) e 15 a 29 anos (21,21%). As faixas de 0 a 4 anos e 50 anos ou mais apresentaram participações menores, com 11,78% e 10,91%, respectivamente. Esse padrão etário é compatível com a maior demanda por acompanhamento terapêutico em idades escolares e em adultos jovens, o que pode influenciar a estrutura de custos dos serviços de saúde suplementar.
Em relação ao porte das operadoras, a categoria “Grande” concentrou aproximadamente 75,05% dos registros avaliados, indicando que a maior parte dos procedimentos assistenciais foi realizada em estabelecimentos de maior porte, que geralmente possuem maior capacidade operacional. As modalidades de operadoras também apresentaram uma distribuição notável, com a Medicina de Grupo respondendo por 44,16% das ocorrências. Cooperativas Médicas, Seguradoras Especializadas em Saúde, Autogestão e Filantropia apresentaram participações menores. Esse cenário reflete a predominância do modelo empresarial no mercado de saúde suplementar brasileiro.
A análise das variáveis quantitativas revelou características importantes sobre os custos. A variável `QT_ITEM_EVENTO_INFORMADO`, que mede a quantidade de procedimentos por evento, apresentou uma média de 1,42 e mediana de 1, indic indicando que a maioria dos eventos envolvia apenas um procedimento. Embora houvesse valores máximos elevados, como 264, sugerindo eventos com múltiplos itens assistenciais, a distribuição manteve uma assimetria à direita, comum em dados administrativos de saúde, mesmo após o tratamento de outliers pelo método IQR.
Para a variável `VL_ITEM_EVENTO_INFORMADO`, que representa o valor do procedimento, a média foi de R$87,15 e a mediana de R$45,46. Isso aponta para uma distribuição assimétrica, com valores mais altos concentrados em uma parcela menor dos registros. O desvio padrão de R$85,55 reforçou a dispersão significativa, e os quartis indicaram que 50% das observações tinham valores inferiores a R$45, enquanto 75% estavam abaixo de R$114. Esses dados sugerem a predominância de procedimentos de menor valor unitário no conjunto analisado.
A variável `VL_ITEM_PAGO_FORNECEDOR`, que corresponde ao valor pago pela operadora ao prestador, apresentou uma média de R$1,25 e uma mediana de R$0,00. Essa característica indicou uma forte concentração de registros sem pagamento direto ao fornecedor, o que pode estar associado a diferentes formas de remuneração ou registro dos procedimentos. O desvio padrão de R$12,76 e o valor máximo de R$340 revelaram a existência de eventos com pagamentos substanciais, apesar da maioria dos registros ser nula, evidenciando uma elevada assimetria na distribuição.
De maneira geral, as variáveis quantitativas demonstraram distribuições assimétricas e uma concentração em valores baixos, com a presença de caudas longas à direita. Esse comportamento ressaltou a necessidade de técnicas robustas de tratamento e modelagem, como as empregadas neste estudo, e indicou que a estrutura de custos pode ser significativamente influenciada por um subconjunto de eventos de maior valor. A análise exploratória inicial, portanto, forneceu um panorama essencial para as etapas subsequentes de clusterização e interpretação dos perfis de custo.
Clusterização
A etapa de clusterização teve como propósito identificar padrões de comportamento associados à estrutura de custos dos procedimentos ambulatoriais, agrupando observações com características semelhantes. Inicialmente, a análise da matriz de correlação de Pearson entre as variáveis quantitativas e as variáveis binárias de perfil de procedimento revelou uma correlação moderada de 0,55 entre `QT_ITEM_EVENTO_INFORMADO` e `VL_ITEM_EVENTO_INFORMADO`. As demais correlações foram baixas, e as correlações negativas entre as variáveis “dummies” de perfil de procedimento eram esperadas, dada a exclusividade mútua das categorias. Esses resultados confirmaram a adequação da base para a aplicação do algoritmo de clusterização, indicando ausência de multicolinearidade relevante.
Para determinar o número ideal de clusters, foram empregados métodos exploratórios complementares. O método do cotovelo (Elbow Method) indicou uma redução acentuada da variabilidade intra-grupo até aproximadamente cinco clusters. A partir desse ponto, os ganhos na redução da soma dos quadrados dentro dos clusters (WCSS) tornaram-se marginais, sugerindo que cinco grupos seriam suficientes para capturar uma parcela significativa da variabilidade dos dados (Fávero e Belfiore, 2025). Este ponto de inflexão na curva é frequentemente interpretado como o número mínimo de clusters para representar adequadamente a estrutura dos dados.
A métrica da silhueta, que avalia a coesão interna e a separação entre os clusters, foi o segundo método utilizado. Os resultados obtidos por meio de diferentes abordagens, incluindo o algoritmo K-means em amostras representativas, indicaram valores relativamente elevados da silhueta média para números de clusters superiores a quatro, com um desempenho máximo próximo a nove clusters. Contudo, a escolha final não se baseou apenas na maximização dessa métrica, mas também em critérios de interpretabilidade, conforme sugerido por Hair et al. (2019) para estudos exploratórios.
A visualização dos agrupamentos em espaço bidimensional, utilizando a técnica de redução de dimensionalidade t-SNE (t-Distributed Stochastic Neighbor Embedding), complementou a avaliação. A comparação entre as soluções com quatro e cinco clusters evidenciou que a solução com cinco clusters proporcionou uma separação mais equilibrada e revelou padrões adicionais na estrutura dos dados, subdividindo um agrupamento anteriormente dominante. A definição de k=5, portanto, resultou da análise conjunta do método do cotovelo, da qualidade de separação da silhueta, da estrutura visual do t-SNE e da interpretabilidade dos perfis, buscando um equilíbrio entre qualidade estatística, parcimônia e utilidade analítica.
Como etapa adicional de validação, realizou-se uma Análise de Variância (ANOVA) para verificar se as variáveis utilizadas no modelo apresentavam diferenças estatisticamente significativas entre os grupos identificados. Os resultados da ANOVA indicaram que todas as variáveis analisadas apresentaram diferenças estatisticamente significativas entre pelo menos dois clusters, com um p-valor inferior a 0,001 ao nível de significância de 5%. A análise do tamanho de efeito (eta quadrado parcial – np²) revelou que as variáveis quantitativas `QT_ITEM_EVENTO_INFORMADO` (np² = 0,7816), `VL_ITEM_EVENTO_INFORMADO` (np² = 0,7473) e `VL_ITEM_PAGO_FORNECEDOR` (np² = 0,7815) apresentaram elevada capacidade discriminatória.
Entre as variáveis qualitativas, `perfil_procedimento_Psico` (np² = 0,8306) e `perfil_procedimento_fono` (np² = 0,5487) também demonstraram forte poder de diferenciação, enquanto `perfil_procedimento_TO` apresentou contribuição moderada (np² = 0,1809). Esses resultados confirmaram que as variáveis relacionadas à estrutura de custos e à natureza dos procedimentos desempenharam um papel central na diferenciação dos clusters. Isso reforçou a consistência dos perfis de custo identificados, indicando que os agrupamentos refletiam diferenças reais nos padrões de utilização dos serviços e nos níveis de gasto assistencial, e não apenas variações aleatórias nos dados.
Interpretação dos Clusters
A síntese das características de cada cluster permitiu uma compreensão aprofundada dos padrões assistenciais e financeiros que os diferenciam. Os clusters apresentaram tamanhos distintos, com o Cluster 4 concentrando a maior parte da base (54,63%), seguido pelos Clusters 1 (22,43%), 3 (13,13%), 2 (9,35%) e 0 (0,47%). Para auxiliar na interpretação, utilizou-se o conceito de perfil dominante, que indica o tipo de procedimento mais frequente, e a força da dominância, que representa o grau de concentração desse perfil. O indicador lift mediu a presença de um perfil de procedimento em um cluster em relação à base total, com valores acima de 1 indicando representação elevada.
O Cluster 4 foi caracterizado pela predominância absoluta de procedimentos psicológicos (100%), com valores informados de nível médio na distribuição da base. Os atendimentos eram realizados de forma individual, sem pagamento direto ao fornecedor, e os valores unitários eram baixos, com mediana de R$40. Esse perfil sugere sessões ambulatoriais rotineiras e padronizadas. O Cluster 1, por sua vez, concentrou procedimentos fonoaudiológicos (72%), com cerca de 28% de terapia ocupacional. Os valores informados também eram de nível médio, com mediana de R$39,82, e os procedimentos eram individuais, sem pagamento direto ao fornecedor, indicando atendimentos ambulatoriais padronizados.
O Cluster 3 foi predominantemente composto por procedimentos psicológicos (86%), com valores informados de nível alto na distribuição da base. Caracterizou-se por procedimentos individuais, sem pagamento direto ao fornecedor, mas com valores unitários mais elevados (mediana de R$200) em comparação com os clusters anteriores. Esse padrão sugeriu a presença de atendimentos mais especializados ou modalidades específicas de intervenção. O Cluster 2 também foi predominantemente psicológico (76%), mas associado a uma maior quantidade de itens por registro e valores informados elevados (mediana de R$227), embora ainda sem pagamento direto ao fornecedor. Com uma mediana de quatro itens por registro, esse cluster indicou eventos assistenciais mais complexos, possivelmente envolvendo agrupamento de procedimentos ou maior intensidade de utilização de serviços.
O Cluster 0, embora o de menor representatividade na base (0,47%), destacou-se por características distintas. Composto majoritariamente por procedimentos psicológicos (55%), mas com menor grau de concentração, indicando heterogeneidade. Economicamente, apresentou valores informados (mediana de R$159) e pagos ao fornecedor (mediana de R$159) de nível alto, além de uma maior quantidade de itens por registro (mediana de dois procedimentos). A presença relevante de pagamento direto ao fornecedor, diferentemente dos demais clusters, sugeriu a ocorrência de procedimentos mais complexos ou modelos de remuneração diferenciados.
Análise de Correspondência Múltipla
A Análise de Correspondência Múltipla (ACM) foi empregada para interpretar os clusters a partir de variáveis qualitativas, complementando a clusterização. Testes de independência qui-quadrado entre a variável “Cluster” e as demais variáveis categóricas (`NM_MODALIDADE`, `Faixa etária agrupada`, `SEXO`, `Porte agregado`) confirmaram que todas as associações foram estatisticamente significativas (p < 0,05), justificando a aplicação da técnica. A decomposição da inércia revelou que as duas primeiras dimensões da ACM explicaram conjuntamente 23,22% da variabilidade total dos dados, com 13,27% atribuídos à primeira dimensão e 9,95% à segunda. Embora esse percentual possa parecer reduzido, é um comportamento esperado em análises de correspondência com múltiplas categorias, onde a variabilidade se dispersa entre diversas dimensões (Fávero e Belfiore, 2025).
A análise do mapa perceptual indicou que a dimensão 1 representou um eixo de diferenciação entre perfis etários e modalidades assistenciais. Observou-se uma oposição entre faixas etárias mais jovens (0 a 4 anos e 5 a 14 anos), posicionadas no lado positivo da dimensão, e faixas etárias adultas (15 a 49 anos), posicionadas no lado negativo. A dimensão 2 foi associada ao perfil assistencial e à intensidade do uso dos serviços, com categorias de maior demanda assistencial e determinados clusters apresentando valores positivos, enquanto perfis de menor intensidade ou maior dispersão se posicionaram no lado negativo.
A terceira dimensão, responsável por cerca de 8,16% da inércia total, acrescentou uma camada interpretativa relacionada à estrutura organizacional do sistema de prestação de serviços de saúde. Observou-se a oposição entre categorias como porte pequeno, autogestão e filantropia, no extremo positivo, e estruturas mais tradicionais e consolidadas do mercado, como seguradoras especializadas, no extremo negativo. Dessa forma, a ACM permitiu uma compreensão integrada dos fatores demográficos, assistenciais e estruturais na formação dos agrupamentos.
O Cluster 0 apresentou associação com o sexo masculino e com faixas etárias mais jovens (5 a 14 anos), situando-se no quadrante positivo das dimensões 1 e 2. Sua posição negativa na dimensão 3 sugeriu proximidade com estruturas mais formalizadas do sistema de saúde, como seguradoras especializadas. Esse resultado, em conjunto com a clusterização, que mostrou equivalência entre valores informados e pagos ao fornecedor, indicou um padrão assistencial possivelmente baseado em repasse direto de custos, característico de modelos mais estruturados e intermediados.
O Cluster 1 apresentou forte associação com a faixa etária de 0 a 4 anos, posicionando-se no extremo positivo da dimensão 1, o que indicou um perfil claramente infantil. Sua proximidade com a modalidade filantrópica sugeriu associação com esse tipo de prestador de serviços de saúde. A posição na dimensão 2 indicou diferenciação no perfil assistencial em relação aos demais clusters, podendo refletir maior especificidade no tipo de atendimento. Na dimensão 3, o Cluster 1 apresentou coordenada próxima de zero, indicando baixa associação com os polos estruturais identificados nessa dimensão, sugerindo que o cluster não é significativamente influenciado pelo tipo de organização do sistema de saúde, sendo sua caracterização mais fortemente explicada por fatores demográficos e assistenciais.
O Cluster 2 posicionou-se no lado negativo da dimensão 1, afastando-se das faixas etárias mais jovens, especialmente de 0 a 4 anos, e aproximando-se de categorias que representam perfis etários intermediários. Sua proximidade com a modalidade “Seguradora Especializada em Saúde” indica associação com estruturas mais formalizadas do sistema de saúde. A posição no eixo positivo da dimensão 2 sugere diferenciação no perfil assistencial em relação aos demais clusters. Quando analisado em conjunto com os resultados da clusterização, esse grupo apresentou características associadas a padrões de utilização mais estruturados dos serviços de saúde, embora não seja possível inferir diretamente a existência de continuidade ou recorrência dos atendimentos a partir das variáveis analisadas.
O Cluster 3 posicionou-se no lado positivo da dimensão 3, indicando associação com estruturas organizacionais menos tradicionais do sistema de saúde, como autogestão, filantropia e prestadores de menor porte. Nas dimensões 1 e 2, apresentou distribuição mais dispersa, sem forte associação com faixas etárias extremas ou modalidades específicas, sugerindo um perfil assistencial mais heterogêneo. Esse comportamento indicou que o cluster é menos definido por características demográficas e mais influenciado por aspectos estruturais do sistema de saúde. Em conjunto com a clusterização, esse grupo pode refletir padrões diferenciados de organização da oferta de serviços, embora sem evidência de predominância de um perfil assistencial específico.
O Cluster 4 apresentou posicionamento próximo ao centro da dimensão 3, indicando baixa influência de fatores estruturais do sistema de saúde. Nas dimensões 1 e 2, situou-se em região oposta aos clusters associados ao público infantil, sugerindo associação com faixas etárias mais elevadas ou menos concentradas nas idades iniciais. Esse padrão indicou um perfil assistencial mais generalista, sem forte concentração em modalidades específicas. A análise conjunta com a clusterização reforçou essa interpretação, evidenciando a presença de procedimentos de menor valor unitário e menor complexidade relativa, possivelmente relacionados a atendimentos mais padronizados.
Em síntese, os resultados da clusterização e da ACM evidenciaram que os custos assistenciais relacionados ao TEA não seguem um padrão homogêneo, mas se organizam em perfis distintos, influenciados por múltiplos fatores assistenciais, demográficos e organizacionais. Observou-se a coexistência de grupos caracterizados por atendimentos mais simples e padronizados, com baixo valor unitário, e outros associados a maior volume de procedimentos e valores mais elevados, indicando maior intensidade de cuidado. Esses achados demonstram que a análise agregada dos custos pode mascarar diferenças importantes entre perfis assistenciais, reforçando a necessidade de abordagens segmentadas para compreensão e gestão dos gastos na saúde suplementar, respondendo ao objetivo do estudo de identificar e caracterizar perfis de custos.
A análise dos dados, precedendo a aplicação dos algoritmos de clusterização e Análise de Correspondência Múltipla (ACM), revelou padrões significativos na distribuição dos registros assistenciais e nos procedimentos relacionados ao Transtorno do Espectro Autista (TEA). Essa etapa exploratória foi fundamental para contextualizar as variáveis e identificar tendências que influenciariam a formação dos agrupamentos e a interpretação dos perfis de custo. A base de dados, composta por mais de quatro milhões de registros de atendimentos ambulatoriais no estado de São Paulo em 2023, permitiu uma visão abrangente da dinâmica assistencial.
No que se refere ao perfil dos procedimentos, observou-se uma forte predominância de atendimentos classificados como Psico, que representaram 73,43% do total das observações. Os procedimentos de Fonoaudiologia corresponderam a 19,09%, enquanto os de Terapia Ocupacional (TO) totalizaram 7,48% dos registros. Esta distribuição indicou uma elevada concentração da base em procedimentos psicológicos, sugerindo um maior volume de atendimentos relacionados a este tipo de intervenção terapêutica. Quanto ao sexo dos beneficiários, a distribuição indicou uma maior proporção de atendimentos para o sexo feminino, com 57,2% das ocorrências, em contraste com 42,8% para o sexo masculino. Esse achado pode refletir particularidades no acesso ou registro dos serviços.
A distribuição por faixa etária dos beneficiários mostrou que a maior concentração de procedimentos ocorreu na faixa de 5 a 14 anos, correspondendo a 29,14% dos registros. Em seguida, destacaram-se as faixas de 30 a 49 anos, com 26,95%, e 15 a 29 anos, com 21,21% das observações. As faixas de 0 a 4 anos e 50 anos ou mais apresentaram participações menores, com 11,78% e 10,91%, respectivamente. Esse padrão etário é compatível com a maior demanda por acompanhamento terapêutico em idades escolares e em adultos jovens, o que pode influenciar diretamente a estrutura de custos dos serviços de saúde suplementar.
Em relação ao porte das operadoras, a categoria “Grande” concentrou aproximadamente 75,05% dos registros avaliados, indicando que a maior parte dos procedimentos assistenciais foi realizada em estabelecimentos de maior porte, os quais tendem a possuir maior capacidade operacional. As modalidades de operadoras também apresentaram uma distribuição notável, com a Medicina de Grupo respondendo por 44,16% das ocorrências. As demais modalidades, como Cooperativa Médica, Seguradora Especializada em Saúde, Autogestão e Filantropia, apareceram com participações menores. Esse cenário reflete a predominância do modelo empresarial no mercado de saúde suplementar brasileiro.
A análise das variáveis quantitativas revelou características importantes sobre os custos. A variável `QT_ITEM_EVENTO_INFORMADO`, que mede a quantidade de procedimentos por evento, apresentou uma média de 1,42 e mediana igual a 1, indicando predominância de eventos com apenas um procedimento. Embora houvesse valores máximos elevados (até 264), sugerindo eventos com múltiplos itens assistenciais, a distribuição manteve uma elevada assimetria à direita, característica comum em dados administrativos de saúde, mesmo após a aplicação do método IQR para remoção de valores extremos.
Para a variável `VL_ITEM_EVENTO_INFORMADO`, que indica o valor do procedimento ou grupo de procedimentos assistenciais informados, a média foi de R$87,15 e a mediana de R$45,46. Isso aponta para uma distribuição assimétrica, com valores mais elevados concentrados em uma parcela menor dos registros. O desvio padrão relativamente alto (R$85,55) reforçou a presença de dispersão significativa. Os quartis indicaram que 50% das observações apresentaram valores inferiores a aproximadamente R$45, enquanto 75% dos procedimentos possuíam valores inferiores a R$114. Esses dados sugerem a predominância de procedimentos de menor valor unitário no conjunto analisado.
A variável `VL_ITEM_PAGO_FORNECEDOR`, que representa o valor pago pela operadora diretamente ao prestador do serviço, apresentou média de R$1,25 e mediana de R$0,00. Esta característica indicou forte concentração de registros sem pagamento direto ao fornecedor, possivelmente associada a diferentes formas de remuneração ou registro dos procedimentos assistenciais. O desvio padrão de R$12,76 e o valor máximo de R$340 indicaram que, embora a maior parte dos registros apresentasse valores nulos, existiam eventos com pagamentos bastante superiores, sugerindo elevada assimetria na distribuição dessa variável.
De maneira geral, as variáveis quantitativas demonstraram distribuições assimétricas e uma concentração em valores baixos, com a presença de caudas longas à direita. Esse comportamento reforçou a necessidade de utilização de técnicas robustas de tratamento e modelagem, como as adotadas neste estudo, além de indicar que a estrutura de custos pode ser fortemente influenciada por um subconjunto reduzido de eventos de maior valor. A análise exploratória inicial, portanto, forneceu um panorama essencial para as etapas subsequentes de clusterização e interpretação dos perfis de custo.
Clusterização
A etapa de clusterização teve como propósito identificar padrões de comportamento associados à estrutura de custos dos procedimentos ambulatoriais, por meio do agrupamento de observações com características semelhantes. Inicialmente, a análise da matriz de correlação de Pearson entre as variáveis quantitativas e as variáveis binárias de perfil de procedimento revelou uma correlação moderada de 0,55 entre `QT_ITEM_EVENTO_INFORMADO` e `VL_ITEM_EVENTO_INFORMADO`. As demais correlações apresentaram valores baixos, e as correlações negativas observadas entre as variáveis “dummies” de perfil de procedimento são esperadas, uma vez que representam categorias mutuamente exclusivas. Esses resultados confirmaram a adequação da base para a aplicação do algoritmo de clusterização, indicando ausência de multicolinearidade relevante.
Para determinar o número adequado de clusters, foram empregados métodos exploratórios complementares. O método do cotovelo (Elbow Method) indicou uma redução acentuada da variabilidade intra-grupo até aproximadamente cinco clusters. A partir desse ponto, os ganhos na redução da soma dos quadrados dentro dos clusters (WCSS) tornaram-se marginais, sugerindo que cinco grupos já capturavam uma parcela significativa da variabilidade presente no conjunto de dados (Fávero e Belfiore, 2025). Este comportamento caracteriza o ponto de inflexão na curva, frequentemente interpretado na literatura como o número mínimo de clusters necessário para representar adequadamente a estrutura de dados.
A métrica da silhueta, que avalia simultaneamente a coesão interna e a separação entre os clusters, foi o segundo método utilizado. Os resultados obtidos por meio de três abordagens distintas, incluindo o algoritmo K-means em amostras representativas, indicaram valores relativamente elevados da silhueta média para diferentes números de clusters, com desempenho máximo próximo a nove clusters. Contudo, a escolha final não se baseou exclusivamente na maximização dessa métrica, mas considerou também critérios de interpretabilidade, especialmente em estudos exploratórios (Hair et al., 2019).
A visualização dos agrupamentos em espaço bidimensional, utilizando a técnica de redução de dimensionalidade t-SNE (t-Distributed Stochastic Neighbor Embedding), complementou a avaliação. A projeção realizada em uma amostra de 100.000 observações permitiu observar a distribuição espacial dos clusters. A comparação entre as soluções com quatro e cinco clusters evidenciou que a solução com cinco clusters proporcionou uma separação mais equilibrada e revelou padrões adicionais na estrutura dos dados, subdividindo um agrupamento anteriormente dominante.
A definição de k=5, portanto, resultou da análise conjunta do comportamento do método do cotovelo, da qualidade de separação indicada pela silhueta, da estrutura visual observada pelo t-SNE e da interpretabilidade dos perfis obtidos, buscando equilibrar qualidade estatística, parcimônia e utilidade analítica. Este processo de validação adicional conferiu maior robustez à estrutura dos clusters obtidos, reforçando a confiança nos agrupamentos identificados como representativos dos padrões de custo assistencial.
Como etapa adicional de validação, realizou-se uma Análise de Variância (ANOVA) com o objetivo de verificar se as variáveis utilizadas no modelo apresentavam diferenças estatisticamente significativas entre os grupos identificados. Os resultados da ANOVA indicaram que todas as variáveis analisadas apresentaram diferenças estatisticamente significativas entre pelo menos dois clusters, com um p-valor inferior a 0,001 ao nível de significância de 5%. Isso confirmou que os agrupamentos não eram resultado de variações aleatórias, mas sim de distinções reais nos dados.
Além da significância estatística, a análise do tamanho de efeito (eta quadrado parcial – np²) revelou que as variáveis quantitativas relacionadas à quantidade e valores dos eventos apresentaram elevada capacidade discriminatória. Destacaram-se `QT_ITEM_EVENTO_INFORMADO` (np² = 0,7816), `VL_ITEM_EVENTO_INFORMADO` (np² = 0,7473) e `VL_ITEM_PAGO_FORNECEDOR` (np² = 0,7815). Entre as variáveis qualitativas, `perfil_procedimento_Psico` (np² = 0,8306) e `perfil_procedimento_fono` (np² = 0,5487) também demonstraram forte poder de diferenciação, enquanto `perfil_procedimento_TO` apresentou contribuição moderada (np² = 0,1809).
Esses resultados indicaram que as variáveis relacionadas à estrutura de custos e à natureza dos procedimentos desempenharam papel central na diferenciação dos clusters. Do ponto de vista prático, isso evidenciou que os agrupamentos identificados refletiram diferenças reais nos padrões de utilização dos serviços e nos níveis de gasto assistencial, e não apenas variações aleatórias nos dados, reforçando a consistência dos perfis de custo identificados. A validação estatística, portanto, fortaleceu a interpretabilidade e a utilidade analítica dos clusters formados.
Interpretação dos Clusters
A síntese das características de cada cluster permitiu uma compreensão aprofundada dos padrões assistenciais e financeiros que os diferenciam. Os clusters apresentaram tamanhos distintos, indicando uma forte heterogeneidade nas distribuições dos registros assistenciais. O Cluster 4 concentrou a maior parte da base (54,63%), seguido pelos Clusters 1 (22,43%), 3 (13,13%), 2 (9,35%) e 0 (0,47%). Para auxiliar na interpretação, utilizou-se o conceito de perfil dominante, que indica o tipo de procedimento mais frequente, e a força da dominância, que representa o grau de concentração desse perfil. O indicador lift mediu a presença de um perfil de procedimento em um cluster em relação à base total, com valores acima de 1 indicando representação elevada.
O Cluster 4 foi identificado como sendo aquele contendo predominantemente procedimentos psicológicos, com uma predominância absoluta desse perfil (100%) e valores informados de nível médio na distribuição da base. Caracterizou-se por atendimentos realizados de forma individual, sem pagamento direto ao fornecedor. Apesar da classificação relativa, os valores corresponderam, em termos absolutos, a procedimentos de baixo valor unitário (mediana de R$40), possivelmente associados a sessões ambulatoriais rotineiras ou sessões individuais com valores padronizados.
O Cluster 1 apresentou características de ser um grupo contendo os procedimentos fonoaudiológicos, com valores informados de nível médio na distribuição da base. Apresentou forte concentração deste perfil (72%), porém cerca de 28% corresponderam a procedimentos de terapia ocupacional. Do ponto de vista econômico e operacional, os procedimentos são realizados de forma individual e, em sua grande maioria, sem pagamento direto a fornecedor. Assim como observado no Cluster 4, os valores corresponderam, em termos absolutos, a procedimentos de baixo valor unitário (mediana de R$39,82), sugerindo atendimentos ambulatoriais padronizados.
O Cluster 3 foi identificado como sendo predominantemente composto por procedimentos psicológicos, com valores informados de nível alto na distribuição da base. O grupo mostrou forte concentração desse perfil (86%), indicando alta homogeneidade. Do ponto de vista econômico, caracterizou-se por procedimentos individuais, sem pagamento direto a fornecedor, porém com valores unitários mais elevados (mediana de R$200) quando comparados aos dois clusters anteriores. Este padrão sugeriu a presença de atendimentos mais especializados ou modalidades específicas de intervenção.
O Cluster 2 foi identificado como sendo predominantemente composto por procedimentos psicológicos, com valores informados de nível alto na distribuição da base, associados a maior quantidade de itens por registro. Apresentou predominância deste perfil (76%), com a presença de outros tipos de procedimentos. Do ponto de vista econômico e operacional, destacou-se por apresentar registros com múltiplos procedimentos (mediana de quatro itens por registro) e valores informados elevados (mediana de R$227), embora ainda sem pagamento direto a fornecedor. Este comportamento sugeriu eventos assistenciais mais complexos, possivelmente envolvendo agrupamento de procedimentos ou maior intensidade de utilização de serviços.
O Cluster 0 foi identificado como sendo o grupo de menor representatividade na base, porém com características distintas dos demais. É composto majoritariamente por procedimentos psicológicos, embora com menor grau de concentração (55%), indicando heterogeneidade. Do ponto de vista econômico, apresenta valores informados (mediana de R$159) e pagos ao fornecedor (mediana de R$159) de nível alto na distribuição da base, além de maior quantidade de itens por registro (mediana de dois procedimentos por registro). Diferentemente dos demais clusters, observou-se a presença relevante de pagamento direto ao fornecedor, o que sugeriu a ocorrência de procedimentos mais complexos ou modelos de remuneração diferenciados.
Análise de Correspondência Múltipla
Antes da aplicação da ACM, foram realizados testes de independência do tipo qui-quadrado entre a variável “Cluster” e as demais variáveis categóricas. Conforme apresentado na Tabela 7 do TCC original, todas as associações foram estatisticamente significativas (p < 0,05), justificando a utilização da técnica para explorar as relações entre os agrupamentos e características como modalidade assistencial, faixa etária, sexo e porte do prestador. A decomposição da inércia revelou que as duas primeiras dimensões da ACM explicaram conjuntamente aproximadamente 23,22% da variabilidade total dos dados, sendo 13,27% atribuídos à primeira dimensão e 9,95% à segunda. Embora esse percentual possa parecer reduzido, trata-se de um comportamento esperado em análises de correspondência com múltiplas categorias, nas quais a variabilidade tende a se dispersar entre diversas dimensões (Fávero e Belfiore, 2025).
A análise do mapa perceptual indicou que a dimensão 1 representa um eixo de diferenciação entre perfis etários e modalidades assistenciais. Observou-se oposição entre faixas etárias mais jovens, como 0 a 4 anos e 5 a 14 anos, posicionadas no lado positivo da dimensão, e faixas etárias adultas, especialmente 15 a 49 anos, posicionadas no lado negativo. A dimensão 2 está associada ao perfil assistencial e à intensidade do uso dos serviços. Categorias associadas a maior demanda assistencial, como faixas etárias mais jovens e determinados clusters, apresentaram valores positivos nessa dimensão, enquanto perfis associados a menor intensidade ou maior dispersão de atendimentos se posicionaram no lado negativo.
Embora a representação bidimensional capturasse os principais padrões, a terceira dimensão, responsável por cerca de 8,16% da inércia total, acrescentou uma camada interpretativa relacionada à estrutura organizacional do sistema de prestação de serviços de saúde. Observou-se a oposição entre categorias como porte pequeno, autogestão e filantropia, no extremo positivo, e categorias relacionadas a estruturas mais tradicionais e consolidadas do mercado, como seguradoras especializadas, no extremo negativo. Desta forma, a ACM permitiu compreender de forma integrada fatores demográficos, assistenciais e estruturais na formação dos agrupamentos.
A parte final da discussão dos resultados concentrou-se na interpretação de cada um dos clusters dentro dos resultados da ACM. O Cluster 0 apresentou associação com o sexo masculino e com faixas etárias mais jovens (5 a 14 anos), situando-se no quadrante positivo das dimensões 1 e 2. Sua posição negativa na dimensão 3 sugeriu proximidade com estruturas mais formalizadas do sistema de saúde, como seguradoras especializadas. Esse resultado, quando analisado em conjunto com a clusterização, na qual se observou equivalência entre valores informados e pagos ao fornecedor, indicou um padrão assistencial possivelmente baseado em repasse direto de custos, característico de modelos mais estruturados e intermediados.
O Cluster 1 apresentou forte associação com a faixa etária de 0 a 4 anos, posicionando-se no extremo positivo da dimensão 1, o que indicou um perfil claramente infantil. Sua proximidade com a modalidade filantrópica sugeriu associação com esse tipo de prestador de serviços de saúde. A posição na dimensão 2 indicou diferenciação em relação ao padrão assistencial dos demais clusters, podendo refletir maior especificidade no tipo de atendimento. Em conjunto com os resultados da clusterização, esse padrão é compatível com perfis que demandam acompanhamento contínuo e multiprofissional, embora não seja possível afirmar diretamente a presença de condições clínicas específicas. Na dimensão 3, o Cluster 1 apresentou coordenada próxima de zero, indicando baixa associação com os polos estruturais identificados nessa dimensão.
Esse resultado sugeriu que o Cluster 1 não é significativamente influenciado pelo tipo de organização do sistema de saúde, sendo sua caracterização mais fortemente explicada por fatores demográficos e assistenciais observados nas duas primeiras dimensões. Isso reforça a ideia de que, para este grupo específico, as características do beneficiário e a natureza do atendimento são mais determinantes do que o modelo de gestão da operadora ou prestador.
O Cluster 2 posicionou-se no lado negativo da dimensão 1, afastando-se das faixas etárias mais jovens, especialmente de 0 a 4 anos, e aproximando-se de categorias que representam perfis etários intermediários. Sua proximidade com a modalidade “Seguradora Especializada em Saúde” indica associação com estruturas mais formalizadas do sistema de saúde. A posição no eixo positivo da dimensão 2 sugere diferenciação no perfil assistencial em relação aos demais clusters. Quando analisado em conjunto com os resultados da clusterização, esse grupo apresentou características associadas a padrões de utilização mais estruturados dos serviços de saúde, embora não seja possível inferir diretamente a existência de continuidade ou recorrência dos atendimentos a partir das variáveis analisadas.
O Cluster 3 posicionou-se no lado positivo da dimensão 3, indicando associação com estruturas organizacionais menos tradicionais do sistema de saúde, como autogestão, filantropia e prestadores de menor porte. Nas dimensões 1 e 2, apresentou distribuição mais dispersa, sem forte associação com faixas etárias extremas ou modalidades específicas, sugerindo um perfil assistencial mais heterogêneo. Esse comportamento indicou que o cluster é menos definido por características demográficas e mais influenciado por aspectos estruturais do sistema de saúde. Em conjunto com a clusterização, esse grupo pode refletir padrões diferenciados de organização da oferta de serviços, embora sem evidência de predominância de um perfil assistencial específico.
O Cluster 4 apresentou posicionamento próximo ao centro da dimensão 3, indicando baixa influência de fatores estruturais do sistema de saúde. Nas dimensões 1 e 2, situou-se em região oposta aos clusters associados ao público infantil, sugerindo associação com faixas etárias mais elevadas ou menos concentradas nas idades iniciais. Esse padrão indicou um perfil assistencial mais generalista, sem forte concentração em modalidades específicas. A análise conjunta com a clusterização reforçou essa interpretação, evidenciando a presença de procedimentos de menor valor unitário e menor complexidade relativa, possivelmente relacionados a atendimentos mais padronizados.
Esses resultados reforçam que os padrões de custo assistencial estão associados não apenas à intensidade dos serviços utilizados, mas também a características demográficas e estruturais do sistema de saúde. Dessa forma, a análise evidencia que os gastos relacionados ao TEA são determinados por múltiplos fatores interdependentes, contribuindo para uma compreensão mais abrangente da dinâmica dos custos na saúde suplementar. Nesse sentido, os resultados obtidos respondem ao objetivo do estudo ao demonstrar que os custos ambulatoriais relacionados ao TEA são estruturados em perfis distintos, influenciados por múltiplos fatores assistenciais, demográficos e organizacionais.
Do ponto de vista prático, os resultados deste estudo oferecem subsídios relevantes para a tomada de decisão no contexto da saúde suplementar. A identificação de perfis distintos de custo assistencial permite que operadoras e gestores adotem estratégias mais direcionadas de acompanhamento e gestão dos beneficiários, especialmente nos grupos associados a maior intensidade de utilização dos serviços. Além disso, a segmentação dos padrões de atendimento possibilita o desenvolvimento de modelos diferenciados de remuneração e organização da rede assistencial, mais aderentes às características de cada perfil identificado.
Esses achados também podem apoiar ações regulatórias e de planejamento, ao evidenciar a heterogeneidade dos custos relacionados ao TEA e a necessidade de abordagens mais específicas para sua gestão. A aplicação combinada de técnicas de clusterização e ACM permitiu identificar padrões assistenciais relevantes e oferecer uma leitura estruturada de um fenômeno complexo, pouco explorado em bases de grande escala no contexto brasileiro. Embora tenham sido identificadas diferenças entre perfis etários e padrões de atendimento, não foi possível estabelecer relação causal direta entre o início precoce do tratamento e a redução de custos, o que reforça o caráter exploratório dos achados e a necessidade de cautela em sua interpretação.
4. Conclusão
O presente estudo buscou identificar e caracterizar perfis distintos de custos ambulatoriais relacionados ao tratamento do Transtorno do Espectro Autista (TEA) em operadoras de planos privados de saúde no estado de São Paulo, utilizando dados de 2023 e algoritmos de aprendizado não supervisionado. Verificou-se que os custos assistenciais não se distribuem de forma homogênea, mas se organizam em cinco perfis distintos, influenciados por múltiplos fatores assistenciais, demográficos e organizacionais. Observou-se a predominância de procedimentos psicológicos e uma concentração de atendimentos em faixas etárias específicas, com a maioria dos registros em operadoras de grande porte. A clusterização revelou grupos que variam desde atendimentos mais simples e padronizados, com baixo valor unitário e sem pagamento direto ao fornecedor, até perfis de maior complexidade assistencial, com maior volume de procedimentos e valores mais elevados, e até mesmo um grupo com pagamento direto ao fornecedor, indicando modelos de remuneração diferenciados. A Análise de Correspondência Múltipla complementou essa compreensão, associando os clusters a características como faixa etária, sexo e modalidade da operadora, evidenciando que os gastos são determinados por fatores interdependentes. A principal contribuição reside na oferta de subsídios para que operadoras e gestores adotem estratégias mais direcionadas de acompanhamento e gestão dos beneficiários, permitindo o desenvolvimento de modelos de remuneração e organização da rede assistencial mais aderentes à heterogeneidade dos padrões de custo.
Contudo, este trabalho apresenta limitações importantes, como a ausência de identificação diagnóstica direta, que exigiu o uso de códigos TUSS como critério indireto, podendo introduzir vieses. Os dados analisados restringiram-se ao ambiente ambulatorial de um único ano e unidade federativa, o que impede a generalização dos resultados e a inferência de relações causais, como a ausência de evidência de relação causal direta entre o início precoce do tratamento e a redução de custos. Do ponto de vista metodológico, o uso do K-means pressupõe estruturas específicas de agrupamento e a Análise de Correspondência Múltipla apresentou explicação parcial da inércia total. Sugere-se para estudos futuros a incorporação de variáveis clínicas, a ampliação do horizonte temporal da análise e a exploração de outras abordagens metodológicas, a fim de aprofundar a compreensão dos custos associados ao TEA no contexto da saúde suplementar.
Referências Bibliográficas
Agência Nacional de Saúde [ANS]. 2022a. Resolução Normativa nº 527, de 29 de abril de 2022. Dispõe sobre a versão XML (Extensible Markup Language) do Documento de Informações Periódicas das Operadoras de Planos de Assistência à Saúde – DIOPS/ANS. Diário Oficial da União, Brasília, 01 jun. 2022. N° 103, pág 471 a 472.
Agência Nacional de Saúde [ANS]. 2022b. Resolução Normativa nº 501, de 30 de março de 2022. Esta Resolução estabelece o Padrão obrigatório para Troca de Informações na Saúde Suplementar – Padrão TISS dos dados de atenção à saúde dos beneficiários de Plano Privado de Assistência à Saúde; revoga as Resoluções Normativas nº 305, de 09 de outubro de 2012, e nº 341, de 27 de novembro de 2013. Diário Oficial da União, Brasília, 23 mai. 2022. N° 96.
Agência Nacional de Saúde [ANS]. 2022c. Resolução Normativa nº 465, de 24 de fevereiro de 2021. Atualiza o Rol de Procedimentos e Eventos em Saúde que estabelece a cobertura assistencial obrigatória a ser garantida nos planos privados de assistência à saúde contratados a partir de 1º de janeiro de 1999 e naqueles adaptados conforme previsto no artigo 35 da Lei n.º 9.656, de 3 de junho de 1998; fixa as diretrizes de atenção à saúde; e revoga a Resolução Normativa – RN nº 428, de 7 de novembro de 2017, a Resolução Normativa – RN n.º 453, de 12 de março de 2020, a Resolução Normativa – RN n.º 457, de 28 de maio de 2020 e a RN n.º 460, de 13 de agosto de 2020. Diário Oficial da União, Brasília, 02 mar. 2021. Seção 1, Nº 40.
Agência Nacional de Saúde [ANS]. 2023a. Dados Abertos. Disponível em: <https://dadosabertos.ans.gov.br/FTP/PDA/TISS/AMBULATORIAL/2023/>. Acesso em: 30 mar. 2025.
Agência Nacional de Saúde [ANS]. 2023b. Dados Abertos. Disponível em: <https://dados.gov.br/dados/conjuntos-dados/terminologia-unificada-da-saude-suplementar-tuss/>. Acesso em: 02 mar. 2026.
Agência Nacional de Saúde [ANS]. 2025. Quem somos. Disponível em: <https://www.gov.br/ans/pt-br/acesso-a-informacao/institucional/quem-somos-1>. Acesso em: 27 fev. 2025.
AMERICAN PSYCHOLOGICAL ASSOCIATION [APA]. 2025. Psychology Topics. Disponível em: <https://www.apa.org/topics/autism-spectrum-disorder>. Acesso em: 24 fev. 2025.
Borges, L.A.F.S.; Yamamoto, I.R.; Lopes, A.P.S.; Melo, A.A.; Siqueira, B.O.; Pereira, B.L; Souza, C.M.T; 2024. Aumento nos casos de Transtorno do Espectro Autista em crianças: fatores e implicações. Revista: Brazilian Journal of Implantology and Health Sciences 6(11): 3697-3705.
Bouder, J.N.; Spielman, S.; Mandell, D.S. 2010. Brief Report: Quantifying the Impact of Autism Coverage on Private Insurance Premiums. Disponível em: <https://pmc.ncbi.nlm.nih.gov/articles/PMC2862974/#R7>. Acesso em: 02 mar. 2025.
Brasil. 1988. Constituição da República Federativa do Brasil de 1988. Diário Oficial da União, Brasília, 5 out. 1988. Seção 1, p. 1.
Brasil. 1990. Lei nº 8.080, de 19 de setembro de 1990. Dispõe sobre as condições para a promoção, proteção e recuperação da saúde, a organização e o funcionamento dos serviços correspondentes e dá outras providências. Diário Oficial da União, Brasília, 20 set. 1990. Seção 1, p. 18055.
Brasil. 2015. Lei nº 13.146, de 6 de julho de 2015. Institui a Lei Brasileira de Inclusão da Pessoa com Deficiência (Estatuto da Pessoa com Deficiência). Diário Oficial da União, Brasília, 7 jul. 2015. Seção 1, p. 2.
Cunha, J. 2024. Autismo supera câncer em custos de planos de saúde, diz setor. Estado de Minas, Belo Horizonte, 08 jan. 2024. Disponível em: <https://www.em.com.br/saude/2024/01/6782012-autismo-supera-cancer-em-custos-de-planos-de-saude-diz-setor.html>. Acesso em: 23 mar. 2025.
Fávero, L. P.; Belfiore, P. 2025. Manual de análise de dados – estatística e machine learning com Excel®, SPSS®, Stata®, R® e Python®. 2. ed. Livros Técnicos e Científicos Editora, Rio de Janeiro, RJ, Brasil.
Gil, A. C. 2022. Como elaborar projetos de pesquisa. Atlas, São Paulo, SP, Brasil.
Hair, J.F.; Black, W.C.; Babin, B.J.; Anderson, R.E. 2019. Análise multivariada de dados. 6. ed. Bookman, Porto Alegre, RS, Brasil.
Rousseeuw, P.J. 1987. Silhouettes: a graphical aid to the interpretation and validation of cluster analysis. Journal of Computational and Applied Mathematics 20: 53-65.
U.S CENTERS FOR DISEASE CONTROL AND PREVENTION [CDC]. 2024. Data and Statistics On Autism Spectrum Disorder. Disponível em: <https://www.cdc.gov/autism/data-research/?CDC_AAref_Val=https://www.cdc.gov/ncbddd/autism/data.html>. Acesso em: 24 fev. 2025.
Artigo oriundo de Trabalho de Conclusão de Curso da Especialização em Data Science e Analytics do MBA USP/Esalq
Para saber mais sobre o curso, clique aqui e acesse a plataforma MBX Academy

