Artigo

15 de setembro de 2026

Padrões de Uso de Cartão de Crédito Convertidos em Perfis Interpretáveis por Clusterização

Jessica Pereira da Silva; Ítalo de Oliveira Braga

DOI: 10.22167/2675-6528-202602233

Artigo derivado de Trabalho de Conclusão de Curso (TCC), com conteúdo baseado no trabalho original do aluno e adaptado ao formato editorial da Revista E&S com apoio da ferramenta ResumeAI, solução de inteligência artificial desenvolvida pelo Instituto Pecege para síntese e organização textual.

Resumo

A expansão dos meios de pagamento digitais e a intensificação da concorrência entre bancos e fintechs intensificaram a necessidade de compreender a diversidade de comportamentos de uso e relacionamento em cartões de crédito. Este trabalho teve como objetivo aplicar técnicas de análise de cluster em uma base de dados de cartão de crédito para identificar e descrever perfis comportamentais, avaliando a qualidade do agrupamento e produzindo uma segmentação interpretável. A metodologia foi quantitativa e aplicada, conduzida sobre uma base de dados de cartão de crédito, com etapas de análise exploratória, padronização z-score das variáveis numéricas e modelagem principal por K-Means. A escolha do número de clusters foi orientada pelo método do cotovelo (inércia/WCSS) e coeficiente de silhueta, com apoio de visualização por PCA (2D) e verificação de diferenciação entre grupos por ANOVA com tamanho de efeito (η²). Os resultados mostraram uma solução com três clusters que separou perfis principalmente por intensidade e mix de canais e por capacidade de crédito/estrutura de cartões. Identificou-se um grupo predominante com maior participação de visitas ao banco e menor intensidade total, um grupo minoritário com limite elevado e predominância de interações online, e um grupo com limite inferior e alta intensidade de chamadas telefônicas. Concluiu-se que a clusterização permitiu reduzir a complexidade do comportamento observado em perfis comparáveis e mensuráveis, oferecendo uma base objetiva para caracterização de clientes e apoio a decisões orientadas por dados.

Palavras-chave: Clusterização K-Means; Customer analytics; Interações multicanais; Limite de crédito; Segmentação de clientes.

1. Introdução

A expansão dos meios de pagamento digitais e a intensificação da concorrência entre bancos tradicionais, fintechs e emissores de cartão têm transformado o cenário financeiro. Nesse contexto, a crescente sensibilidade dos clientes à experiência de uso tornou a personalização um eixo central das estratégias de relacionamento. Em ambientes onde múltiplas interações são registradas, como compras, frequência, sazonalidade, canais de atendimento, limites e formas de pagamento, a gestão baseada apenas em recortes demográficos ou regras fixas tende a ser insuficiente para explicar a diversidade de comportamentos.

Diante dessa complexidade, organizações que operam com cartão de crédito demandam abordagens analíticas capazes de traduzir grandes volumes de dados comportamentais em perfis interpretáveis. Essa capacidade é crucial para apoiar decisões de negócio relacionadas a ofertas, comunicação, retenção e eficiência operacional, superando as limitações das estratégias genéricas.

A segmentação de clientes é um tema consolidado na literatura de marketing e CRM, reconhecida como um instrumento fundamental para compreender heterogeneidades e orientar a alocação de recursos de forma mais eficaz. A utilidade dos segmentos depende de serem mensuráveis, acionáveis e interpretáveis, contribuindo para decisões de posicionamento e relacionamento (Wedel & Kamakura, 2000).

No contexto de bases ricas em variáveis comportamentais, a segmentação baseada em técnicas de Ciência de Dados amplia a capacidade de capturar padrões não triviais, superando abordagens exclusivamente descritivas. A perspectiva de customer analytics reforça que identificar grupos com necessidades e comportamentos distintos permite elevar a efetividade das ações de relacionamento e otimizar investimentos em aquisição, fidelização e atendimento (Blattberg, Kim & Neslin, 2008).

Entre as técnicas quantitativas aplicadas à segmentação, destacam-se os métodos de aprendizado não supervisionado, especialmente a análise de cluster. Essa abordagem é apropriada quando o objetivo é descobrir estruturas latentes nos dados, sem a necessidade de rótulos prévios. O algoritmo K-means, introduzido por MacQueen (1967), é uma escolha frequente devido à sua simplicidade, escalabilidade e capacidade de produzir partições claras quando aplicado a variáveis numéricas padronizadas.

A literatura de clusterização enfatiza que resultados úteis dependem de decisões metodológicas consistentes, incluindo a seleção de variáveis, padronização de escalas, definição do número de grupos e validação da qualidade dos clusters (Everitt, Landau, Leese & Stahl, 2011). Procedimentos de validação e interpretabilidade são fundamentais para sustentar as conclusões. Métricas como o coeficiente de silhueta (Rousseeuw, 1987) oferecem suporte à avaliação da separação e coesão interna dos grupos. De modo complementar, técnicas de redução de dimensionalidade, como a Análise de Componentes Principais (PCA), são amplamente utilizadas para apoiar a visualização e compreensão dos padrões dominantes nos dados (Jolliffe, 2002). Adicionalmente, análises estatísticas de perfilamento, como a comparação de médias e dispersões entre clusters, podem fortalecer a caracterização dos grupos, tornando-os mais comunicáveis e acionáveis (Hair, Black, Babin & Anderson, 2010; Field, 2013).

Do ponto de vista gerencial, a contribuição esperada de uma segmentação baseada em comportamento de uso de cartão não se limita à descrição de grupos, mas reside em transformar padrões em decisões. A literatura de data-analytic thinking reforça que projetos analíticos bem-sucedidos conectam diretamente método, métricas e decisões, evitando análises que não resultem em ação (Provost & Fawcett, 2013). Assim, ao identificar perfis de comportamento, torna-se possível orientar estratégias como o desenho de campanhas mais aderentes, a priorização de atendimento, os ajustes de comunicação, a seleção de benefícios e as intervenções preventivas para retenção.

Diante desse cenário, a presente pesquisa justifica-se pela necessidade de compreender a diversidade de comportamentos de uso e relacionamento em cartões de crédito, fornecendo uma base objetiva para a caracterização de clientes e o apoio a decisões orientadas por dados. Este estudo teve como objetivo geral aplicar técnicas de análise de cluster a uma base de dados de cartão de crédito para identificar e descrever perfis comportamentais de clientes, avaliando a qualidade da segmentação por métricas apropriadas e comparando, de forma complementar, resultados do K-means com uma abordagem hierárquica.

2. Material e Métodos

A pesquisa caracterizou-se como aplicada, de natureza quantitativa, com caráter descritivo e exploratório. O estudo baseou-se em análise de dados secundários de clientes de cartão de crédito. A etapa analítica foi estruturada em quatro blocos complementares: (i) análise exploratória dos dados, (ii) pré-processamento, incluindo tratamento de inconsistências, padronização e seleção de variáveis, (iii) modelagem por clusterização, com aplicação do K-means como método principal e comparação complementar com método hierárquico, e (iv) interpretação e perfilamento dos clusters.

A base de dados foi composta por registros em nível de cliente, obtidos de um dataset público (Kaggle), estruturados em formato tabular. Incluiu um identificador do cliente (Customer Key) e variáveis comportamentais e de relacionamento, como limite de crédito médio (Avg_Credit_Limit), quantidade de cartões (Total_Credit_Cards) e indicadores de interação por canal (Total_visits_bank, Total_visits_online, Total_calls_made). A unidade de análise foi o cliente, e um dicionário de tradução das colunas para o português foi elaborado para padronização. O estudo utilizou dados secundários.

As variáveis do estudo foram organizadas em um dicionário de tradução, incluindo: (i) IDs/chaves (Id_Linha, Chave_Cliente), utilizadas apenas para rastreabilidade e não para o cálculo de distância; (ii) variáveis originais do dataset (limite de crédito médio, quantidade de cartões e interações por canal); e (iii) features derivadas determinísticas (interações totais, proporções por canal, razões entre canais, limite por cartão, interações por cartão e logaritmo do limite de crédito). Variáveis simuladas (como tempo de relacionamento, idade, renda anual, gasto médio mensal, taxa de utilização do limite, taxa de atraso de pagamento, score de crédito, taxa de uso de recompensas e reclamações em 12 meses) foram incluídas quando presentes. Colunas de saída dos modelos (cluster_kmeans e cluster_hier) foram reservadas para análise posterior. A base final apresentou predominância de variáveis numéricas e uma variável categórica (Segmento_Canal), reservada para interpretação e rotulagem dos perfis, sem integrar o cálculo de distância.

A preparação e pré-processamento dos dados foram realizados em ambiente Python para assegurar consistência e comparabilidade. Incluíram verificações estruturais, separação de variáveis numéricas e categóricas, rotinas de limpeza (checagem de duplicidades, conferência de identificadores, inspeção de valores ausentes/inconsistências e avaliação de outliers). As variáveis destinadas ao modelo principal foram organizadas em uma matriz apenas com atributos numéricos. Por fim, aplicou-se padronização por z-score (média zero e desvio-padrão um) via StandardScaler para evitar que variáveis em escalas diferentes dominassem a medida de distância do algoritmo.

A análise exploratória dos dados (EDA) foi realizada para compreender a estrutura do conjunto de dados, identificar padrões iniciais de comportamento e subsidiar a seleção de atributos. Incluiu o exame da base quanto à dimensão, tipos de dados, estatísticas resumo e consistência. Foram calculadas medidas de tendência central e dispersão para variáveis numéricas e utilizadas visualizações gráficas (histogramas e boxplots) para identificar assimetrias e outliers. A análise de associação entre variáveis foi conduzida com a correlação de Spearman para investigar redundâncias. Os achados da EDA foram sintetizados em tabelas e gráficos, destacando variáveis com maior poder discriminante potencial e padrões preliminares de comportamento.

Para a clusterização, foram selecionadas variáveis numéricas, excluindo identificadores (Id_Linha, Chave_Cliente) e atributos categóricos (Segmento_Canal) do cálculo de distância, reservando-os para perfilamento e rotulagem. A seleção incluiu variáveis originais (limite médio, quantidade de cartões e interações por canal) e features derivadas (interações totais, proporções por canal, razões entre canais, limite por cartão, interações por cartão e log do limite de crédito) que contribuíram para representar dimensões comportamentais relevantes. As variáveis numéricas foram padronizadas por z-score (média zero e desvio-padrão um) utilizando o StandardScaler, resultando em uma matriz final padronizada para os modelos de agrupamento.

A modelagem principal utilizou o algoritmo K-means, aplicado sobre a matriz padronizada de variáveis numéricas. Para definir o número de clusters (k), foi avaliado um intervalo de candidatos, calculando-se a inércia (within-cluster sum of squares) pelo método do cotovelo e o coeficiente de silhueta. O valor de k foi selecionado com base no desempenho mais consistente entre esses critérios. O modelo final foi estimado com o k escolhido e controle de reprodutibilidade (random_state), gerando rótulos (cluster_kmeans) para cada cliente, que foram incorporados à base para análises subsequentes.

Como modelagem complementar, aplicou-se a clusterização hierárquica aglomerativa, utilizando o método de Ward, sobre a mesma matriz padronizada de variáveis numéricas. O objetivo foi comparar a estrutura de agrupamento com a do K-means e avaliar a coerência da segmentação. O modelo aglomerativo foi ajustado com o número de grupos definido para comparação, gerando rótulos (cluster_hier) incorporados à base para perfilamento e verificação de convergência, servindo como referência de robustez para a validade interpretativa da segmentação.

O perfilamento dos clusters foi realizado para descrever e interpretar as características de cada grupo. Os rótulos gerados (cluster_kmeans e cluster_hier) foram incorporados à base para sumarização estatística e comparação. O perfilamento incluiu o cálculo de estatísticas descritivas por cluster (médias, medianas e dispersões de variáveis numéricas selecionadas, como limite de crédito, número de cartões, volume e composição das interações por canal, e features derivadas). Variáveis categóricas como Segmento_Canal foram usadas para rotular e caracterizar os grupos. Testes de comparação entre grupos, como ANOVA, foram aplicados para identificar diferenças estatisticamente relevantes e variáveis discriminantes. Por fim, os métodos K-means e hierárquico foram comparados para verificar convergências e divergências, reforçando a escolha do modelo principal.

A análise foi executada em ambiente Python, utilizando bibliotecas como pandas e numpy para manipulação de dados, matplotlib para visualização, e scikit-learn para modelagem e validação de clusters (incluindo StandardScaler, K-means, clusterização hierárquica aglomerativa, PCA e cálculo do coeficiente de silhueta). Rotinas estatísticas, como ANOVA, foram empregadas para apoio ao perfilamento e comparação. Os critérios gerais adotados incluíram: padronização por z-score para todas as variáveis numéricas; definição do número de clusters por método do cotovelo (inércia) e coeficiente de silhueta; controle de reprodutibilidade pela fixação de semente aleatória (random_state); e uso de variáveis categóricas apenas para interpretação e rotulagem dos perfis, sem compor a distância do modelo principal.

3. Resultados e Discussão

A análise foi conduzida a partir da base cartao_credito_enriquecida.csv, composta por 660 registros e 28 variáveis relacionadas a limite de crédito, quantidade de cartões e interações por canal (banco, online e telefone). Não foram identificados valores ausentes no conjunto de dados, permitindo avançar diretamente para a exploração das distribuições e dispersões das variáveis, conforme detalhado na Tabela 1.

Tabela 1. Estatística descritiva das variáveis principais (média, mediana, desvio padrão, mínimo, P25, P75 e máximo).

Variável (relatório)Variável (base)MédiaMedianaDesvio PadrãoMínimoP25P75Máximo
Limite_Credito_MedioAvg_Credit_Limit3454.241800037625.49300010048000200000
Qtde_Cartoes_CreditoTotal_Credit_Cards4.7152.1713610
Visitas_Banco_TotalTotal_visits_bank2.421.630145
Visitas_Online_TotalTotal_visits_online2.6122.9401415
Chamadas_Total_deTotal_calls_made3.5832.8701510
Interacoes_TotaisTotal_Interactions8.5983.41261119
Limite_Por_CartaoLimit_per_Card7200.185666.675454.32714.293009999.9949999.98
Proporcao_OnlineOnline_Share0.25860.250.22300.1250.3331
Proporcao_BancoBank_Share0.36420.3750.28700.09090.57141
Proporcao_TelefoneCall_Share0.37720.40.23300.16670.57140.8889
Razao_Online_BancoOnline_to_Bank_Ratio1.47760.52.378900.1917215
Razao_Telefone_OnlineCalls_to_Online_Ratio1.296611.061400.524
Canais_UtilizadosChannels_Used2.4830.61233
Interacoes_Por_CartaoInteractions_per_Card2.911.53.210.2913.516
Log_Limite_CreditoLog_Credit_Limit109.80.938.019.2110.7812.21
Idade_simAge_sim35.88369.5118304265

Fonte: Resultados originais da pesquisa

O Limite de Crédito Médio apresenta elevada heterogeneidade entre os registros. Observa-se concentração de valores em faixas mais baixas, acompanhada de uma cauda longa com poucos casos em valores muito elevados, caracterizando assimetria à direita, conforme Figura 1.

Figura 1. Distribuição do Limite_Credito_Medio.

Fonte: Resultados originais da pesquisa

Como complemento, o Limite por Cartão também evidencia assimetria e dispersão relevantes, pois combina o efeito do limite total com o número de cartões. A presença de valores extremos nessa variável é coerente com a observada no limite médio, indicando que alguns registros apresentam uma relação limite/cartão substancialmente superior ao padrão da amostra, vide Figura 2.

Figura 2. Distribuição do Limite_Por_Cartao.

Fonte: Resultados originais da pesquisa

A variável Qtde_Cartoes_Credito é discreta e se concentra em valores intermediários, com ocorrência menor nas extremidades, conforme demonstrado na Figura 3. Essa característica sugere que a amostra possui predominância de clientes com quantidade moderada de cartões, enquanto poucos registros exibem valores muito baixos ou muito altos.

Figura 3. Distribuição da Qtde_Cartoes_Credito.

Fonte: Resultados originais da pesquisa

Na Figura 4, a variável Interacoes_Totais (soma de visitas ao banco, visitas online e chamadas) apresenta variação ampla e indica diferentes intensidades de relacionamento com os canais. O histograma mostra uma distribuição com maior concentração em faixas intermediárias, mas com amplitude suficiente para diferenciar grupos com baixa, média e alta intensidade de contato.

Figura 4. Distribuição de Interacoes_Totais.

Fonte: Resultados originais da pesquisa

A variável Idade_sim apresenta distribuição distribuída ao longo das faixas etárias da base, com maior concentração em idades adultas, conforme observado na Figura 5. Por se tratar de variável simulada/enriquecida, ela é utilizada nesta etapa apenas como apoio interpretativo e de caracterização do conjunto.

Figura 5. Distribuição de Idade_sim.

Fonte: Resultados originais da pesquisa

Na Figura 6, a inspeção por boxplots confirma diferenças de escala, dispersão e presença de pontos extremos nas variáveis analisadas. Em especial, as variáveis de limite e algumas métricas derivadas (proporções/razões) tendem a apresentar maior variabilidade, reforçando a necessidade de tratamento por padronização antes da modelagem de cluster.

Figura 6. Boxplots das principais variáveis analisadas na EDA.

Fonte: Resultados originais da pesquisa

Ao final desta etapa, a análise exploratória dos dados (EDA) forneceu evidências de: (i) heterogeneidade no limite de crédito e em métricas derivadas; (ii) padrões discretos e concentrados na quantidade de cartões; (iii) ampla variabilidade na intensidade de interações; e (iv) presença de dispersão e valores extremos em algumas variáveis. Esses achados orientaram a etapa seguinte, na qual foram definidos critérios para padronização e escolha do número de clusters com base em métricas internas.

Após a análise exploratória, foi realizada a definição do número de clusters a ser utilizado no agrupamento. Para isso, calcularam-se soluções de K-Means para diferentes valores de k e avaliou-se o comportamento da inércia (WCSS) e do coeficiente médio de silhueta, com o objetivo de identificar um ponto de equilíbrio entre simplicidade do modelo e qualidade de separação dos grupos.

A Figura 7 apresenta o gráfico do método do cotovelo, no qual se observa a redução da inércia à medida que o número de clusters aumenta. O comportamento do traçado indica uma queda mais acentuada nos primeiros valores de k, seguida de ganhos marginais menores conforme os clusters adicionais passam a capturar variações mais finas dos dados.

Figura 7. Elbow (Inércia / WCSS).

Fonte: Resultados originais da pesquisa

A Tabela 2 apresenta os valores numéricos associados à inércia para cada k, permitindo reprodutibilidade e comparação.

Tabela 2. Inércia (WCSS) por número de clusters (k).

KInércia (WCSS)
212932.25
39292.39
48384.19
58148.81
67580.52
77153.64
86730.62
96402.56
106265.53

Fonte: Resultados originais da pesquisa

Em complemento, foi calculada a silhueta média para k ≥ 2, apresentada na Figura 8. A silhueta avalia simultaneamente a coesão interna e a separação entre clusters. Observa-se que o melhor desempenho ocorre em um valor específico de k, indicando a configuração com maior separação média entre os grupos no espaço das variáveis padronizadas.

Figura 8. Silhueta média (k≥2).

Fonte: Resultados originais da pesquisa

A Tabela 3 apresenta os valores de silhueta em formato tabular para documentar a comparação entre soluções.

Tabela 3. Silhueta média por número de clusters (k).

KSilhueta_média
20.4292
30.2926
40.2154
50.2023
60.1729
70.1583
80.1679
90.1754
100.1531

Fonte: Resultados originais da pesquisa

Com base na leitura conjunta dos dois critérios (redução de inércia e silhueta média), selecionou-se o valor de k que apresenta desempenho superior na silhueta e comportamento coerente no gráfico de cotovelo. Essa escolha orientou a etapa seguinte, na qual o agrupamento final foi aplicado e visualizado por redução de dimensionalidade.

Após a definição do número de clusters, aplicou-se o K-Means com o valor de k selecionado e, na sequência, utilizou-se a Análise de Componentes Principais (PCA) como técnica de apoio para visualizar a separação dos grupos em duas dimensões. A PCA foi aplicada sobre as variáveis numéricas padronizadas (z-score), reduzindo a dimensionalidade do conjunto para componentes que concentram a maior parcela possível da variância total.

A Tabela 4 apresenta a variância explicada por cada componente principal utilizada na visualização (PC1 e PC2), bem como o percentual acumulado. Esses valores indicam quanto da informação do conjunto original é preservada quando os dados são projetados no plano bidimensional.

Tabela 4. Variância explicada pelo PCA (PC1, PC2 e acumulada).

ComponenteVariância explicadaVariância explicada (%)
PC10,31173231,17
PC20,23657123,66
Acumulado (PC1+PC2)0,54830254,83

Fonte: Resultados originais da pesquisa

A Figura 9 apresenta o gráfico de dispersão dos registros no plano formado por PC1 e PC2, com as cores indicando a classificação atribuída pelo K-Means. A visualização permite observar o grau de separação entre os grupos, bem como regiões de maior sobreposição ou concentração de pontos.

Figura 9. PCA (2D): dispersão por cluster.

Fonte: Resultados originais da pesquisa

De forma descritiva, observa-se que os registros se organizam em regiões distintas do plano, evidenciando que os clusters obtidos capturam diferenças relevantes no conjunto de variáveis analisadas. Além disso, a presença de zonas com maior densidade de pontos em determinados grupos sugere padrões dominantes compartilhados por subconjuntos de registros, enquanto áreas com menor densidade indicam perfis menos frequentes.

Após a aplicação do K-Means com o número de clusters definido, realizou-se a análise das variáveis que mais contribuem para diferenciar os grupos formados. Para isso, foi aplicada ANOVA unidirecional comparando as médias das variáveis numéricas entre os clusters, com o objetivo de identificar quais variáveis apresentam diferenças estatisticamente relevantes entre os grupos. Além do valor de significância, foi reportado o tamanho de efeito (η²), que quantifica a proporção da variância explicada pela separação em clusters.

A Tabela 5 apresenta, para cada variável analisada, o valor da estatística F, o p-valor e o η². Esse conjunto de indicadores permite identificar não apenas se há diferença entre grupos, mas também o quanto essa diferença é expressiva.

Tabela 5. ANOVA por variável (F, p-valor e n²), ordenada por n².

VariávelFp_valoreta2
Total_visits_online1475,41541,0348E-2430,8179
Avg_Credit_Limit884,60224,1839E-1870,7292
Total_Credit_Cards851,19144,036E-1830,7215
Online_to_Bank_Ratio834,53514,3115E-1810,7175
Online_Share812,86152,0813E-1780,7122
Bank_Share777,81045,8652E-1740,7031
Total_calls_made717,76655,3624E-1660,686
Total_visits_bank504,95221,4878E-1330,6059
Total_Interactions424,23185,0762E-1190,5636
Payment_Delay_Rate_sim383,03815,4296E-1110,5383
Call_Share369,33543,2285E-1080,5293
Interactions_per_Card354,22414,2885E-1050,5188
Log_Credit_Limit320,61946,81159E-980,4939
Tenure_Years_sim298,29466,70246E-930,4759
Credit_Score_sim244,67493,84176E-800,4269
Annual_Income_sim190,63895,14288E-660,3672
Complaints_12M_sim119,80594,3618E-450,2672
Limit_per_Card104,78143,18361E-400,2418
Rewards_Usage_Rate_sim98,76253,15236E-380,2312
Avg_Monthly_Spend_sim76,96899,28583E-310,1898
Calls_to_Online_Ratio48,99121,47229E-200,1298
Age_sim35,95071,52594E-150,0986
Cards_per_100k_Limit23,72711,12352E-100,0674
Utilization_Ratio_sim15,59052,42609E-070,0453
Channels_Used14,4737,06295E-070,0422

Fonte: Resultados originais da pesquisa

De modo descritivo, observa-se que as variáveis com maior poder discriminante são majoritariamente associadas a: (i) intensidade de uso de canal digital (visitas online e medidas derivadas), (ii) capacidade de crédito (limite médio e derivadas), (iii) estrutura de produto (quantidade de cartões), e (iv) mix de canal (proporções e razões). Esse padrão indica que a segmentação está fortemente orientada por diferenças no comportamento de relacionamento e no perfil de limite/produto. As variáveis com maiores valores de η² (por exemplo, as 8–12 primeiras) concentram maior variação explicada pela segmentação, sendo o conjunto principal de diferenciação entre os clusters.

Após identificar as variáveis com maior capacidade de diferenciação entre os clusters, procedeu-se ao perfilamento dos grupos, isto é, à descrição objetiva das características de cada cluster com base em medidas-resumo (principalmente média e mediana) das variáveis centrais do estudo. Essa etapa permite transformar a saída do algoritmo em perfis interpretáveis, destacando como os grupos se distinguem em termos de limite, quantidade de cartões e padrão de interação por canal.

Inicialmente, a Tabela 6 apresenta a distribuição dos registros por cluster, indicando o número de observações em cada grupo e sua participação percentual no total da amostra.

Tabela 6. Distribuição dos registros por cluster (n e %).

ClusterN%
038558,33
1497,42
222634,24
Total660100

Fonte: Resultados originais da pesquisa

Na sequência, a Tabela 7 apresenta as medidas de tendência central e dispersão por cluster (por exemplo, médias e medianas) para as variáveis mais relevantes do ponto de vista analítico: Avg_Credit_Limit, Total_Credit_Cards, Total_Interactions, Total_visits_online, Total_visits_bank, Total_calls_made, além das variáveis derivadas (Online_Share, Bank_Share, Call_Share, Online_to_Bank_Ratio, Limit_per_Card).

Tabela 7. Perfil dos clusters (médias e/ou medianas por variável).

ClusterAvg_Credit_LimitTotal_Credit_CardsTotal_visits_bankTotal_visits_onlineTotal_calls_madeTotal_InteractionsOnline_ShareBank_ShareCall_ShareOnline_to_Bank_RatioCalls_to_Online_RatioLimit_per_CardInteractions_per_CardChannels_UsedLog_Credit_LimitAge_simAnnual_Income_simCredit_Score_sim
03405.5273.470.9941.986.4490.10.5670.24271.25496.66231.2152566393741265729
11428.7550.59111.0812.670.80.0490.1667.81630.094361.36021.47875333842.7831818
21272.4290.973.5316.8511.350.30.0860.62.20691.62827.3486.11216232.28321814
Total3454.7062.402.6063.588.5920.20.3640.31.47761.29667200.18282.9116336235.9816

Fonte: Resultados originais da pesquisa

De forma descritiva, essa tabela permite observar diferenças consistentes entre os grupos, especialmente em relação a: (i) capacidade de crédito (níveis de Avg_Credit_Limit e Limit_per_Card), (ii) estrutura de produto (quantidade de cartões), e (iii) padrão de interação (intensidade total e predominância de canal).

O Cluster 0 (n=385; 58,33%) apresenta um Avg_Credit_Limit médio de 34.083,12 e Total_Interactions de 6,45. Este grupo demonstra maior presença de interações no canal físico (Total_visits_bank 3,47) com baixa atividade online (Total_visits_online 0,99). Seu mix de canal confirma esse padrão: Bank_Share 0,5674, Online_Share 0,1496, Call_Share 0,2831, e uma Online_to_Bank_Ratio baixa (0,2427). Trata-se de um grupo predominantemente “banco-centrado”, com menor intensidade total de contato quando comparado aos demais.

O Cluster 1 (n=49; 7,42%) é o grupo mais distinto e concentrado em perfis de alta capacidade: Avg_Credit_Limit médio de 142.061,22 e Total_Credit_Cards de 8,76. Em comportamento de canal, apresenta Total_visits_online 11,00, quase sem visitas ao banco (Total_visits_bank 0,59) e poucas chamadas (Total_calls_made 1,08). O mix de canal confirma dominância digital (Online_Share 0,8664) e uma razão online/banco extremamente elevada (Online_to_Bank_Ratio 7,8163). Esse perfil é coerente com a lógica de segmentação comportamental em customer analytics, na qual grupos de “alto valor” tendem a ser identificados combinando capacidade (limite/produtos) e padrão de interação (Blattberg, Kim, & Neslin, 2008).

O Cluster 2 (n=226; 34,24%) contrasta fortemente com o Cluster 1 no que se refere ao canal de suporte: Avg_Credit_Limit médio de 12.106,19 (mais baixo), Total_Credit_Cards de 2,43 e Total_Interactions de 11,36, alta intensidade, porém concentrada em Total_calls_made (6,85). O mix de canal evidencia predominância do telefone (Call_Share 0,6011), com participação online moderada (Online_Share 0,3127) e baixa participação de banco (Bank_Share 0,0863). Esse padrão sugere um grupo cuja jornada de relacionamento ocorre mais por contato reativo (chamadas), o que, em termos analíticos, costuma sinalizar maior necessidade de suporte, dúvidas operacionais ou maior fricção na experiência e hipóteses que devem ser verificadas com variáveis de motivo de contato, reclamações ou status de serviço, caso existam (Provost & Fawcett, 2013).

A solução de clusterização obtida a partir da base cartao_credito_enriquecida.csv evidenciou heterogeneidade substantiva no comportamento de relacionamento e no perfil de crédito dos registros. Na etapa de validação interna, a silhueta média apresentou o maior valor em k=2 (0,4292), com queda em k=3 (0,2926) e valores ainda menores para k mais altos. Esse padrão é comum em dados comportamentais com sobreposição entre perfis: a silhueta tende a favorecer soluções mais “grossas” (menos grupos), enquanto soluções com mais clusters podem capturar nuances ao custo de menor separação média (Rousseeuw, 1987; Hennig, Meila, Murtagh, & Rocci, 2015). Ainda assim, a escolha de k=3 se sustenta quando se considera o equilíbrio entre qualidade e interpretabilidade, uma recomendação recorrente na literatura aplicada de segmentação: clusters devem ser úteis, acionáveis e comunicáveis, não apenas “ótimos” em uma métrica isolada (Wedel & Kamakura, 2000). A redução de dimensionalidade via PCA ajudou a checar a coerência do agrupamento no plano bidimensional. Os dois primeiros componentes explicaram 54,83% da variância (PC1=31,17%; PC2=23,66%), o que é adequado para visualização exploratória sem pretender esgotar a estrutura do dado (Jolliffe, 2002). A etapa de ANOVA por variável reforçou que os clusters encontrados se diferenciam de modo consistente e, principalmente, por quais dimensões. As maiores magnitudes de tamanho de efeito (η²) concentraram-se em variáveis relacionadas ao canal digital e ao limite/produto: Total_visits_online (η²=0,8179), Avg_Credit_Limit (η²=0,7292), Total_Credit_Cards (η²=0,7215), Online_to_Bank_Ratio (η²=0,7175) e Online_Share (η²=0,7122). Em leitura aplicada, isso indica que a segmentação foi guiada por diferenças estruturais na intensidade de uso online, na capacidade de crédito e na estrutura de cartões, com forte papel das métricas derivadas de composição de canal (Hair et al., 2010; Field, 2013).

Em síntese, os resultados mostram que a segmentação por cluster, aplicada a variáveis numéricas e derivadas de comportamento, produziu uma estrutura de três perfis bem definidos por: (i) predominância de canal (banco vs online vs telefone), (ii) intensidade total de interações e (iii) capacidade/estrutura de crédito. Esse conjunto de evidências (métricas internas, PCA e ANOVA com η²) atende ao que a literatura recomenda como mínimo para sustentar uma segmentação quantitativa: solução estável/justificada, diferenças mensuráveis entre grupos e perfilamento interpretável (Wedel & Kamakura, 2000; Hair et al., 2010; Hennig et al., 2015).

4. Conclusão

O presente estudo buscou aplicar técnicas de análise de cluster a uma base de dados de cartão de crédito para identificar e descrever perfis comportamentais de clientes, avaliando a qualidade da segmentação por métricas apropriadas e apoiando a interpretação por análises estatísticas complementares. Verificou-se uma solução de agrupamento com três clusters, que organizou os registros em perfis distintos, principalmente pela intensidade e mix de canais de interação, bem como pela capacidade de crédito e estrutura de cartões. Identificou-se um grupo majoritário com maior participação de visitas ao banco e menor intensidade total de contato, um grupo minoritário com limite elevado e predominância de interações online, e um grupo com limite inferior e alta intensidade de chamadas telefônicas. Essa diferenciação foi consistentemente sustentada pela análise de variância, que apontou variáveis como visitas online, limite de crédito e quantidade de cartões como os principais discriminadores entre os grupos. A clusterização permitiu reduzir a complexidade do comportamento observado em perfis comparáveis e mensuráveis, oferecendo uma base objetiva para a caracterização de clientes e o apoio a decisões orientadas por dados em iniciativas de relacionamento e gestão.

Contudo, o estudo esteve condicionado às variáveis disponíveis em uma base de dados secundária e à natureza dos algoritmos de agrupamento, que envolvem julgamento analítico na definição do número de clusters, mesmo com o suporte de métricas internas. A escolha de três clusters privilegiou o equilíbrio entre qualidade e interpretabilidade gerencial, reconhecendo trade-offs entre separação e granularidade. Para estudos futuros, recomenda-se aprofundar a validação externa do agrupamento com variáveis de desempenho, risco ou retenção, testar soluções alternativas de clusterização e verificar a estabilidade temporal dos perfis, caso dados multiperíodo estejam disponíveis. Tais abordagens podem enriquecer a compreensão dos padrões de uso e relacionamento, ampliando a robustez e a aplicabilidade da segmentação.

Referências Bibliográficas

Blattberg, R. C., Kim, B.-D., & Neslin, S. A. 2008. Database marketing: Analyzing and managing customers. New York, NY, USA: Springer.

Everitt, Landau, Leese & Stahl, 2011 [Referência completa não encontrada no documento original]

Field, A. 2013. Discovering statistics using IBM SPSS statistics (4th ed.). London, UK: SAGE Publications.

Hair, J. F., Black, W. C., Babin, B. J., & Anderson, R. E. 2010. Multivariate data analysis (7th ed.). Upper Saddle River, NJ, USA: Pearson.

Hennig, C., Meila, M., Murtagh, F., & Rocci, R., eds. 2015. Handbook of cluster analysis. Boca Raton, FL, USA: CRC Press.

Jolliffe, I. T. 2002. Principal component analysis (2nd ed.). New York, NY, USA: Springer.

MacQueen, J. 1967. Some methods for classification and analysis of multivariate observations. In L. M. Le Cam & J. Neyman, eds., Proceedings of the Fifth Berkeley Symposium on Mathematical Statistics and Probability, Volume 1: Statistics (pp. 281–297). Berkeley, CA, USA: University of California Press.

Provost, F., & Fawcett, T. 2013. Data science for business: What you need to know about data mining and data-analytic thinking. Sebastopol, CA, USA: O’Reilly Media.

Rousseeuw, P. J. 1987. Silhouettes: A graphical aid to the interpretation and validation of cluster analysis. Journal of Computational and Applied Mathematics, 20, 53–65.

Wedel, M., & Kamakura, W. A. 2000. Market segmentation: Conceptual and methodological foundations (2nd ed.). Boston, MA, USA: Kluwer Academic Publishers.

Artigo oriundo de Trabalho de Conclusão de Curso da Especialização em Data Science e Analytics do MBA USP/Esalq

Para saber mais sobre o curso, clique aqui e acesse a plataforma MBX Academy

Você também pode gostar

17 de setembro de 2026

Heterogeneidade Territorial do Bolsa Família: uma Análise por Clusters e Efeitos Fixos

O Programa Bolsa Família (PBF) representa uma das políticas de proteção social mais relevantes globalmente, o que justifica a investigação de seus efeitos diante das acentuadas e heterogêneas desigualdades regionais brasileiras. O estudo avaliou os reflexos socioeconômicos dos repasses do programa sobre a saúde, a educação e o mercado de trabalho nos municípios brasileiros, no período de 2004 a 2019. Para isso, aplicou-se a técnica de agrupamento K-means para segmentação territorial e estimaram-se modelos econométricos de dados em painel com efeitos fixos, tanto a nível nacional quanto segregados por clusters. Os resultados revelaram a natureza anticíclica do PBF no mercado de trabalho, com uma relação negativa entre repasses e vínculos empregatícios formais em quatro dos cinco clusters, sugerindo que os recursos foram mais intensos onde o mercado formal falhou. Na saúde, o programa associou-se à redução significante da mortalidade infantil evitável em municípios com maior equilíbrio socioeconômico, mas não apresentou efeito detectável em agrupamentos de maior precariedade estrutural, indicando que a transferência de renda é necessária, porém insuficiente sem infraestrutura de saúde funcional. Na educação, a análise por subperíodos mostrou atenuação progressiva do coeficiente nacional, refletindo a convergência das taxas de matrícula para um patamar de alta inércia temporal. Concluiu-se que o PBF cumpriu seu objetivo de proteção social de forma anticíclica e territorialmente focalizada, mas sua capacidade de transformar indicadores estruturais dependeu da sinergia com investimentos em infraestrutura pública.

Palavras-chave: Bolsa Família; Mortalidade Infantil; Municípios Brasileiros; Painel de Dados; Política Pública.

Gestão Tributária

17 de setembro de 2026

Limites Jurídicos e Práticos da Dedutibilidade Retroativa dos Juros sobre Capital Próprio

A gestão tributária adequada é crucial para a saúde financeira das empresas, especialmente no complexo sistema tributário brasileiro. Os Juros sobre Capital Próprio (JCP) constituem um mecanismo jurídico relevante para a remuneração do capital próprio, utilizado para otimizar a carga tributária. O estudo investigou a controvérsia sobre a dedutibilidade de JCP referentes a exercícios anteriores à deliberação societária que autoriza seu pagamento. Aplicou-se a metodologia de pesquisa e análise documental empírica, baseada em “Normative Systems”, para identificar cinco propriedades representativas dos argumentos jurídicos na jurisprudência administrativa e judicial. Analisaram-se acórdãos do Conselho Administrativo de Recursos Fiscais (CARF), revelando padrões decisórios predominantes, divergências interpretativas, incoerências argumentativas e significativa insegurança jurídica. Os resultados indicaram forte tendência de invalidação dos planejamentos envolvendo JCP extemporâneos na esfera administrativa. Contudo, o julgamento do Tema 1319 pelo Superior Tribunal de Justiça (STJ) seguiu direção oposta, consagrando tese favorável à dedutibilidade e estabelecendo um precedente paradigmático que pode influenciar a jurisprudência administrativa e redefinir os critérios decisórios.

Palavras-chave: CARF; gestão tributária; limitação temporal; lucro real; planejamento tributário.

17 de setembro de 2026

Símbolos da Moda Esportiva: Consumo, Identidade e Status entre Consumidores Brasileiros

A moda esportiva consolidou-se como linguagem simbólica de distinção social nas últimas décadas, impulsionada pela expansão do mercado de wellness e pela reconfiguração dos padrões de prestígio nas sociedades de consumo contemporâneas. O estudo objetivou compreender como os símbolos da moda esportiva influenciaram a construção de identidade e pertencimento e sua associação ao prestígio social entre consumidores brasileiros que adquiriram produtos do setor nos últimos 12 meses. Desenvolveu-se a pesquisa por meio de levantamento bibliográfico e pesquisa descritiva, com levantamento do tipo survey aplicado a uma amostra não probabilística por conveniência de 445 consumidores brasileiros de moda esportiva. Os principais resultados indicaram que a maioria dos respondentes associou marcas esportivas a percepções de status social; mais da metade reconheceu o wellness como novo símbolo de prestígio; e parcela expressiva percebeu o sportstyle como mais aceito em ambientes formais de trabalho. Em contrapartida, formas ostensivas de sinalização, como preferência por logotipos visíveis, influência de redes sociais e disposição a pagar sobrepreço, foram amplamente rejeitadas, revelando uma dissociação entre a atribuição simbólica de status e o comportamento de sinalização ostensiva. O consumidor brasileiro de moda esportiva com elevado capital cultural operou por meio de sinais simbólicos sutis e não ostensivos, compatíveis com o fenômeno do consumo inconspícuo, no qual a distinção social se manifestou de forma internalizada.

Palavras-chave: Consumo inconspícuo; Distinção; Prestígio social; Sportstyle; Wellness.

17 de setembro de 2026

Modelo Validado de Formação de Competência Técnica e Habilidades Não Técnicas em Indústrias Químicas Complexas

Analisou-se a implementação de um processo sistemático para o desenvolvimento e a atualização de competências técnicas e habilidades não técnicas em Operações Industriais e Segurança de Processo em uma indústria química de alta complexidade, pertencente a uma multinacional localizada no Polo Petroquímico de Camaçari, Bahia. O estudo objetivou implementar um processo mensurável e sustentável que assegurou a competência técnica e não técnica de 100% dos operadores, em conformidade com a legislação estadual da Bahia, diretrizes de institutos internacionais e políticas corporativas. A pesquisa caracterizou-se como um estudo de caso de abordagem mista, que envolveu diagnóstico documental, entrevistas semiestruturadas com 85 operadores experientes, análise de tarefas críticas e o desenvolvimento e aplicação piloto de um programa modular de treinamento. Este processo evidenciou a necessidade de alinhamento e atualização sistemática das competências requeridas. Os resultados obtidos indicaram a eficácia do modelo proposto, com 100% dos operadores concluindo os módulos teóricos e práticos e alcançando uma taxa de aprovação superior a 80%, além de conformidade operacional em campo. O trabalho contribuiu com um modelo estruturado de formação, incluindo matriz de competências, programas modulares de treinamento e diretrizes para certificação e recertificação, demonstrando potencial de replicação em outras unidades industriais de elevada complexidade e risco, e fortalecendo a segurança de processo e a sustentabilidade operacional.

Palavras-chave: Capacitação; Competência; Habilidades não técnicas; Segurança de processo; Treinamento.

Compliance E Esg

17 de setembro de 2026

Governança Pública Climática e Enchentes de 2024 no Rio Grande do Sul

As enchentes de 2024 no Rio Grande do Sul evidenciaram fragilidades estruturais na governança pública em um contexto federativo submetido a risco climático extremo. Este trabalho analisou, no recorte temporal de maio de 2024 a maio de 2025, como a atuação federal, estadual e municipal se estruturou diante da crise e em que medida a comparação com os Países Baixos ofereceu parâmetros úteis para o fortalecimento da resiliência institucional. A pesquisa adotou abordagem qualitativa, aplicada, exploratória e comparativa, com análise documental e análise de conteúdo de fontes oficiais, relatórios técnicos internacionais, atos normativos e pronunciamentos institucionais, organizados por categorias temáticas e interpretados com apoio do Modelo das Três Linhas do IIA. Os resultados mostraram que, embora os três níveis de governo tenham criado ou reestruturado instrumentos relevantes de coordenação e reconstrução após o desastre, prevaleceu uma institucionalidade reativa, posterior ao evento, com lacunas de continuidade administrativa, integração preventiva, monitoramento e accountability. Na comparação internacional, o modelo neerlandês destacou-se por combinar autoridade operacional permanente, base territorial clara, financiamento próprio e mecanismos mais robustos de monitoramento e responsabilização. Concluiu-se que os impactos das enchentes foram agravados menos pela ausência formal de normas e mais pela insuficiente articulação entre operação, gestão de riscos e controle. O fortalecimento da governança climática, no caso gaúcho, depende de institucionalizar coordenação, dados, financiamento e accountability em bases permanentes.

Palavras-chave: accountability; adaptação climática; gestão de riscos; governança multinível.

Digital Business

17 de setembro de 2026

Dados e Automação Utilizados em uma Campanha de Marketing na Engenharia Civil

A crescente utilização de dados no marketing digital impulsionou a adoção de estratégias mais orientadas por métricas e desempenho, com o Inbound Marketing em destaque. O uso de ferramentas de Business Intelligence (BI) mostrou-se fundamental para transformar dados em informações estratégicas, apoiando a tomada de decisão e a construção de bases de contatos qualificadas. Analisou-se como a ausência de integração entre sistemas de BI e plataformas de automação de marketing impactou a eficiência operacional e a efetividade das estratégias de Inbound Marketing em uma empresa de engenharia. Para isso, adotou-se uma abordagem descritiva de natureza qualitativa, baseada na análise dos processos operacionais envolvidos, desde a leitura de relatórios extraídos do BI e sua posterior transformação em mailings, até a preparação para importação no RD Station. Os resultados indicaram que o processo atual dependia de etapas manuais e empíricas, demandando tempo significativo. Identificaram-se limitações relacionadas à ausência de integração entre os sistemas, o que impactou diretamente a eficiência operacional e aumentou a dependência de atividades repetitivas. Concluiu-se que a estruturação adequada do processo de gestão de mailings e a integração entre BI e ferramentas de automação de marketing representam uma oportunidade para otimizar fluxos, melhorar a qualidade dos dados e fortalecer as estratégias de Inbound Marketing.

Palavras-chave: Automação de Marketing; Business Intelligence; Inbound Marketing; Integração de Sistemas; RD Station.

17 de setembro de 2026

Detecção de Anomalias no Monitoramento de Saúde de Pontes Usando Redes Neurais

O monitoramento da saúde estrutural de pontes tornou-se cada vez mais relevante diante do envelhecimento das infraestruturas e da intensificação de eventos extremos associados às mudanças climáticas. Nesse contexto, abordagens baseadas em dados destacaram-se como alternativas promissoras para o reconhecimento de anomalias. O estudo objetivou desenvolver e avaliar uma abordagem baseada em aprendizado de máquina para o reconhecimento de anomalias em séries temporais de aceleração estrutural. A metodologia adotada consistiu no uso de autoencoders treinados exclusivamente com dados representativos da condição íntegra, permitindo ao modelo aprender padrões associados ao estado saudável da estrutura; em seguida, o erro de reconstrução, quantificado por meio do erro quadrático médio (MSE), foi utilizado como critério para identificação de desvios em relação a essa condição. O conjunto de dados analisado foi composto por 1767 séries temporais de 1000 pontos cada, pertencentes a duas classes: íntegra (normal) e anômala (danificada). Os resultados obtidos demonstraram que o modelo proposto apresentou elevada capacidade de reconhecimento da classe anômala, com taxa de detecção superior a 90%, e desempenho global satisfatório, com área sob a curva ROC (AUC) próxima de 0,78, indicando boa capacidade discriminativa e reforçando o potencial da abordagem para aplicações em monitoramento estrutural.

Palavras-chave: Autoencoders; Detecção de Anomalias; Monitoramento de Pontes; Redes Neurais.

17 de setembro de 2026

Gestão Escolar Integrada: o Papel da Direção Administrativa na Capacitação da Equipe de Gestão Pedagógica para a Compreensão do Orçamento Escolar

A administração escolar foi abordada sob a perspectiva da integração entre gestores administrativos e pedagógicos, com foco na participação democrática, capacitação e qualificação dos atores. O objetivo geral consistiu na elaboração de um Guia de Orientações para Orçamento, direcionado à equipe de gestão pedagógica e mediado pela direção administrativa, visando instrumentalizar esses profissionais para a compreensão e participação nos processos financeiros e decisórios da instituição. Para tanto, o estudo desenvolveu-se em uma instituição particular privada, adotando uma abordagem qualitativa, descritiva e aplicada, com procedimento metodológico de estudo de caso. A pesquisa mapeou desafios práticos e dificuldades de comunicação entre os setores, analisou referenciais teóricos da gestão escolar e estruturou o instrumento formativo proposto. Os resultados demonstraram que a ausência de integração entre as áreas administrativa e pedagógica pode comprometer a efetividade da gestão escolar, evidenciando a necessidade de processos formativos contínuos que promovam entendimento mútuo, cooperação e construção coletiva de soluções. O Guia proposto fortaleceu a gestão democrática, elevou a qualificação da equipe pedagógica e melhorou os processos decisórios institucionais, destacando o papel formativo e estratégico do diretor administrativo.

Palavras-chave: Comunicação escolar; Gestão escolar participativa; Orçamento escolar.

Inscreva-se em nossa newsletter!

Receba conteúdos e fique sempre atualizado sobre as novidades em gestão, liderança e carreira com a Revista E&S.

Ao preencher o formulário você está ciente de que podemos enviar comunicações e conteúdos da Revista E&S. Confira nossa Política de Privacidade