Artigo

15 de setembro de 2026

Segmentação de Clientes Financeiros por Clusterização e Aprendizado Não Supervisionado

Luciana Martins Esteves; Henrique Raymundo Gioia

DOI: 10.22167/2675-6528-202602263

Artigo derivado de Trabalho de Conclusão de Curso (TCC), com conteúdo baseado no trabalho original do aluno e adaptado ao formato editorial da Revista E&S com apoio da ferramenta ResumeAI, solução de inteligência artificial desenvolvida pelo Instituto Pecege para síntese e organização textual.

Resumo

A crescente disponibilidade de dados no setor financeiro tornou relevante o uso de técnicas analíticas para segmentação e apoio à decisão. O estudo teve como objetivo aplicar técnicas de clusterização a uma base de clientes, a fim de identificar grupos homogêneos e interpretar perfis distintos com base em variáveis financeiras, comportamentais e cadastrais. Metodologicamente, a pesquisa classificou-se como aplicada, descritiva e quantitativa, conduzida como estudo de caso com 750 registros. Inicialmente, os dados foram preparados, tratados e padronizados. Em seguida, aplicou-se o algoritmo K-Means, testando diferentes valores de k e utilizando métricas internas de validação (WCSS, silhouette, Calinski-Harabasz e Davies-Bouldin). Realizou-se também comparação com métodos hierárquicos e análise estatística complementar por ANOVA. Os resultados mostraram que, embora a solução com dois clusters tenha apresentado melhor desempenho estatístico em parte das métricas, a configuração com três grupos teve maior capacidade interpretativa e analítica. Os clusters identificados distinguiram clientes com maior vulnerabilidade financeira, perfil intermediário e maior valor econômico, com diferenças relevantes em renda, endividamento, utilização do crédito, investimento e reserva de emergência. Concluiu-se que a clusterização foi eficaz para segmentar a base analisada e demonstrou potencial para apoiar a interpretação de perfis e a tomada de decisão orientada por dados.

Palavras-chave: aprendizado não supervisionado; ciência de dados; clusterização; K-Means; segmentação de clientes.

1. Introdução

A crescente digitalização do setor financeiro ampliou de forma significativa a geração, o armazenamento e o uso estratégico de dados de clientes. No contexto bancário contemporâneo, a competitividade deixou de depender apenas da oferta de produtos padronizados e passou a exigir maior capacidade analítica para compreender perfis, comportamentos e necessidades específicas dos consumidores.

No Brasil, esse movimento tem sido intensificado pela expansão dos canais digitais, pelo amadurecimento do Open Finance e pelo uso crescente de inteligência artificial e análises preditivas para personalização de produtos e serviços. A Federação Brasileira de Bancos (FEBRABAN, 2025) aponta que a personalização é impulsionada, entre outros fatores, pelo uso de dados compartilhados via Open Finance e por análises baseadas em inteligência artificial. O Banco Central do Brasil (BCB, 2023) destaca que o ecossistema de Open Finance busca ampliar o acesso a serviços financeiros mais adequados ao perfil e à necessidade de cada cliente. Nesse cenário, o uso de métodos analíticos capazes de transformar grandes volumes de dados em conhecimento aplicável tornou-se relevante tanto para a diferenciação competitiva quanto para a melhoria da experiência do cliente.

Do ponto de vista teórico, a clusterização ocupa posição importante na Ciência de Dados e na mineração de dados por permitir a identificação de estruturas latentes em bases sem rótulos prévios. Jain, Murty e Flynn (1999) definem clusterização como a classificação não supervisionada de padrões em grupos, ressaltando sua utilidade como etapa de análise exploratória de dados. Na mesma direção, Han, Kamber e Pei (2012) tratam a clusterização como uma das técnicas centrais de mineração de dados para descoberta de padrões, organização de bases complexas e apoio à geração de conhecimento a partir dos dados.

Em uma perspectiva mais ampla de aprendizado estatístico, Hastie, Tibshirani e Friedman (2009), assim como James et al. (2021), situam os métodos não supervisionados como ferramentas apropriadas quando o interesse do pesquisador está menos em prever uma variável-resposta e mais em compreender a estrutura interna dos dados, identificar semelhanças e descrever perfis com base em múltiplos atributos observados. Assim, a clusterização se mostra especialmente pertinente quando o problema de pesquisa envolve heterogeneidade de clientes, diversidade comportamental e necessidade de segmentação orientada por evidências, e não apenas por critérios intuitivos ou administrativos.

No setor bancário e financeiro, a literatura recente tem reforçado a utilidade da segmentação analítica de clientes para fins de personalização, retenção, desenho de ofertas e priorização comercial. Estudos recentes mostram que algoritmos de clusterização, especialmente o K-Means, têm sido empregados para agrupar clientes a partir de atributos financeiros, transacionais e comportamentais, permitindo distinguir padrões de consumo, risco e valor econômico. Em trabalho recente, Yan et al. (2025) demonstraram que abordagens de clusterização aplicadas ao contexto bancário podem apoiar estratégias de marketing mais precisas, enquanto Nofal (2024) mostrou que a combinação entre características transacionais e técnicas de aprendizado de máquina possibilita identificar clientes de maior valor em bases bancárias reais.

Esses resultados dialogam com a literatura aplicada mais ampla, que reconhece a segmentação como instrumento para converter dados brutos em perfis acionáveis, com potencial para orientar decisões mais precisas. Apesar disso, a qualidade da segmentação depende de escolhas metodológicas consistentes, como seleção de variáveis, padronização dos dados, definição do número de clusters e validação da solução encontrada, o que exige rigor técnico e justificativa teórica para que os resultados não sejam interpretados como simples agrupamentos arbitrários.

A relevância deste trabalho decorre, portanto, de dois aspectos complementares. No plano prático, a pesquisa responde à necessidade crescente de segmentar clientes de forma mais precisa em ambientes financeiros marcados por competição, digitalização e personalização intensiva. No plano acadêmico, o estudo contribui ao aplicar fundamentos de Ciência de Dados a um problema concreto de segmentação, articulando técnicas de clusterização com métricas de validação e interpretação analítica dos grupos formados. Dessa forma, evita-se uma leitura meramente descritiva ou institucional do fenômeno e reforça-se uma abordagem metodologicamente embasada, apoiada na literatura de mineração de dados, aprendizado não supervisionado e aplicações financeiras. Nesse sentido, o objetivo deste trabalho foi aplicar técnicas de clusterização a uma base de clientes do setor financeiro, a fim de identificar segmentos com características homogêneas e estatisticamente distinguíveis, capazes de subsidiar a interpretação de perfis e apoiar decisões orientadas por dados.

2. Material e Métodos

A pesquisa foi classificada como aplicada, descritiva e quantitativa. Quanto à sua finalidade, buscou gerar conhecimento com utilidade prática para a compreensão e segmentação de clientes a partir de dados financeiros e comportamentais. Em relação aos objetivos, procurou identificar, analisar e descrever padrões presentes na base de dados, evidenciando diferenças entre os grupos formados. Sob a perspectiva da abordagem do problema, foi quantitativa, envolvendo o uso de dados numéricos, métricas estatísticas e técnicas computacionais. Em termos de procedimentos técnicos, o trabalho assumiu características de estudo de caso, desenvolvido a partir de uma base específica analisada em profundidade.

A base de dados utilizada foi composta por 750 registros de clientes e 26 colunas, contemplando variáveis de natureza financeira, comportamental e cadastral, além dos rótulos de cluster gerados. Tratou-se de uma base anonimizada, oriunda do ambiente analítico de uma instituição do setor financeiro atuante no Brasil, sem identificação nominal da organização, dos clientes ou de informações sensíveis individualizadas. As variáveis analisadas abrangeram indicadores de renda, patrimônio, saldo em conta, limite de cartão, investimento mensal, utilização de crédito, percentual de atraso, taxa de endividamento, reserva de emergência, tempo de relacionamento, canal de interação predominante e enquadramento em segmentos previamente identificados. A escolha dessas variáveis foi justificada por sua aderência ao problema de pesquisa, exigindo atributos capazes de discriminar diferentes perfis de clientes em termos de valor econômico, exposição ao risco, intensidade de uso de produtos financeiros e padrão de relacionamento com a instituição. A base final incorporou os rótulos gerados pelos métodos de agrupamento aplicados, incluindo K-Means e abordagens hierárquicas.

A etapa de preparação e tratamento dos dados visou garantir a qualidade, consistência e adequação da base para aplicação das técnicas de clusterização. Inicialmente, foi realizada a inspeção para identificação de inconsistências, como registros duplicados (removidos) e valores ausentes (tratados conforme a natureza da variável, com imputação simples ou manutenção). Em seguida, foram realizados ajustes de tipagem das variáveis (numéricas, categóricas e temporais). Também foi conduzida análise exploratória para compreender a distribuição das variáveis e identificar possíveis outliers, que foram mantidos quando representavam características reais dos clientes e removidos apenas se inconsistências ou erros. Variáveis categóricas relevantes foram mantidas para interpretação dos clusters. A base foi estruturada em formato adequado para aplicação dos algoritmos de clusterização.

A padronização das variáveis foi realizada por meio do z-score, técnica que transforma as variáveis para uma mesma escala com média igual a zero e desvio padrão igual a um. Esse procedimento foi aplicado exclusivamente às variáveis numéricas utilizadas na etapa de modelagem, com o objetivo de garantir que todos os atributos contribuíssem de forma equilibrada para a formação dos grupos, evitando que variáveis com maior escala numérica exercessem influência desproporcional.

A etapa de clusterização foi realizada para identificar grupos homogêneos de clientes, utilizando o algoritmo K-Means. O K-Means divide um conjunto de dados em k grupos, buscando maior similaridade interna e dissimilaridade externa, medida pela distância euclidiana. O processo envolve a definição de k, seleção aleatória de centróides iniciais, atribuição de observações ao centróide mais próximo, e recalculo iterativo dos centróides até a convergência. O objetivo do algoritmo é minimizar a soma das distâncias quadráticas entre os pontos e os centróides de seus respectivos clusters (WCSS), representada pela Equação 1:

WCSS = Σ₁=1* Σ(x ∈ Ci) ||x – μ₁||²

(Eq. 1)

Em que Ci representa o conjunto de pontos pertencentes ao cluster i, x representa cada observação do grupo e μ¡ corresponde ao centróide desse cluster. O algoritmo foi aplicado à base previamente tratada e padronizada, sendo justificado pela sua capacidade de lidar com bases de tamanho moderado e múltiplas variáveis numéricas.

A definição do número de clusters (k) e a validação da qualidade dos agrupamentos foram etapas essenciais. Foram testados diferentes valores de k, variando de 2 a 10, utilizando métricas internas de validação: Within-Cluster Sum of Squares (WCSS), silhouette score, índice de Calinski-Harabasz e índice de Davies-Bouldin. A análise conjunta dessas métricas indicou melhor desempenho estatístico para a configuração com dois clusters (k = 2). Entretanto, optou-se pela adoção de três clusters (k = 3) na análise final, fundamentada na maior capacidade de interpretação e segmentação dos perfis de clientes. Adicionalmente, foi analisada a curva de inércia (método do cotovelo), que demonstrou redução significativa da variabilidade até determinado ponto.

Para comparar a estrutura dos grupos e avaliar a robustez da segmentação, foram testadas abordagens hierárquicas de agrupamento, incluindo single linkage, complete linkage e average linkage. Para comparar os agrupamentos gerados, utilizou-se o Adjusted Rand Index (ARI), que avalia o grau de concordância entre duas soluções de clusterização. Os resultados mostraram que os métodos hierárquicos complete linkage e average linkage apresentaram elevada concordância entre si, enquanto o single linkage apresentou baixa estabilidade. Em comparação, o K-Means produziu grupos mais equilibrados em termos de distribuição de observações e mostrou concordância moderada com as abordagens hierárquicas mais robustas.

Após a definição e validação dos agrupamentos, realizou-se a análise dos perfis dos clusters para interpretar suas características predominantes. A análise foi conduzida a partir das médias das variáveis numéricas em cada cluster, considerando indicadores financeiros, comportamentais e de relacionamento. Variáveis categóricas, como canal predominante de interação e classificação em segmentos, também foram consideradas para enriquecer a interpretação. Os clusters foram descritos de forma interpretativa, sintetizando os principais traços de cada grupo e comparando as diferenças que os distinguem entre si.

Com o objetivo de verificar se os clusters identificados apresentavam diferenças estatisticamente significativas, aplicou-se a ANOVA às variáveis numéricas consideradas no estudo. A ANOVA foi aplicada às principais variáveis financeiras e comportamentais da base, como renda mensal, saldo em conta, investimento, utilização de crédito, percentual de atraso e taxa de endividamento. Além da significância estatística (p-valor), considerou-se a magnitude do efeito por meio do eta quadrado parcial (η²). Os resultados da ANOVA indicaram que a maior parte das variáveis analisadas apresentou diferenças estatisticamente significativas entre os clusters, com valores de p inferiores ao nível de significância adotado, e diversas variáveis apresentaram elevados valores de eta quadrado parcial.

A execução do pipeline analítico foi realizada com a linguagem de programação Python. Para tratamento e manipulação dos dados, foram utilizadas as bibliotecas Pandas e NumPy. A análise exploratória e a visualização dos dados, incluindo a análise da curva de inércia, foram conduzidas com o apoio da biblioteca Matplotlib. Para a aplicação das técnicas de clusterização (K-Means e métodos hierárquicos) e validação dos agrupamentos (silhouette score, índice de Calinski-Harabasz e índice de Davies-Bouldin), utilizou-se a biblioteca Scikit-learn. A análise estatística, incluindo a ANOVA, foi realizada com o suporte de bibliotecas especializadas em estatística computacional. O ambiente de desenvolvimento utilizado foi baseado em notebooks interativos.

3. Resultados e Discussão

A aplicação de técnicas de clusterização à base de clientes evidenciou a capacidade de transformar dados heterogêneos em grupos analiticamente distintos e interpretáveis, alinhando-se à literatura de mineração de dados e aprendizado não supervisionado. A qualidade da segmentação dependeu da combinação entre coesão interna, separação entre grupos e utilidade substantiva dos resultados (Jain, 2010; Han, Kamber e Pei, 2012; Hair et al., 2019). A discussão foi organizada para examinar a definição do número de clusters, a comparação entre métodos, o equilíbrio da partição final e a interpretação dos perfis identificados.

A curva de inércia foi utilizada para avaliar a redução da variabilidade intra-cluster à medida que o número de grupos aumentava. A Figura 1 ilustra esse comportamento.

Figura 1. Curva de inércia do K-Means

Fonte: Resultados originais da pesquisa

A Figura 1 demonstrou uma queda acentuada da inércia entre k=2 e k=4, seguida por uma redução progressivamente menor para valores superiores. Esse padrão, compatível com o método do cotovelo, sugeriu que os maiores ganhos de compactação ocorreram nas primeiras partições. Isso indica que soluções com poucos grupos já capturam uma parcela relevante da estrutura interna da base, mas a análise conjunta com métricas adicionais e a interpretabilidade dos segmentos gerados são indispensáveis.

A comparação normalizada das métricas internas de validação, apresentada na Figura 2, permitiu confrontar diferentes critérios de qualidade para a escolha do número de clusters.

Figura 2. Comparação normalizada das métricas internas de validação

Fonte: Resultados originais da pesquisa

A Figura 2 indicou que k=2 apresentou o melhor desempenho relativo nas métricas de silhouette, Calinski-Harabasz e Davies-Bouldin (invertido), sinalizando maior equilíbrio entre coesão interna e separação entre grupos. Contudo, optou-se por aprofundar a análise com k=3, uma decisão metodologicamente defensável que considerou a maior capacidade de interpretação e segmentação dos perfis de clientes, conforme a literatura que recomenda considerar a utilidade analítica e prática dos agrupamentos (Han, Kamber e Pei, 2012).

Para comparar a consistência estrutural dos agrupamentos obtidos por técnicas distintas, a Tabela 1 apresenta os valores do Adjusted Rand Index (ARI) entre as soluções do K-Means e dos métodos hierárquicos.

Tabela 1. Comparação entre métodos de agrupamento pelo Adjusted Rand Index

ComparaçãoARILeitura
kmeans x hier_single-0.000Baixa
kmeans x hier_complete0.452Moderada
kmeans x hier_average0.581Moderada
hier_single x hier_complete0.007Baixa
hier_single x hier_average0.009Baixa
hier_complete x hier_average0.886Alta

Fonte: Resultados originais da pesquisa

A Tabela 1 evidenciou que a maior convergência ocorreu entre complete linkage e average linkage, com ARI elevado, enquanto o single linkage apresentou baixa aderência às demais soluções. Esse resultado confirmou a limitação do single linkage em bases com maior variabilidade. O K-Means, por sua vez, apresentou concordância moderada com as abordagens hierárquicas mais robustas, sugerindo que a partição final preservou coerência estrutural sem perder equilíbrio e interpretabilidade.

A distribuição final dos clientes na solução adotada pode ser observada na Figura 3, que permite verificar se os grupos formados se mantiveram representativos e operacionalmente úteis.

Figura 3. Distribuição dos clientes por cluster no K-Means

Fonte: Resultados originais da pesquisa

A Figura 3 mostrou uma partição relativamente equilibrada, com 274 clientes no Cluster 0, 221 no Cluster 1 e 255 no Cluster 2. Esse equilíbrio é relevante do ponto de vista analítico, pois reduz o risco de que um cluster residual comprometa a leitura substantiva dos resultados, garantindo massa crítica suficiente para sustentar interpretações consistentes.

A Figura 4 aprofunda a leitura dos agrupamentos ao apresentar o perfil padronizado dos clusters nas variáveis mais relevantes do modelo.

Figura 4. Perfil padronizado dos clusters K-Means

Fonte: Resultados originais da pesquisa

A Figura 4 evidenciou três estruturas bastante distintas. O Cluster 0 concentrou valores padronizados mais elevados em utilização do crédito, atraso e endividamento, combinados com patamares inferiores de renda, patrimônio, investimento e reserva de emergência, caracterizando um perfil de maior vulnerabilidade financeira. O Cluster 1 apresentou comportamento mais intermediário, com menor tempo de relacionamento e indicadores geralmente moderados, sugerindo um segmento de transição. Já o Cluster 2 reuniu os maiores níveis relativos de renda, patrimônio, limite de cartão, investimento, saldo em conta e reserva de emergência, além de menor atraso e menor utilização do crédito, configurando o grupo de maior valor econômico e menor sensibilidade ao risco.

Para verificar quais atributos mais contribuíram para a separação estatística entre os grupos, a Figura 5 apresenta as principais variáveis discriminantes segundo a magnitude do eta quadrado parcial na ANOVA.

Figura 5. Principais variáveis discriminantes entre os clusters

Fonte: Resultados originais da pesquisa

A Figura 5 demonstrou que reserva de emergência, renda mensal, gasto com viagem, saldo em conta, investimento mensal, taxa de endividamento, percentual de atraso, limite do cartão, utilização do crédito e score de crédito foram os atributos com maior poder discriminante entre os clusters. Esse resultado reforça que a segmentação não foi formada por ruído estatístico, mas por diferenças estruturais associadas à capacidade financeira, liquidez, padrão de consumo e risco de crédito. A predominância dessas variáveis fortalece a validade interna da solução, confirmando que os grupos foram definidos por dimensões substantivamente coerentes com o problema estudado.

Em conjunto, os resultados mostraram coerência entre preparação dos dados, modelagem, validação e interpretação dos agrupamentos. Embora as métricas internas tenham indicado melhor ajuste estatístico para k=2, a escolha de k=3 revelou maior poder de discriminação analítica e maior utilidade prática, o que é compatível com estudos aplicados de Ciência de Dados quando a decisão metodológica é explicitada de forma transparente. A análise da base sustenta que a clusterização foi capaz de converter uma base financeira complexa em segmentos úteis para interpretação de perfis de clientes e apoio à decisão orientado por dados.

A execução do pipeline analítico foi realizada com o auxílio da linguagem de programação Python, utilizando bibliotecas como Pandas e NumPy para tratamento de dados, Matplotlib para análise exploratória e Scikit-learn para clusterização (K-Means e métodos hierárquicos) e validação. A análise estatística, incluindo a ANOVA, também foi suportada por bibliotecas especializadas. O ambiente de notebooks interativos facilitou a organização e reprodutibilidade das análises (VanderPlas, 2016).

A análise dos resultados obtidos a partir da aplicação do pipeline de clusterização evidenciou que a segmentação da base de clientes foi capaz de identificar padrões consistentes e estatisticamente relevantes, em consonância com o objetivo do estudo de identificar grupos homogêneos e interpretáveis por meio de técnicas de aprendizado não supervisionado. As diferenças observadas entre os clusters foram estatisticamente significativas, com variáveis como renda mensal, reserva de emergência, investimento e taxa de endividamento apresentando elevado poder discriminante, o que reforça que os agrupamentos refletem diferenças reais na estrutura dos dados (Hair et al., 2019). A segmentação obtida não apenas atendeu ao propósito analítico da pesquisa, mas também evidenciou potencial de aplicação prática, ao permitir a diferenciação de estratégias conforme o perfil dos grupos identificados.

4. Conclusão

A presente pesquisa buscou aplicar técnicas de clusterização a uma base de clientes do setor financeiro, com o propósito de identificar segmentos homogêneos e estatisticamente distinguíveis, capazes de subsidiar a interpretação de perfis e apoiar decisões orientadas por dados. Verificou-se que a clusterização foi eficaz para segmentar a base analisada, revelando três perfis distintos de clientes. O primeiro grupo caracterizou-se por maior vulnerabilidade financeira, com elevados níveis de utilização do crédito, atraso e endividamento, e menores patamares de renda, patrimônio, investimento e reserva de emergência. O segundo grupo apresentou um perfil intermediário, enquanto o terceiro reuniu clientes de maior valor econômico, com indicadores superiores de renda, patrimônio, investimento e reserva de emergência, e menor sensibilidade ao risco. A análise estatística confirmou que variáveis como renda mensal, reserva de emergência, investimento e taxa de endividamento foram os principais atributos discriminantes entre os grupos, reforçando a validade interna da segmentação. Essa abordagem demonstrou o potencial das técnicas de aprendizado não supervisionado para transformar dados complexos em conhecimento estruturado, oferecendo uma contribuição prática relevante para a diferenciação de estratégias e a tomada de decisão no setor financeiro.

Contudo, alguns limites do estudo devem ser reconhecidos. A análise foi realizada com base em uma única base de dados e um recorte específico de variáveis, o que restringe a generalização dos resultados para outros contextos ou populações. Embora a solução com três clusters tenha sido adotada pela sua maior utilidade interpretativa, as métricas internas apontaram um melhor desempenho estatístico para uma configuração com dois grupos, indicando que a escolha final envolveu um critério de utilidade analítica. Sugere-se, para estudos futuros, a ampliação da base analítica com novas variáveis, como indicadores de comportamento transacional e relacionamento digital, a fim de aprofundar a capacidade discriminante dos modelos. Recomenda-se também testar outras abordagens de clusterização, como DBSCAN ou Gaussian Mixture Models, e explorar a integração entre clusterização e modelos supervisionados para previsão de risco ou propensão de compra, ampliando a aplicabilidade da Ciência de Dados em ambientes financeiros.

Referências Bibliográficas

Banco Central do Brasil [BCB]. (2023). Open Finance no Brasil. https://www.bcb.gov.br/estabilidadefinanceira/openfinance

Federação Brasileira de Bancos [FEBRABRAN]. (2025). Pesquisa Febraban de Tecnologia Bancária 2025. https://cmsarquivos.febraban.org.br

Han, J., Kamber, M., & Pei, J. (2012). Data mining: Concepts and techniques (3rd ed.). Morgan Kaufmann.

Hastie, T., Tibshirani, R., & Friedman, J. (2009). The elements of statistical learning: Data mining, inference, and prediction (2nd ed.). Springer.

Jain, A. K., Murty, M. N., & Flynn, P. J. (1999). Data clustering: A review. ACM Computing Surveys, 31(3), 264-323.

James, G., Witten, D., Hastie, T., & Tibshirani, R. (2021). An introduction to statistical learning: With applications in Python (2nd ed.). Springer.

Nofal, S. (2024). Identifying highly-valued

Yan, X., Li, Y., Nie, F., & Li, R. (2025). Bank customer segmentation and marketing strategies based on improved DBSCAN algorithm. Applied Sciences, 15(6), 3138.

Artigo oriundo de Trabalho de Conclusão de Curso da Especialização em Data Science e Analytics do MBA USP/Esalq

Para saber mais sobre o curso, clique aqui e acesse a plataforma MBX Academy

Você também pode gostar

15 de setembro de 2026

Implementação e Aplicação de um Módulo de Aprendizado Não-supervisionado em um Arcabouço de Automl

A maioria das ferramentas de automação de aprendizado de máquina foca em aprendizado supervisionado, negligenciando recursos para dados não rotulados, como o AutoBioLearn (ABL), voltado para pesquisadores das Ciências Biológicas e da Saúde. O objetivo deste trabalho foi implementar e testar um módulo de Aprendizado Não-Supervisionado (ANS) no ABL. Primeiramente, identificaram-se as metodologias de ANS mais mencionadas em teses e dissertações brasileiras de ciências médicas e biológicas nos últimos oito anos. Em seguida, implementaram-se classes para Análise de Componentes Principais (PCA), agrupamento hierárquico e não-hierárquico no ABL, utilizando Python. O novo módulo passou por testes de validação, reprodutibilidade e escalabilidade. Para demonstrar sua aplicação, realizaram-se dois estudos de caso: um com dados de saúde mental de gestantes durante a pandemia de COVID-19 e outro com o perfil sensorial de crianças autistas. O módulo validado sugeriu, nos dados de gestantes, uma possível relação entre a duração de “lockdowns” e tipos de ansiedade. No conjunto de dados de perfil sensorial, o módulo de ANS identificou possíveis subgrupos de comportamentos alimentares. Espera-se que esta ferramenta simplifique a escrita de código por pesquisadores das Ciências da Saúde e Biológicas.

Palavras-chave: Aprendizado de Máquina Não-supervisionado; AutoML; Design de Software; Informática Médica; Validação de Software.

15 de setembro de 2026

Inteligência Artificial como Agente de Transformação no Mercado de Trabalho

A ascensão da Quarta Revolução Industrial, impulsionada pela Inteligência Artificial (IA) generativa, alterou profundamente a relação entre capital e trabalho ao automatizar tarefas cognitivas não rotineiras. O objetivo geral consistiu em analisar as percepções de profissionais operacionais de diferentes setores sobre o impacto da IA no mercado de trabalho, identificando tendências e desafios. A metodologia empregou pesquisa exploratória e descritiva, com abordagem quantitativa por meio de um survey. O instrumento de coleta de dados foi um questionário estruturado, aplicado a 124 respondentes, utilizando escalas Likert e de múltipla escolha. Os resultados demonstraram um estágio avançado de adoção tecnológica (74,2%), caracterizando a amostra como “early adopters”. Identificou-se que o ganho de eficiência liberou entre uma e oito horas semanais para a maioria, embora subsistam barreiras críticas como a falta de treinamento e preocupações éticas. Notou-se uma resistência significativa ao gerenciamento algorítmico e à substituição do julgamento humano em decisões críticas, como no conceito de “Hospital Agente”. Apesar do otimismo quanto à produtividade, a sustentabilidade da força de trabalho depende de políticas urgentes de “reskilling” e da preservação da agência humana. A supervisão humana permaneceu indispensável em áreas que exigem empatia e responsabilidade moral.

Palavras-chave: Automação; Competências Digitais; Ética Tecnológica; Mercado de Trabalho.

Neurociência E Aprendizagem Na Educação

15 de setembro de 2026

Percepções Docentes sobre Funções Executivas e Cognição Espacial na Aprendizagem Matemática: Implicações Pedagógicas para a Equidade

Este estudo investigou as percepções de docentes dos anos iniciais sobre o papel das funções executivas (FEs) e da cognição espacial na aprendizagem matemática, bem como suas implicações para a equidade de gênero no contexto educacional. Participaram 48 professores da Educação Infantil e do Ensino Fundamental I, que responderam a um questionário composto por itens em escala Likert e questões abertas. As análises incluíram estatística descritiva, estimativas de confiabilidade, testes não paramétricos e análise temática das respostas discursivas. Os resultados indicaram elevada concordância quanto à relevância das FEs (M=4,83) e da cognição espacial (M=4,85) para a aprendizagem matemática. Contudo, a integração sistemática dessas habilidades e a observação cotidiana de autorregulação apresentaram menor uniformidade na prática docente. As práticas pedagógicas foram frequentes, mas heterogêneas, especialmente nas intervenções para cognição espacial e FEs (M=4,25). Em relação ao gênero, observou-se incerteza sobre o interesse inicial equivalente entre meninos e meninas (M=3,35), mas forte concordância de que a escola pode reduzir desigualdades (M=4,75). Docentes que atribuíram maior importância às FEs e à cognição espacial relataram maior frequência de práticas pedagógicas associadas. Os achados evidenciaram a necessidade de fortalecer a tradução desses conhecimentos em práticas pedagógicas intencionais, oferecendo subsídios para a formação docente e a promoção da equidade na aprendizagem matemática desde os primeiros anos escolares.

Palavras-chave: Aprendizagem matemática; Cognição espacial; Equidade de gênero; Funções executivas; Práticas pedagógicas.

Compliance E Esg

15 de setembro de 2026

Compliance na Gestão Contratual do Setor Aéreo Brasileiro: um Framework Aplicado

A gestão de compliance contratual no setor aéreo brasileiro é um tema de crescente relevância. O estudo objetivou desenvolver um framework de práticas de compliance aplicáveis à gestão contratual nesse setor, a partir da análise de documentos e diretrizes de acesso público. Para isso, adotou-se uma abordagem qualitativa, aplicada e descritiva, fundamentada em análise documental de normas, guias institucionais, relatórios setoriais e revisão de literatura especializada sobre governança contratual, integridade e gestão de riscos. Os resultados indicaram avanços na incorporação de cláusulas de integridade e anticorrupção em instrumentos contratuais corporativos, bem como na estruturação de mecanismos de due diligence voltados à gestão de terceiros e fornecedores. Observou-se, entretanto, que a aplicação desses instrumentos apresentou níveis distintos de formalização e maturidade ao longo do ciclo de vida contratual, revelando oportunidades de aprimoramento na integração entre compliance, governança e gestão contratual. Como contribuição aplicada, propôs-se um framework estruturado de práticas, operacionalizado por meio de uma tabela comparativa e um checklist orientativo, com potencial para apoiar profissionais de compliance, gestores de contratos e áreas de governança corporativa na mitigação de riscos legais, regulatórios e reputacionais.

Palavras-chave: Controles internos; Gestão de contrato; Gestão de riscos; Governança corporativa; Integridade.

15 de setembro de 2026

Métodos Não Supervisionados Aplicados a Leveduras Industriais Produtoras de Etanol de Primeira e Segunda Gerações

A compreensão dos mecanismos moleculares na produção de etanol é crucial para a otimização industrial, dada sua consolidação como alternativa sustentável. O estudo avaliou os perfis transcriptômicos de leveduras industriais Saccharomyces cerevisiae “Pedra-2” na produção de etanol de primeira (1G) e segunda geração (2G), em diferentes tempos de fermentação, utilizando métodos não supervisionados. Dados públicos de RNA-seq foram empregados, submetidos a controle de qualidade, pré-processamento, alinhamento genômico e quantificação de transcritos em TPM. As análises incluíram correlação de Pearson, Análise de Componentes Principais (PCA), Análise Fatorial de Dados Mistos (FAMD) e clusterização hierárquica. Os resultados revelaram uma clara separação entre os perfis de expressão gênica de 1G e 2G, com o tipo de fermentação como principal fator de variabilidade. As amostras 1G exibiram maior organização temporal e estabilidade, enquanto as 2G mostraram maior heterogeneidade e complexidade metabólica. Diferenças nas vias metabólicas associadas ao fluxo de carbono foram identificadas, com predominância da glicólise em 1G e maior participação das vias da pentose fosfato e do ciclo do ácido tricarboxílico em 2G. Concluiu-se que os métodos não supervisionados foram eficazes na identificação de padrões biológicos relevantes, contribuindo para o entendimento das diferenças metabólicas entre os processos e oferecendo suporte para estratégias de otimização na produção de etanol.

Palavras-chave: Aprendizado de máquina; Bioinformática; Expressão gênica; Fermentação; Transcriptoma.

15 de setembro de 2026

Tomada de Decisão e Qualidade dos Dados: Percepções sobre Acurácia, Completude, Consistência e Disponibilidade.

O crescimento exponencial do volume de dados gerados e consumidos globalmente transformou a forma como as organizações conduziram seus processos decisórios, tornando a qualidade das informações um fator determinante para a efetividade dessas decisões. Este estudo analisou a percepção de profissionais que utilizam dados em suas funções diárias quanto à qualidade dos dados nos processos de tomada de decisão nas organizações. Adotou-se uma metodologia descritiva quantitativa, com coleta de dados realizada por meio de um survey estruturado em escala Likert de cinco pontos. A amostra foi não probabilística por conveniência, composta por profissionais de diferentes níveis hierárquicos e portes de empresa. Para a análise dos resultados, empregaram-se técnicas estatísticas descritivas e a correlação de Spearman. As análises revelaram que o uso de dados estava amplamente incorporado à rotina decisória dos participantes e que as dimensões de qualidade avaliadas foram percebidas predominantemente positivamente, com exceção da consistência, que apresentou o menor desempenho e a maior dispersão. As correlações entre as dimensões de qualidade e a confiança decisória mostraram-se positivas e estatisticamente significativas, com destaque para a acurácia como a dimensão de maior influência sobre a segurança decisória. Concluiu-se que, embora as organizações apresentem avanços na adoção de práticas orientadas por dados, persistem desafios estruturais relacionados à consistência das informações, indicando a importância do aprimoramento das práticas de integração e de governança de dados.

Palavras-chave: Confiança decisória; Governança de dados; Percepção organizacional; Qualidade de dados; Tomada de decisão.

15 de setembro de 2026

Entre o Artificial e o Humano: Identificação de Textos Humanizados no Enem por Features Linguísticas

A crescente utilização de modelos de linguagem na produção de textos acadêmicos tornou relevante o desenvolvimento de métodos para identificar a autoria de produções textuais, especialmente diante de ferramentas de humanização que mascaram a origem sintética. O objetivo foi investigar a viabilidade da detecção de textos gerados por inteligência artificial, mesmo após reescrita automática, por meio de atributos linguísticos interpretáveis. Para isso, construiu-se um corpus de redações dissertativo-argumentativas no padrão do ENEM, abrangendo textos humanos, gerados por modelo de linguagem e versões humanizadas por ferramenta de paráfrase. Extraíram-se métricas estilométricas de diversidade lexical, complexidade sintática, legibilidade e previsibilidade textual, empregadas na modelagem de um problema de classificação binária supervisionada. Treinaram-se três algoritmos de aprendizado de máquina (Regressão Logística, Random Forest e XGBoost) e os avaliaram por validação interna, em um conjunto independente de dados e em comparação com uma ferramenta comercial. Os modelos apresentaram desempenho elevado na distinção entre textos humanos e sintéticos, mantendo consistência mesmo com textos humanizados, enquanto a ferramenta comercial demonstrou maior dificuldade. Concluiu-se que a abordagem baseada em atributos estilométricos mostrou-se eficaz e robusta para a detecção de autoria textual no contexto analisado.

Palavras-chave: Análise linguística; Aprendizado de máquina; Detecção de autoria textual; Humanização de texto; Processamento de linguagem natural.

Neurociência E Aprendizagem Na Educação

15 de setembro de 2026

Trabalhando a Diversidade Através de Atividades Lúdicas e Colaborativas

Um estudo analisou o impacto da “II Gincana Leonor: Gincana da Inclusão” como estratégia pedagógica para promover a empatia e combater o capacitismo em uma escola pública municipal de Campinas, envolvendo alunos do 6º ao 9º ano. A metodologia, de natureza aplicada, caracterizou-se como um estudo de caso com abordagem qualitativa e quantitativa. A coleta de dados envolveu análise documental do guia de atividades da gincana, registros fotográficos das vivências e aplicação de questionários estruturados via Google Forms para a equipe gestora, docentes e funcionários da instituição. Os resultados revelaram alto engajamento e protagonismo estudantil, com mais de 80% de percepção positiva dos participantes sobre a eficácia das atividades lúdicas na sensibilização sobre a diversidade. Contudo, evidenciaram desafios na transposição do aprendizado para o cotidiano escolar, pois a maioria dos docentes relatou aplicação apenas parcial dos valores de inclusão nas atitudes diárias dos alunos. Concluiu-se que, embora a gincana tenha sido um catalisador eficaz para a empatia e o acolhimento, a consolidação de uma cultura anticapacitista exige a integração contínua dessas discussões ao currículo escolar, superando o caráter pontual das intervenções.

Palavras-chave: Capacitismo; Educação Inclusiva; Gincana Escolar; Metodologias Ativas; Protagonismo Estudantil.

Neurociência E Aprendizagem Na Educação

15 de setembro de 2026

Entendendo a Superdotação: o que a Escrita de Mulheres Superdotadas Diz sobre a Norma Linguística

Este estudo analisou textos produzidos em blogs por mulheres com altas habilidades/superdotação, com o objetivo de identificar marcas linguísticas relacionadas ao uso da norma-padrão e compreender como tais escolhas se articulam a normas sociais e a possíveis estratégias de masking. Uma abordagem qualitativa, descritiva e documental foi empregada, examinando dez textos de blogs pessoais, publicados entre 2018 e 2025, por mulheres que se autodeclararam superdotadas e que abordaram suas experiências. A análise evidenciou um manejo consistente da norma-padrão, mas também uma oscilação entre usos mais monitorados e formas mais flexíveis, com traços de oralidade e menor formalidade. Essa tensão linguística refletiu negociações identitárias em diferentes contextos discursivos. Observou-se que expectativas sociais de perfeição e adequação linguística incidem intensamente sobre meninas, influenciando suas práticas. Contudo, o ambiente dos blogs favoreceu maior liberdade expressiva, permitindo discursos íntimos e autobiográficos. Concluiu-se que a análise da escrita contribuiu para ampliar a compreensão sobre identidade, gênero e inclusão, destacando a importância de práticas educacionais sensíveis às especificidades de estudantes com altas habilidades.

Palavras-chave: Altas habilidades/superdotação; Blogs; Identidade; Masking; Norma-padrão.

Inscreva-se em nossa newsletter!

Receba conteúdos e fique sempre atualizado sobre as novidades em gestão, liderança e carreira com a Revista E&S.

Ao preencher o formulário você está ciente de que podemos enviar comunicações e conteúdos da Revista E&S. Confira nossa Política de Privacidade