02 de outubro de 2026
Transformação de Dados em Estratégia: Pesquisa Aplicada para Otimização de Operação em Ecoturismo
Transformação de Dados em Estratégia: Pesquisa Aplicada para Otimização de Operação em Ecoturismo
Fernanda Karla Pinto Morais; Edilson José Rodrigues
DOI: 10.22167/2675-6528-202602896
Artigo derivado de Trabalho de Conclusão de Curso (TCC), com conteúdo baseado no trabalho original do aluno e adaptado ao formato editorial da Revista E&S com apoio da ferramenta ResumeAI, solução de inteligência artificial desenvolvida pelo Instituto Pecege para síntese e organização textual.
Resumo
A crescente demanda no turismo ecológico em Minas Gerais impulsionou a busca por inteligência de negócios para transformar dados de clientes em informações estratégicas. O estudo objetivou estruturar um pipeline de ciência de dados para coletar, segmentar e classificar a base de clientes de uma operação de ecoturismo, visando otimizar ações de marketing e antecipar movimentos de mercado. Realizou-se uma pesquisa exploratória, de natureza quali-quantitativa, por meio de um estudo de caso. Utilizaram-se 2.777 registros transacionais de uma empresa de ecoturismo, referentes a janeiro de 2024 a dezembro de 2025. O processo metodológico envolveu coleta automatizada de dados (API Google Sheets), tratamento e enriquecimento (ETL), validação e criação de atributos RFM (Recência, Frequência e Valor Monetário). Aplicou-se redução de dimensionalidade via PCA e agrupamento K-Means, com o número de clusters definido pelo método do Cotovelo e Silhouette Score. Validaram-se os resultados com DBSCAN e K-Medoids. Os resultados revelaram a identificação de três segmentos comportamentais de clientes: “Fiel”, “Baixo Valor” e “Potencial”. O segmento “Fiel” representou o maior valor econômico acumulado, enquanto o “Potencial” destacou-se pelo alto ticket médio e potencial de conversão em recorrência. A integração das técnicas de análise de dados demonstrou ser um método robusto e replicável para gerar inteligência no ecoturismo. Concluiu-se que o pipeline de ciência de dados estruturado viabilizou a segmentação comportamental da base de clientes, a validação estatística dos grupos e a criação de um sistema preditivo para novos compradores, fornecendo subsídios para decisões estratégicas baseadas em dados e futuras análises.
Palavras-chave: Clusterização; Inteligência de negócios; Machine Learning; Segmentação de clientes; Tomada de decisão.
1. Introdução
Nos últimos anos, o ecoturismo tem se consolidado como um segmento que transcende o simples lazer, alinhando o contato direto com a natureza à preservação ambiental e à valorização da cultura local. Este setor, amparado pelas diretrizes do Ministério do Turismo, não só gera benefícios socioeconômicos, mas também influencia toda a cadeia turística nacional. Minas Gerais, em particular, destaca-se como um dos principais polos ecoturísticos do país, abrigando a única cordilheira do Brasil, o Espinhaço, reconhecido pela Unesco como Reserva da Biosfera, o que a torna um cenário estratégico para o desenvolvimento dessa atividade (Miranda, 2025).
Acompanhando o crescimento expressivo do ecoturismo, as agências de turismo assumem um papel crucial de consultoria para os consumidores, organizando viagens que atendem às necessidades de seu público (Silva, 2016). Contudo, a intensa concorrência exige uma compreensão aprofundada do mercado e dos clientes. Nesse contexto, os dados deixam de ser informações fragmentadas e de baixo valor analítico (Olsen, 2015) para se tornarem um ativo estratégico. Eles demandam processos sistemáticos de tratamento, modelagem e análise, capazes de gerar vantagens competitivas sustentáveis e transformar a inteligência informacional em um fator decisivo para o desempenho organizacional (Fávero e Belfiore, 2024).
O presente estudo foca em uma empresa de ecoturismo em Minas Gerais que oferece diversas experiências outdoor, desde roteiros de um dia até expedições e imersões. Atualmente, os gestores dessa empresa enfrentam o desafio de organizar e otimizar o vasto volume de dados gerados pelo negócio. A transição de uma gestão baseada no empirismo para uma abordagem orientada a dados é essencial para aprofundar o conhecimento sobre o perfil do cliente e compreender fatores como a sazonalidade e os movimentos de mercado que podem influenciar as decisões estratégicas.
Conhecer o cliente é fundamental para o sucesso das ações de marketing, desde a definição do mercado-alvo até a escolha das abordagens mais adequadas para cada segmento (Solomon, 2016). No ecoturismo, essa necessidade é ainda mais premente, pois a programação de uma viagem é, para o cliente, um momento memorável, muitas vezes superando as recordações da experiência em si (Silva, 2016). Além disso, o cenário atual impõe que as empresas utilizem suas redes sociais digitais como canais estratégicos para alavancar vendas e fortalecer o relacionamento com o público (Destro, 2023).
Diante desse cenário, a pesquisa se justifica pela necessidade de transformar dados brutos em inteligência acionável para otimizar a operação de ecoturismo, e o objetivo deste trabalho é estruturar o pipeline de dados da empresa em questão, viabilizando a identificação de grupos de clientes por meio de seus registros transacionais e, através da aplicação de algoritmos, otimizar as ações estratégicas de marketing, aumentando suas chances de sucesso, além de buscar maneiras de se antecipar a movimentos relacionados ao mercado, sazonalidade e a questões relacionadas ao comportamento do cliente.
2. Material e Métodos
A pesquisa exploratória, quali-quantitativa e aplicada, foi realizada como estudo de caso com elementos descritivos (Gil, 2002). O estudo analisou registros transacionais de uma empresa de ecoturismo em Minas Gerais, referentes a negociações de janeiro de 2024 a dezembro de 2025. A metodologia estruturou um pipeline de ciência de dados para identificar grupos de clientes, otimizando ações de marketing e antecipando movimentos de mercado e comportamento.
O conjunto de dados primários (Google Sheets) continha 2.777 registros transacionais de vendas. As variáveis incluíam data da transação, correio eletrônico e nome completo anonimizados, gênero, CPF anonimizado, data de nascimento, telefone, local de embarque, Instagram (opcional) e o evento adquirido. O tratamento seguiu a LGPD (Lei nº 13.709/2018), com anonimização de identificadores diretos. O uso das informações foi autorizado pela gestão da empresa para fins acadêmicos, preservando confidencialidade e integridade.
O processo de Extração, Transformação e Carregamento (ETL) foi implementado em Python (Spyder/Anaconda). Bibliotecas como Gspread, Google-auth e Sys foram usadas para centralização, autenticação e controle de execução. Pandas (Caetano, 2025) tratou e enriqueceu os dados, removendo não numéricos, validando CPFs, criando colunas de status e recuperando registros incompletos (backfill), conforme diretrizes metodológicas (Barbieri, 2020).
Na engenharia de atributos, as colunas foram convertidas para tipos de dados adequados, e aplicou-se a técnica RFM (Recência, Frequência e Valor Monetário). O RFM ranqueou a base de clientes em categorias quantitativas, padronizando o comportamento de compra. O RFM foi agregado a uma medida operacional de Lifetime Value (LTV), definido como o valor monetário acumulado das transações do cliente.
Para a preparação e transformação dos dados, utilizou-se Scikit-learn para padronização Z-score (StandardScaler) e para a Análise de Componentes Principais (PCA), configurada para preservar 95% da variância explicada (Netto e Maciel, 2021). A padronização garantiu que as variáveis contribuíssem de forma equilibrada para o cálculo das distâncias (Barr et al., 2024), e a PCA eliminou redundâncias.
A definição do número ideal de clusters (K) foi realizada com o algoritmo K-Means (Scikit-Learn), o método Elbow (Cotovelo) e o índice Silhouette Score (Sharda et al., 2025). Matplotlib e Seaborn auxiliaram na visualização (Netto e Maciel, 2021; Kyran, 2024). A análise integrada apontou para a segmentação em três grupos (K=3), representando o melhor equilíbrio entre coesão e separação dos clusters (Gomes, 2024; Pierson, 2019).
Para validar os resultados, aplicaram-se os algoritmos DBSCAN e K-Medoids. O DBSCAN foi empregado como método de apoio para validar a estrutura dos grupos encontrados pelo K-Means (Faceli et al., 2025). O K-Medoids definiu pontos reais da base de dados (medoids) como centros de cluster, conferindo maior robustez a outliers e ruídos (Goldschmidt et al., 2015), e seus resultados convergiram com os do K-Means, validando a estrutura de três clusters.
A definição dos nomes comerciais dos clusters ocorreu por mapeamento dinâmico dos perfis estatísticos dos agrupamentos. Ao fim de cada rodada do K-Means, calculou-se a média da variável Total_Gasto para cada cluster e, em ordem crescente, atribuíram-se os rótulos ‘Baixo Valor’, ‘Potencial’ e ‘Fiel’. Esse processo alinhou o sentido de negócio dos segmentos aos perfis quantitativos, conforme a área de aplicação (Faceli et al., 2025).
3. Resultados e Discussão
A análise dos dados transacionais da empresa de ecoturismo iniciou-se com a exploração das relações entre as variáveis, revelando padrões comportamentais importantes dos clientes. Observou-se uma correlação de 0,98 entre o Total_Gasto e a Qtd_Viagens, indicando que clientes com maior volume de gastos tendem a realizar mais viagens. Essa forte dependência linear, superior ao limite de 0,90 estabelecido por Fávero e Belfiore (2024), confirmou a multicolinearidade severa esperada, uma vez que o gasto total é intrinsecamente ligado à frequência de viagens e ao ticket médio. Adicionalmente, a variável Recencia_Dias apresentou uma correlação negativa moderada de -0,27 com as variáveis de gasto e quantidade de viagens, sugerindo que clientes que viajaram mais recentemente tendem a gastar mais e a ter maior frequência de viagens.
Para mitigar os efeitos da multicolinearidade e otimizar a aplicação dos algoritmos de clusterização, a técnica de Análise de Componentes Principais (PCA) foi empregada como etapa de pré-processamento. A configuração do PCA foi definida para preservar 95% da variância explicada original dos dados, resultando na geração de quatro componentes principais (PC1 a PC4). Essa transformação garantiu que os novos componentes apresentassem correlação zero entre si, assegurando a ortogonalidade e a independência matemática das informações. Tal procedimento eliminou redundâncias e tornou os dados mais adequados para algoritmos baseados em distância, contribuindo para a estabilidade e interpretabilidade dos resultados subsequentes, conforme destacado por Netto e Maciel (2021).
A definição do número ideal de clusters (K) foi realizada por meio da aplicação conjunta do Método do Cotovelo (Elbow) e do Silhouette Score. O Método do Cotovelo indicou uma inflexão na curva de inércia entre K=3 e K=4, sugerindo retornos decrescentes na adição de novos grupos a partir de K=5. O Silhouette Score, por sua vez, métrica que quantifica a coesão interna e a separação entre os clusters (Rousseeuw, 1987), apontou K=2 com o maior coeficiente (0,467), seguido por K=3 (0,454). Apesar da pequena diferença, a escolha de K=3 foi justificada pela sua maior utilidade prática para a personalização de estratégias de marketing, oferecendo um equilíbrio superior entre a coesão dos grupos e a distinção entre eles.
A segmentação final, utilizando o algoritmo K-Means com K=3, demonstrou uma separação espacial nítida dos grupos de clientes, cada um com características bem delimitadas. O Cluster 0 concentrou a maior parte da população de clientes, correspondendo a um segmento de maior volume populacional. O Cluster 1 abrangeu clientes de alto engajamento e gasto acumulado, enquanto o Cluster 2 reuniu clientes com um padrão de comportamento distinto, caracterizado por recência e ticket médio elevados. A redução da dimensionalidade via PCA, que manteve 95% da variância explicada nos dois primeiros componentes, assegurou que a representação visual dos clusters preservou a estrutura essencial para a interpretação dos dados.
Para validar a robustez da segmentação obtida com o K-Means, aplicaram-se os algoritmos DBSCAN e K-Medoids. O DBSCAN, parametrizado com eps=1,5 e min_samples=3, identificou três clusters e classificou algumas observações como ruído. Contudo, a segmentação resultante foi assimétrica, com o Cluster 0 concentrando a maioria das observações e os Clusters 1 e 2 sendo menores, além de ruídos dispersos. Embora o número de clusters tenha coincidido com K=3, a diferença na composição e distribuição limitou a interpretação de uma convergência qualitativa direta, o que é consistente com as limitações do DBSCAN em lidar com distribuições heterogêneas de dados, conforme Faceli et al. (2025).
O algoritmo K-Medoids, aplicado com K=3 sobre os dados transformados por PCA, também confirmou a estrutura de três clusters. Diferentemente do K-Means, que utiliza médias aritméticas como centróides, o K-Medoids seleciona pontos reais da base de dados (medoids) como centros dos clusters, o que confere maior robustez à presença de outliers e ruídos (Goldschmidt et al., 2015). A distribuição dos grupos no K-Medoids, embora com uma composição ligeiramente diferente do K-Means (Cluster 0: n=341; Cluster 1: n=99; Cluster 2: n=224, comparado a Cluster 0: n=67; Cluster 1: n=555; Cluster 2: n=42 no K-Means), manteve uma separação espacial semelhante, reforçando a estabilidade da escolha de K=3.
A caracterização estatística dos clusters, utilizando boxplots das variáveis originais em escala não padronizada, permitiu traduzir os perfis quantitativos em inteligência de negócio. O segmento “Fiel” (Cluster 0) destacou-se como o de maior valor econômico acumulado, com uma média de 41 anos, cinco viagens adquiridas, LTV histórico de R$994,00 e recência média de 290 dias. Seu ticket médio foi de R$203,00. Este perfil, que demonstra um relacionamento ativo e frequente com a empresa, é estratégico para ações de fidelização e programas de recompensa por frequência, visando maximizar sua rentabilidade.
O segmento “Baixo Valor” (Cluster 1) representou a maior parte da base de clientes (83,6%), concentrando compradores de experiência pontual, predominantemente de compra única. Este grupo apresentou uma média de 37 anos, o menor ticket médio da base (R$181,00), LTV reduzido e uma recência elevada, em torno de 420 dias. A ampla dispersão interquartílica na recência sugere baixo engajamento e maior propensão ao abandono (churn). A conversão de uma parcela desse público em clientes recorrentes representa um ganho significativo no LTV histórico da operação, tornando-o prioritário para estratégias de reativação.
Por fim, o segmento “Potencial” (Cluster 2) destacou-se pelo maior ticket médio entre os grupos, atingindo R$294,00, valor aproximadamente 45% superior ao segmento “Fiel”. Este grupo apresentou uma média de idade mais jovem (33 anos), baixa frequência de compras (média de 1,14 viagens) e recência média elevada, em torno de 480 dias. A expressiva heterogeneidade interna do ticket médio, com outliers acima de R$300,00, indica que parte do grupo possui um poder de gasto consideravelmente superior à mediana. Esse perfil é suscetível a campanhas de upsell, ações de relacionamento pós-venda e comunicações direcionadas a experiências de maior valor, com grande potencial de conversão a longo prazo.
Em síntese, a estruturação do pipeline de ciência de dados e a aplicação de algoritmos de clusterização permitiram a identificação de três segmentos comportamentais de clientes — Fiel, Baixo Valor e Potencial — na operação de ecoturismo. Essa segmentação, validada por múltiplas técnicas, oferece uma compreensão aprofundada do perfil e comportamento de compra dos clientes, fornecendo subsídios concretos para a otimização de ações estratégicas de marketing e a antecipação de movimentos de mercado, alinhando-se diretamente ao objetivo central do estudo de transformar dados brutos em inteligência acionável.
4. Conclusão
O presente estudo objetivou estruturar um pipeline de ciência de dados para coletar, segmentar e classificar a base de clientes de uma operação de ecoturismo em Minas Gerais, visando otimizar ações de marketing e antecipar movimentos de mercado. Verificou-se que a integração de técnicas de análise de dados, desde a coleta automatizada (API Google Sheets) até a clusterização, constituiu um método robusto e replicável. A aplicação de Análise de Componentes Principais (PCA) mitigou a multicolinearidade e otimizou os dados para os algoritmos. Por meio do K-Means, com K=3 definido pelos métodos do Cotovelo e Silhouette Score, identificaram-se três segmentos comportamentais de clientes: “Fiel”, “Baixo Valor” e “Potencial”. O segmento “Fiel” representou o maior valor econômico acumulado, enquanto o “Potencial” destacou-se pelo alto ticket médio e potencial de conversão em recorrência. A segmentação foi validada estatisticamente por DBSCAN e K-Medoids, reforçando a estabilidade dos grupos e a coerência de seus perfis. Essa abordagem viabilizou a transformação de dados brutos em inteligência acionável, fornecendo subsídios concretos para decisões estratégicas baseadas em dados e a criação de um sistema preditivo para novos compradores.
Apesar das contribuições, o estudo apresentou limitações, como a dependência da qualidade dos dados coletados via formulários digitais, que podem conter erros de digitação não detectados automaticamente, e o volume da base de clientes únicos validados, que restringiu a capacidade de generalização para segmentos minoritários. A análise também foi limitada pelas variáveis transacionais disponíveis, impedindo uma compreensão mais densa do comportamento do cliente por meio de dados demográficos, de saúde ou de marketing. Além disso, o caráter de estudo de caso único restringe a generalização dos padrões identificados a outras operações de ecoturismo e a observações de longo prazo. Para trabalhos futuros, sugere-se a expansão da base de dados com novos períodos para ampliar a representatividade e identificar novas oportunidades de clusterização. Recomenda-se a implementação de um sistema de pontuação de relacionamento em tempo real, a mineração de dados por Processamento de Linguagem Natural (PLN) sobre feedbacks de clientes, a incorporação do Método de Análise Hierárquica (AHP) ou AHP-Gaussiano ao modelo RFM para ponderação diferenciada das dimensões, e a aplicação de algoritmos como Random Forest e LightGBM para criar um sistema preditivo de classificação de novos clientes, mapear a relevância das variáveis e estimar o valor futuro de cada cliente.
Referências Bibliográficas
FÁVERO, L. P.; BELFIORE, P. 2024. Manual de Análise de Dados: Estatística e Machine Learning com Excel®, SPSS®, Stata®, R® e Python®. 2. ed., LTC. Rio de Janeiro, Brasil.
MIRANDA, T. Espinhaço: A Cordilheira do Brasil em Minas Gerais. Governo do Estado de Minas Gerais, 26 jun. 2025. Disponível em: https://minasgerais.com.br/pt/blog/artigo/espinhaco-a-cordilheira-do-brasil-em-minas-gerais. Acesso em: 25 jan. 2026.
OLSEN, W.. 2015. Coleta de Dados. Penso. Porto Alegre, Brsil. Disponível em: https://app.minhabiblioteca.com.br/reader/books/9788584290543/. Acesso em: 06 fev. 2026.
SILVA, G.G. 2016. Um comparativo entre o planejamento de uma viagem pelo guia PMBOOK e método convencional. Trabalho para obtenção de título de especialista em Gestão de Projetos. Escola Superior de Agricultura “Luiz de Queiroz” (ESALQ), Campus Piracicaba, Universidade de São Paulo (USP). Paulínia, São Paulo, Brasil.
SOLOMON, M.R..
Artigo oriundo de Trabalho de Conclusão de Curso da Especialização em Data Science e Analytics do MBA USP/Esalq
Para saber mais sobre o curso, clique aqui e acesse a plataforma MBX Academy

