Article

October 08, 2026

Precificação dinâmica de estúdios por temporada com algoritmos “multi-armed bandits”

Precificação Dinâmica de Estúdios por Temporada com Algoritmos “Multi-armed Bandits”

Kleber Ricardo de Abreu; Larissa Simões

DOI: 10.22167/2675-6528-202603114

Artigo derivado de Trabalho de Conclusão de Curso (TCC), com conteúdo baseado no trabalho original do aluno e adaptado ao formato editorial da Revista E&S com apoio da ferramenta ResumeAI, solução de inteligência artificial desenvolvida pelo Instituto Pecege para síntese e organização textual.

Resumo

As plataformas digitais de hospedagem transformaram o mercado de aluguel por temporada na última década, tornando a precificação um determinante crucial do desempenho econômico dos imóveis. Investigou-se como algoritmos da classe “Multi-Armed Bandits” (MAB) podem otimizar essa decisão de preço, comparando-se as estratégias ε-Greedy, Upper Confidence Bound (UCB) e Thompson Sampling (TS). A base analítica reuniu 2.284 observações de 571 estúdios no Rio de Janeiro, coletadas entre junho de 2024 e março de 2025. A qualidade percebida dos imóveis foi sintetizada por Análise de Componentes Principais (PCA), e a demanda modelada por regressão linear ordinária (OLS) com sete variáveis significativas. O modelo explicou 10% da variação na ocupação. Simulações foram realizadas em 1.000 rodadas e 50 repetições estocásticas em cenários estacionário e dinâmico multi-estação. No cenário estacionário, o UCB maximizou a receita acumulada, seguido por ε-Greedy e TS. No cenário dinâmico multi-estação, o UCB manteve a receita absoluta mais alta, mas o TS apresentou queda relativa menor entre cenários, indicando maior adaptabilidade à volatilidade sazonal. Concluiu-se que, em mercados oscilantes, a adaptabilidade bayesiana do TS compensou seu custo de exploração, tornando-o mais robusto a mudanças de contexto.

Palavras-chave: Aprendizado por reforço; Decisão sequencial sob incerteza; Hospedagem de curta duração; Otimização de receita; Sazonalidade turística.

1. Introdução

O mercado de aluguel por temporada passou por transformação expressiva na última década, impulsionado pela consolidação de plataformas digitais de hospedagem. Essa evolução ampliou o acesso de anfitriões individuais a mercados competitivos e elevou as expectativas dos hóspedes quanto à relação custo-benefício. Abrate et al. (2022) documentaram que anfitriões profissionais reajustam preços com maior frequência e precisão, resultando em ocupação e receita superiores. Este cenário evidencia a insuficiência da fixação estática de preços em um mercado onde a comparação entre imóveis é imediata.

A precificação dinâmica emergiu como uma alternativa vital ao modelo estático. Neubert (2022), em sua revisão sistemática, identificou ganhos de receita consistentes em diversos setores com a adoção de métodos adaptativos. Talón-Ballestero et al. (2022) descreveram a evolução rumo ao “open pricing”, um modelo em que cada unidade tem seu preço determinado de forma independente e contínua, sugerindo que o futuro da precificação em hospitalidade reside na individualização e automação. Contudo, a adoção de ferramentas algorítmicas ainda é limitada, com Foroughifar e Mehta (2024) apontando a desconfiança no algoritmo e a percepção de perda de controle como principais obstáculos, reforçando a relevância de abordagens metodologicamente transparentes.

A definição do preço ótimo em um ambiente incerto envolve um dilema contínuo entre explorar novas faixas de preço e explotar as já conhecidas por bom desempenho. A formulação rigorosa desse “trade-off” remete à classe de algoritmos “Multi-Armed Bandits” (MAB). Auer et al. (2002) demonstraram que o “Upper Confidence Bound” (UCB) oferece garantias de “regret” logarítmico, onde o custo da exploração diminui de forma controlada sem exigir conhecimento prévio das distribuições de retorno. Russo et al. (2018) formalizaram as propriedades do “Thompson Sampling” (TS), evidenciando convergência teórica e desempenho empírico particularmente favorável em cenários não estacionários.

Dada a natureza transformadora das plataformas digitais e as complexidades inerentes aos mercados de aluguel por temporada, especialmente aqueles marcados por sazonalidade e demanda dinâmica, a aplicação de algoritmos de precificação sofisticados torna-se essencial. A necessidade de equilibrar a exploração de novas estratégias de preço com a explotação de faixas de preço já conhecidas como lucrativas, enquanto se navega por incertezas de mercado e percepções dos consumidores, justifica uma investigação aprofundada da eficácia dos algoritmos MAB neste contexto.

O presente estudo investigou a aplicação desses algoritmos à precificação dinâmica de estúdios em plataforma digital de hospedagem, utilizando dados do Rio de Janeiro — 571 estúdios com histórico de preços e ocupação entre junho de 2024 e março de 2025 — como ambiente de simulação. O objetivo central foi comparar ɛ-Greedy, UCB e TS na maximização de receita, em cenários estacionário e multi-estação.

2. Material e Métodos

O presente estudo adotou uma abordagem quantitativa, de natureza exploratória e comparativa, estruturada em três etapas sequenciais: preparação dos dados, modelagem da função de demanda e simulação dos algoritmos de precificação. A pesquisa concentrou-se na aplicação de algoritmos da classe “Multi-Armed Bandits” (MAB) para otimizar a precificação dinâmica de estúdios em plataformas digitais de hospedagem, visando maximizar a receita em diferentes cenários de mercado.

Os dados utilizados foram obtidos do Inside Airbnb (2024), um repositório público e independente que compila informações sobre anúncios e calendários de disponibilidade da plataforma Airbnb. A coleta incidiu sobre estúdios localizados no Rio de Janeiro, abrangendo quatro extrações trimestrais realizadas entre junho de 2024 e março de 2025. Essa escolha temporal foi ditada pela política da plataforma de manter acesso gratuito apenas às extrações dos últimos 12 meses, em periodicidade trimestral.

A amostra foi selecionada intencionalmente para o Rio de Janeiro devido à concentração de estúdios em regiões turísticas e à conhecida sazonalidade da demanda, fatores que amplificam os desafios de precificação (Ye et al., 2018). Para garantir a homogeneidade estrutural e a comparabilidade dos resultados, aplicaram-se critérios rigorosos de filtragem. Foram incluídos apenas imóveis do tipo “unidade residencial inteira”, “loft inteiro” ou “condomínio inteiro”, com capacidade máxima de três pessoas e um quarto, excluindo-se aluguéis de longo prazo (máximo de 90 noites).

Adicionalmente, restringiu-se a amostra a anfitriões com status “Superhost”, assegurando um patamar mínimo de qualidade de serviço e regularidade de atividade. Cada imóvel selecionado precisava estar presente nas quatro extrações trimestrais, eliminando entradas intermitentes e viabilizando a comparação temporal direta. Após a filtragem, a base analítica compreendeu 571 estúdios, totalizando 2.284 observações em painel balanceado.

Na etapa de tratamento de dados, padronizaram-se os tipos de dados e converteram-se variáveis monetárias. Valores faltantes foram imputados pela mediana em 17 registros de notas de avaliação (0,74%) e dois registros de preço (0,09%). Valores extremos foram tratados por winsorização nos percentis 1 e 99, técnica que substitui observações atípicas pelos respectivos limites, preservando o tamanho amostral e reduzindo a influência de “outliers” (Wilcox, 2021).

Variáveis com distribuição assimétrica à direita, como preço, número de avaliações e avaliações por mês, foram submetidas a transformações logarítmicas (log(1 + x)) para aproximá-las de distribuições mais simétricas e reduzir a influência de valores extremos. As notas de avaliação foram reescaladas para a faixa de 0 a 100, com zeros convertidos em valores ausentes e um piso de 40 pontos aplicado para eliminar valores espúrios, sendo os dados faltantes imputados pela mediana.

A engenharia de atributos derivou variáveis de contexto competitivo, como a diferença relativa do preço do imóvel em relação à mediana de sua categoria de bairro e a ocupação média do bairro. A sazonalidade foi representada por quatro categorias: inverno (junho a agosto), primavera (setembro a novembro), verão (dezembro a fevereiro) e outono (março a maio). Os bairros originais foram agrupados em seis categorias, sendo cinco com maior representação na amostra (Copacabana, Ipanema, Leblon, Centro e Jacarepaguá) e uma categoria residual.

Para consolidar os indicadores de qualidade percebida, aplicou-se a Análise de Componentes Principais (PCA). Essa técnica visou reduzir a dimensionalidade e mitigar a multicolinearidade entre as notas de avaliação (nota geral, precisão, limpeza, check-in, comunicação e custo-benefício), transformando-as em um único componente principal, denominado índice de qualidade percebida. A nota de localização foi excluída por representar um atributo geográfico fixo, distinto dos demais indicadores de experiência.

A seleção das variáveis explicativas para a função de demanda baseou-se na correlação de Spearman com a variável-alvo, avaliação de multicolinearidade e critérios conceituais (Hollander et al., 2013). Variáveis redundantes ou sem significância estatística ao nível de 5% no modelo multivariado foram eliminadas. O conjunto final de preditores incluiu o logaritmo do preço da diária, a nota de localização, o logaritmo do número de avaliações, a ocupação média do bairro e indicadores binários para as estações do ano (outono, primavera e verão, com inverno como categoria de referência).

A função de demanda foi modelada por regressão linear ordinária (OLS), utilizando a taxa de ocupação trimestral como variável dependente (Wooldridge, 2020). A comparação entre modelos, que incluiu também um modelo linear misto (MixedLM) e alternativas não lineares como Random Forest e Gradient Boosting, utilizou o erro absoluto médio (MAE) sob validação cruzada agrupada (GroupKFold). Cada imóvel funcionou como um grupo, e suas quatro observações trimestrais permaneceram juntas no conjunto de treino ou de validação, evitando vazamento de informação (Hastie et al., 2009).

O modelo OLS foi selecionado como modelo final devido ao seu desempenho preditivo equivalente ao do modelo misto, mas com maior simplicidade interpretativa. Os notebooks Python utilizados na coleta, tratamento de dados, modelagem da função de demanda e simulação dos algoritmos MAB estão disponíveis em repositório público (Abreu, 2026), permitindo a reprodução integral das análises.

A estrutura de precificação dinâmica foi formalizada como um problema de “Multi-Armed Bandits” (MAB) (Auer et al., 2002). Cada “braço” correspondeu a uma faixa de preço da diária, e a recompensa associada a cada decisão foi a receita estimada, calculada como o produto do preço selecionado pela taxa de ocupação prevista pela função de demanda, considerando o vetor de contexto do imóvel. Dez braços foram testados, com preços variando de R$ 100 a R$ 1.000 em intervalos de R$ 100, cobrindo o intervalo entre o percentil 25 e o percentil 90 da distribuição amostral.

As simulações utilizaram 1.000 rodadas e 50 repetições estocásticas para cada cenário, com dez imóveis selecionados aleatoriamente como representantes do mercado. A cada rodada, o algoritmo selecionava um braço, observava a recompensa resultante acrescida de ruído estocástico gaussiano (σ = 0,08), simulando a incerteza inerente ao comportamento real da demanda (Qu, 2024), e atualizava sua política de seleção.

Três algoritmos MAB foram comparados: ε-Greedy, Upper Confidence Bound (UCB) e Thompson Sampling (TS). O algoritmo ε-Greedy selecionou, com probabilidade de 1 – ε, o braço com maior recompensa média estimada (explotação) e, com probabilidade ε, um braço aleatório (exploração), adotando-se ε = 0,10. O algoritmo UCB selecionou o braço que maximizou um índice composto pela média das recompensas observadas acrescida de um bônus de exploração, com o parâmetro de exploração c = 2,0 (Auer et al., 2002).

O “Thompson Sampling” (TS) adotou uma abordagem bayesiana, mantendo para cada braço uma distribuição a posteriori sobre a recompensa esperada. A cada rodada, amostrou-se um valor de cada distribuição e selecionou-se o braço com o maior valor amostrado. A implementação utilizou distribuições Normal-Gamma, que permitem atualização conjugada eficiente (Russo et al., 2018). As simulações foram realizadas em dois cenários: um estacionário (simulando 1.000 rodadas durante o verão) e um dinâmico multi-estação (replicando um ciclo sazonal completo com inverno, primavera, verão e outono, com mudança de contexto a cada 250 rodadas).

3. Resultados e Discussão

A presente investigação teve como objetivo central comparar o desempenho dos algoritmos Multi-Armed Bandits (MAB) ε-Greedy, Upper Confidence Bound (UCB) e Thompson Sampling (TS) na otimização da receita de estúdios de aluguel por temporada, em cenários estacionário e multi-estação. Os resultados obtidos revelaram dinâmicas distintas entre as estratégias, evidenciando a importância da adaptabilidade em mercados voláteis. A análise iniciou-se com a caracterização da base de dados, seguida pela modelagem da demanda e, por fim, pelas simulações dos algoritmos MAB, permitindo uma compreensão aprofundada dos mecanismos de precificação dinâmica.

A base analítica compreendeu 571 imóveis classificados como estúdio ou apartamento compacto, distribuídos por 32 bairros do Rio de Janeiro, totalizando 2.284 observações. A Zona Sul concentrou a maior parte das observações, com Copacabana respondendo por 43,2% da amostra, seguida por Ipanema (11,2%), Leblon (8,1%) e Centro (8,0%). Em termos de tipologia, as “rental units” predominaram com 82,0%, enquanto “loft” e “condo” representaram 10,2% e 7,8%, respectivamente. A capacidade de acomodação distribuiu-se de forma bimodal, com 64,1% dos imóveis para dois hóspedes e 35,6% para três.

A taxa de ocupação trimestral, variável-alvo do estudo, exibiu uma média de 34,6 dias (equivalente a 38,0% de ocupação), com mediana de 31 dias e desvio padrão de 23,7 dias. Aproximadamente 4,2% das observações registraram ocupação nula. A sazonalidade manifestou-se de forma pronunciada, com a ocupação média no verão atingindo 43,1 dias, superando o inverno em 53%, período em que a média caiu para 28,2 dias. Esse padrão reflete o perfil turístico consolidado da cidade do Rio de Janeiro, onde a demanda por hospedagem varia significativamente entre as estações do ano.

Os bairros de Botafogo e Flamengo emergiram como os mais demandados, com 46,7 e 45,7 dias de ocupação média, respectivamente, apesar de praticarem preços medianos moderados. Essa combinação sugere que os hóspedes percebem uma forte relação custo-benefício nessas localidades. A distribuição de preços revelou assimetria à direita, com média de R$ 415,91 e mediana de R$ 282,00. Os preços praticados no verão foram, em média, 3,1 vezes superiores aos do inverno, indicando a resposta do mercado à alta demanda sazonal.

Os indicadores de qualidade percebida, restritos a anfitriões “superhosts”, mantiveram-se consistentemente elevados, com médias superiores a 96 pontos e baixa dispersão. A nota de avaliação de custo-benefício, contudo, apresentou a maior variabilidade, com desvio padrão de 2,54, sugerindo ser o indicador mais sensível às diferenças reais de desempenho entre os imóveis. Essa heterogeneidade nas avaliações de custo-benefício aponta para a complexidade de se estabelecer um preço ótimo que satisfaça as expectativas dos hóspedes em relação ao valor percebido.

Consolidação de Indicadores e Seleção de Variáveis

A Análise de Componentes Principais (PCA) foi aplicada para reduzir a dimensionalidade e mitigar a multicolinearidade entre os tipos de notas de avaliação. Os testes de adequação amostral confirmaram a viabilidade da fatoração, com o índice Kaiser-Meyer-Olkin (KMO) atingindo 0,88, classificado como meritório, e o teste de esfericidade de Bartlett rejeitando a hipótese nula. A matriz de correlação de Pearson entre as seis notas de avaliação ilustrou a redundância, com correlações variando de 0,38 (limpeza e check-in) a 0,75 (nota geral e precisão), indicando um bloco coeso de indicadores de qualidade.

O primeiro componente principal capturou 64,7% da variância total das seis notas, com cargas fatoriais equilibradas, consolidando-o como uma referência consistente de qualidade percebida. Esse componente, denominado índice de qualidade percebida, foi invertido para que valores maiores representassem maior qualidade e foi incorporado à modelagem como variável de controle. A exclusão da nota de localização da PCA deveu-se ao seu caráter de atributo geográfico fixo, conceitualmente distinto dos indicadores de experiência do hóspede.

A seleção das variáveis explicativas para a função de demanda baseou-se na correlação de Spearman com a variável-alvo, avaliação de multicolinearidade e critérios conceituais. A correlação marginal entre preço e ocupação apresentou um sinal positivo agregado de +0,12, resultado aparentemente contraintuitivo. Essa anomalia refletiu a presença de uma variável de confusão, onde imóveis de melhor qualidade e localização praticam preços mais elevados e recebem maior demanda simultaneamente, mascarando o efeito real do preço.

Ao desagregar a correlação por período, o sinal inverteu-se em três das quatro extrações, revelando o padrão esperado pela teoria econômica, onde o aumento do preço leva à redução da demanda. O controle por qualidade no modelo multivariado tornou-se, portanto, essencial para isolar o efeito do preço. Variáveis redundantes, como a diferença relativa para a mediana do bairro, foram eliminadas devido à sua alta correlação com o logaritmo do preço da diária e ausência de significância no modelo multivariado.

O índice de qualidade percebida, embora relevante para controlar a confusão entre preço e qualidade, não alcançou significância estatística no modelo expandido com 11 preditores. Isso provavelmente ocorreu porque sua variação dentro de cada imóvel foi inferior a 10%, limitando sua capacidade explicativa em um modelo linear com dados em painel. O logaritmo do total de anúncios do anfitrião e a capacidade de hóspedes também foram eliminados por não atingirem significância estatística. O conjunto final de sete preditores foi encaminhado para a modelagem da demanda.

Modelagem da Função de Demanda

O modelo de regressão linear ordinária (OLS) foi adotado como modelo final para a função de demanda, pois seu desempenho preditivo igualava o do modelo linear misto, ambos com erro absoluto médio de 18,6 dias, mas oferecia maior simplicidade interpretativa. O modelo misto indicou que a variância entre imóveis era pequena face ao erro residual, não compensando a complexidade adicional de um modelo com intercepto aleatório por imóvel. O OLS modelou a taxa de ocupação trimestral como variável dependente.

Todos os sete preditores selecionados alcançaram significância estatística ao nível de 5%. O modelo apresentou um R² de 10,0%, consistente entre treino e validação cruzada agrupada por imóvel. Esse R² de 10% não representou uma fragilidade do modelo, mas sim o limite empírico observado com as variáveis disponíveis, refletindo a complexidade inerente ao mercado de hospitalidade, onde preferências subjetivas e fatores não mensuráveis desempenham um papel significativo na variação da ocupação.

O coeficiente do logaritmo do preço (β = -0,046) representou uma semielasticidade, indicando que um aumento de 1% no preço da diária associa-se a uma redução de aproximadamente 0,046 pontos percentuais na taxa de ocupação trimestral. A correlação positiva de +0,294 entre variações de preço e ocupação dentro do mesmo imóvel indicou endogeneidade preço-ocupação, sugerindo que o efeito causal do preço sobre a demanda é plausivelmente mais negativo do que o coeficiente indica. Essa endogeneidade reforçou a justificativa para o uso de algoritmos MAB, que exploram ativamente faixas de preço para isolar o efeito causal de forma mais rigorosa.

A comparação com modelos não lineares, como Random Forest e Gradient Boosting, confirmou a escolha do OLS. Embora Random Forest e Gradient Boosting tenham atingido R² mais altos na amostra (33,2% e 42,4%, respectivamente), eles apresentaram quedas significativas na validação (7,9% e 4,5%), indicando sobreajuste severo. O OLS, com seu R² estável em torno de 10%, demonstrou maior robustez e generalização para dados não vistos, sendo mais adequado para o ambiente de simulação.

As curvas de demanda estimadas mantiveram-se monotonicamente decrescentes nas quatro estações, confirmando a relação negativa esperada entre preço e ocupação. A receita estimada, produto do preço pela ocupação, cresceu monotonicamente no intervalo analisado de R$ 100 a R$ 1.000, sem ponto de máximo interno. Essa característica decorreu da baixa semielasticidade do preço, onde o ganho unitário por diária superou sistematicamente a perda marginal de ocupação. Em faixas de preço muito acima das praticadas, onde a demanda provavelmente acelera sua queda, a curva de receita presumivelmente apresentaria um ponto de máximo, mas o modelo não dispôs de observações nessas regiões devido à prática dos anfitriões de não testarem preços extremos.

Simulação dos Algoritmos MAB em Cenário Estacionário

No cenário estacionário, que simulou 1.000 rodadas durante o verão em 50 repetições, o algoritmo UCB obteve a maior receita acumulada média, alcançando R$ 40,3 mil. Ele foi seguido pelo ε-Greedy, com R$ 37,2 mil, e pelo Thompson Sampling (TS), que registrou R$ 35,3 mil. Esses resultados indicam que, em um ambiente de demanda estável e previsível, a estratégia de exploração mais focada do UCB, que minimiza o custo de exploração ao longo do tempo, tende a maximizar a receita acumulada.

A evolução temporal da receita acumulada evidenciou trajetórias distintas entre os algoritmos. O UCB separou-se dos demais já nas primeiras 100 rodadas, período em que o ε-Greedy e o Thompson Sampling ainda acumulavam um custo exploratório visível. Após a rodada 200, as inclinações das curvas estabilizaram-se e a ordenação entre os algoritmos não se alterou mais, indicando que as políticas de seleção já haviam convergido para o braço de preço mais lucrativo. Essa rápida convergência do UCB é uma de suas vantagens em cenários estacionários, conforme demonstrado por Auer et al. (2002).

Os três algoritmos convergiram para o braço de preço mais elevado (R$ 1.000), o que era esperado dada a curva de demanda estimada, que mostrou a receita crescendo monotonicamente com o preço no intervalo testado. Essa limitação impõe uma ressalva à análise, pois em cenários onde a elasticidade variasse mais e o preço ótimo não fosse simplesmente o mais alto, as diferenças de desempenho entre os algoritmos provavelmente apareceriam com mais clareza. No entanto, a abordagem MAB ainda se mostra valiosa pela sua capacidade de explorar empiricamente faixas de preço não testadas pelos anfitriões, sem depender de uma modelagem econométrica precisa (Qu, 2024).

A distribuição de braços selecionados tornou o contraste entre os algoritmos visível. O UCB, após testar cada braço uma vez, direcionou 94,4% das rodadas ao braço de R$ 1.000, mantendo uma exploração mínima. O ε-Greedy dedicou sistematicamente 10% das rodadas à exploração aleatória, distribuída de forma uniforme entre todos os braços, uma consequência mecânica do parâmetro ε = 0,10. O Thompson Sampling, por sua vez, manteve uma exploração ativa ao longo de todo o horizonte, concentrando 51,7% das seleções no braço preferido, mas também 28,1% no braço de R$ 800 e 12,1% no de R$ 650, refletindo a incerteza residual da distribuição a posteriori mesmo após 1.000 rodadas (Russo et al., 2018).

Essa exploração mais ampla do Thompson Sampling custou entre R$ 2 mil e R$ 3 mil por rodada em estado estacionário frente ao UCB. Esse custo, no entanto, precisa ser qualificado. Ao manter probabilidade não-nula sobre os braços de R$ 650 e R$ 800, o Thompson Sampling preservou flexibilidade para reagir a deslocamentos na função de receita. Em contraste, o UCB já tinha praticamente encerrado essa exploração por volta da rodada 100. A relevância dessa diferença é o que se examina no cenário dinâmico multi-estação, onde a variação sazonal é introduzida.

Simulação dos Algoritmos MAB em Cenário Multi-Estação

A simulação multi-estação replicou um ciclo sazonal completo, abrangendo inverno, primavera, verão e outono, com mudança de contexto a cada 250 rodadas. Nesse cenário dinâmico, o UCB manteve a receita absoluta mais alta, com R$ 29,7 mil, seguido pelo ε-Greedy (R$ 27,8 mil) e pelo Thompson Sampling (R$ 27,2 mil). No entanto, a diferença relativa entre os algoritmos reduziu-se em comparação ao cenário estacionário, indicando que a volatilidade sazonal impactou o desempenho de todas as estratégias.

A receita acumulada ao longo das quatro estações revelou uma dinâmica que as médias absolutas não captam. As curvas dos três algoritmos caminharam praticamente sobrepostas durante o inverno e a primavera, e a separação só se consolidou a partir do verão, quando a demanda mais alta ampliou a recompensa dos braços superiores. As faixas de incerteza, mais largas no Thompson Sampling e mais estreitas no UCB, refletiram o grau de exploração mantido por cada estratégia, com o TS demonstrando maior abertura para explorar alternativas em momentos de maior incerteza.

Os padrões de adaptação variaram por estação de modo revelador. O UCB convergiu rapidamente em todas elas, direcionando 79,2% das seleções ao braço de R$ 1.000 já no inverno e mantendo-se em torno de 84% nas estações posteriores. Esse comportamento uniforme expôs uma limitação do UCB: o algoritmo não respondeu às mudanças de contexto sazonal, aderindo à política aprendida no primeiro período. O ε-Greedy apresentou convergência mais lenta no inverno (47,1%), estabilizando-se em torno de 82% a partir do outono.

O Thompson Sampling exibiu um padrão radicalmente distinto, com a concentração no braço de R$ 1.000 crescendo progressivamente: 30% no inverno, 52% na primavera, 63% no verão e 66% no outono. Durante o inverno, 70% das seleções distribuíram-se entre braços intermediários (R$ 500 a R$ 800), refletindo maior incerteza sobre qual faixa maximizaria a receita em período de demanda inferior. Esse gradiente de exploração para explotação ilustrou o aprendizado bayesiano contínuo do Thompson Sampling: a cada nova observação, a distribuição a posteriori concentrou-se em torno do braço com maior recompensa sem abandonar completamente a exploração (Jain et al., 2024; Russo et al., 2018).

Discussão Integrada dos Achados

Os resultados obtidos confirmaram as contribuições centrais do estudo. A função de demanda capturou a estrutura de mercado esperada, com o preço exercendo um efeito negativo significativo sobre a ocupação, a sazonalidade como fator dominante e a visibilidade como principal determinante da ocupação. Os algoritmos MAB demonstraram capacidade de convergência para faixas de preço superiores baseando-se exclusivamente em dados de recompensa observados, prescindindo de conhecimento prévio da curva de demanda, o que é uma vantagem em mercados complexos e dinâmicos.

A endogeneidade preço-ocupação identificada, com uma correlação positiva de +0,294 entre variações de preço e ocupação dentro do mesmo imóvel, reforçou a justificativa para a aplicação dos algoritmos MAB. Ao explorar ativamente faixas de preço de forma quase experimental, o algoritmo isola o efeito causal de modo mais rigoroso do que estimadores observacionais puros. Contudo, Foroughifar e Mehta (2024) alertaram para desafios de implementação, como a necessidade de acesso a dados em tempo real e a disposição de absorver custos exploratórios.

A sazonalidade exerceu um impacto expressivo na receita. Ao transitar do cenário estacionário (verão) para o multi-estação, a receita declinou entre 23% e 26% para todos os algoritmos. O Thompson Sampling sofreu uma queda relativa menor (-23,1%) em comparação com o UCB (-26,4%). Esses números apontaram que a exploração contínua do Thompson Sampling, característica intrínseca da abordagem bayesiana, o torna mais robusto frente a mudanças de contexto, como a sazonalidade, permitindo-lhe adaptar-se sem exigir reinicialização ou ajuste manual.

Embora o UCB tenha conquistado a maior receita acumulada em ambos os cenários, sua superioridade comportou nuances. Em termos de receita absoluta, o UCB liderou, mas em adaptabilidade, o Thompson Sampling revelou uma vantagem relativa. A estabilidade do UCB, direcionando consistentemente mais de 79% das seleções ao braço preferido em todas as estações, decorreu de sua peculiaridade de não responder às mudanças de contexto, mantendo a política aprendida no inverno. Em contraste, o Thompson Sampling demonstrou adaptação gradual, redistribuindo seleções entre braços a cada estação, o que é crucial em mercados sujeitos a variações competitivas e choques exógenos.

Os “trade-offs” entre exploração e explotação diferenciaram os algoritmos de forma notável. O UCB concentrou 94,4% das seleções no braço preferido no cenário estacionário, minimizando a exploração. O ε-Greedy dedicou 10% das rodadas à exploração aleatória indiscriminada. O Thompson Sampling dirigiu 48,3% das seleções para fora do braço preferido, distribuindo-as proporcionalmente à incerteza residual da distribuição a posteriori. O custo dessa exploração adicional foi de aproximadamente 14% da receita no cenário estacionário e de 9% no dinâmico. A redução dessa diferença com a mudança de contexto indicou que a exploração do Thompson Sampling adquire valor parcial quando o ambiente não permanece estável, justificando seu custo incremental como prêmio de adaptabilidade.

Em síntese, os algoritmos Multi-Armed Bandits demonstraram ser eficazes na precificação dinâmica de estúdios por temporada, mesmo com a limitação de uma curva de receita monotonicamente crescente no intervalo analisado. O UCB destacou-se em cenários estacionários pela sua eficiência em explorar e convergir rapidamente para o braço ótimo. No entanto, em ambientes dinâmicos e sazonais, a adaptabilidade bayesiana do Thompson Sampling, que permite uma exploração contínua e ajustada à incerteza, mostrou-se mais robusta, compensando seu custo de exploração moderado e tornando-o uma estratégia mais resiliente a mudanças de contexto.

4. Conclusão

O presente estudo investigou a aplicação de algoritmos Multi-Armed Bandits (MAB) na precificação dinâmica de estúdios em plataformas digitais de hospedagem, comparando as estratégias ɛ-Greedy, Upper Confidence Bound (UCB) e Thompson Sampling (TS) em cenários estacionário e multi-estação. Verificou-se que a função de demanda, modelada por regressão linear ordinária com sete preditores significativos, capturou a estrutura de mercado esperada, com o preço exercendo um efeito negativo sobre a ocupação e a sazonalidade como fator dominante. A endogeneidade preço-ocupação identificada reforçou a justificativa para a aplicação dos algoritmos MAB, que exploram ativamente faixas de preço para isolar o efeito causal de forma mais rigorosa. Nas simulações, o UCB maximizou a receita acumulada no cenário estacionário, convergindo rapidamente para o braço de preço mais elevado. Contudo, no cenário dinâmico multi-estação, o Thompson Sampling demonstrou maior adaptabilidade à volatilidade sazonal, apresentando uma queda relativa de receita menor em comparação com o UCB, que manteve a política aprendida no período inicial sem responder às mudanças de contexto. Essa exploração contínua e ajustada à incerteza, característica da abordagem bayesiana do Thompson Sampling, revelou-se mais robusta em ambientes sujeitos a variações.

A principal contribuição do estudo reside na demonstração da eficácia dos algoritmos MAB para a otimização de receita em mercados de aluguel por temporada, especialmente a resiliência do Thompson Sampling em contextos voláteis e sazonais, oferecendo uma alternativa adaptativa à precificação estática. Observou-se, contudo, que a natureza observacional dos dados limitou a captura do comportamento de preço em faixas extremas e a interpretação causal dos coeficientes da regressão. A simplificação da função de demanda para um modelo linear e a ausência de simulação de choques exógenos de oferta também constituíram limitações. Para pesquisas futuras, sugere-se a incorporação de dados contextuais em tempo real, como preços concorrentes e eventos, para viabilizar bandits contextuais. Recomenda-se também a investigação de algoritmos com mecanismos de desconto exponencial ou janelas deslizantes, além da validação empírica dos ganhos simulados por meio de experimentos controlados com anfitriões reais.

Referências Bibliográficas

Abrate, G.; Sainaghi, R.; Mauri, A.G. 2022. Dynamic pricing in Airbnb: individual versus professional hosts. Journal of Business Research 141: 191-199.

Abreu, K.R. 2026. Precificação dinâmica de estúdios por temporada com algoritmos multi-armed bandits: notebooks de análise. Disponível em: https://github.com/kleberAbreu/tcc-precificacao-dinamica-mab. Acesso em: 21 abr. 2026.

Auer, P.; Cesa-Bianchi, N.; Fischer, P. 2002. Finite-time analysis of the multi-armed bandit problem. Machine Learning 47(2-3): 235-256.

Foroughifar, M.; Mehta, N. 2024. The challenges of deploying an algorithmic pricing tool: evidence from Airbnb. Working Paper, Rotman School of Management, University of Toronto, Toronto, Canada.

Hastie, T.; Tibshirani, R.; Friedman, J. 2009. The Elements of Statistical Learning: Data Mining, Inference, and Prediction. 2ed. Springer, New York, NY, USA.

Hollander, M.; Wolfe, D.A.; Chicken, E. 2013. Nonparametric Statistical Methods. 3ed. John Wiley & Sons, Hoboken, NJ, USA.

Inside Airbnb [Inside Airbnb]. 2024. Get the data. Disponível em: http://insideairbnb.com/get-the-data.html. Acesso em: 15 jun. 2025.

Jain, L.; Li, Z.; Loghmani, E.; Mason, B.; Yoganarasimhan, H. 2024. Effective adaptive exploration of prices and promotions in choice-based demand models. Marketing Science 43(5): 1002-1030.

Neubert, M. 2022. A systematic literature review of dynamic pricing strategies. International Business Research 15(4): 1-17.

Qu, J. 2024. Survey of dynamic pricing based on multi-armed bandit algorithms. Applied and Computational Engineering 37: 160-165.

Russo, D.; Van Roy, B.; Kazerouni, A.; Osband, I.; Wen, Z. 2018. A tutorial on Thompson sampling. Foundations and Trends in Machine Learning 11(1): 1-96.

Talón-Ballestero, P.; Nieto-García, M.; González-Serrano, L. 2022. The wheel of dynamic pricing: towards open pricing and one to one pricing in hotel revenue management. International Journal of Hospitality Management, 102: 103184. https://doi.org/10.1016/j.ijhm.2022.103184.

Wilcox, R.R. 2021. Introduction to Robust Estimation and Hypothesis Testing. 5ed. Elsevier, Amsterdam, Netherlands.

Wooldridge, J.M. 2020. Introductory Econometrics: a Modern Approach. 7ed. Cengage Learning, Boston, MA, USA.

Ye, P.; Qian, J.; Chen, J.; Wu, C.; Zhou, Y.; De Mars, S.; Yang, F.; Zhang, L. 2018. Customized regression model for Airbnb dynamic pricing. p. 932-940. In: Proceedings of the 24th ACM SIGKDD Conference on Knowledge Discovery and Data Mining. ACM, London, UK.

Artigo oriundo de Trabalho de Conclusão de Curso da Especialização em Data Science e Analytics do MBA USP/Esalq

Para saber mais sobre o curso, clique aqui e acesse a plataforma MBX Academy

You may also like

October 08, 2026

Árvores de classificação e regressão para previsão dos resultados de deputados estaduais em São Paulo

As eleições no Brasil movimentam recursos significativos, e a formação de chapas competitivas é um desafio para os partidos. Avaliou-se a viabilidade de modelos de classificação e regressão baseados em árvores de decisão e florestas aleatórias para identificar candidatos com potencial de eleição e competitividade, e para prever sua votação nominal na disputa para deputado estadual em São Paulo em 2022. A amostra incluiu todos os candidatos a deputado estadual em São Paulo em 2022, utilizando dados eleitorais, demográficos, partidários e econômicos do período entre 2018 e 2022. A seleção de hiperparâmetros foi realizada por busca em grade, seguida de análise de sensibilidade para o ponto de corte, e a pontuação F1 foi a métrica principal. Comparou-se os modelos de árvore de decisão e floresta aleatória usando F1 e AUC-ROC. O modelo de classificação de candidatos competitivos alcançou uma pontuação F1 de 0,70 e 94% de AUC-ROC, demonstrando ser uma ferramenta viável para auxiliar a tomada de decisão de partidos e candidatos. Os modelos de previsão de eleitos e de votos nominais foram considerados insuficientes. Concluiu-se que características de eleições passadas e o conceito de competitividade são preditores relevantes para a previsibilidade eleitoral, e que o uso de árvores de classificação e regressão, especialmente florestas aleatórias, é adequado para a previsibilidade da competitividade de candidatos.

Palavras-chave: Análise de sensibilidade; Competitividade eleitoral; Florestas aleatórias; Scikit-Learn.

October 08, 2026

Disrupções analíticas para a governança da pesca artesanal na Amazônia: Novas abordagens para dados limitados de desembarque

Técnicas de machine learning foram propostas para a governança da pesca artesanal na Amazônia, buscando superar limitações de dados de desembarque. O estudo objetivou constituir grupos de manejo, avaliar tendências temporais e propor modelos de predição para dados de desembarque pesqueiro, a fim de apoiar a tomada de decisão e o ordenamento. Os dados de desembarque, coletados entre 2010 e 2022 nos rios Baixo Amazonas e Baixo Araguaia-Tocantins, foram integralizados em uma matriz de análise. Adotou-se a família taxonômica como unidade de estoque funcional para agrupar os dados. Foram empregadas técnicas multivariadas de agrupamento (clusterização hierárquica e K-means), análise e simulação de séries temporais (modelo ARIMA Forecast otimizado) e técnicas multivariadas confirmatórias (modelos de regressão em painel longitudinal). A análise de agrupamento segmentou grupos de estoques funcionais por faixas de quilos de peixe (Alvos Mistos, Alvos Baixo Araguaia-Tocantins, Alvos Baixo Amazonas). A investigação de padrões temporais revelou que o atraso de 12 meses foi a melhor alternativa, indicando que as pescarias de um ano afetam as do ano seguinte. Os modelos ARIMA-Forecast otimizados foram bem ajustados, mas não detectaram tendência de declínio ou aumento no comportamento temporal, sugerindo estratégias de adaptação da pesca artesanal. O modelo em painel indicou um quadro estratégico de priorização de estoques funcionais para monitoramento e ordenamento. As abordagens analíticas disruptivas e inovadoras desenvolvidas modernizaram os protocolos de governança da pesca artesanal na Amazônia, fornecendo um painel de indicações estratégicas para o manejo, especialmente nas regiões do Baixo Amazonas e Baixo Araguaia-Tocantins.

Palavras-chave: Amazônia; Desembarque pesqueiro; Estoques funcionais; Governança; Manejo.

October 08, 2026

Transformação de Dados Transacionais em Inteligência de Negócio: Framework de “Data Wrangling” e “Dashboards”

A evolução das capacidades de captura e processamento de dados tornou imperativa a transformação de informações para tomada de decisão ágil e bem-informada. O estudo focou na aplicação de conhecimentos da ciência de dados para capturar, processar e manipular dados transacionais de um comércio britânico, visando facilitar a compreensão e a tomada de decisões sobre consumidores, produtos e vendas. Utilizou-se uma abordagem qualitativa do tipo pesquisa-ação, empregando dados transacionais de um varejo digital do Reino Unido. Os dados foram tratados em Python, aplicando técnicas de data wrangling, modelagem dimensional em esquema estrela e métodos estatísticos como Tuckey Fences (IQR) para normalização de preços. A segmentação de consumidores foi realizada por meio do algoritmo K-Means, considerando frequência e valor monetário. Os dados processados foram então carregados e visualizados em dashboards interativos no Power BI. Os resultados revelaram a identificação de diferentes perfis de consumidores, destacando a importância de clientes de alto valor e a oportunidade de crescimento em mercados específicos. Observaram-se tendências de vendas sazonais e anomalias em dados de produtos, evidenciando a necessidade de governança de dados. Concluiu-se que o framework desenvolvido permite transformar dados brutos em diagnósticos estratégicos, promovendo a maturidade digital e a tomada de decisão baseada em dados.

Palavras-chave: Clustering; Dashboards; Data Wrangling; Power BI.

October 08, 2026

Otimização do processo de gaseificação de biomassa para produção de hidrogênio usando redes neurais agregadas

A matriz mundial de produção de hidrogênio ainda é dependente em 98% de fontes fósseis, gerando um passivo ambiental de aproximadamente 9 kg de CO2 para cada kg de H2 produzido. No cenário brasileiro, a gaseificação do bagaço de cana-de-açúcar surge como uma alternativa de baixo carbono, porém a complexidade e a não-linearidade das reações termoquímicas dificultam o controle e a maximização do rendimento por métodos convencionais. O estudo objetivou identificar parâmetros operacionais ótimos para a gaseificação de biomassa, visando maximizar a fração molar de hidrogênio, por meio de uma abordagem computacional integrada que combinou simulação termodinâmica e técnicas de inteligência artificial. Para tal, o processo de gaseificação foi simulado no software Aspen Plus e, após validação com dados da literatura, gerou uma base de dados de 1.000 cenários por amostragem via hipercubo latino. Esses dados alimentaram um metamodelo de redes neurais agregadas por bootstrap (BANN) com 57 neurônios, seguido da aplicação do algoritmo de otimização por enxame de partículas (PSO) para a busca do ótimo global. O metamodelo alcançou um coeficiente de determinação R² de 0,9902 no conjunto de teste, indicando elevada capacidade preditiva. A otimização revelou que a fração molar de hidrogênio pode atingir 67,54% após enriquecido por meio da reação de deslocamento do gás de água (WGS) sob condições de 857,12 °C e razão de equivalência (ER) de 0,10. A integração BANN-PSO reduziu o custo computacional da otimização em aproximadamente 5.400 vezes em relação à simulação direta no Aspen Plus, identificando condições operacionais que maximizam a fração molar de hidrogênio para 67,54% na entrada da PSA. Ao integrar modelagem termodinâmica, aprendizado de máquina, otimização metaheurística e técnicas de interpretabilidade, o estudo contribuiu para o avanço metodológico na análise e intensificação de processos de produção de hidrogênio a partir de biomassa, oferecendo uma estrutura computacional reprodutível e aplicável a sistemas energéticos complexos no contexto da transição energética.

Palavras-chave: Aprendizado de máquina; Bagaço de cana; Gás de síntese; Meta-heurística; Sustentabilidade.

October 08, 2026

Ferramentas de gestão do tempo em uma instituição bancária na cidade de São Paulo

A gestão do tempo constitui-se como um diferencial competitivo estratégico, especialmente no setor bancário, ambiente caracterizado por alta pressão e constante transformação tecnológica. O estudo teve como objetivo analisar as percepções dos colaboradores de uma instituição bancária na cidade de São Paulo acerca da eficácia e aplicabilidade das ferramentas de gestão do tempo em suas rotinas profissionais. Para isso, adotou-se uma metodologia de pesquisa descritiva, de abordagem quantitativa, operacionalizada por meio de um levantamento (survey) que envolveu 37 colaboradores, os quais responderam a um questionário estruturado de 14 questões. Os resultados revelaram que, embora 45,9% dos respondentes planejassem a maior parte de suas atividades, a técnica predominante utilizada foi a de listas de tarefas simples (64,9%), com baixa adesão a métodos mais estruturados. Os maiores obstáculos identificados para a gestão eficaz do tempo foram as interrupções não planejadas (43,2%) e o excesso de reuniões improdutivas. Um dado crítico apontou que a gestão ineficiente do tempo impactou diretamente a saúde mental e o estresse de 48,6% da amostra. Concluiu-se que a eficácia da gestão do tempo no ambiente bancário depende não apenas da adoção de ferramentas individuais, mas também de uma mudança na cultura organizacional que privilegie o trabalho focado e a redução da fragmentação das atividades. Recomendaram-se a implementação de práticas como o Time Blocking e a adoção de protocolos de reuniões mais objetivos para mitigar a sobrecarga e promover o bem-estar sustentável.

Palavras-chave: Bem-estar ocupacional; Cultura organizacional; Eficiência operacional; Metodologias ágeis; Produtividade.

Neuroscience And Learning In Education

October 08, 2026

Consequências do Uso de IA Generativa na Capacidade Cognitiva e Saúde Mental de Profissionais Brasileiros

A integração de ferramentas de inteligência artificial generativa (GenAI) no trabalho acelerou-se nos últimos anos, levantando questões sobre seus efeitos nos processos cognitivos e no bem-estar emocional dos profissionais. O estudo objetivou mensurar o impacto do uso de GenAI sobre capacidades cognitivas autorreferidas e indicadores de saúde mental de profissionais brasileiros, comparando os achados com evidências empíricas internacionais. Adotou-se uma abordagem mista, com delineamento transversal e não experimental, aplicando um questionário digital estruturado a 108 profissionais adultos brasileiros, recrutados via LinkedIn e WhatsApp. O instrumento avaliou memória de trabalho, atenção sustentada e alternada, controle inibitório, flexibilidade cognitiva, tecnoestresse, saúde mental e senso de propósito profissional, além de percepções qualitativas. Os resultados revelaram que 92,6% dos respondentes utilizaram GenAI regularmente, com impacto percebido majoritariamente positivo no desempenho, mas acompanhado por dependência declarada em 52,8% da amostra. A atenção sustentada mostrou-se a dimensão cognitiva mais fragilizada, e os indicadores de equilíbrio emocional e desconexão digital concentraram os resultados mais críticos. A análise comparativa identificou uma relação entre maior frequência de uso, maior dependência e menores escores cognitivos, com declínio progressivo da atenção focada ao longo do tempo de uso. Concluiu-se que o uso intensivo de GenAI coexiste com fragilidades cognitivas e emocionais mensuráveis, cujos efeitos tendem a se acumular, reforçando a necessidade de práticas conscientes que preservem a autonomia intelectual dos profissionais.

Palavras-chave: Cognição; Dependência tecnológica; Inteligência artificial; Saúde mental.

Neuroscience And Learning In Education

October 08, 2026

A contribuição da neuroaprendizagem na elaboração de objetos educacionais multimídia para a recomposição de aprendizagens

A defasagem de aprendizagem na educação brasileira, agravada pela pandemia de Covid-19 e evidenciada por resultados insatisfatórios do SAEB, tornou a recomposição de aprendizagens uma prioridade nacional. O presente trabalho analisou como a produção audiovisual, integrante de um programa de recomposição de aprendizagens em Língua Portuguesa e Matemática, desenvolvido para estudantes do 9º ano do Ensino Fundamental de uma rede estadual, incorporou fundamentos da neurociência da aprendizagem em sua estrutura metodológica. A pesquisa caracterizou-se como estudo de caso qualitativo e aplicado, e analisou 20 roteiros pedagógicos e as respectivas videoaulas produzidas e aplicadas em 2024. A partir do referencial teórico, construíram-se sete dimensões de análise: ludicidade e interatividade, funcionamento cerebral e aprendizagem, emoção e cognição, singularidade do estudante, contexto sociocultural, mediação pedagógica consistente e aprendizagem ativa. Os resultados indicaram que elementos da neuroaprendizagem foram incorporados de forma estrutural à metodologia do programa. Identificou-se que a personalização da aprendizagem não reside exclusivamente no objeto audiovisual, mas na cadeia sistêmica que o envolve, incluindo diagnóstico, produção, mediação presencial e monitoramento. A integração entre neurociência, conteúdos dedicados à superação de lacunas e linguagem audiovisual demonstrou ser uma estratégia metodologicamente consistente e com potencial relevante para ampliar a eficácia de programas de recomposição de aprendizagens.

Palavras-chave: Defasagem; Eduentretenimento; Mediação pedagógica; Plasticidade cerebral; Videoaula.

School Management

October 08, 2026

Lei do Novo Ensino Médio: monitoramento e avaliação da qualidade após a reforma

A qualidade do Ensino Médio no Brasil tem sido objeto de debates diante das mudanças iniciadas pela Lei nº 13.415/2017 e reestruturadas pela Lei nº 14.945/2024. Analisou-se a evolução de indicadores associados à qualidade do Ensino Médio entre 2017 e 2024, considerando aprendizagem, fluxo, permanência e equidade, e discutiram-se as implicações dos mecanismos federais de monitoramento para a gestão escolar. Realizou-se estudo exploratório e descritivo, de abordagem quantitativa e natureza documental, com dados secundários do Inep sistematizados pela plataforma QEdu e documentos oficiais do Ministério da Educação. Examinaram-se taxas de aprovação, reprovação e abandono, distorção idade-série, aprendizagem adequada no Saeb e desigualdades por rede de ensino, nível socioeconômico e unidade federativa. Os resultados mostraram melhora do fluxo e redução da distorção idade-série, mas permanência de baixos níveis de aprendizagem e desigualdades expressivas. A análise documental indicou maior estruturação da governança e do monitoramento da política, ainda sem avaliação consolidada de seus efeitos sobre a aprendizagem. Para a gestão escolar, os achados orientaram o acompanhamento da transição para a 1ª série, a identificação de riscos de abandono, a recomposição das aprendizagens e a priorização de grupos mais vulneráveis. Concluiu-se que a qualidade exige a leitura articulada de indicadores e decisões contextualizadas, sem atribuir exclusivamente ao Novo Ensino Médio relações causais que o desenho desta pesquisa não permite estabelecer.

Palavras-chave: Aprendizagem; Equidade educacional; Gestão escolar; Permanência escolar; Política educacional.

October 08, 2026

Modelagem de emissão de CO2: Clusterização a partir de variáveis socioeconômicas e energéticas.

Um estudo aplicou técnicas de clusterização, com foco no algoritmo K-means, para agrupar os 20 membros do G20, incluindo a União Europeia, com base em sete variáveis socioeconômicas, energéticas e ambientais referentes ao ano de 2025. As variáveis consideradas foram Produto Interno Bruto (PIB), população, emissões de CO2 per capita, emissões de CO2 da construção civil, Índice de Desenvolvimento Humano (IDH), índice de Gini e participação de fontes renováveis na matriz energética. A relevância do setor da construção civil para as emissões globais e seu potencial de redução justificaram sua inclusão. O número ótimo de agrupamentos foi determinado pela combinação do método do cotovelo e do Índice de Silhouette, resultando em quatro clusters distintos. A Análise de Componentes Principais (PCA) foi empregada para visualizar os agrupamentos, e as duas primeiras componentes explicaram 69,86% da variabilidade dos dados. O Cluster 0, composto por China e Índia, caracterizou-se por elevada população e altas emissões da construção civil. O Cluster 1, com 12 países, apresentou alto desenvolvimento humano e elevadas emissões per capita. O Cluster 2, formado por Brasil, Indonésia, México e África do Sul, exibiu o menor PIB médio, maior desigualdade e baixas emissões per capita. O Cluster 3, que incluiu Estados Unidos e União Europeia, concentrou o maior PIB médio e as maiores emissões per capita. Os resultados evidenciaram a heterogeneidade entre os países do G20 e reforçaram a necessidade de políticas climáticas diferenciadas, adaptadas às características de cada grupo.

Palavras-chave: Cluster; CO2; Emissão; K-means; Países.