08 de octubre de 2026
Precificação dinâmica de estúdios por temporada com algoritmos “multi-armed bandits”
Precificação Dinâmica de Estúdios por Temporada com Algoritmos “Multi-armed Bandits”
Kleber Ricardo de Abreu; Larissa Simões
DOI: 10.22167/2675-6528-202603114
Artigo derivado de Trabalho de Conclusão de Curso (TCC), com conteúdo baseado no trabalho original do aluno e adaptado ao formato editorial da Revista E&S com apoio da ferramenta ResumeAI, solução de inteligência artificial desenvolvida pelo Instituto Pecege para síntese e organização textual.
Resumo
As plataformas digitais de hospedagem transformaram o mercado de aluguel por temporada na última década, tornando a precificação um determinante crucial do desempenho econômico dos imóveis. Investigou-se como algoritmos da classe “Multi-Armed Bandits” (MAB) podem otimizar essa decisão de preço, comparando-se as estratégias ε-Greedy, Upper Confidence Bound (UCB) e Thompson Sampling (TS). A base analítica reuniu 2.284 observações de 571 estúdios no Rio de Janeiro, coletadas entre junho de 2024 e março de 2025. A qualidade percebida dos imóveis foi sintetizada por Análise de Componentes Principais (PCA), e a demanda modelada por regressão linear ordinária (OLS) com sete variáveis significativas. O modelo explicou 10% da variação na ocupação. Simulações foram realizadas em 1.000 rodadas e 50 repetições estocásticas em cenários estacionário e dinâmico multi-estação. No cenário estacionário, o UCB maximizou a receita acumulada, seguido por ε-Greedy e TS. No cenário dinâmico multi-estação, o UCB manteve a receita absoluta mais alta, mas o TS apresentou queda relativa menor entre cenários, indicando maior adaptabilidade à volatilidade sazonal. Concluiu-se que, em mercados oscilantes, a adaptabilidade bayesiana do TS compensou seu custo de exploração, tornando-o mais robusto a mudanças de contexto.
Palavras-chave: Aprendizado por reforço; Decisão sequencial sob incerteza; Hospedagem de curta duração; Otimização de receita; Sazonalidade turística.
1. Introdução
O mercado de aluguel por temporada passou por transformação expressiva na última década, impulsionado pela consolidação de plataformas digitais de hospedagem. Essa evolução ampliou o acesso de anfitriões individuais a mercados competitivos e elevou as expectativas dos hóspedes quanto à relação custo-benefício. Abrate et al. (2022) documentaram que anfitriões profissionais reajustam preços com maior frequência e precisão, resultando em ocupação e receita superiores. Este cenário evidencia a insuficiência da fixação estática de preços em um mercado onde a comparação entre imóveis é imediata.
A precificação dinâmica emergiu como uma alternativa vital ao modelo estático. Neubert (2022), em sua revisão sistemática, identificou ganhos de receita consistentes em diversos setores com a adoção de métodos adaptativos. Talón-Ballestero et al. (2022) descreveram a evolução rumo ao “open pricing”, um modelo em que cada unidade tem seu preço determinado de forma independente e contínua, sugerindo que o futuro da precificação em hospitalidade reside na individualização e automação. Contudo, a adoção de ferramentas algorítmicas ainda é limitada, com Foroughifar e Mehta (2024) apontando a desconfiança no algoritmo e a percepção de perda de controle como principais obstáculos, reforçando a relevância de abordagens metodologicamente transparentes.
A definição do preço ótimo em um ambiente incerto envolve um dilema contínuo entre explorar novas faixas de preço e explotar as já conhecidas por bom desempenho. A formulação rigorosa desse “trade-off” remete à classe de algoritmos “Multi-Armed Bandits” (MAB). Auer et al. (2002) demonstraram que o “Upper Confidence Bound” (UCB) oferece garantias de “regret” logarítmico, onde o custo da exploração diminui de forma controlada sem exigir conhecimento prévio das distribuições de retorno. Russo et al. (2018) formalizaram as propriedades do “Thompson Sampling” (TS), evidenciando convergência teórica e desempenho empírico particularmente favorável em cenários não estacionários.
Dada a natureza transformadora das plataformas digitais e as complexidades inerentes aos mercados de aluguel por temporada, especialmente aqueles marcados por sazonalidade e demanda dinâmica, a aplicação de algoritmos de precificação sofisticados torna-se essencial. A necessidade de equilibrar a exploração de novas estratégias de preço com a explotação de faixas de preço já conhecidas como lucrativas, enquanto se navega por incertezas de mercado e percepções dos consumidores, justifica uma investigação aprofundada da eficácia dos algoritmos MAB neste contexto.
O presente estudo investigou a aplicação desses algoritmos à precificação dinâmica de estúdios em plataforma digital de hospedagem, utilizando dados do Rio de Janeiro — 571 estúdios com histórico de preços e ocupação entre junho de 2024 e março de 2025 — como ambiente de simulação. O objetivo central foi comparar ɛ-Greedy, UCB e TS na maximização de receita, em cenários estacionário e multi-estação.
2. Material e Métodos
O presente estudo adotou uma abordagem quantitativa, de natureza exploratória e comparativa, estruturada em três etapas sequenciais: preparação dos dados, modelagem da função de demanda e simulação dos algoritmos de precificação. A pesquisa concentrou-se na aplicação de algoritmos da classe “Multi-Armed Bandits” (MAB) para otimizar a precificação dinâmica de estúdios em plataformas digitais de hospedagem, visando maximizar a receita em diferentes cenários de mercado.
Os dados utilizados foram obtidos do Inside Airbnb (2024), um repositório público e independente que compila informações sobre anúncios e calendários de disponibilidade da plataforma Airbnb. A coleta incidiu sobre estúdios localizados no Rio de Janeiro, abrangendo quatro extrações trimestrais realizadas entre junho de 2024 e março de 2025. Essa escolha temporal foi ditada pela política da plataforma de manter acesso gratuito apenas às extrações dos últimos 12 meses, em periodicidade trimestral.
A amostra foi selecionada intencionalmente para o Rio de Janeiro devido à concentração de estúdios em regiões turísticas e à conhecida sazonalidade da demanda, fatores que amplificam os desafios de precificação (Ye et al., 2018). Para garantir a homogeneidade estrutural e a comparabilidade dos resultados, aplicaram-se critérios rigorosos de filtragem. Foram incluídos apenas imóveis do tipo “unidade residencial inteira”, “loft inteiro” ou “condomínio inteiro”, com capacidade máxima de três pessoas e um quarto, excluindo-se aluguéis de longo prazo (máximo de 90 noites).
Adicionalmente, restringiu-se a amostra a anfitriões com status “Superhost”, assegurando um patamar mínimo de qualidade de serviço e regularidade de atividade. Cada imóvel selecionado precisava estar presente nas quatro extrações trimestrais, eliminando entradas intermitentes e viabilizando a comparação temporal direta. Após a filtragem, a base analítica compreendeu 571 estúdios, totalizando 2.284 observações em painel balanceado.
Na etapa de tratamento de dados, padronizaram-se os tipos de dados e converteram-se variáveis monetárias. Valores faltantes foram imputados pela mediana em 17 registros de notas de avaliação (0,74%) e dois registros de preço (0,09%). Valores extremos foram tratados por winsorização nos percentis 1 e 99, técnica que substitui observações atípicas pelos respectivos limites, preservando o tamanho amostral e reduzindo a influência de “outliers” (Wilcox, 2021).
Variáveis com distribuição assimétrica à direita, como preço, número de avaliações e avaliações por mês, foram submetidas a transformações logarítmicas (log(1 + x)) para aproximá-las de distribuições mais simétricas e reduzir a influência de valores extremos. As notas de avaliação foram reescaladas para a faixa de 0 a 100, com zeros convertidos em valores ausentes e um piso de 40 pontos aplicado para eliminar valores espúrios, sendo os dados faltantes imputados pela mediana.
A engenharia de atributos derivou variáveis de contexto competitivo, como a diferença relativa do preço do imóvel em relação à mediana de sua categoria de bairro e a ocupação média do bairro. A sazonalidade foi representada por quatro categorias: inverno (junho a agosto), primavera (setembro a novembro), verão (dezembro a fevereiro) e outono (março a maio). Os bairros originais foram agrupados em seis categorias, sendo cinco com maior representação na amostra (Copacabana, Ipanema, Leblon, Centro e Jacarepaguá) e uma categoria residual.
Para consolidar os indicadores de qualidade percebida, aplicou-se a Análise de Componentes Principais (PCA). Essa técnica visou reduzir a dimensionalidade e mitigar a multicolinearidade entre as notas de avaliação (nota geral, precisão, limpeza, check-in, comunicação e custo-benefício), transformando-as em um único componente principal, denominado índice de qualidade percebida. A nota de localização foi excluída por representar um atributo geográfico fixo, distinto dos demais indicadores de experiência.
A seleção das variáveis explicativas para a função de demanda baseou-se na correlação de Spearman com a variável-alvo, avaliação de multicolinearidade e critérios conceituais (Hollander et al., 2013). Variáveis redundantes ou sem significância estatística ao nível de 5% no modelo multivariado foram eliminadas. O conjunto final de preditores incluiu o logaritmo do preço da diária, a nota de localização, o logaritmo do número de avaliações, a ocupação média do bairro e indicadores binários para as estações do ano (outono, primavera e verão, com inverno como categoria de referência).
A função de demanda foi modelada por regressão linear ordinária (OLS), utilizando a taxa de ocupação trimestral como variável dependente (Wooldridge, 2020). A comparação entre modelos, que incluiu também um modelo linear misto (MixedLM) e alternativas não lineares como Random Forest e Gradient Boosting, utilizou o erro absoluto médio (MAE) sob validação cruzada agrupada (GroupKFold). Cada imóvel funcionou como um grupo, e suas quatro observações trimestrais permaneceram juntas no conjunto de treino ou de validação, evitando vazamento de informação (Hastie et al., 2009).
O modelo OLS foi selecionado como modelo final devido ao seu desempenho preditivo equivalente ao do modelo misto, mas com maior simplicidade interpretativa. Os notebooks Python utilizados na coleta, tratamento de dados, modelagem da função de demanda e simulação dos algoritmos MAB estão disponíveis em repositório público (Abreu, 2026), permitindo a reprodução integral das análises.
A estrutura de precificação dinâmica foi formalizada como um problema de “Multi-Armed Bandits” (MAB) (Auer et al., 2002). Cada “braço” correspondeu a uma faixa de preço da diária, e a recompensa associada a cada decisão foi a receita estimada, calculada como o produto do preço selecionado pela taxa de ocupação prevista pela função de demanda, considerando o vetor de contexto do imóvel. Dez braços foram testados, com preços variando de R$ 100 a R$ 1.000 em intervalos de R$ 100, cobrindo o intervalo entre o percentil 25 e o percentil 90 da distribuição amostral.
As simulações utilizaram 1.000 rodadas e 50 repetições estocásticas para cada cenário, com dez imóveis selecionados aleatoriamente como representantes do mercado. A cada rodada, o algoritmo selecionava um braço, observava a recompensa resultante acrescida de ruído estocástico gaussiano (σ = 0,08), simulando a incerteza inerente ao comportamento real da demanda (Qu, 2024), e atualizava sua política de seleção.
Três algoritmos MAB foram comparados: ε-Greedy, Upper Confidence Bound (UCB) e Thompson Sampling (TS). O algoritmo ε-Greedy selecionou, com probabilidade de 1 – ε, o braço com maior recompensa média estimada (explotação) e, com probabilidade ε, um braço aleatório (exploração), adotando-se ε = 0,10. O algoritmo UCB selecionou o braço que maximizou um índice composto pela média das recompensas observadas acrescida de um bônus de exploração, com o parâmetro de exploração c = 2,0 (Auer et al., 2002).
O “Thompson Sampling” (TS) adotou uma abordagem bayesiana, mantendo para cada braço uma distribuição a posteriori sobre a recompensa esperada. A cada rodada, amostrou-se um valor de cada distribuição e selecionou-se o braço com o maior valor amostrado. A implementação utilizou distribuições Normal-Gamma, que permitem atualização conjugada eficiente (Russo et al., 2018). As simulações foram realizadas em dois cenários: um estacionário (simulando 1.000 rodadas durante o verão) e um dinâmico multi-estação (replicando um ciclo sazonal completo com inverno, primavera, verão e outono, com mudança de contexto a cada 250 rodadas).
3. Resultados e Discussão
A presente investigação teve como objetivo central comparar o desempenho dos algoritmos Multi-Armed Bandits (MAB) ε-Greedy, Upper Confidence Bound (UCB) e Thompson Sampling (TS) na otimização da receita de estúdios de aluguel por temporada, em cenários estacionário e multi-estação. Os resultados obtidos revelaram dinâmicas distintas entre as estratégias, evidenciando a importância da adaptabilidade em mercados voláteis. A análise iniciou-se com a caracterização da base de dados, seguida pela modelagem da demanda e, por fim, pelas simulações dos algoritmos MAB, permitindo uma compreensão aprofundada dos mecanismos de precificação dinâmica.
A base analítica compreendeu 571 imóveis classificados como estúdio ou apartamento compacto, distribuídos por 32 bairros do Rio de Janeiro, totalizando 2.284 observações. A Zona Sul concentrou a maior parte das observações, com Copacabana respondendo por 43,2% da amostra, seguida por Ipanema (11,2%), Leblon (8,1%) e Centro (8,0%). Em termos de tipologia, as “rental units” predominaram com 82,0%, enquanto “loft” e “condo” representaram 10,2% e 7,8%, respectivamente. A capacidade de acomodação distribuiu-se de forma bimodal, com 64,1% dos imóveis para dois hóspedes e 35,6% para três.
A taxa de ocupação trimestral, variável-alvo do estudo, exibiu uma média de 34,6 dias (equivalente a 38,0% de ocupação), com mediana de 31 dias e desvio padrão de 23,7 dias. Aproximadamente 4,2% das observações registraram ocupação nula. A sazonalidade manifestou-se de forma pronunciada, com a ocupação média no verão atingindo 43,1 dias, superando o inverno em 53%, período em que a média caiu para 28,2 dias. Esse padrão reflete o perfil turístico consolidado da cidade do Rio de Janeiro, onde a demanda por hospedagem varia significativamente entre as estações do ano.
Os bairros de Botafogo e Flamengo emergiram como os mais demandados, com 46,7 e 45,7 dias de ocupação média, respectivamente, apesar de praticarem preços medianos moderados. Essa combinação sugere que os hóspedes percebem uma forte relação custo-benefício nessas localidades. A distribuição de preços revelou assimetria à direita, com média de R$ 415,91 e mediana de R$ 282,00. Os preços praticados no verão foram, em média, 3,1 vezes superiores aos do inverno, indicando a resposta do mercado à alta demanda sazonal.
Os indicadores de qualidade percebida, restritos a anfitriões “superhosts”, mantiveram-se consistentemente elevados, com médias superiores a 96 pontos e baixa dispersão. A nota de avaliação de custo-benefício, contudo, apresentou a maior variabilidade, com desvio padrão de 2,54, sugerindo ser o indicador mais sensível às diferenças reais de desempenho entre os imóveis. Essa heterogeneidade nas avaliações de custo-benefício aponta para a complexidade de se estabelecer um preço ótimo que satisfaça as expectativas dos hóspedes em relação ao valor percebido.
Consolidação de Indicadores e Seleção de Variáveis
A Análise de Componentes Principais (PCA) foi aplicada para reduzir a dimensionalidade e mitigar a multicolinearidade entre os tipos de notas de avaliação. Os testes de adequação amostral confirmaram a viabilidade da fatoração, com o índice Kaiser-Meyer-Olkin (KMO) atingindo 0,88, classificado como meritório, e o teste de esfericidade de Bartlett rejeitando a hipótese nula. A matriz de correlação de Pearson entre as seis notas de avaliação ilustrou a redundância, com correlações variando de 0,38 (limpeza e check-in) a 0,75 (nota geral e precisão), indicando um bloco coeso de indicadores de qualidade.
O primeiro componente principal capturou 64,7% da variância total das seis notas, com cargas fatoriais equilibradas, consolidando-o como uma referência consistente de qualidade percebida. Esse componente, denominado índice de qualidade percebida, foi invertido para que valores maiores representassem maior qualidade e foi incorporado à modelagem como variável de controle. A exclusão da nota de localização da PCA deveu-se ao seu caráter de atributo geográfico fixo, conceitualmente distinto dos indicadores de experiência do hóspede.
A seleção das variáveis explicativas para a função de demanda baseou-se na correlação de Spearman com a variável-alvo, avaliação de multicolinearidade e critérios conceituais. A correlação marginal entre preço e ocupação apresentou um sinal positivo agregado de +0,12, resultado aparentemente contraintuitivo. Essa anomalia refletiu a presença de uma variável de confusão, onde imóveis de melhor qualidade e localização praticam preços mais elevados e recebem maior demanda simultaneamente, mascarando o efeito real do preço.
Ao desagregar a correlação por período, o sinal inverteu-se em três das quatro extrações, revelando o padrão esperado pela teoria econômica, onde o aumento do preço leva à redução da demanda. O controle por qualidade no modelo multivariado tornou-se, portanto, essencial para isolar o efeito do preço. Variáveis redundantes, como a diferença relativa para a mediana do bairro, foram eliminadas devido à sua alta correlação com o logaritmo do preço da diária e ausência de significância no modelo multivariado.
O índice de qualidade percebida, embora relevante para controlar a confusão entre preço e qualidade, não alcançou significância estatística no modelo expandido com 11 preditores. Isso provavelmente ocorreu porque sua variação dentro de cada imóvel foi inferior a 10%, limitando sua capacidade explicativa em um modelo linear com dados em painel. O logaritmo do total de anúncios do anfitrião e a capacidade de hóspedes também foram eliminados por não atingirem significância estatística. O conjunto final de sete preditores foi encaminhado para a modelagem da demanda.
Modelagem da Função de Demanda
O modelo de regressão linear ordinária (OLS) foi adotado como modelo final para a função de demanda, pois seu desempenho preditivo igualava o do modelo linear misto, ambos com erro absoluto médio de 18,6 dias, mas oferecia maior simplicidade interpretativa. O modelo misto indicou que a variância entre imóveis era pequena face ao erro residual, não compensando a complexidade adicional de um modelo com intercepto aleatório por imóvel. O OLS modelou a taxa de ocupação trimestral como variável dependente.
Todos os sete preditores selecionados alcançaram significância estatística ao nível de 5%. O modelo apresentou um R² de 10,0%, consistente entre treino e validação cruzada agrupada por imóvel. Esse R² de 10% não representou uma fragilidade do modelo, mas sim o limite empírico observado com as variáveis disponíveis, refletindo a complexidade inerente ao mercado de hospitalidade, onde preferências subjetivas e fatores não mensuráveis desempenham um papel significativo na variação da ocupação.
O coeficiente do logaritmo do preço (β = -0,046) representou uma semielasticidade, indicando que um aumento de 1% no preço da diária associa-se a uma redução de aproximadamente 0,046 pontos percentuais na taxa de ocupação trimestral. A correlação positiva de +0,294 entre variações de preço e ocupação dentro do mesmo imóvel indicou endogeneidade preço-ocupação, sugerindo que o efeito causal do preço sobre a demanda é plausivelmente mais negativo do que o coeficiente indica. Essa endogeneidade reforçou a justificativa para o uso de algoritmos MAB, que exploram ativamente faixas de preço para isolar o efeito causal de forma mais rigorosa.
A comparação com modelos não lineares, como Random Forest e Gradient Boosting, confirmou a escolha do OLS. Embora Random Forest e Gradient Boosting tenham atingido R² mais altos na amostra (33,2% e 42,4%, respectivamente), eles apresentaram quedas significativas na validação (7,9% e 4,5%), indicando sobreajuste severo. O OLS, com seu R² estável em torno de 10%, demonstrou maior robustez e generalização para dados não vistos, sendo mais adequado para o ambiente de simulação.
As curvas de demanda estimadas mantiveram-se monotonicamente decrescentes nas quatro estações, confirmando a relação negativa esperada entre preço e ocupação. A receita estimada, produto do preço pela ocupação, cresceu monotonicamente no intervalo analisado de R$ 100 a R$ 1.000, sem ponto de máximo interno. Essa característica decorreu da baixa semielasticidade do preço, onde o ganho unitário por diária superou sistematicamente a perda marginal de ocupação. Em faixas de preço muito acima das praticadas, onde a demanda provavelmente acelera sua queda, a curva de receita presumivelmente apresentaria um ponto de máximo, mas o modelo não dispôs de observações nessas regiões devido à prática dos anfitriões de não testarem preços extremos.
Simulação dos Algoritmos MAB em Cenário Estacionário
No cenário estacionário, que simulou 1.000 rodadas durante o verão em 50 repetições, o algoritmo UCB obteve a maior receita acumulada média, alcançando R$ 40,3 mil. Ele foi seguido pelo ε-Greedy, com R$ 37,2 mil, e pelo Thompson Sampling (TS), que registrou R$ 35,3 mil. Esses resultados indicam que, em um ambiente de demanda estável e previsível, a estratégia de exploração mais focada do UCB, que minimiza o custo de exploração ao longo do tempo, tende a maximizar a receita acumulada.
A evolução temporal da receita acumulada evidenciou trajetórias distintas entre os algoritmos. O UCB separou-se dos demais já nas primeiras 100 rodadas, período em que o ε-Greedy e o Thompson Sampling ainda acumulavam um custo exploratório visível. Após a rodada 200, as inclinações das curvas estabilizaram-se e a ordenação entre os algoritmos não se alterou mais, indicando que as políticas de seleção já haviam convergido para o braço de preço mais lucrativo. Essa rápida convergência do UCB é uma de suas vantagens em cenários estacionários, conforme demonstrado por Auer et al. (2002).
Os três algoritmos convergiram para o braço de preço mais elevado (R$ 1.000), o que era esperado dada a curva de demanda estimada, que mostrou a receita crescendo monotonicamente com o preço no intervalo testado. Essa limitação impõe uma ressalva à análise, pois em cenários onde a elasticidade variasse mais e o preço ótimo não fosse simplesmente o mais alto, as diferenças de desempenho entre os algoritmos provavelmente apareceriam com mais clareza. No entanto, a abordagem MAB ainda se mostra valiosa pela sua capacidade de explorar empiricamente faixas de preço não testadas pelos anfitriões, sem depender de uma modelagem econométrica precisa (Qu, 2024).
A distribuição de braços selecionados tornou o contraste entre os algoritmos visível. O UCB, após testar cada braço uma vez, direcionou 94,4% das rodadas ao braço de R$ 1.000, mantendo uma exploração mínima. O ε-Greedy dedicou sistematicamente 10% das rodadas à exploração aleatória, distribuída de forma uniforme entre todos os braços, uma consequência mecânica do parâmetro ε = 0,10. O Thompson Sampling, por sua vez, manteve uma exploração ativa ao longo de todo o horizonte, concentrando 51,7% das seleções no braço preferido, mas também 28,1% no braço de R$ 800 e 12,1% no de R$ 650, refletindo a incerteza residual da distribuição a posteriori mesmo após 1.000 rodadas (Russo et al., 2018).
Essa exploração mais ampla do Thompson Sampling custou entre R$ 2 mil e R$ 3 mil por rodada em estado estacionário frente ao UCB. Esse custo, no entanto, precisa ser qualificado. Ao manter probabilidade não-nula sobre os braços de R$ 650 e R$ 800, o Thompson Sampling preservou flexibilidade para reagir a deslocamentos na função de receita. Em contraste, o UCB já tinha praticamente encerrado essa exploração por volta da rodada 100. A relevância dessa diferença é o que se examina no cenário dinâmico multi-estação, onde a variação sazonal é introduzida.
Simulação dos Algoritmos MAB em Cenário Multi-Estação
A simulação multi-estação replicou um ciclo sazonal completo, abrangendo inverno, primavera, verão e outono, com mudança de contexto a cada 250 rodadas. Nesse cenário dinâmico, o UCB manteve a receita absoluta mais alta, com R$ 29,7 mil, seguido pelo ε-Greedy (R$ 27,8 mil) e pelo Thompson Sampling (R$ 27,2 mil). No entanto, a diferença relativa entre os algoritmos reduziu-se em comparação ao cenário estacionário, indicando que a volatilidade sazonal impactou o desempenho de todas as estratégias.
A receita acumulada ao longo das quatro estações revelou uma dinâmica que as médias absolutas não captam. As curvas dos três algoritmos caminharam praticamente sobrepostas durante o inverno e a primavera, e a separação só se consolidou a partir do verão, quando a demanda mais alta ampliou a recompensa dos braços superiores. As faixas de incerteza, mais largas no Thompson Sampling e mais estreitas no UCB, refletiram o grau de exploração mantido por cada estratégia, com o TS demonstrando maior abertura para explorar alternativas em momentos de maior incerteza.
Os padrões de adaptação variaram por estação de modo revelador. O UCB convergiu rapidamente em todas elas, direcionando 79,2% das seleções ao braço de R$ 1.000 já no inverno e mantendo-se em torno de 84% nas estações posteriores. Esse comportamento uniforme expôs uma limitação do UCB: o algoritmo não respondeu às mudanças de contexto sazonal, aderindo à política aprendida no primeiro período. O ε-Greedy apresentou convergência mais lenta no inverno (47,1%), estabilizando-se em torno de 82% a partir do outono.
O Thompson Sampling exibiu um padrão radicalmente distinto, com a concentração no braço de R$ 1.000 crescendo progressivamente: 30% no inverno, 52% na primavera, 63% no verão e 66% no outono. Durante o inverno, 70% das seleções distribuíram-se entre braços intermediários (R$ 500 a R$ 800), refletindo maior incerteza sobre qual faixa maximizaria a receita em período de demanda inferior. Esse gradiente de exploração para explotação ilustrou o aprendizado bayesiano contínuo do Thompson Sampling: a cada nova observação, a distribuição a posteriori concentrou-se em torno do braço com maior recompensa sem abandonar completamente a exploração (Jain et al., 2024; Russo et al., 2018).
Discussão Integrada dos Achados
Os resultados obtidos confirmaram as contribuições centrais do estudo. A função de demanda capturou a estrutura de mercado esperada, com o preço exercendo um efeito negativo significativo sobre a ocupação, a sazonalidade como fator dominante e a visibilidade como principal determinante da ocupação. Os algoritmos MAB demonstraram capacidade de convergência para faixas de preço superiores baseando-se exclusivamente em dados de recompensa observados, prescindindo de conhecimento prévio da curva de demanda, o que é uma vantagem em mercados complexos e dinâmicos.
A endogeneidade preço-ocupação identificada, com uma correlação positiva de +0,294 entre variações de preço e ocupação dentro do mesmo imóvel, reforçou a justificativa para a aplicação dos algoritmos MAB. Ao explorar ativamente faixas de preço de forma quase experimental, o algoritmo isola o efeito causal de modo mais rigoroso do que estimadores observacionais puros. Contudo, Foroughifar e Mehta (2024) alertaram para desafios de implementação, como a necessidade de acesso a dados em tempo real e a disposição de absorver custos exploratórios.
A sazonalidade exerceu um impacto expressivo na receita. Ao transitar do cenário estacionário (verão) para o multi-estação, a receita declinou entre 23% e 26% para todos os algoritmos. O Thompson Sampling sofreu uma queda relativa menor (-23,1%) em comparação com o UCB (-26,4%). Esses números apontaram que a exploração contínua do Thompson Sampling, característica intrínseca da abordagem bayesiana, o torna mais robusto frente a mudanças de contexto, como a sazonalidade, permitindo-lhe adaptar-se sem exigir reinicialização ou ajuste manual.
Embora o UCB tenha conquistado a maior receita acumulada em ambos os cenários, sua superioridade comportou nuances. Em termos de receita absoluta, o UCB liderou, mas em adaptabilidade, o Thompson Sampling revelou uma vantagem relativa. A estabilidade do UCB, direcionando consistentemente mais de 79% das seleções ao braço preferido em todas as estações, decorreu de sua peculiaridade de não responder às mudanças de contexto, mantendo a política aprendida no inverno. Em contraste, o Thompson Sampling demonstrou adaptação gradual, redistribuindo seleções entre braços a cada estação, o que é crucial em mercados sujeitos a variações competitivas e choques exógenos.
Os “trade-offs” entre exploração e explotação diferenciaram os algoritmos de forma notável. O UCB concentrou 94,4% das seleções no braço preferido no cenário estacionário, minimizando a exploração. O ε-Greedy dedicou 10% das rodadas à exploração aleatória indiscriminada. O Thompson Sampling dirigiu 48,3% das seleções para fora do braço preferido, distribuindo-as proporcionalmente à incerteza residual da distribuição a posteriori. O custo dessa exploração adicional foi de aproximadamente 14% da receita no cenário estacionário e de 9% no dinâmico. A redução dessa diferença com a mudança de contexto indicou que a exploração do Thompson Sampling adquire valor parcial quando o ambiente não permanece estável, justificando seu custo incremental como prêmio de adaptabilidade.
Em síntese, os algoritmos Multi-Armed Bandits demonstraram ser eficazes na precificação dinâmica de estúdios por temporada, mesmo com a limitação de uma curva de receita monotonicamente crescente no intervalo analisado. O UCB destacou-se em cenários estacionários pela sua eficiência em explorar e convergir rapidamente para o braço ótimo. No entanto, em ambientes dinâmicos e sazonais, a adaptabilidade bayesiana do Thompson Sampling, que permite uma exploração contínua e ajustada à incerteza, mostrou-se mais robusta, compensando seu custo de exploração moderado e tornando-o uma estratégia mais resiliente a mudanças de contexto.
4. Conclusão
O presente estudo investigou a aplicação de algoritmos Multi-Armed Bandits (MAB) na precificação dinâmica de estúdios em plataformas digitais de hospedagem, comparando as estratégias ɛ-Greedy, Upper Confidence Bound (UCB) e Thompson Sampling (TS) em cenários estacionário e multi-estação. Verificou-se que a função de demanda, modelada por regressão linear ordinária com sete preditores significativos, capturou a estrutura de mercado esperada, com o preço exercendo um efeito negativo sobre a ocupação e a sazonalidade como fator dominante. A endogeneidade preço-ocupação identificada reforçou a justificativa para a aplicação dos algoritmos MAB, que exploram ativamente faixas de preço para isolar o efeito causal de forma mais rigorosa. Nas simulações, o UCB maximizou a receita acumulada no cenário estacionário, convergindo rapidamente para o braço de preço mais elevado. Contudo, no cenário dinâmico multi-estação, o Thompson Sampling demonstrou maior adaptabilidade à volatilidade sazonal, apresentando uma queda relativa de receita menor em comparação com o UCB, que manteve a política aprendida no período inicial sem responder às mudanças de contexto. Essa exploração contínua e ajustada à incerteza, característica da abordagem bayesiana do Thompson Sampling, revelou-se mais robusta em ambientes sujeitos a variações.
A principal contribuição do estudo reside na demonstração da eficácia dos algoritmos MAB para a otimização de receita em mercados de aluguel por temporada, especialmente a resiliência do Thompson Sampling em contextos voláteis e sazonais, oferecendo uma alternativa adaptativa à precificação estática. Observou-se, contudo, que a natureza observacional dos dados limitou a captura do comportamento de preço em faixas extremas e a interpretação causal dos coeficientes da regressão. A simplificação da função de demanda para um modelo linear e a ausência de simulação de choques exógenos de oferta também constituíram limitações. Para pesquisas futuras, sugere-se a incorporação de dados contextuais em tempo real, como preços concorrentes e eventos, para viabilizar bandits contextuais. Recomenda-se também a investigação de algoritmos com mecanismos de desconto exponencial ou janelas deslizantes, além da validação empírica dos ganhos simulados por meio de experimentos controlados com anfitriões reais.
Referências Bibliográficas
Abrate, G.; Sainaghi, R.; Mauri, A.G. 2022. Dynamic pricing in Airbnb: individual versus professional hosts. Journal of Business Research 141: 191-199.
Abreu, K.R. 2026. Precificação dinâmica de estúdios por temporada com algoritmos multi-armed bandits: notebooks de análise. Disponível em: https://github.com/kleberAbreu/tcc-precificacao-dinamica-mab. Acesso em: 21 abr. 2026.
Auer, P.; Cesa-Bianchi, N.; Fischer, P. 2002. Finite-time analysis of the multi-armed bandit problem. Machine Learning 47(2-3): 235-256.
Foroughifar, M.; Mehta, N. 2024. The challenges of deploying an algorithmic pricing tool: evidence from Airbnb. Working Paper, Rotman School of Management, University of Toronto, Toronto, Canada.
Hastie, T.; Tibshirani, R.; Friedman, J. 2009. The Elements of Statistical Learning: Data Mining, Inference, and Prediction. 2ed. Springer, New York, NY, USA.
Hollander, M.; Wolfe, D.A.; Chicken, E. 2013. Nonparametric Statistical Methods. 3ed. John Wiley & Sons, Hoboken, NJ, USA.
Inside Airbnb [Inside Airbnb]. 2024. Get the data. Disponível em: http://insideairbnb.com/get-the-data.html. Acesso em: 15 jun. 2025.
Jain, L.; Li, Z.; Loghmani, E.; Mason, B.; Yoganarasimhan, H. 2024. Effective adaptive exploration of prices and promotions in choice-based demand models. Marketing Science 43(5): 1002-1030.
Neubert, M. 2022. A systematic literature review of dynamic pricing strategies. International Business Research 15(4): 1-17.
Qu, J. 2024. Survey of dynamic pricing based on multi-armed bandit algorithms. Applied and Computational Engineering 37: 160-165.
Russo, D.; Van Roy, B.; Kazerouni, A.; Osband, I.; Wen, Z. 2018. A tutorial on Thompson sampling. Foundations and Trends in Machine Learning 11(1): 1-96.
Talón-Ballestero, P.; Nieto-García, M.; González-Serrano, L. 2022. The wheel of dynamic pricing: towards open pricing and one to one pricing in hotel revenue management. International Journal of Hospitality Management, 102: 103184. https://doi.org/10.1016/j.ijhm.2022.103184.
Wilcox, R.R. 2021. Introduction to Robust Estimation and Hypothesis Testing. 5ed. Elsevier, Amsterdam, Netherlands.
Wooldridge, J.M. 2020. Introductory Econometrics: a Modern Approach. 7ed. Cengage Learning, Boston, MA, USA.
Ye, P.; Qian, J.; Chen, J.; Wu, C.; Zhou, Y.; De Mars, S.; Yang, F.; Zhang, L. 2018. Customized regression model for Airbnb dynamic pricing. p. 932-940. In: Proceedings of the 24th ACM SIGKDD Conference on Knowledge Discovery and Data Mining. ACM, London, UK.
Artigo oriundo de Trabalho de Conclusão de Curso da Especialização em Data Science e Analytics do MBA USP/Esalq
Para saber mais sobre o curso, clique aqui e acesse a plataforma MBX Academy