09 de octubre de 2026
Previsão de vendas por produto e cliente com modelos da família ARIMA
Previsão de Vendas por Produto e Cliente com Modelos da Família Arima
Marcelo Guadagnini Buzato Villaron Xavier; Jacques Henrique Dias
DOI: 10.22167/2675-6528-202603238
Artigo derivado de Trabalho de Conclusão de Curso (TCC), com conteúdo baseado no trabalho original do aluno e adaptado ao formato editorial da Revista E&S com apoio da ferramenta ResumeAI, solução de inteligência artificial desenvolvida pelo Instituto Pecege para síntese e organização textual.
Resumo
O planejamento de vendas e estoques mostrou-se relevante para a tomada de decisão empresarial. O trabalho teve como objetivo desenvolver um modelo de previsão de vendas por produto, cliente e loja para os 12 meses subsequentes, utilizando dados históricos mensais. A metodologia baseou-se na aplicação de modelos da família ARIMA a 5.669 registros de vendas, abrangendo 745 combinações únicas de produto, cliente e loja, de janeiro de 2021 a dezembro de 2024. Realizou-se análise exploratória da série agregada, decomposição sazonal, testes de estacionariedade, análise de autocorrelação e identificação de modelos candidatos. A seleção dos modelos foi apoiada por procedimento stepwise e comparação walk-forward com estimador uniforme (SARIMAX). Os resultados indicaram que o modelo SARIMA(1,1,0)(1,0,0,12) apresentou desempenho superior ao ARIMA(1,1,1), com um MAPE de 13,51% e melhor aderência ao comportamento sazonal. Na aplicação granular, 122 séries receberam SARIMA, 247 receberam ARIMA e 376 utilizaram média histórica. Concluiu-se que a incorporação da componente sazonal fortaleceu a consistência metodológica e a utilidade prática do modelo para a previsão de vendas.
Palavras-chave: planejamento de estoques; SARIMA; sazonalidade; séries temporais.
1. Introdução
A previsão de vendas constitui uma atividade central na gestão empresarial, influenciando diretamente decisões estratégicas e operacionais. Ela é fundamental para o planejamento comercial, a reposição de estoques, a programação de compras e o monitoramento do desempenho do negócio. Em mercados dinâmicos e altamente competitivos, a capacidade de antecipar volumes futuros de vendas, com base em dados históricos, é crucial para mitigar incertezas e aprimorar a qualidade das escolhas gerenciais (Lewis, 1982).
Tradicionalmente, muitas decisões de previsão são baseadas em julgamentos gerenciais ou em projeções simplificadas. Embora essas abordagens possam ter utilidade em certos cenários, elas frequentemente apresentam limitações significativas quando não são complementadas por métodos quantitativos que exploram a estrutura temporal dos dados. Nesse contexto, a aplicação de técnicas de ciência de dados, especificamente voltadas à modelagem de séries temporais, oferece uma alternativa mais robusta, objetiva e replicável para o suporte ao processo de previsão (Hyndman e Athanasopoulos, 2021).
Entre os métodos quantitativos disponíveis para séries temporais, os modelos da família ARIMA (Autoregressive Integrated Moving Average) destacam-se pela sua capacidade de capturar dependências temporais e tendências. Para séries que exibem padrões recorrentes ao longo do tempo, a extensão SARIMA (Seasonal Autoregressive Integrated Moving Average) é particularmente adequada, pois incorpora componentes sazonais autorregressivos, de diferenciação e de médias móveis, permitindo uma representação mais precisa de comportamentos periódicos (Box e Jenkins, 1976; Brockwell e Davis, 2016).
A consideração da sazonalidade é de suma importância na previsão de vendas, visto que variações recorrentes mensais podem estar ligadas a fatores como calendários comerciais, hábitos de compra dos clientes e sazonalidade setorial. A negligência desse componente pode comprometer a aderência do modelo e, consequentemente, reduzir a qualidade preditiva das projeções. A utilização conjunta de modelos ARIMA e SARIMA, pertencentes à mesma família metodológica, possibilita tratar de forma coerente séries com e sem sazonalidade evidente.
Diante da necessidade de aprimorar a precisão das previsões de vendas e da relevância da sazonalidade nos dados, este trabalho justifica-se pela busca por uma abordagem metodológica que integre a capacidade de modelar padrões temporais e sazonais. O objetivo deste trabalho foi desenvolver um modelo de previsão de vendas para os 12 meses subsequentes ao período histórico analisado, no nível de produto, cliente e loja, utilizando modelos da família ARIMA.
2. Material e Métodos
A pesquisa caracterizou-se como um estudo de natureza quantitativa, com abordagem metodológica baseada na modelagem de séries temporais. O objetivo central foi desenvolver um modelo de previsão de vendas para os 12 meses subsequentes, no nível de produto, cliente e loja. Para tanto, aplicaram-se modelos da família ARIMA, seguindo os princípios da metodologia Box-Jenkins (Box e Jenkins, 1976), adaptados ao contexto de previsão de vendas.
A análise foi conduzida com base em dados históricos mensais de vendas, abrangendo o período de janeiro de 2021 a dezembro de 2024, totalizando 48 meses de observação. A base de dados utilizada continha 5.669 registros, que representavam 745 combinações únicas de produto, cliente e loja. O produto comercializado consistia em tintas empregadas no processo de estamparia têxtil, em um contexto de vendas business-to-business.
Na etapa de preparação dos dados, a variável de data foi convertida para o formato datetime. Uma chave identificadora única foi criada pela concatenação de produto, cliente e loja. A série agregada de vendas, obtida pelo somatório mensal das quantidades vendidas, serviu como base para a análise exploratória inicial.
A estratégia metodológica iniciou-se com a análise da série agregada para identificação de sua estrutura temporal. Realizou-se a decomposição clássica aditiva da série, com período sazonal de 12 meses, procedimento adequado para séries com oscilações sazonais de amplitude constante. Este passo visou identificar padrões sazonais recorrentes.
Após a análise exploratória, aplicaram-se testes de estacionariedade à série agregada. Utilizaram-se os testes Augmented Dickey-Fuller (ADF) e Kwiatkowski-Phillips-Schmidt-Shin (KPSS), complementares em suas hipóteses nulas (Dickey e Fuller, 1979; Kwiatkowski et al., 1992). Os testes foram aplicados à série em nível e às suas versões diferenciadas para orientar a escolha da ordem de diferenciação.
Para apoiar a identificação das ordens autorregressiva e de médias móveis dos modelos, analisaram-se as funções de autocorrelação (ACF) e autocorrelação parcial (PACF) da série agregada, após as diferenciações necessárias para alcançar a estacionariedade. As bandas de confiança de 95% foram consideradas.
A seleção dos modelos candidatos foi realizada em duas etapas. Na primeira, empregou-se o procedimento “stepwise”, baseado no algoritmo de Hyndman e Khandakar (2008) e implementado pela biblioteca pmdarima, para propor combinações plausíveis de parâmetros. Na segunda etapa, os modelos sugeridos foram comparados com especificações adicionais definidas de forma dirigida, todos estimados com o estimador SARIMAX para garantir comparabilidade.
A validação dos modelos foi conduzida por meio da técnica “walk-forward” na série agregada. Reservaram-se os últimos 12 meses da amostra como janela de teste. Em cada iteração, o modelo foi reestimado com base nos dados disponíveis e gerou-se uma previsão de um passo à frente. Como métricas de desempenho preditivo, calcularam-se RMSE, MAE, MAPE, sMAPE e bias percentual (Hyndman e Athanasopoulos, 2021).
Após a seleção do modelo final, procedeu-se ao diagnóstico dos resíduos. Para isso, aplicaram-se o teste de Ljung e Box (1978) para autocorrelação residual e o teste de Shapiro e Wilk (1965) para normalidade. Complementarmente, realizou-se uma análise gráfica dos resíduos, incluindo série temporal, histograma com curva normal ajustada e gráfico Quantil-Quantil (Q-Q).
A estratégia de aplicação granular aos dados individuais, no nível de produto, cliente e loja, adotou critérios específicos baseados na faixa de histórico disponível. Para séries com menos de 12 meses de histórico, utilizou-se a média histórica. Para aquelas com histórico entre 12 e 23 meses, aplicou-se o modelo ARIMA(1,1,1). Já as séries com 24 meses ou mais de histórico foram modeladas com SARIMA(1,1,0)(1,0,0,12).
Todas as etapas de processamento e modelagem foram implementadas em linguagem Python, utilizando bibliotecas como pandas, numpy, matplotlib, statsmodels, scipy, tqdm e pmdarima. Com base nos modelos selecionados e aplicados, geraram-se previsões mensais para os 12 meses subsequentes ao período histórico, acompanhadas de intervalos de confiança de 95%.
3. Resultados e Discussão
A análise inicial da série agregada de vendas revelou um comportamento temporal que não se caracterizava por aleatoriedade pura, mas sim por padrões estruturados. A decomposição clássica aditiva, aplicada com um período sazonal de doze meses, evidenciou a presença simultânea de uma tendência subjacente e de uma clara sazonalidade anual. Essa sazonalidade manifestava-se por meio de repetições de padrões em determinados meses do ano, indicando a necessidade de uma abordagem de modelagem que considerasse explicitamente esses componentes temporais para uma previsão mais precisa.
Após a identificação da sazonalidade, procedeu-se à avaliação da estacionariedade da série agregada por meio dos testes Augmented Dickey-Fuller (ADF) e Kwiatkowski-Phillips-Schmidt-Shin (KPSS). Os resultados indicaram que a série original, em nível, apresentou um p-valor de 0,0005 no teste ADF, sugerindo estacionariedade. Contudo, o teste KPSS para a série original, com p-valor de 0,0933, também apontou para a estacionariedade. Após a primeira diferenciação, o teste ADF obteve um p-valor de 0,0030, enquanto o KPSS resultou em 0,0417, indicando não estacionariedade. Essa análise conjunta, complementada pela inspeção gráfica, foi crucial para determinar a ordem de diferenciação necessária para estabilizar a série e permitir a aplicação dos modelos ARIMA e SARIMA.
Para auxiliar na identificação das ordens autorregressivas e de médias móveis, foram analisadas as funções de autocorrelação (ACF) e autocorrelação parcial (PACF) da série agregada após a diferenciação. A estrutura dessas funções forneceu insights sobre a persistência dos valores da série ao longo do tempo e a influência de observações passadas. Essa etapa foi fundamental para propor modelos candidatos que pudessem capturar as dependências temporais e sazonais, orientando a escolha dos parâmetros (p, d, q) e (P, D, Q, s) dos modelos da família ARIMA, conforme os princípios de Box e Jenkins (1976).
A seleção dos modelos candidatos foi realizada em duas etapas complementares. Inicialmente, utilizou-se um procedimento “stepwise” para explorar o espaço de busca e sugerir combinações plausíveis de parâmetros não sazonais e sazonais. Este procedimento indicou o modelo SARIMA(1,1,0)(1,0,0,12) como uma especificação promissora. Posteriormente, os modelos sugeridos foram comparados com outras especificações definidas de forma dirigida, utilizando o estimador uniforme SARIMAX para garantir a comparabilidade dos critérios de informação entre as diferentes estruturas, tanto sazonais quanto não sazonais.
A comparação entre os modelos candidatos da família ARIMA na série agregada, avaliada por métricas como RMSE, MAPE, SMAPE e Bias percentual, demonstrou a superioridade do modelo SARIMA(1,1,0)(1,0,0,12). Este modelo obteve um MAPE de 13,51%, significativamente menor que o MAPE de 15,26% do modelo ARIMA(1,1,1). Os critérios de informação AIC e BIC também favoreceram o SARIMA em comparação com o ARIMA não sazonal, embora esses critérios tenham sido interpretados com cautela devido às diferentes ordens de diferenciação sazonal, que alteram a amostra efetiva utilizada na estimação (Akaike, 1974; Schwarz, 1978).
O argumento central para a escolha do SARIMA foi a sua capacidade de capturar a sazonalidade, o que se refletiu em uma aderência superior aos valores reais durante a validação “walk-forward”. Enquanto o ARIMA(1,1,1) apresentava dificuldades em replicar os picos e vales recorrentes, o SARIMA(1,1,0)(1,0,0,12) demonstrou uma capacidade preditiva mais robusta, especialmente nos meses com maior amplitude de variação. Essa observação é crucial, pois a negligência da componente sazonal pode levar a previsões imprecisas e, consequentemente, a decisões gerenciais subótimas (Hyndman e Athanasopoulos, 2021).
Os coeficientes estimados para o modelo SARIMA(1,1,0)(1,0,0,12) foram estatisticamente significativos ao nível de 5%. O coeficiente AR(1), com valor de -0,4792, apresentou um sinal negativo, indicando um comportamento oscilatório nas diferenças da série. Por sua vez, o coeficiente SAR(1), estimado em 0,2608, confirmou uma correlação positiva entre os volumes de vendas do mesmo mês em anos consecutivos. Essa correlação é consistente com o padrão sazonal identificado na análise exploratória e reforça a adequação do modelo para representar a estrutura temporal dos dados, conforme a literatura de séries temporais (Box e Jenkins, 1976).
A validação “walk-forward” confirmou o desempenho superior do modelo SARIMA selecionado. As métricas de desempenho revelaram um RMSE de 1.510,57 unidades e um MAE de 1.139,15 unidades. O MAPE de 13,51% classificou o modelo na faixa de boa precisão, de acordo com Lewis (1982), e esteve dentro do intervalo de 15% a 25% reportado para séries mensais de demanda na competição M4 (Makridakis et al., 2020). A proximidade entre o MAPE e o sMAPE (12,72%) sugeriu a ausência de distorções extremas nas previsões, enquanto o bias de 5,01% indicou uma leve tendência à superestimação, considerada moderada e aceitável para fins de planejamento de abastecimento.
Esse resultado é coerente com a literatura de séries temporais, que aponta que a inclusão explícita da componente sazonal tende a melhorar o desempenho preditivo quando a série apresenta recorrência anual bem definida. Em problemas de previsão de demanda mensal, modelos sazonais da família ARIMA geralmente oferecem melhor aderência ao comportamento observado dos dados do que especificações exclusivamente não sazonais, especialmente quando há repetição de picos e vales em intervalos regulares. A superioridade do SARIMA neste estudo não representa apenas um ganho numérico, mas reflete uma especificação estatística mais compatível com a estrutura temporal da série analisada.
O diagnóstico dos resíduos do modelo SARIMA selecionado indicou uma adequação estatística satisfatória. O teste de Ljung-Box (Ljung e Box, 1978) não apresentou evidência de autocorrelação residual, com p-valores de 0,2926 para lag 6 e 0,3227 para lag 12. Adicionalmente, o teste de Shapiro-Wilk (Shapiro e Wilk, 1965) para normalidade dos resíduos resultou em um p-valor de 0,1240, não permitindo rejeitar a hipótese de normalidade ao nível de 5%. Esses resultados, em conjunto com a análise gráfica dos resíduos, que mostrou valores oscilando em torno de zero e dentro dos limites de ±2σ, sem padrão temporal visível, e uma distribuição aproximadamente simétrica e unimodal, confirmaram que os pressupostos do modelo foram atendidos, validando a confiabilidade das previsões geradas.
Após a definição do modelo principal na série agregada, a estratégia foi estendida para a aplicação granular, no nível de produto, cliente e loja. A metodologia adaptou-se às características de cada série individual, com base na extensão do histórico disponível. Séries com menos de doze meses de histórico foram tratadas com média histórica, enquanto aquelas com histórico entre doze e vinte e três meses receberam modelagem ARIMA(1,1,1). As séries com vinte e quatro meses ou mais de histórico foram elegíveis para o modelo SARIMA(1,1,0)(1,0,0,12), permitindo compatibilizar rigor metodológico com viabilidade prática.
Do total de 745 séries individuais analisadas, a maioria, 376 séries (50,5%), foi tratada por média histórica devido ao histórico insuficiente. Um número significativo de 247 séries (33,2%) recebeu modelagem ARIMA(1,1,1), e 122 séries (16,4%) foram modeladas com SARIMA(1,1,0)(1,0,0,12). Essa distribuição reflete a heterogeneidade dos dados em nível granular e a estratégia adaptativa adotada para garantir a aplicação do método mais adequado a cada contexto, maximizando a precisão onde o histórico permitia modelos mais sofisticados e mantendo a consistência metodológica.
A consolidação das previsões individuais resultou em uma projeção mensal para os doze meses subsequentes ao período histórico. A incorporação do SARIMA na modelagem das séries elegíveis permitiu que a previsão consolidada refletisse de forma mais precisa a alternância entre meses de maior e menor volume, aproximando-se da lógica real do negócio. A curva de previsão reproduziu o padrão sazonal identificado na análise exploratória, com oscilações mensais recorrentes que refletem a estrutura temporal da demanda observada historicamente. A amplitude do intervalo de confiança de 95% se ampliou ao longo do horizonte de previsão, o que é um comportamento esperado em modelos de séries temporais e indica corretamente o aumento da incerteza à medida que o horizonte se estende.
Do ponto de vista da utilidade econômica, a previsão consolidada oferece subsídios concretos para decisões operacionais e comerciais da empresa. A projeção mensal por produto, cliente e loja, com sua granularidade, permite antecipar volumes de demanda para orientar o planejamento de compras, a programação de reposição de estoques e o acompanhamento do desempenho comercial ao longo do ano. A identificação de meses com volumes projetados superiores ou inferiores à média histórica possibilita ajustar antecipadamente os níveis de estoque, reduzindo o risco tanto de rupturas quanto de excesso de mercadoria. Em termos estratégicos, a abordagem proposta transforma dados históricos em um instrumento de planejamento quantitativo, reduzindo a dependência de julgamentos subjetivos e fornecendo uma referência objetiva para decisões de abastecimento, compras e acompanhamento orçamentário.
Em síntese, os resultados da pesquisa demonstraram que a série agregada de vendas exibe um comportamento sazonal relevante, o que justificou a escolha e o desempenho superior do modelo SARIMA(1,1,0)(1,0,0,12) em comparação com o ARIMA(1,1,1). A validação por “walk-forward” e o diagnóstico dos resíduos confirmaram a adequação estatística do modelo, que obteve um MAPE de 13,51%, indicando boa precisão preditiva. A aplicação granular, adaptada ao histórico de cada série, permitiu gerar previsões detalhadas que refletem a sazonalidade e oferecem um suporte objetivo e prático para o planejamento de vendas, estoques e compras, alinhando-se ao objetivo de desenvolver um modelo de previsão robusto e útil para a tomada de decisão empresarial.
4. Conclusão
O estudo visou desenvolver um modelo de previsão de vendas para os 12 meses subsequentes, desagregado por produto, cliente e loja, empregando modelos da família ARIMA. Verificou-se que a série agregada de vendas exibia um comportamento sazonal relevante, com padrões anuais recorrentes. A análise comparativa demonstrou que o modelo SARIMA(1,1,0)(1,0,0,12) apresentou desempenho superior ao ARIMA(1,1,1) na série agregada, com um MAPE de 13,51%, indicando boa precisão preditiva. A capacidade do SARIMA de capturar a sazonalidade foi crucial para sua aderência aos valores reais, conforme confirmado pela validação walk-forward e pelo diagnóstico dos resíduos, que atestou a adequação estatística do modelo. Na aplicação granular, a metodologia foi adaptada ao histórico disponível de cada uma das 745 séries individuais, com 122 séries recebendo modelagem SARIMA, 247 utilizando ARIMA e 376 sendo tratadas por média histórica. A principal contribuição deste trabalho reside na oferta de um instrumento de planejamento quantitativo que transforma dados históricos em projeções detalhadas, fornecendo subsídios objetivos para decisões operacionais e comerciais, como planejamento de compras, reposição de estoques e acompanhamento orçamentário, ao reduzir a dependência de julgamentos subjetivos.
Uma limitação identificada foi a elevada proporção de séries individuais com histórico insuficiente, o que restringiu a aplicação de modelos sazonais mais sofisticados a uma parcela menor das combinações de produto, cliente e loja. Contudo, a estratégia adaptativa adotada permitiu gerenciar essa restrição de forma consistente. Para estudos futuros, recomenda-se a atualização periódica dos modelos com a incorporação de novas observações, a ampliação do histórico de dados para permitir a aplicação do SARIMA a um maior número de séries granulares e a investigação de extensões do modelo com a inclusão de variáveis exógenas que possam influenciar as vendas.
Referências Bibliográficas
Akaike, H. 1974. A new look at the statistical model identification. IEEE Transactions on Automatic Control 19(6): 716-723.
Box, G.E.P.; Jenkins, G.M. 1976. Time Series Analysis: Forecasting and control. Holden-Day, San Francisco, CA, EUA.
Brockwell, P.J.; Davis, R.A. 2016. Introduction to Time Series and Forecasting. 3ed. Springer, New York, NY, EUA.
Dickey, D.A.; Fuller, W.A. 1979. Distribution of the estimators for autoregressive time series with a unit root. Journal of the American Statistical Association 74(366): 427-431.
Hyndman, R.J.; Athanasopoulos, G. 2021. Forecasting: Principles and practice. 3ed. OTexts, Melbourne, Austrália. Disponível em: <https://otexts.com/fpp3>. Acesso em: mar. 2025.
Hyndman, R.J.; Khandakar, Y. 2008. Automatic time series forecasting: the forecast package for R. Journal of Statistical Software 27(3): 1-22.
Kwiatkowski, D.; Phillips, P.C.B.; Schmidt, P.; Shin, Y. 1992. Testing the null hypothesis of stationarity against the alternative of a unit root. Journal of Econometrics 54(1-3): 159-178.
Lewis, C.D. 1982. Industrial and Business Forecasting Methods. Butterworths, London, Reino Unido.
Ljung, G.M.; Box, G.E.P. 1978. On a measure of lack of fit in time series models. Biometrika 65(2): 297-303.
Makridakis, S.; Spiliotis, E.; Assimakopoulos, V. 2020. The M4 competition: 100,000 time series and 61 forecasting methods. International Journal of Forecasting 36(1): 54-74.
Schwarz, G. 1978. Estimating the dimension of a model. The Annals of Statistics 6(2): 461-464.
Shapiro, S.S.; Wilk, M.B. 1965. An analysis of variance test for normality (complete samples). Biometrika 52(3-4): 591-611.
Artigo oriundo de Trabalho de Conclusão de Curso da Especialização em Data Science e Analytics do MBA USP/Esalq
Para saber mais sobre o curso, clique aqui e acesse a plataforma MBX Academy