09 de outubro de 2026
Uso de Web Scraping e Data Science para Otimização da Manutenção Metroferroviária
Uso de Web Scraping e Data Science para Otimização da Manutenção Metroferroviária
Lucas Duarte de Souza; Felipe Pinto da Silva
DOI: 10.22167/2675-6528-202603177
Artigo derivado de Trabalho de Conclusão de Curso (TCC), com conteúdo baseado no trabalho original do aluno e adaptado ao formato editorial da Revista E&S com apoio da ferramenta ResumeAI, solução de inteligência artificial desenvolvida pelo Instituto Pecege para síntese e organização textual.
Resumo
A manutenção metroferroviária gera um volume significativo de registros operacionais que, frequentemente, permanecem subutilizados para análises preditivas. O objetivo principal deste estudo foi automatizar a coleta de dados e comparar o desempenho de modelos preditivos para estimar o volume semanal de falhas no Sistema de Controle de Rotas (CBI) do Metrô de São Paulo. Implementou-se uma infraestrutura computacional virtualizada (Proxmox e LXC) com uma aplicação Python/Flask para web scraping contínuo de dados do sistema SAP, armazenados em um banco MySQL. Processaram-se 3.181 registros de falhas entre 2021 e 2024. A Validação Cruzada em Janelas Deslizantes foi aplicada para avaliar o método Holt-Winters e o algoritmo Facebook Prophet, após a agregação semanal dos dados para estabilizar a série temporal, dada a alta volatilidade diária. Os resultados indicaram que o modelo Holt-Winters apresentou o melhor ajuste preditivo, com um Erro Médio Absoluto (MAE) de 5,63, sendo aproximadamente 30% mais preciso que o Prophet (MAE = 8,08) no contexto específico. Projetou-se um aumento de aproximadamente 10 para 18 falhas semanais no próximo ciclo. Concluiu-se que a integração de um pipeline automatizado de dados com o modelo Holt-Winters oferece uma ferramenta robusta para projetar o comportamento de falhas do sistema CBI, permitindo a transição para uma manutenção preditiva que otimiza a alocação de recursos e eleva a confiabilidade operacional.
Palavras-chave: Automação de Processos; Holt-Winters; Predição de Falhas; Séries Temporais; Sinalização.
1. Introdução
O Metrô de São Paulo constitui um elemento vital na infraestrutura de mobilidade urbana da maior metrópole do país, sendo responsável pelo transporte de aproximadamente três milhões e setecentas mil pessoas diariamente em dias úteis (COMPANHIA DO METROPOLITANO DE SÃO PAULO, [202-?]). A garantia da eficiência operacional, da disponibilidade contínua e da segurança dos usuários depende, intrinsecamente, de uma gestão de manutenção altamente eficaz. Este ecossistema tecnológico complexo abrange milhares de equipamentos interdependentes, incluindo sistemas de energia, telecomunicações e, de forma crucial, a sinalização ferroviária.
Com o avanço da Indústria 4.0 e a crescente digitalização dos equipamentos metroferroviários, o paradigma da manutenção transformou-se. Ela deixou de ser percebida meramente como um centro de custo focado em reparos corretivos para se tornar uma área estratégica, capaz de gerar inteligência preditiva e otimizar a disponibilidade dos ativos por meio da análise de grandes volumes de dados históricos, conhecidos como Big Data (Lee, Kao e Yang, 2014). Pesquisas recentes têm demonstrado o desenvolvimento de frameworks de Machine Learning explicáveis que utilizam fluxos de dados em tempo real para aumentar a confiabilidade em operadores metroferroviários (Abreu et al., 2024), e como técnicas de mineração de dados permitem a priorização estratégica do planejamento da manutenção, superando as limitações dos cronogramas preventivos fixos (Obal, Bellinello e Petrovic, 2025).
Apesar do volume significativo de dados sobre falhas e intervenções gerado e registrado em sistemas internos, esses registros frequentemente permanecem subutilizados ou restritos a funções descritivas, não explorando a totalidade das informações para a antecipação de falhas recorrentes. Essa lacuna entre a coleta e a análise efetiva é particularmente crítica em ativos de alta complexidade, como o Sistema de Controle de Rotas (CBI), que exige uma abordagem mais proativa para garantir a continuidade dos serviços e a segurança.
A relevância deste trabalho reside na sua capacidade de transformar dados brutos em inteligência preditiva, permitindo a projeção antecipada de curvas de degradação e a identificação de padrões sazonais de estresse no sistema. A eficácia da análise sistemática de registros históricos para esse fim é fortemente corroborada na literatura, onde métodos estatísticos permitem estimar com precisão o volume futuro de ocorrências (Hyndman; Athanasopoulos, 2021), e o uso da mineração de dados viabiliza a priorização estratégica de ações de manutenção preventiva nos períodos de maior criticidade (Obal, Bellinello e Petrovic, 2025). Aplicada ao contexto metroferroviário, como evidenciado por Abreu et al. (2024), essa abordagem proativa otimiza a alocação de recursos e equipes, traduzindo-se diretamente em redução de custos operacionais, aumento da disponibilidade dos ativos e, crucialmente, na elevação dos níveis de segurança e satisfação dos passageiros.
Diante do exposto, o objetivo deste trabalho foi desenvolver e comparar modelos preditivos de falhas — especificamente o método estatístico Holt-Winters e o algoritmo Facebook Prophet — para determinar qual abordagem oferece maior acurácia na previsão de falhas semanais do sistema CBI. Para viabilizar este estudo, utilizou-se uma infraestrutura de dados virtualizada em Proxmox, alimentada por uma rotina automatizada de coleta de dados (Web Scraping) do sistema SAP, garantindo a integridade e atualização contínua das informações analisadas.
2. Material e Métodos
Esta pesquisa classificou-se como aplicada, visando gerar conhecimentos práticos para a otimização da manutenção ferroviária (GIL, 2019). Adotou-se uma abordagem quantitativa, baseada na coleta e análise estatística de dados numéricos para identificar padrões de comportamento (PRODANOV; FREITAS, 2013). O trabalho estruturou-se em etapas de configuração da infraestrutura, coleta automatizada, tratamento de dados e modelagem estatística comparativa.
O objeto empírico consistiu nos registros de falhas do Sistema de Controle de Rotas (CBI) do Metrô de São Paulo. Coletaram-se 3.181 registros de falhas, abrangendo o período de janeiro de 2021 a dezembro de 2024. Os dados foram extraídos do sistema corporativo SAP, que armazena informações sobre ocorrências e intervenções de manutenção.
Para a aquisição e processamento dos dados, implementou-se uma infraestrutura computacional virtualizada com hypervisor Proxmox VE. Uma aplicação web customizada em Python/Flask hospedou-se para automatizar o fluxo de dados e centralizar informações. A arquitetura foi segregada em contêineres LXC distintos: um para MySQL, outro para a aplicação de backend e web scraping, e um terceiro para o ambiente de análise exploratória (Jupyter Lab).
A rotina de extração de dados, via web scraping, implementou-se no backend da aplicação utilizando Python, com as bibliotecas Requests e BeautifulSoup. O algoritmo simulou a navegação de um usuário no sistema SAP, com autenticação automatizada por credenciais criptografadas. O processo seguiu um fluxo automatizado de ETL (Extract, Transform, Load), requisitando relatórios de ocorrências, intervenções e ordens de serviço, processando tabelas HTML e arquivos binários (.xls).
Os dados brutos foram processados em memória com a biblioteca Pandas para limpeza, tipagem e padronização de campos, como a extração de Linha e Zona. Posteriormente, os dados tratados foram inseridos e atualizados no banco MySQL utilizando o ORM SQLAlchemy, com um modelo relacional que garantiu a integridade e evitou duplicidades. Um sistema de logging integrado acompanhou todo o processo para assegurar a rastreabilidade.
O processamento analítico ocorreu no ambiente Jupyter Lab, onde os dados foram submetidos a etapas de limpeza, conversão de datas e reamostragem. Geraram-se duas séries temporais distintas para análise: uma com granularidade diária e outra com agregação semanal. A alta volatilidade estocástica diária justificou a agregação semanal para estabilização da série temporal e melhor exposição dos padrões de comportamento do sistema CBI.
Para a modelagem preditiva, selecionaram-se o método estatístico Holt-Winters e o algoritmo Facebook Prophet. O Holt-Winters, uma Suavização Exponencial Tripla, aplicou-se por ser adequado para séries com tendência e sazonalidade. Optou-se pelo método aditivo, dada a constância da variância da série (HYNDMAN; ATHANASOPOULOS, 2021). Os parâmetros de suavização foram otimizados automaticamente pelo algoritmo Statsmodels para minimizar o erro quadrático, com período sazonal fixado em 4.
Em caráter comparativo, utilizou-se o algoritmo Facebook Prophet, um modelo de regressão aditiva que se adapta a dados com fortes efeitos sazonais e mudanças de tendência. O Prophet formula o problema como um ajuste de curva decomponível (TAYLOR; LETHAM, 2018), onde o componente de sazonalidade é modelado por uma Série de Fourier. A sazonalidade diária foi desativada, mantendo-se a semanal ativa, e um parâmetro de sazonalidade customizada inseriu-se para capturar o comportamento mensal.
Para a validação e comparação de desempenho, adotou-se a Validação Cruzada em Janelas Deslizantes (Walk-Forward Validation). Esta técnica, implementada via TimeSeriesSplit da biblioteca Scikit-Learn, dividiu o conjunto de dados em 5 iterações sequenciais. Em cada iteração, o modelo foi treinado com uma janela histórica progressiva e testado na janela imediatamente futura, evitando o uso de informações futuras no treinamento. A métrica de desempenho adotada foi o Erro Médio Absoluto (MAE), pela interpretabilidade direta em relação à quantidade física de falhas.
3. Resultados e Discussão
A etapa inicial da pesquisa concentrou-se na mineração de dados para identificar e isolar o Sistema de Controle de Rotas (CBI) como o ativo crítico para o estudo, conforme o objetivo estabelecido. Durante o período compreendido entre janeiro de 2021 e dezembro de 2024, foram acumulados 3.181 registros de falhas referentes a este sistema. Essa base de dados robusta permitiu uma análise aprofundada do comportamento das falhas, fornecendo o subsídio empírico necessário para o desenvolvimento e a comparação dos modelos preditivos, alinhando-se à proposta de transformar dados brutos em inteligência operacional, como sugerido por Lee, Kao e Yang (2014).
Previamente à aplicação dos algoritmos preditivos, realizou-se uma Análise Exploratória de Dados (AED) para caracterizar a série histórica de falhas. Observou-se que a granularidade diária da série apresentava um comportamento altamente estocástico, com um Coeficiente de Variação (CV) superior a 100%. A média de falhas diárias foi de 2,97, com um desvio padrão de 3,12, e a contagem total de aproximadamente 1.460 dias. Essa alta volatilidade, juntamente com a presença de um número significativo de dias sem falhas (valores zero), indicou que a granularidade diária seria inadequada para a modelagem preditiva, dificultando a convergência dos modelos de regressão.
Em contrapartida, a agregação dos dados em granularidade semanal demonstrou uma estabilização considerável da série temporal. Neste formato, a série abrangeu aproximadamente 208 semanas, com uma média de 16,87 falhas por semana e um desvio padrão de 8,45. O Coeficiente de Variação (CV) foi reduzido para cerca de 50%, indicando uma volatilidade moderada. Essa agregação semanal eliminou os valores nulos e suavizou a variância, revelando de forma mais clara a tendência cíclica do processo de degradação do sistema CBI. Essa abordagem de reamostragem foi crucial para expor os padrões subjacentes de comportamento do sistema, conforme a literatura sobre séries temporais (Hyndman; Athanasopoulos, 2021).
Com base na caracterização estatística, os modelos preditivos foram aplicados priorizando a série semanal. No experimento inicial com o modelo Holt-Winters, a aplicação à granularidade diária resultou em um Erro Médio Absoluto (MAE) de 1,70, o que representou cerca de 57% da média de falhas diárias, confirmando a baixa confiabilidade para essa frequência. Contudo, ao ser aplicado à série semanal, o modelo Holt-Winters obteve um MAE de 5,63. Esse resultado representou uma redução do erro relativo para aproximadamente 33%, indicando uma capacidade robusta de capturar a tendência de degradação do ativo e projetar o volume de falhas.
A projeção realizada pelo modelo Holt-Winters indicou um aumento esperado de aproximadamente 10 para 18 falhas semanais no próximo ciclo, evidenciando a capacidade preditiva do modelo para antecipar o comportamento futuro do sistema. A visualização do comportamento observado e da previsão do Holt-Winters demonstrou um ajuste adequado, com a linha de previsão seguindo de perto a tendência dos dados históricos. Este achado é fundamental para a transição de uma manutenção reativa para uma abordagem proativa, otimizando a alocação de recursos e equipes, conforme a literatura aponta (Abreu et al., 2024).
Posteriormente, o algoritmo Facebook Prophet foi aplicado sob a mesma metodologia de validação cruzada em janelas deslizantes. O modelo Prophet, embora reconhecido por sua capacidade de lidar com sazonalidades e tendências, apresentou instabilidade nas janelas iniciais de teste. Após a convergência, o modelo alcançou um Erro Médio Absoluto (MAE) final de 8,08. A análise gráfica da previsão do Prophet em relação aos dados reais mostrou uma dispersão maior e uma menor aderência aos picos e vales da série temporal observada, especialmente nas fases iniciais da previsão.
A comparação direta entre os dois modelos preditivos revelou que o Holt-Winters apresentou um desempenho superior. O Holt-Winters alcançou um MAE de 5,63 e uma Raiz do Erro Quadrático (RMSE) de 7,04, sendo classificado como o modelo de melhor ajuste. Em contraste, o Facebook Prophet obteve um MAE de 8,08 e uma RMSE de 9,73, resultando em uma precisão aproximadamente 43% inferior à do Holt-Winters para este conjunto de dados específico. Essa diferença substancial nas métricas de erro valida a escolha do Holt-Winters como o motor principal de predição para o volume de falhas semanais do sistema CBI.
Para o modelo Holt-Winters, a configuração adotada incluiu componentes de tendência e sazonalidade aditivos, com o período sazonal fixado em quatro, refletindo as variações cíclicas mensais na agregação semanal. Os parâmetros de suavização da série, como nível, tendência e sazonalidade, não foram fixados arbitrariamente, mas otimizados automaticamente pelo algoritmo Statsmodels. Essa otimização, baseada na maximização da verossimilhança, garantiu o melhor ajuste matemático aos dados de treino, conferindo robustez numérica ao modelo e alinhando-se às melhores práticas de modelagem de séries temporais (Hyndman; Athanasopoulos, 2021).
Apesar do desempenho inferior do Prophet nas métricas de erro global, a decomposição de seus componentes forneceu evidências importantes sobre o comportamento sazonal da série de falhas. A análise sazonal semanal, por exemplo, identificou que terças, quintas-feiras e sábados são os dias de maior probabilidade de ocorrência de falhas. Em contrapartida, domingos e segundas-feiras apresentaram uma retração natural no volume de falhas, indicando padrões operacionais e de uso do sistema que influenciam a frequência das ocorrências.
Adicionalmente, a decomposição dos componentes do Prophet revelou ciclos mensais de criticidade, com picos notáveis nos dias 4 e 28 do mês. No âmbito anual, observou-se uma clara tendência de agravamento das ocorrências durante o mês de dezembro. Essas informações sazonais, embora não diretamente utilizadas para a predição primária devido à superioridade do Holt-Winters, são valiosas para o diagnóstico de padrões operacionais e para o planejamento estratégico da manutenção, permitindo que a equipe de manutenção antecipe períodos de maior demanda e aloque recursos de forma mais eficiente (Obal, Bellinello e Petrovic, 2025).
A infraestrutura de dados virtualizada em Proxmox, com a aplicação Python/Flask para web scraping contínuo do sistema SAP e armazenamento em MySQL, demonstrou ser eficaz na coleta e tratamento dos 3.181 registros de falhas. Essa automação do pipeline de dados é um pilar fundamental para a sustentabilidade da abordagem preditiva, garantindo que os modelos sejam alimentados com informações atualizadas e íntegras. A capacidade de extrair e processar dados de sistemas corporativos, como o SAP, é um diferencial que permite a aplicação prática das técnicas de data science em ambientes reais de manutenção metroferroviária.
Em síntese, os resultados da pesquisa confirmaram que o modelo Holt-Winters, ao ser aplicado à série semanal de falhas do sistema CBI, oferece a maior acurácia preditiva, com um Erro Médio Absoluto significativamente menor em comparação ao Facebook Prophet. A integração desse modelo com um pipeline automatizado de coleta de dados representa uma ferramenta robusta para projetar o comportamento futuro das falhas. Essa capacidade de predição permite que o Metrô de São Paulo transite para uma manutenção preditiva mais eficiente, otimizando a alocação de recursos e elevando a confiabilidade operacional do sistema de sinalização, respondendo diretamente ao objetivo principal do estudo.
4. Conclusão
O presente estudo buscou desenvolver e comparar modelos preditivos para estimar o volume semanal de falhas no Sistema de Controle de Rotas (CBI) do Metrô de São Paulo, utilizando uma infraestrutura de dados automatizada. Verificou-se que a coleta contínua de 3.181 registros de falhas, entre 2021 e 2024, por meio de web scraping do sistema SAP e armazenamento em MySQL, estabeleceu uma base de dados robusta. A análise exploratória revelou a alta volatilidade da série temporal diária, o que justificou a agregação dos dados em granularidade semanal para estabilizar o comportamento das falhas. Neste contexto, o modelo Holt-Winters demonstrou o melhor desempenho preditivo, com um Erro Médio Absoluto (MAE) de 5,63, superando o algoritmo Facebook Prophet, que obteve um MAE de 8,08. A projeção realizada pelo Holt-Winters indicou um aumento de aproximadamente 10 para 18 falhas semanais no próximo ciclo, evidenciando sua capacidade de antecipar a degradação do ativo. A principal contribuição reside na integração de um pipeline automatizado de dados com um modelo preditivo eficaz, oferecendo uma ferramenta robusta que permite ao Metrô de São Paulo transitar de uma manutenção reativa para uma abordagem preditiva, otimizando a alocação de recursos e elevando a confiabilidade operacional do sistema CBI.
Apesar da eficácia demonstrada, o estudo enfrentou a limitação da alta estocasticidade dos dados diários, que exigiu a agregação semanal e pode ter mitigado a detecção de padrões de falha de curtíssimo prazo. Adicionalmente, observou-se que o algoritmo Facebook Prophet, embora útil para a decomposição de componentes sazonais que identificaram picos de falhas em terças, quintas-feiras e sábados, e tendências de agravamento em dezembro, apresentou instabilidade nas janelas iniciais de teste e menor acurácia preditiva global para este conjunto de dados. Como sugestão para estudos futuros, recomenda-se a implementação de um dashboard interativo para a visualização das predições pela equipe de manutenção, facilitando a tomada de decisão. Além disso, aprofundar a análise dos padrões sazonais identificados pelo Prophet pode refinar o planejamento estratégico da manutenção, permitindo intervenções mais assertivas em períodos de maior criticidade.
Referências Bibliográficas
ABREU, D. et al. An explainable machine learning framework for railway predictive maintenance using data streams from the metro operator of Portugal. Scientific Reports, v. 14, n. 1, p. 8189, 2024.
COMPANHIA DO METROPOLITANO DE SÃO PAULO (METRÔ). Tecnologia: Operação. São Paulo, [202-?]. Disponível em: https://www.metro.sp.gov.br/tecnologia/operacao/. Acesso em: 03 fev. 2026.
GIL, A. C. Como elaborar projetos de pesquisa. 6. ed. São Paulo: Atlas, 2019.
HYNDMAN, R. J.; ATHANASOPOULOS, G. Forecasting: principles and practice. 3. ed. [S.I.]: OTexts, 2021. Disponível em: OTexts.com/fpp3.
LEE, J.; KAO, H.-A.; YANG, S. Service innovation and smart analytics for industry 4.0 and big data environment. Procedia CIRP, v. 16, p. 3-8, 2014.
OBAL, T. M.; BELLINELLO, M.; PETROVIC, S. Uso de mineração de dados para priorização no planejamento de manutenção preventiva. Proceeding Series of the Brazilian Society of Computational and Applied Mathematics, v. 9, n. 1, 2025.
PRODANOV, C. C.; FREITAS, E. C. Metodologia do trabalho científico: métodos e técnicas da pesquisa e do trabalho acadêmico. 2. ed. Novo Hamburgo: Feevale, 2013.
TAYLOR, S. J.; LETHAM, B. Prophet: forecasting at scale. The American Statistician, v. 72, n. 1, p. 37-45, 2018.
Artigo oriundo de Trabalho de Conclusão de Curso da Especialização em Data Science e Analytics do MBA USP/Esalq
Para saber mais sobre o curso, clique aqui e acesse a plataforma MBX Academy

