October 09, 2026
Automação e Curadoria de Séries Históricas Hidrometeorológicas da ANA via Pipeline Computacional em Linguagem R
Automação e Curadoria de Séries Históricas Hidrometeorológicas da Ana Via Pipeline Computacional em Linguagem R
Marcos Aurélio Eustorgio Filho; Douglas Augusto De Paula
DOI: 10.22167/2675-6528-202603237
Artigo derivado de Trabalho de Conclusão de Curso (TCC), com conteúdo baseado no trabalho original do aluno e adaptado ao formato editorial da Revista E&S com apoio da ferramenta ResumeAI, solução de inteligência artificial desenvolvida pelo Instituto Pecege para síntese e organização textual.
Resumo
A disponibilidade de dados ambientais consistentes é fundamental para o avanço das pesquisas em climatologia e gestão de recursos hídricos. Desenvolveu-se e implementou-se um algoritmo computacional em linguagem R para a aquisição automatizada, padronização e organização de séries históricas diárias de precipitação, nível e vazão, provenientes do WebService da Agência Nacional de Águas e Saneamento Básico (ANA). O método baseou-se em um pipeline de dados estruturado, operando conforme as janelas temporais de 1961–1990, 1991–2020 e 2021–2024. A implementação utilizou processamento paralelizado, o que garantiu ganho de desempenho em relação a métodos sequenciais. Como resultado, o algoritmo qualificou o inventário de estações e gerou dados estruturados em formato Parquet com compressão gzip, assegurando alta performance e economia volumétrica. Concluiu-se que a solução automatizada superou as limitações operacionais de ferramentas manuais e preexistentes, provendo datasets curados e de alta granularidade, aptos para aplicações avançadas de modelagem hidrológica e algoritmos de Machine Learning.
Palavras-chave: Automação; Ciência de dados; Hidrologia; Linguagem R; Séries temporais.
1. Introdução
A disponibilidade de dados ambientais consistentes e acessíveis é um elemento fundamental para o avanço das pesquisas em climatologia, hidrologia e gestão de recursos naturais. Nas últimas décadas, iniciativas voltadas à disponibilização de dados abertos por instituições governamentais e organizações científicas têm ampliado o acesso a informações meteorológicas e hidrológicas em escala global (Andrade et al., 2022; Menezes et al., 2026). Esse avanço tem contribuído significativamente para o desenvolvimento de estudos voltados à compreensão da variabilidade climática, modelagem hidrológica e à gestão de riscos associados a eventos extremos (Amorim et al., 2020; Andrade et al., 2022; Palharini et al., 2022; Pedreira Junior et al., 2021; Silva et al., 2022; Xavier et al., 2016).
Entre as variáveis ambientais observadas em superfície terrestre, a precipitação destaca-se como um dos principais componentes do ciclo hidrológico, exercendo influência direta sobre processos como escoamento superficial, recarga de aquíferos, dinâmica fluvial e disponibilidade hídrica para diferentes usos (Amorim et al., 2020; Andrade et al., 2022; Pedreira Junior et al., 2021; Zanin e Satyamurty, 2021). Complementarmente, variáveis hidrológicas como o nível dos rios (cotas) e a vazão são fundamentais para o entendimento da dinâmica das bacias hidrográficas, permitindo a análise integrada do comportamento hidrológico em diferentes escalas espaciais e temporais (Amorim et al., 2020; Marengo et al., 2024). No Brasil, a crescente ocorrência de eventos hidrometeorológicos extremos, como episódios de precipitação intensa que resultam em inundações e deslizamentos, evidencia ainda mais a importância do monitoramento sistemático dessas variáveis para subsidiar análises científicas, planejamento territorial e processos de tomada de decisão em políticas públicas (Marengo, 2024; Marengo et al., 2024; Menezes et al., 2026; Moreira, 2024; Palharini et al., 2022).
As redes de monitoramento hidrometeorológico desempenham papel estratégico ao fornecer observações diretas em superfície, consideradas essenciais para a caracterização do comportamento hidrológico regional e para o suporte a análises científicas robustas. Uma das principais fontes de dados hidrológicos e pluviométricos no Brasil é a base disponibilizada pela Agência Nacional de Águas e Saneamento Básico (ANA), que reúne séries históricas provenientes de milhares de estações distribuídas pelo território nacional (Andrade et al., 2022; Menezes et al., 2026; Silva, 2025; Xavier et al., 2016). Essas informações incluem registros de precipitação, nível de rios e vazão, constituindo uma infraestrutura essencial para pesquisas científicas e aplicações operacionais no país. Contudo, a obtenção de dados meteorológicos com adequada representatividade espacial e temporal ainda representa um desafio em diversas regiões do Brasil, especialmente em áreas onde a densidade de estações de monitoramento é limitada (Andrade et al., 2022; Menezes et al., 2026; Palharini et al., 2021; Xavier et al., 2016).
Apesar da relevância da base de dados da ANA, o acesso sistemático a essas séries históricas ainda apresenta desafios operacionais, especialmente quando se deseja obter dados para múltiplas estações e longos períodos temporais. Em geral, o processo de obtenção exige consultas individuais ao WebService da ANA ou o desenvolvimento de rotinas específicas de coleta, o que pode resultar em procedimentos pouco eficientes, de difícil replicação e suscetíveis a falhas (Chagas et al., 2020; Silva, 2025; Sousa, 2017). Embora existam ferramentas voltadas a esse tipo de processamento, como SisCAH, SiADH e o pacote hydrobr, ainda há limitações importantes relacionadas à atualização dessas soluções, à robustez frente a falhas do serviço e à ausência de padronização na geração de metadados e na organização dos dados (Calegario et al., 2024; Lopes et al., 2013; Sousa et al., 2009). Iniciativas de maior escala, como o CAMELS-BR (Chagas et al., 2020), consolidaram séries históricas e atributos de bacia a partir de dados da ANA, contudo, tratam-se de datasets estáticos e pré-processados, sem a disponibilização de um algoritmo replicável e atualizável de aquisição, lacuna que este trabalho buscou preencher. Adicionalmente, dados observacionais de superfície desempenham papel fundamental na validação de produtos meteorológicos derivados de sensoriamento remoto e reanálises atmosféricas, tornando indispensável a utilização de dados observados para avaliação e calibração (Amorim et al., 2020; Andrade et al., 2022; Pedreira Junior et al., 2021; Xavier et al., 2016).
Diante desse contexto, a necessidade de superar as limitações operacionais associadas à obtenção manual de dados e a carência de um algoritmo replicável e atualizável para a aquisição de séries hidrometeorológicas da ANA justificam a presente pesquisa. Um diferencial crítico da solução proposta é o foco na extração de dados diários brutos (cotas, chuva e vazão), preservando a granularidade necessária para a modelagem de eventos extremos, em detrimento de médias agregadas. O recorte temporal do sistema foi estruturado com base em períodos de até trinta anos (1961-1990, 1991–2020 e 2021-2024), permitindo o acesso sistemático a informações em larga escala. Além disso, o estudo documenta critérios técnicos para a validação das séries, contribuindo para a transparência e confiabilidade do processo. Por fim, o algoritmo incorpora mecanismos de robustez operacional e eficiência computacional via processamento paralelizado, acelerando a curadoria das bases de dados. Assim, este trabalho tem como objetivo desenvolver e implementar um algoritmo computacional em linguagem R para a aquisição automatizada, padronização e organização de séries históricas diárias de precipitação, nível e vazão provenientes do WebService da Agência Nacional de Águas e Saneamento Básico (ANA).
2. Material e Métodos
A pesquisa caracterizou-se como um estudo aplicado em Ciência de Dados, enquadrado na linha de Automação e Strategic Analytics. O objetivo foi desenvolver e implementar um algoritmo computacional em linguagem R para a aquisição automatizada, padronização e organização de séries históricas diárias de precipitação, nível e vazão provenientes do WebService da Agência Nacional de Águas e Saneamento Básico (ANA). O trabalho fundamentou-se na construção de um pipeline de dados estruturado para superar as limitações operacionais de obtenção manual e de ferramentas preexistentes.
Os dados secundários foram obtidos do WebService HidroSerieHistorica da ANA (ANA, 2024; SNIRH, 2023; Silva, 2025). O pipeline foi concebido para extrair registros pontuais diários de precipitação, vazão ou nível (cotas), preservando a granularidade necessária para a modelagem de eventos extremos (Andrade et al., 2022; Pedreira Junior et al., 2021; Xavier et al., 2016). O recorte temporal abrangeu os períodos de 1961 a 1990, 1991 a 2020 (Xavier et al., 2016) e 2021 a 2024, baseados nas normais climatológicas do INMET. Filtros automáticos foram aplicados para processar estações com ao menos um ano de registros no intervalo selecionado (Calegario et al., 2024; Silva, 2025; Sousa, 2017).
A coleta de dados realizou-se por meio do consumo automatizado do WebService da ANA, utilizando requisições HTTP implementadas em linguagem R (R Core Team, 2025) com o pacote httr2 (Wickham, 2025). Os dados, originalmente em formato XML, foram submetidos a um processamento de parsing estruturado com o pacote xml2 (Wickham et al., 2019), o que permitiu a captura individualizada dos campos diários e seus respectivos status e níveis de consistência. As séries incluíram CodEstacao (código único, 8 dígitos), Data (observação diária, AAAA-MM-DD) e Chuva, Cota ou Vazão (valor diário observado).
As variáveis foram expressas em milímetros (mm) para precipitação, centímetros (cm) para nível de rios e metros cúbicos por segundo (m³/s) para vazão. O campo Status indicou a qualidade da observação diária, com códigos de 0 a 4, onde 1 representava observado e 2 estimado. NivelConsistencia diferenciou registros não revisados (Nível 1 – Bruto) daqueles submetidos ao controle de qualidade institucional (Nível 2 – Consistido). DataIns registrou a data de inserção do registro pela ANA.
O desenvolvimento do pipeline foi integralmente estruturado na linguagem R (R Core Team, 2025), utilizando pacotes como httr2 (Wickham, 2025) para comunicação HTTP, future (Bengtsson, 2021) para paralelização, tidyverse (Wickham et al., 2019) para manipulação de dados e xml2 (Wickham et al., 2019) para processamento XML. A persistência dos dados ocorreu no formato Parquet com compressão gzip, via pacote arrow (Richardson et al., 2025). O ambiente de execução foi configurado com 12 workers em plano multisession, permitindo o processamento simultâneo dos meses de uma mesma estação (Bengtsson, 2021).
Implementou-se uma arquitetura de comunicação resiliente, com mecanismo de retry automático via pacote httr2, permitindo até seis tentativas de conexão antes de abortar o processamento (Wickham, 2025). Configurou-se um timeout de 180 segundos para evitar bloqueios de requisições. Adicionalmente, estabeleceu-se uma estratégia de backoff exponencial, com intervalos crescentes entre tentativas sucessivas (1, 2, 4, 8, 16 e 32 segundos), limitada a 90 segundos (Wickham, 2025). Para mitigar a sobrecarga no serviço remoto, implementou-se controle de carga com pausas sistemáticas de 6 segundos entre requisições de estações e interrupções de 60 segundos a cada lote de 30 estações processadas. Um intervalo de 120 segundos foi aplicado na transição entre Unidades Federativas.
A etapa de curadoria e validação das séries abordou a redundância de múltiplas séries mensais concorrentes disponibilizadas pelo WebService da ANA. O algoritmo aplicou um modelo determinístico de seleção, priorizando séries cuja referência temporal (DataHora) ocorria no primeiro dia do mês. Em casos de empate, utilizou-se uma hierarquia de desempate baseada na qualidade e recência da informação, priorizando o Nível de Consistência 2 (Consistido) e a Data de Inserção mais recente. Após a seleção, realizou-se o parsing diário, reconstituindo calendários completos e preenchendo meses sem dados com valores nulos (NA).
Incorporou-se um sistema de geração de metadados e logs analíticos para controle de qualidade, rastreabilidade e transparência. O algoritmo monitorou o status das requisições HTTP e a integridade das respostas XML, classificando as estações processadas em três categorias: com dados válidos, sem dados no período e com falhas técnicas. Ao final de cada execução estadual, gerou-se uma tabela resumo consolidada em formatos CSV e Parquet com compressão gzip.
3. Resultados e Discussão
A execução do pipeline computacional proposto resultou na aquisição e processamento de um volume significativo de dados hidrometeorológicos, abrangendo 36.063 estações cadastradas, das quais 16.078 eram fluviométricas e 19.985 pluviométricas. A estratégia de coleta foi delineada para incluir apenas estações com data de início de operação igual ou anterior a 1º de janeiro de 2024, garantindo a potencialidade de um ano completo de registros até a data de referência final de 31 de dezembro de 2024. Essa abordagem considerou a latência observada na atualização do banco de dados da Agência Nacional de Águas e Saneamento Básico (ANA), onde registros mais recentes ainda estavam em processo de inserção, especialmente para o ano de 2025. A segmentação dos dados por Unidade Federativa e por períodos temporais (1961–1990, 1991–2020 e 2021–2024) foi crucial para mitigar a carga sobre o WebService da ANA e contornar instabilidades operacionais, conforme observado em estudos anteriores (Silva, 2025; Sousa, 2017).
Os resultados da execução do pipeline foram organizados em três diretórios principais, correspondentes às variáveis de precipitação, nível de rios e vazão. Cada diretório continha subdiretórios para os três períodos temporais analisados, além de arquivos de resumo que consolidavam informações sobre o processo de download. Esses resumos detalhavam o número de estações elegíveis, os processamentos bem-sucedidos, as estações sem dados disponíveis e as falhas associadas a erros de servidor. Internamente, os subdiretórios dos períodos temporais foram subdivididos em long_data, contendo os arquivos padronizados por Unidade Federativa; nodata_gauges, com a listagem de estações sem dados no período; e problem_gauges, que armazenava as estações com falhas, mesmo após a aplicação de mecanismos de retry automático, backoff exponencial e tratamento de erros, evidenciando a robustez do sistema.
Visão geral dos dados obtidos
A cobertura de estações alcançada pelo pipeline demonstrou variações significativas entre os tipos de dados e os períodos temporais. No período de 1961 a 1990, das 11.627 estações elegíveis para precipitação, 77,1% retornaram dados válidos. Para nível e vazão, das 6.534 estações elegíveis para cada tipo, 63,9% e 39,1% apresentaram dados, respectivamente. No período de 1991 a 2020, a disponibilidade de dados para precipitação foi de 43,8% das 19.582 estações elegíveis, enquanto para nível e vazão, foi de 30,8% e 20,6% das 15.149 estações elegíveis, respectivamente. Já no período mais recente, de 2021 a 2024, das 19.985 estações elegíveis para precipitação, 22,0% continham dados, e das 16.078 estações elegíveis para nível e vazão, 16,0% e 10,9% apresentaram dados, respectivamente. A redução nos percentuais de dados disponíveis nos períodos mais recentes é um achado esperado, pois reflete a proximidade da data de coleta com o período em análise, implicando que uma parcela significativa dos registros ainda não havia sido inserida ou consolidada no repositório da ANA. Durante a coleta de dados de vazão para 1991 a 2020, identificou-se instabilidade no servidor da ANA, afetando estados como Pernambuco, Piauí, Paraná, Rio de Janeiro e Rio Grande do Norte, o que exigiu uma nova execução do pipeline para esses locais, garantindo a integridade dos resultados.
Performance computacional e eficiência da paralelização
A avaliação da performance computacional do pipeline revelou um ganho substancial de desempenho com a implementação do processamento paralelizado. Ao comparar a execução sequencial com a paralelizada, utilizando 12 workers e o mesmo conjunto de dados de precipitação para o período de 1991 a 2020 (19.582 estações elegíveis), observou-se uma redução no tempo total de processamento. O método sequencial demandou aproximadamente 4.629 minutos (77,1 horas), enquanto a execução paralela concluiu a tarefa em cerca de 3.430 minutos (57,2 horas). Isso representou um ganho de desempenho de 1,35 vezes, ou uma redução de aproximadamente 26% no tempo total. Esse benefício foi mais acentuado em estados com redes de monitoramento mais densas, onde o escalonamento das tarefas mensais encontrou maior espaço para otimização. É importante notar que esses valores refletem uma aplicação prática, sujeita a latências de rede e às limitações de resposta do serviço remoto, mantendo-se em patamares operacionais realistas, o que valida a eficiência da solução desenvolvida.
Qualidade e consistência da base de dados extraída
A qualidade dos dados extraídos foi um dos pilares da avaliação do pipeline. A análise de completude indicou que aproximadamente 43,76% das estações elegíveis resultaram em séries temporais válidas, demonstrando a capacidade da ferramenta em recuperar informações da base da ANA. A maioria das estações classificadas como sem dados estava associada à ausência real de registros no período solicitado, e não a falhas técnicas de extração, as quais representaram uma fração reduzida do total (0,27%), confirmando a robustez do algoritmo no acesso ao serviço remoto. A distribuição espacial dos resultados revelou heterogeneidade entre as Unidades Federativas, com Roraima (82,81%), Ceará (74,13%) e Paraná (69,32%) apresentando maior disponibilidade de dados, em contraste com Rio Grande do Norte (21,68%), Pernambuco (22,62%) e Santa Catarina (22,64%). Essa variabilidade é consistente com as diferenças na densidade da rede de monitoramento e na disponibilidade histórica de registros no Brasil, conforme apontado por Chagas et al. (2020), que identificaram disparidades na maturidade do monitoramento hidrometeorológico entre as regiões do país.
A consistência das séries mensais também foi avaliada, revelando padrões distintos entre as variáveis. Para nível e vazão, o percentual de séries consistidas (Nível 2) manteve-se elevado e relativamente estável nos períodos de 1961-1990 e 1991-2020, variando de 71,9% a 90,1%. Contudo, houve uma queda expressiva no período de 2021 a 2024, com 62,3% para nível e 71,2% para vazão, refletindo o caráter ainda provisório e em revisão institucional dos dados mais recentes. Em contraste, a precipitação apresentou percentuais de consistência substancialmente inferiores em todos os períodos, tornando-se praticamente nula (0,3%) no período mais recente. Isso sugere um ritmo mais lento na consolidação institucional dos dados pluviométricos em comparação com as demais variáveis. Essa caracterização da confiabilidade das séries, baseada em indicadores oficiais de controle de qualidade da ANA, alinha-se a precedentes metodológicos como o CAMELS-BR (Chagas et al., 2020), que também utilizou o percentual de dados checados pela agência para qualificar a confiabilidade das séries.
Comparativo entre todos os órgãos responsáveis e estações da própria ANA
A análise desagregada da cobertura de estações e da consistência das séries mensais, comparando o conjunto de todos os órgãos responsáveis com o subconjunto de estações operadas diretamente pela ANA, revelou diferenças notáveis. As estações sob responsabilidade exclusiva da ANA apresentaram percentuais de cobertura substancialmente superiores em todos os tipos de dados e períodos. Para precipitação, a cobertura exclusiva da ANA alcançou 90,0% no período de 1961 a 1990, 70,6% de 1991 a 2020 e 60,5% de 2021 a 2024, em contraste com 77,1%, 43,8% e 22,0% para o conjunto de todos os órgãos, respectivamente. Um padrão similar foi observado para nível e vazão, onde as estações da ANA também apresentaram maior cobertura. Essa diferença se acentuou no período mais recente, indicando que a rede operada diretamente pela ANA é menos afetada pela latência de atualização dos dados, um fator crítico para a disponibilidade de informações em tempo hábil.
A vantagem das estações da própria ANA também se refletiu na qualidade técnica das séries obtidas, especialmente na consistência de Nível 2 (Consistido). Para as variáveis fluviométricas, as séries exclusivas da ANA apresentaram percentuais de consistência consistentemente superiores aos da rede combinada. A vazão atingiu 100,0%, 99,5% e 77,5% nos três períodos (1961-1990, 1991-2020 e 2021-2024, respectivamente) para as estações da ANA, em comparação com 88,9%, 90,1% e 71,2% para todos os órgãos. O nível dos rios seguiu um padrão semelhante, com 91,2%, 97,4% e 74,7% para a ANA, versus 71,9%, 82,0% e 62,3% para todos os órgãos. A precipitação, embora com um padrão mais heterogêneo, também mostrou consistência muito superior nas estações da ANA nos períodos mais antigos (89,9% vs. 26,7% em 1961-1990; 41,3% vs. 23,5% em 1991-2020), convergindo para percentuais próximos de zero no período mais recente para ambos os recortes.
A distribuição dos status de observação diária, agregada em categorias como “Observado”, “Sem informação”, “Outras classificações” e “Sem registro”, revelou uma tendência de aumento na proporção de dias observados (Status 1) em direção aos períodos mais recentes, acompanhada por uma redução na proporção de dias sem registro para todos os tipos de dados. No período de 2021 a 2024, a precipitação apresentou a maior proporção de dias observados (73,5%), seguida pela vazão (67,1%) e pelo nível (67,6%). Em contrapartida, o nível apresentou a maior proporção de dias sem registro no período de 1961 a 1990 (63,4%), refletindo a menor densidade histórica da rede de monitoramento fluviométrico nesse período. A categoria “Outras classificações” manteve-se residual para a precipitação em todos os períodos (inferior a 0,6%), mas cresceu de forma mais expressiva para nível e vazão no período de 2021 a 2024 (9,1% e 9,8%, respectivamente), sugerindo maior incidência de classificações provisórias ou ainda não plenamente consolidadas nos dados fluviométricos mais recentes. Quando a análise foi restrita às estações sob responsabilidade exclusiva da ANA, a proporção de dias sem registro reduziu-se expressivamente no período de 1991 a 2020, de 49,4% para 18,3% na precipitação e de 41,4% para 24,6% na vazão, um padrão coerente com o comparativo de cobertura de estações.
Eficiência de armazenamento e estruturação dos dados
A eficiência de armazenamento foi um critério fundamental para a adequação do pipeline a aplicações de grande escala. Para quantificar essa eficiência, comparou-se o volume total ocupado pelos arquivos de precipitação do período de 1991 a 2020, agregando os dados de todas as Unidades Federativas. Os dados exportados em formato CSV ocuparam 6.866 MB, enquanto o mesmo conjunto de dados armazenado em formato Parquet com compressão Gzip ocupou apenas 181 MB. Essa diferença representa uma redução de aproximadamente 97,36% no volume de armazenamento. Essa economia volumétrica é atribuída à estrutura de armazenamento colunar do Parquet, que preserva a tipagem das variáveis, permite compressão mais eficaz e possibilita a leitura seletiva de colunas, ao contrário do CSV, que armazena os dados como texto simples e sem tipagem explícita. Essa otimização reduz os custos de infraestrutura e o tempo de leitura e escrita em aplicações que processam séries históricas de longo prazo, confirmando a adequação do formato à escala de dados gerada pelo pipeline para estudos hidrológicos e climatológicos.
Robustez do pipeline e tratamento de erros
A robustez do pipeline foi avaliada pela análise do comportamento do sistema frente a falhas de comunicação e inconsistências nos dados de origem, conforme demonstrado pelos logs analíticos gerados durante a execução. Esses logs registraram detalhadamente o status das requisições, o processamento das estações e os eventos associados à extração dos dados, permitindo o acompanhamento completo do fluxo operacional do algoritmo. Isso incluiu mensagens informativas, identificação de ausência de dados, ocorrência de erros e confirmação de execuções bem-sucedidas. O sistema foi capaz de diferenciar situações de inexistência de registros daquelas em que ocorreram falhas técnicas, o que contribuiu para a transparência e a rastreabilidade do processo. A robustez do pipeline tornou-se ainda mais evidente no tratamento de falhas de comunicação, onde ocorreram registros de erros associados à ausência de dados retornados pelo WebService, o que ativou mecanismos internos de controle, como as pausas automáticas implementadas entre as requisições por Unidade Federativa. Tais interrupções programadas tiveram como objetivo evitar a sobrecarga no servidor da ANA, especialmente em cenários de múltiplas requisições consecutivas, assegurando que a extração ocorresse de forma estável e em conformidade com as capacidades do repositório institucional. A continuidade do processo de coleta foi garantida pela combinação de mecanismos de retry automático e backoff exponencial, que permitiram a recuperação de requisições instáveis e o contorno de limitações de tráfego, como o erro HTTP 429 (Too Many Requests), sem a necessidade de intervenção manual. O sistema forneceu informações detalhadas sobre cada etapa do processamento, com o acompanhamento individual das estações e a indicação explícita de ausência de dados em níveis mensais e anuais, demonstrando a capacidade do pipeline em diferenciar cenários operacionais.
Em síntese, os resultados demonstram que o algoritmo desenvolvido e implementado atingiu o objetivo de automatizar a aquisição, padronização e organização de séries históricas diárias de precipitação, nível e vazão da ANA. O pipeline apresentou elevada eficiência computacional, especialmente pela paralelização e pelo uso do formato Parquet, que otimizou o tempo de processamento e o volume de armazenamento. A aplicação de critérios determinísticos para seleção e validação das séries, juntamente com mecanismos de resiliência, garantiu a robustez do sistema frente a instabilidades de rede e assegurou a integridade e consistência temporal das informações extraídas. A solução provê datasets curados e de alta granularidade, superando limitações operacionais de ferramentas preexistentes e oferecendo um modelo metodológico reprodutível para a curadoria de dados ambientais em larga escala, apto para aplicações avançadas de modelagem hidrológica e algoritmos de Machine Learning.
4. Conclusão
O presente estudo dedicou-se ao desenvolvimento e à implementação de um algoritmo computacional em linguagem R, visando a aquisição automatizada, padronização e organização de séries históricas diárias de precipitação, nível e vazão, provenientes do WebService da Agência Nacional de Águas e Saneamento Básico (ANA). Verificou-se que o pipeline processou um volume expressivo de dados de 36.063 estações, segmentados por Unidade Federativa e períodos temporais, demonstrando sua capacidade de lidar com grandes escalas. Os resultados evidenciaram elevada eficiência computacional, com o processamento paralelizado proporcionando um ganho de desempenho de 1,35 vezes em comparação com a execução sequencial. A utilização do formato Parquet com compressão Gzip resultou em uma redução de aproximadamente 97,36% no volume de armazenamento, otimizando a gestão de dados. Identificou-se que a disponibilidade e consistência dos dados variaram entre os tipos de variáveis e períodos, sendo as estações operadas diretamente pela ANA as que apresentaram maior cobertura e qualidade. A robustez do sistema foi confirmada pela sua capacidade de gerenciar falhas de comunicação e inconsistências nos dados de origem, por meio de mecanismos de retry automático e backoff exponencial, garantindo a integridade e a continuidade do processo de extração.
A principal contribuição deste trabalho reside na provisão de um modelo metodológico reprodutível para a curadoria de dados hidrometeorológicos em larga escala, gerando datasets diários curados e de alta granularidade. Essa solução supera as limitações operacionais de ferramentas manuais e preexistentes, oferecendo uma base de dados consistente e confiável, apta para aplicações avançadas de modelagem hidrológica e algoritmos de Machine Learning. Embora se tenham identificado limitações pontuais relacionadas às formas de acesso oficial ao sistema HidroWeb, que podem condicionar a liberação de chaves para consulta, o algoritmo demonstrou a vantagem estratégica de operar diretamente sobre o WebService institucional, ampliando sua aplicabilidade imediata. Como perspectiva futura, sugere-se a integração com as interfaces oficiais da instituição, o que poderá potencializar o volume de dados obtidos, mantendo os protocolos de validação e estruturação já estabelecidos. Em suma, o sistema desenvolvido constitui uma ferramenta robusta e eficiente, contribuindo significativamente para a transparência e o suporte a estudos científicos e tomadas de decisão que demandam bases de dados ambientais confiáveis e reprodutíveis.
Referências Bibliográficas
Amorim, J.S.; Viola, M.R.; Junqueira, R.; Oliveira, V.A.; Mello, C.R. 2020. Evaluation of satellite precipitation products for hydrological modeling in the Brazilian Cerrado biome. Water 12(9): 2571.
Andrade, J.M.; Neto, A.R.; Bezerra, U.A.; Moraes, A.C.C.; Montenegro, S.M.G.L. 2022. A comprehensive assessment of precipitation products: Temporal and spatial analyses over terrestrial biomes in Northeastern Brazil. Remote Sensing Applications: Society and Environment 28(100842): 1-27.
Marengo, J.A.; Dolif, G.; Cuartas, A.; Camarinha
Menezes, P.C.M.; Souza, D.C.; Tavares, M.G.; Marques, R.A.G. 2026. Comparative analysis of the accuracy of temperature and precipitation data in Brazil. Atmosphere 1(1): 1-21.
Palharini, R.S.A.; Vila, D.A.; Araujo Palharini, R.S.; Machado, E.M.; Undurraga, E. 2022. Analysis of extreme rainfall and natural disasters events using satellite precipitation products in different regions of Brazil. Atmosphere 13(10): 1680.
Pedreira Junior, A.L.; Biudes, M.S.; Machado, N.G.; Vourilitis, G.L.; Geli, H.M.E.; Santos, L.O.F.; Querino, C.A.S.; Ivo, I.O.; Neto, N.L. 2021. Assessment of remote sensing and re-analysis estimates of regional precipitation over Mato Grosso, Brazil. Water 13(3): 333.
Silva, E.H.L.; Silva, F.D.S.; Junior, R.S.S.; Pinto, D.D.C.; Costa, R.L.; Gomes, H.B.; Júnior, J.B.C.; Freitas, I.G.F.; Herdies, D.L. 2022. Performance assessment of different precipitation databases (Gridded analyses and reanalyses) for the new Brazilian agricultural frontier: SEALBA. Water 14(9): 1473.
Xavier, A.C.; King, C.W.; Scanlon, B.R. 2016. Daily gridded meteorological variables in Brazil (1980-2013). International Journal of Climatology 36(6): 2644-2659.
Zanin, P.R.; Satyamurty, P. 2021. Interseasonal and Interbasins Hydrological Coupling in South America. Journal of Hydrometeorology 22(6): 1609-1625.
Artigo oriundo de Trabalho de Conclusão de Curso da Especialização em Data Science e Analytics do MBA USP/Esalq
Para saber mais sobre o curso, clique aqui e acesse a plataforma MBX Academy