Article

October 05, 2026

Detecção de novas disfuncionalidades em políticas públicas utilizando monitoramento de anomalias sobre manifestações de usuários

Detecção de Novas Disfuncionalidades em Políticas Públicas Utilizando Monitoramento de Anomalias sobre Manifestações de Usuários

Gustavo Tomás Costa; William Barbosa

DOI: 10.22167/2675-6528-202602977

Artigo derivado de Trabalho de Conclusão de Curso (TCC), com conteúdo baseado no trabalho original do aluno e adaptado ao formato editorial da Revista E&S com apoio da ferramenta ResumeAI, solução de inteligência artificial desenvolvida pelo Instituto Pecege para síntese e organização textual.

Resumo

A plataforma Fala.BR consolidou-se como o principal canal de comunicação entre a sociedade e a Administração Pública Federal, registrando milhões de manifestações anualmente. Reconheceu-se a oportunidade de utilizar as percepções dos usuários para verificar a qualidade dos serviços públicos e identificar disfunções. O objetivo foi desenvolver e implantar um sistema de detecção de anomalias para identificar novos problemas ou agravamentos atípicos na prestação de serviços públicos, analisando séries históricas de manifestações no Fala.BR. Realizou-se um estudo exploratório e quantitativo, utilizando dados secundários extraídos diretamente do sistema Fala.BR, abrangendo 421 entidades de 2014 a 2025. Implementou-se um sistema em Python com um ensemble de 15 detectores de anomalias, com decisão por Votação Não Ponderada (EVNP), e métricas de priorização, como a DS_1M, além de uma ferramenta de identificação de temas baseada em LLM. O sistema demonstrou ser eficaz ao capturar problemas relevantes, como impactos de alterações regulatórias e interrupções de serviços, que geraram aumentos atípicos nas manifestações. Concluiu-se que o sistema implementado atingiu seu objetivo, sendo capaz de identificar disfuncionalidades novas e relevantes, e pode servir como base para um sistema de monitoramento permanente, auxiliando a Administração Pública na atuação tempestiva.

Palavras-chave: Eficiência institucional; Fala.BR; Ouvidoria; Serviços públicos; Tomada de decisão.

1. Introdução

A Plataforma Integrada de Ouvidoria e Acesso à Informação do Poder Executivo Federal, conhecida como Fala.BR (Fala.BR, 2026), estabeleceu-se como o principal canal de comunicação entre a sociedade e os órgãos e entidades da Administração Pública Federal. Sua função é crucial para o Sistema de Ouvidorias do Poder Executivo Federal, permitindo que cidadãos registrem reclamações, denúncias, solicitações, elogios e sugestões. Dessa forma, a plataforma atua como um instrumento fundamental para a participação social e o fortalecimento da transparência pública.

O sistema, que teve sua origem no e-Ouv desenvolvido pela Controladoria-Geral da União (CGU) em 2014 e foi substituído pelo Fala.BR em 2019, tornou-se obrigatório para diversos órgãos da Administração Pública Federal a partir do Decreto nº 9.492/2018. Atualmente, abrange mais de 300 ouvidorias federais e é utilizado por mais de três mil órgãos e entidades não federais. A adesão da sociedade a esses canais é notável, evidenciada pelo crescimento expressivo no número de manifestações, que passou de 15.362 em 2015 para 1.391.373 em 2025 (Fernandez, 2021; Painel Resolveu?, 2026).

Contudo, a mera existência de um canal de comunicação não é suficiente. É imperativo reconhecer o valor das percepções dos usuários dos serviços públicos para verificar a qualidade dos serviços prestados (Cardim, 2022). Surge, então, a necessidade de estabelecer mecanismos inteligentes que transformem essas percepções em métricas de qualidade e em conhecimento aplicável à tomada de decisões, apoiando a eficiência institucional (Santos, 2025).

Diante do volume de manifestações, que supera um milhão por ano, o desafio reside em aplicar tecnologias que possam gerar insumos gerenciais. Uma estratégia promissora é o emprego de técnicas de Inteligência Artificial, que possibilitam a visualização de padrões, gargalos e oportunidades de melhoria, apoiando a gestão estratégica da ouvidoria (Santos, 2025). Neste contexto, a detecção de anomalias surge como uma ferramenta essencial.

A detecção de anomalias permite identificar comportamentos que se desviam do esperado, comparando-os com o histórico de padrões. Ao observar os fluxos de manifestações dos usuários e identificar mudanças atípicas, é possível detectar novos problemas ou agravamentos inesperados na prestação de serviços públicos. A identificação tempestiva dessas disfunções é de grande valia para a Administração Pública, pois viabiliza a adoção de medidas corretivas em tempo hábil.

Assim, o presente estudo justifica-se pela necessidade de transformar o grande volume de dados de manifestações em informações acionáveis para a melhoria contínua dos serviços públicos e tem como objetivo desenvolver e implantar um sistema de detecção de anomalias e verificar se esse sistema pode contribuir para a Administração Pública por meio da identificação tempestiva de problemas na prestação de serviços públicos por meio da análise do comportamento dos usuários.

2. Material e Métodos

O presente estudo caracterizou-se como uma pesquisa de natureza exploratória e quantitativa, com delineamento experimental. O objetivo foi verificar a viabilidade prática de um sistema de detecção de anomalias para identificar novos problemas ou agravamentos inesperados na prestação de serviços públicos. Para tanto, realizou-se a análise de séries históricas do número de manifestações registradas na plataforma Fala.BR, testando a eficácia de algoritmos de detecção de anomalias e métricas de priorização.

A coleta de dados secundários foi realizada a partir do sistema Fala.BR. Inicialmente, considerou-se a utilização de dados disponibilizados na seção de Dados Abertos – Manifestações de Ouvidoria da Controladoria-Geral da União (CGU, 2026). Contudo, após verificação, constatou-se que esses dados não refletiam a integralidade do fluxo de registros, pois abrangiam apenas manifestações consideradas procedentes. Assim, obteve-se acesso direto aos dados do sistema Fala.BR para a construção da base de dados da pesquisa.

A base de dados final compreendeu o conjunto de manifestações diárias, associadas a 421 entidades federais distintas, abrangendo o período de 09 de dezembro de 2014 a 31 de dezembro de 2025. As manifestações foram categorizadas pelos tipos Denúncia, Reclamação, Solicitação, Sugestão e Comunicação. As entidades foram classificadas como “Nacional” para aquelas com abrangência de políticas e serviços em nível nacional, e “Local” para as de impacto mais regionalizado.

Para garantir a privacidade e a confidencialidade, a autorização para uso dos dados foi concedida mediante restrições. As informações que pudessem identificar órgãos, entidades ou dados pessoais foram descaracterizadas. O acesso aos dados e a implementação dos algoritmos foram restritos ao ambiente computacional da CGU, sem compartilhamento externo. Os nomes das entidades foram alterados e referenciados por sua classificação e um número identificador.

O sistema de detecção de anomalias foi implementado em Python, utilizando 15 modelos de detecção, todos da biblioteca Python Outlier Detection [PyOD]. O sistema operou como um comitê de detectores, onde cada um participou da classificação das anomalias. A decisão final sobre a classificação de um ponto da série histórica como anômalo ou não anômalo ocorreu por meio de um processo de votação não ponderada.

Nesse processo de votação, cada detector analisou individualmente cada série temporal e classificou cada ponto de forma binária (anômalo ou não anômalo). Um ponto foi classificado como anômalo se a soma das pontuações dos detectores que o classificaram como tal superasse 50% da quantidade total de detectores. Este sistema, denominado Detector Ensemble com decisão por Votação Não Ponderada [EVNP], foi aplicado às 421 séries temporais, que consistiam na quantidade de manifestações registradas por entidade em subperíodos de 30 dias.

O comitê de detectores incluiu modelos como o Clustering-Based Local Outlier Factor [CBLOF] (He et al., 2003), que utiliza clusterização e distância entre clusters para calcular o escore de anomalia. Também se empregou o Copula-Based Outlier Detector [COPOD] (Li et al., 2020), um modelo estatístico que detecta anomalias medindo a improbabilidade da combinação das posições marginais nas caudas das distribuições. O Empirical Cumulative Distribution-based Outlier Detection [ECOD] (Li et al., 2022) foi utilizado para identificar observações extremas com base em funções de distribuição acumulada empíricas.

Outros detectores aplicados foram o Gaussian Mixture Model [GMM] (Aggarwal, 2017), um modelo probabilístico que estima componentes gaussianos latentes para classificar pontos pouco prováveis como anômalos. O Histogram-Based Outlier Score [HBOS] (Goldstein e Dengel, 2012) modela atributos com histogramas, atribuindo escores altos a pontos em bins raros. O Isolation Forest [IForest] (Liu et al., 2008) também integrou o comitê, sendo um método de ensemble baseado em árvores aleatórias para isolar anomalias.

Para viabilizar a análise e o uso do sistema, implementou-se uma interface gráfica que permitiu acionar funcionalidades como atualização da base de dados, realização de análises e geração de relatórios. Um relatório automatizado foi desenvolvido para apresentar o número de anomalias por entidade por subperíodo, com o objetivo de identificar entidades com anomalias para posterior análise individual. Este mecanismo foi aprimorado para incluir a priorização das séries temporais.

A priorização das anomalias foi realizada por meio de métricas desenvolvidas para estimar a relevância dos eventos. Foram implementadas três métricas: a Métrica DS (Diferença Simples), que calcula a diferença entre o quantitativo de registros no subperíodo analisado e um valor de referência; a Métrica DR (Diferença Relativa), que mede a diferença relativa; e a Métrica ZS (Z-score), que calcula o Z-score entre o quantitativo de registros e o valor de referência.

Para o cálculo dessas métricas, foram testados quatro valores de referência: o valor médio do último mês (1M), dos últimos três meses (3M), do último ano (1A) e dos últimos cinco anos (5A). Após testes exploratórios, optou-se pela utilização da métrica DS com o valor de referência de 1M, por sua maior sensibilidade ao efeito imediato de incremento anômalo e por priorizar entidades de abrangência nacional.

Adicionalmente, implementou-se uma funcionalidade para a detecção de temas, capaz de extrair uma lista sintética dos assuntos abordados nas manifestações. Esta ferramenta utilizou um Large Language Model (LLM) para elaborar resumos de cada manifestação, com pseudonimização de dados pessoais, e para gerar listas de temas a partir desses resumos. As listas de temas foram consolidadas por meio de normalização, tokenização, cálculo de TF-IDF e agrupamento por similaridade do cosseno, com um limiar de 0,7.

O funcionamento coordenado do sistema abrangeu desde a captura das informações referentes às séries históricas até a análise final sobre os temas extraídos das manifestações. Para a implantação de um sistema de monitoramento permanente, propôs-se uma rotina mensal que incluiria a atualização dos dados do Fala.BR, a análise das séries históricas dos órgãos ativos pelo detector EVNP, a priorização dos pontos anômalos pelo critério DS_1M e a análise humana aprofundada das manifestações priorizadas.

3. Resultados e Discussão

O presente estudo visou desenvolver e implantar um sistema de detecção de anomalias para identificar novos problemas ou agravamentos atípicos na prestação de serviços públicos, utilizando a análise de séries históricas de manifestações registradas na plataforma Fala.BR. Os resultados obtidos demonstraram a eficácia do sistema em capturar disfuncionalidades relevantes, evidenciando sua capacidade de transformar o volume de dados de ouvidoria em informações acionáveis para a Administração Pública. A abordagem adotada permitiu não apenas a identificação de picos atípicos no volume de manifestações, mas também a correlação desses eventos com causas subjacentes, como alterações regulatórias e interrupções de serviços, conforme previsto no objetivo da pesquisa (Santos, 2025).

Inicialmente, a pesquisa envolveu a comparação entre duas fontes de dados: a base de Dados Abertos e os dados extraídos diretamente do sistema Fala.BR. Essa etapa foi crucial para garantir a fidedignidade das informações utilizadas. Verificou-se que as bases apresentavam diferenças superiores a cinco por cento na quantidade total de registros, o que impactou diretamente os resultados da detecção de anomalias. Enquanto a base de Dados Abertos registrou 423.159 manifestações, a base do Fala.BR totalizou 445.610, uma diferença de 5,3%. Essa discrepância se estendeu ao número de entidades com anomalias e ao total de anomalias identificadas, com o Fala.BR revelando mais ocorrências.

A análise detalhada revelou que, embora 355 das 398 entidades com anomalias (89,2%) tivessem sido identificadas em pelo menos uma das bases, a concordância quanto ao número exato de anomalias foi observada em apenas 46 entidades (11,6%). Em um exemplo específico de uma Entidade Nacional, a análise com dados do Fala.BR identificou sete anomalias, enquanto a mesma análise com dados de Dados Abertos apontou apenas duas. Essa divergência substancial levou à decisão de utilizar exclusivamente os dados do Fala.BR para as análises subsequentes, por refletirem de forma mais precisa o comportamento integral dos registros de manifestações no sistema.

A implementação do sistema de detecção de anomalias foi realizada em Python, empregando um ensemble de 15 detectores da biblioteca PyOD. Este comitê de detectores opera por meio de um processo de Votação Não Ponderada (EVNP), onde cada detector classifica um ponto da série temporal como anômalo ou não anômalo. Um ponto é considerado anômalo se mais de 50% dos detectores o classificarem como tal. Essa abordagem robusta permite uma avaliação mais consistente e confiável das flutuações nas séries históricas de manifestações, que foram analisadas em subperíodos de 30 dias para 421 entidades distintas.

Os detectores utilizados no ensemble abrangem uma variedade de técnicas de machine learning e estatísticas, como Clustering-Based Local Outlier Factor (CBLOF), Copula-Based Outlier Detector (COPOD), Empirical Cumulative Distribution-based Outlier Detection (ECOD), Gaussian Mixture Model (GMM), Histogram-Based Outlier Score (HBOS), Isolation Forest (IForest), Isolation-based Nearest Neighbour Ensemble (INNE), Kernel Density Estimation (KDE), K-Nearest Neighbors Detector (KNN), Linear Method for Deviation-based Outlier Detection (LMDD), Lightweight Online Detector of Anomalies (LODA), Median Absolute Deviation (MAD), Minimum Covariance Determinant (MCD), Quasi-Monte Carlo Discrepancy (QMCD) e Sampling-based Outlier Detection (Sampling). A combinação dessas metodologias fortalece a capacidade do sistema de identificar diferentes tipos de anomalias em séries temporais complexas.

Para viabilizar a interpretação e priorização das anomalias detectadas, foi desenvolvida uma interface gráfica que integra funcionalidades como atualização de dados, análises e geração de relatórios. Dada a grande quantidade de entidades e anomalias identificadas, tornou-se essencial a criação de métricas de priorização. Inicialmente, o número de votos dos detectores foi considerado, mas descartado por ser mais adequado para indicar a confiança na classificação do que a relevância da anomalia. Assim, foram implementadas três métricas exploratórias: Diferença Simples (DS), Diferença Relativa (DR) e Z-score (ZS), cada uma calculada com quatro valores de referência (média do último mês, três meses, um ano e cinco anos).

A avaliação dessas métricas revelou que a escolha do período de referência impacta significativamente a capacidade de captura da anomalia. Períodos de referência mais curtos, como o último mês (1M), mostraram-se mais eficazes na detecção de efeitos imediatos de incrementos anômalos, o que é ideal para um sistema de monitoramento contínuo. Em contraste, valores de referência de períodos mais longos, como os últimos cinco anos (5A), tendem a capturar a amplitude global da anomalia, incluindo movimentos de queda ou anomalias iniciadas em períodos anteriores, o que é menos relevante para a identificação tempestiva de novos problemas.

A métrica DS_1M (Diferença Simples com referência do último mês) destacou-se nos testes por sua capacidade de priorizar entidades de abrangência nacional e, consequentemente, políticas e serviços de maior impacto. Por exemplo, a Entidade Nacional 1, com 10.303 registros, foi a mais bem classificada por essa métrica. Essa característica é fundamental para um sistema de monitoramento que busca alertar sobre disfunções que afetam um grande número de cidadãos. Em contrapartida, a métrica DS_5A, embora útil para estudos de longo prazo, mostrou-se menos adequada para a detecção de anomalias que representam incrementos recentes, pois pode classificar como anômalos eventos de decréscimo de registros ou movimentos já em curso.

A métrica DR (Diferença Relativa) e ZS (Z-score) apresentaram resultados análogos, sem uma clara predominância por categorias de entidades, e não distinguiram a abrangência das políticas públicas. Diante disso, a métrica DS_1M foi selecionada como a mais apropriada para o sistema de monitoramento permanente, devido à sua maior sensibilidade a incrementos anômalos imediatos e à sua tendência de priorizar entidades com maior alcance. Essa escolha alinha-se diretamente ao objetivo de identificar problemas novos e relevantes de forma tempestiva na Administração Pública.

Para complementar a detecção de anomalias, foi implementada uma ferramenta baseada em Large Language Models (LLM) para extrair e sintetizar os temas abordados nas manifestações. Esta ferramenta pseudonimiza dados pessoais, resume cada manifestação e agrupa temas similares utilizando vetorização TF-IDF e similaridade de cosseno. O objetivo é correlacionar o aumento atípico de registros com alterações específicas no provimento de serviços públicos, fornecendo um contexto qualitativo para as anomalias quantitativas identificadas. Essa funcionalidade permite uma análise mais aprofundada e a validação da relevância dos pontos anômalos.

Análise das anomalias priorizadas

A partir da lista de anomalias priorizadas pela métrica DS_1M, as três primeiras colocadas foram selecionadas para uma análise individual aprofundada, utilizando a ferramenta de identificação de temas. Essa abordagem permitiu validar a capacidade do sistema em identificar problemas reais e relevantes na prestação de serviços públicos, conforme o comportamento dos usuários. Cada caso analisado ilustra diferentes cenários de disfuncionalidades e a eficácia do sistema em detectá-los.

A primeira anomalia priorizada refere-se à Entidade Nacional 1, que registrou 10.303 manifestações em dezembro de 2025, um aumento de 258,6% em relação aos 2.837 registros do mês anterior. A série histórica dessa entidade, embora apresentasse certa regularidade, exibiu um salto quantitativo expressivo. A análise dos temas das manifestações revelou um crescimento notável em “Regulamento para exercício profissional” (de 2 para 1.051 registros, um aumento de 52.450,0%) e “Serviço público com novas regras” (de 370 para 4.800 registros, um aumento de 1.197,3%).

O aprofundamento da análise dos dados confirmou que o tema “Regulamento para exercício profissional” estava relacionado a dúvidas e dificuldades decorrentes de uma alteração legislativa que entrou em vigor em dezembro de 2025. O tema “Serviço público com novas regras” também se referia a um serviço existente cujo acesso foi alterado por uma nova norma, gerando dificuldades e dúvidas. Assim, o sistema demonstrou ser capaz de capturar o impacto de alterações regulatórias significativas, tanto no exercício profissional quanto no acesso a serviços públicos, resultando em uma maior demanda de informação por parte da sociedade.

A segunda anomalia priorizada foi identificada na Entidade Nacional 2, que apresentou 1.161 registros em dezembro de 2025, um aumento em relação aos 592 registros do mês anterior. A série histórica dessa entidade mostrou um pico de registros de caráter mais local, com um incremento proporcional de 95,8%. A comparação dos temas das manifestações entre novembro e dezembro de 2025 revelou aumentos substanciais em “Problemas na prestação de serviço B” (de 22 para 88 registros, 300,0%), “Atendimento” (de 52 para 142 registros, 173,1%) e “Problemas na prestação de serviço A” (de 371 para 753 registros, 103,0%).

A investigação aprofundada dos dados indicou que todos os serviços da Entidade Nacional 2 sofreram uma redução de 20% na capacidade de provimento durante a segunda quinzena de dezembro de 2025. Essa interrupção parcial não apenas impactou os serviços diretamente referenciados nas manifestações, mas também gerou um aumento nas dificuldades relacionadas ao atendimento geral. Este caso demonstrou a capacidade do sistema em capturar o impacto de reduções operacionais na prestação de serviços, refletindo-se no comportamento atípico das manifestações dos usuários.

A terceira anomalia analisada referiu-se à Entidade Nacional 3, com 432 registros em dezembro de 2025, precedidos por 172 registros no mês anterior, representando um incremento proporcional de 151,2%. A série histórica dessa entidade também exibiu um ponto de destaque local. A análise dos temas das manifestações revelou aumentos significativos em “Problemas na prestação de serviço público” (de 92 para 252 registros, 173,9%), “Atendimento” (de 20 para 54 registros, 170,0%) e “Cobranças incorretas em serviço público” (de 39 para 96 registros, 146,2%).

O aprofundamento das análises confirmou que tanto o tema “Problemas na prestação de serviço público” quanto “Cobranças incorretas em serviço público” estavam relacionados a um mesmo serviço de abrangência nacional. Verificou-se que esse serviço sofreu uma interrupção não prevista em dezembro de 2025, restrita a uma região específica do país. Apesar de localizada, essa interrupção teve um impacto equivalente a 4,6% da população consumidora do serviço em nível nacional. Este achado reforça a capacidade do sistema em identificar disfuncionalidades, mesmo quando estas são regionalizadas, mas com impacto relevante.

Em síntese, os resultados demonstram que o sistema de detecção de anomalias, com seu ensemble de detectores e a métrica de priorização DS_1M, é eficaz na identificação tempestiva de disfuncionalidades na prestação de serviços públicos. A integração com a ferramenta de detecção de temas baseada em LLM permitiu contextualizar e validar as anomalias, revelando problemas como impactos de alterações regulatórias e interrupções de serviços. Esses achados confirmam que o sistema atinge o objetivo de transformar o volume de manifestações em conhecimento acionável, contribuindo para a eficiência institucional e a tomada de decisões na Administração Pública, conforme proposto por Santos (2025).

4. Conclusão

O presente estudo buscou desenvolver e implantar um sistema de detecção de anomalias para identificar novos problemas ou agravamentos atípicos na prestação de serviços públicos, por meio da análise de séries históricas de manifestações registradas na plataforma Fala.BR. Verificou-se que o sistema, implementado em Python com um ensemble de 15 detectores de anomalias e decisão por Votação Não Ponderada (EVNP), demonstrou eficácia ao capturar disfuncionalidades relevantes. A métrica de priorização DS_1M foi crucial para focar em incrementos anômalos imediatos, e a ferramenta de identificação de temas baseada em LLM permitiu contextualizar qualitativamente as anomalias. Observou-se que o sistema foi capaz de identificar o impacto de alterações regulatórias, como as que afetaram o exercício profissional e o acesso a serviços públicos, bem como interrupções operacionais, mesmo quando regionalizadas, que geraram aumentos atípicos nas manifestações. Esses achados confirmam a capacidade do sistema em transformar o volume de manifestações em conhecimento acionável para a Administração Pública.

A principal contribuição deste trabalho reside na proposição de um sistema que pode servir como base para um monitoramento permanente da qualidade dos serviços públicos, auxiliando a Administração Pública na tomada de decisões tempestivas. Contudo, o método desenvolvido ainda exige análise individual humana para a validação final das anomalias, mesmo com o apoio da ferramenta de geração de temas. Para estudos futuros, sugere-se a ampliação das informações e vetores analisados, incorporando dados como UF, tipo de manifestação e assunto, já disponíveis nas bases. Recomenda-se também a realização de testes com diferentes tamanhos de subperíodos, como 15 ou sete dias, para avaliar o impacto no desempenho do sistema.

Referências Bibliográficas

Aggarwal, C.C. 2017. Outlier analysis. 2. ed. Cham: Springer. Cap. 2. Disponível em: <https://charuaggarwal.net/outlierbook.pdf>. Acesso em: 27 mar. 2026.

Cardim, C.H.C.M. 2022. Ouvidoria: um efetivo canal de comunicação entre o hospital e o paciente. Revista ABO Nacional 5: 63-74.

Controladoria-Geral da União [CGU]. 2026. Dados Abertos – Manifestações de Ouvidoria. Disponível em: <https://www.gov.br/cgu/pt-br/acesso-a-informacao/dados-abertos/arquivos/ouvidoria>. Acesso em: 08 abr. 2026.

Fernandez, M.V.; Cavalcanti, P.; Sá, D.; Viegas, J. 2021. Ouvidoria como instrumento de participação, controle e avaliação de políticas públicas de saúde no Brasil. Physis: Revista de Saúde Coletiva 31(4): e310403.

Goldstein, M.; Dengel, A.. 2012. Histogram-based outlier score (HBOS): a fast unsupervised anomaly detection algorithm. KI-2012: Poster and Demo Track: 59-63. Disponível em: <https://www.goldiges.de/publications/HBOS-KI-2012.pdf>. Acesso em: 27 mar. 2026.

He, Z.; Xu, X.; Deng, S. 2003. Discovering cluster-based local outliers. Pattern Recognition Letters 24(9-10): 1641-1650. Disponível em: <https://doi.org/10.1016/S0167-8655(03)00003-5>. Acesso em: 27 mar. 2026.

Li, Z.; Zhao, Y.; Botta, N.; Ionescu, C.; Hu, X. 2020. COPOD: copula-based outlier detection. arXiv. Disponível em: <https://arxiv.org/abs/2009.09463>. Acesso em: 27 mar. 2026.

Li, Z.; Zhao, Y.; Hu, X.; Botta, N.; Ionescu, C.; Chen G.H. 2022. ECOD: unsupervised outlier detection using empirical cumulative distribution functions. IEEE Transactions on Knowledge and Data Engineering. Disponível em: <https://doi.org/10.1109/TKDE.2022.3159580>. Acesso em: 27 mar. 2026.

Liu, F.T.; Ting, K.M.; Zhou, Z. 2008. Isolation forest. 2008 Eighth IEEE International Conference on Data Mining: 413-422. Disponível em: <https://doi.org/10.1109/ICDM.2008.17>. Acesso em: 27 mar. 2026.

Painel Resolveu? [Resolveu?]. 2026. Disponível em: <https://centralpaineis.cgu.gov.br/visualizar/resolveu>. Acesso em: 13 abr. 2026.

Plataforma Integrada de Ouvidoria e Acesso à Informação do Poder Executivo Federal [Fala.BR]. 2026. Disponível em: <https://falabr.cgu.gov.br>. Acesso em: 13 abr. 2026.

Santos, T.N. 2025. Ouvidoria inteligente: estratégias omnichannel e IA na ampliação da voz do cidadão. Revista Científica da Associação Brasileira de Ouvidores/Ombudsman 9(7): 65-73.

Artigo oriundo de Trabalho de Conclusão de Curso da Especialização em Data Science e Analytics do MBA USP/Esalq

Para saber mais sobre o curso, clique aqui e acesse a plataforma MBX Academy

You may also like

Neuroscience And Learning In Education

October 05, 2026

Elaboração de material educativo sobre higiene do sono para cuidadores de crianças com Transtorno do Espectro Autista

O sono exerce papel fundamental nos processos de aprendizagem e no funcionamento cognitivo, e evidências indicam que crianças com Transtorno do Espectro Autista (TEA) apresentam alterações significativas na arquitetura do sono, com possíveis repercussões no comportamento e no desempenho escolar. Diante desses desafios, objetivou-se elaborar um material educativo direcionado a cuidadores, contendo orientações práticas sobre higiene do sono em crianças com TEA, considerando seus impactos cognitivos, comportamentais e educacionais. O estudo caracterizou-se como um relato de experiência de natureza aplicada, com abordagem qualitativa, descritiva e reflexiva. O desenvolvimento do material baseou-se em dois eixos: a experiência clínica fonoaudiológica do pesquisador, por meio de observações e registros reflexivos, e o embasamento em evidências científicas, através de revisão da literatura sobre a neurociência do sono e o desenvolvimento neurocognitivo no TEA. A análise dos registros clínicos possibilitou a identificação de padrões recorrentes relacionados às dificuldades na higiene do sono em crianças com TEA, como resistência ao adormecer e despertares noturnos. A partir desses achados, elaborou-se uma cartilha educativa com orientações práticas sobre higiene do sono. Espera-se que o material contribua para a orientação de cuidadores na promoção de hábitos de sono adequados, favorecendo melhorias no comportamento, na aprendizagem e na qualidade de vida das crianças, além de auxiliar na redução da sobrecarga parental e na condução mais efetiva da rotina de sono.

Palavras-chave: Aprendizagem; Neurociências; Sono; Transtorno do Espectro Autista.

October 05, 2026

Aplicação do método de compressão de cronograma em projeto logístico e-commerce

Um estudo analisou a aplicação de técnicas de compressão de cronograma em um projeto de implantação logística de e-commerce, com o objetivo de avaliar seus impactos sobre prazo, custos, riscos e execução operacional. A pesquisa foi conduzida como um estudo de caso qualitativo, utilizando dados de cronogramas, estimativas, registros de projeto e participação direta na execução. Inicialmente, elaborou-se o planejamento do projeto com ferramentas estruturadas, como Estrutura Analítica do Projeto (EAP), sequenciamento de atividades, estimativa de duração por três pontos e alocação de recursos. Posteriormente, aplicou-se um método de priorização para definir as entregas críticas. A compressão do cronograma foi implementada por meio das técnicas de crashing e fast-tracking, focando nas atividades do caminho crítico. Como resultado, a duração total do projeto foi reduzida de seis para três meses, mantendo o escopo original. A análise indicou um aumento de custos, devido à intensificação do uso de recursos, e uma ampliação dos riscos operacionais, decorrente da execução paralela de atividades e da maior complexidade na coordenação. Observou-se que a aplicação dessas técnicas exige avaliação prévia da viabilidade operacional e definição de critérios de aceitação para custo e risco. O estudo contribuiu ao apresentar evidências empíricas da aplicação dessas técnicas em um contexto logístico, ressaltando a importância do alinhamento entre planejamento, execução e controle.

Palavras-chave: Compressão de cronograma; E-commerce; Gerenciamento de projetos; Logística; Riscos operacionais.

October 05, 2026

Infraestrutura Sanitária e Saúde Pública com Modelo de Dados em Painel

O acesso ao saneamento básico é um fator determinante para a saúde comunitária, influenciando a incidência de doenças de veiculação hídrica e relacionadas ao saneamento ambiental inadequado. Este estudo objetivou estimar a relação entre a expansão da infraestrutura de saneamento básico e os casos de diarreia em municípios paulistas entre 2010 e 2020. Utilizou-se um painel balanceado de 371 municípios e estimou-se um modelo de contagem com efeitos fixos (Poisson QMLE) para controlar especificidades locais. Os resultados indicaram que o aumento das ligações de esgoto no ano anterior associou-se à redução das internações (IRR = 0,9952; p = 0,003), enquanto o aumento das ligações de água não apresentou significância estatística (IRR = 1,0035; p = 0,144). Como desenvolvimento adicional, construiu-se uma variável de déficit de esgoto (GAP) em relação às ligações de água, e simulou-se o impacto da equalização desses volumes. A eliminação do déficit de esgoto evitaria aproximadamente 12.650 internações no período, representando uma redução de 17,96%. Uma análise de robustez com modelo binomial negativo confirmou a direção dos coeficientes, mas sem significância estatística para o GAP. Concluiu-se que a universalização dos serviços de esgotamento sanitário é uma estratégia efetiva de saúde pública para a redução das internações por diarreia.

Palavras-chave: Diarreia; Efeitos Fixos; Saneamento básico.

October 05, 2026

Índices de desempenho por posição em jogadores de futebol mediante análise de componentes principais

A crescente disponibilidade de dados no futebol impulsionou a necessidade de métodos para sintetizar indicadores de desempenho em medidas objetivas e interpretáveis. O estudo objetivou construir índices sintéticos de desempenho para jogadores de futebol, aplicando a Análise de Componentes Principais (PCA) a estatísticas individuais da Premier League 2024/2025. Utilizaram-se dados públicos de jogadores de linha da Premier League 2024/2025, excluindo-se goleiros e adotando-se um mínimo de 30% de participação nos minutos da temporada. As variáveis de contagem foram normalizadas por 90 minutos, as percentuais mantidas e todas padronizadas pelo método z-score. A PCA foi aplicada separadamente para defensores, meio-campistas e atacantes, com verificação de adequação pelo teste de esfericidade de Bartlett, retenção de fatores pelo critério de Kaiser e rotação ortogonal Varimax. Os resultados demonstraram a adequação da técnica para os três grupos posicionais, permitindo reter fatores interpretáveis que explicaram parcela expressiva da variância total dos dados. Os índices construídos revelaram que o desempenho posicional resultou da combinação de múltiplas dimensões, como participação defensiva, circulação, progressão com bola, produção ofensiva e objetividade nas ações de ataque. A abordagem adotada sintetizou o desempenho de forma coerente com as funções exercidas em campo, constituindo uma alternativa útil para análises comparativas entre atletas de uma mesma posição.

Palavras-chave: Análise multivariada; Avaliação posicional; Estatística aplicada; Premier League; Redução de dimensionalidade.

October 05, 2026

Web Scraping e NLP aplicados à análise de reclamações de seguradoras no site Reclame Aqui

O mercado segurador desempenha um papel crucial na economia, mas enfrenta desafios relacionados à satisfação do consumidor. Buscou-se analisar e categorizar as principais fontes de insatisfação dos consumidores no mercado segurador brasileiro. Para isso, aplicaram-se técnicas de Web Scraping e Processamento de Linguagem Natural (NLP) a dados textuais não estruturados, extraídos da plataforma Reclame Aqui, referentes a reclamações contra cinco seguradoras independentes. Realizou-se a coleta de aproximadamente 2.500 reclamações, que foram pré-processadas e submetidas à análise exploratória de dados, classificação temática e análise de sentimentos para mensurar a gravidade da insatisfação. Os resultados revelaram que temas como cancelamento, cobrança indevida e vendas irregulares concentram a maior parte das insatisfações, com alta frequência e elevada gravidade. A análise de Pareto confirmou que seis temas prioritários abrangem 81% das reclamações graves. Concluiu-se que a metodologia empregada gerou insights valiosos para a gestão da qualidade, permitindo a identificação de vulnerabilidades operacionais e a formulação de recomendações estratégicas para aprimorar a experiência do cliente e fortalecer a reputação corporativa.

Palavras-chave: Análise de dados textuais; Mercado segurador; Processamento de linguagem natural; Satisfação do consumidor.

October 05, 2026

Previsão da cobertura vacinal de hepatite A infantil no Paraná: rumo à meta ODS 2030

A vacinação infantil contra a hepatite A é uma ferramenta essencial de saúde pública, com crianças sendo as principais transmissoras silenciosas da doença. No contexto da Agenda 2030, a Meta 3.b dos Objetivos de Desenvolvimento Sustentável (ODS) promove inovações tecnológicas no Sistema Único de Saúde para prevenir doenças transmissíveis. Contudo, o declínio da cobertura vacinal no Brasil após 2015 impôs desafios. Diante desse cenário, o estudo objetivou desenvolver modelos estatísticos clássicos de séries temporais para prever a cobertura vacinal contra a hepatite A infantil nos municípios do Paraná até 2030. Adicionalmente, a pesquisa contemplou a visualização das predições em dashboards de Business Intelligence para monitoramento estratégico dos indicadores municipais. A metodologia compreendeu o processamento de grandes volumes de dados, seguido por uma abordagem comparativa entre os modelos de Suavização Exponencial Simples (SES) e Médias Móveis Integradas Autorregressivas (ARIMA). Os resultados revelaram que o modelo ARIMA(1,0,1) obteve a melhor acurácia para a projeção estadual, indicando uma tendência de estabilização da cobertura em 90,3%, patamar inferior à meta ideal de 95%. A análise municipal identificou 180 cidades (45%) como Pontos de Atenção, com riscos de não conformidade com as metas globais. Concluiu-se que o uso de ferramentas preditivas atua como um sistema de alerta antecipado crucial para o fortalecimento das políticas de imunização e a redução de desigualdades regionais.

Palavras-chave: Análise preditiva; Cobertura vacinal; Hepatite A; Modelos estatísticos clássicos; Séries temporais.

October 05, 2026

Contextualização de sentimentos em chats de transmissão ao vivo por LLMs

A proliferação de plataformas de transmissão ao vivo gerou fluxos contínuos de mensagens curtas em português brasileiro, cujas características linguísticas, como gírias e “emotes”, dificultam a classificação automática de sentimentos. Motivou-se esta investigação pelo interesse em processar dados localmente sem dependência de serviços proprietários. Avaliaram-se modelos de linguagem de grande escala (LLMs) de código aberto, com parâmetros reduzidos, para a classificação de sentimentos em três classes (Positivo, Neutro e Negativo) em mensagens de chat ao vivo do YouTube em português. Aplicaram-se três estratégias de “prompting” (zero-shot, ICL e CoT) em múltiplas execuções independentes, sobre um conjunto de referência rotulado manualmente. Toda a inferência foi executada via plataforma Colab, buscando a viabilidade de LLMs de código aberto para análise de sentimentos em ambientes com infraestrutura de média capacidade. As características do modelo, como forma de treinamento, responderam pela maior parcela da variância de desempenho, superando o efeito da estratégia de “prompting”. O melhor resultado foi obtido por um modelo da família Qwen 2.5 com ICL. Modelos treinados para raciocínio matemático e de código apresentaram desempenho abaixo do esperado, revelando incompatibilidade entre regime de treinamento e classificação de texto curto. A classe Neutro permaneceu o principal gargalo em todos os modelos, e o consenso entre modelos não se mostrou um substituto válido para a anotação humana. Os resultados indicaram a viabilidade de LLMs de código aberto de pequena escala para análise de sentimentos em português, com implicações para aplicações que exigem processamento local ou restrições de custo computacional, embora não sustentem o uso autônomo como substitutos da interpretação humana.

Palavras-chave: Aprendizado em contexto; Cadeia de raciocínio; Classificação de texto curto; Inferência local; Variabilidade de modelo.

October 05, 2026

Custos assistenciais referentes ao autismo na Saúde Suplementar: Uma abordagem com algoritmos não supervisionados

O crescimento dos casos de Transtorno do Espectro Autista (TEA) e a ampliação da cobertura assistencial na saúde suplementar têm gerado impactos relevantes nos custos das operadoras, tornando necessária a compreensão dos padrões associados a esses gastos. Identificou-se e caracterizou-se perfis distintos de custos ambulatoriais relacionados ao tratamento do TEA em operadoras de planos privados de saúde no estado de São Paulo, utilizando dados de 2023 e algoritmos de aprendizado não supervisionado. A metodologia empregou a construção e tratamento de uma base de mais de quatro milhões de registros, aplicou o algoritmo k-means para identificar agrupamentos e utilizou a Análise de Correspondência Múltipla para explorar associações entre variáveis categóricas. Os resultados revelaram a existência de diferentes perfis de custo, com padrões distintos na intensidade de utilização dos serviços, composição dos procedimentos e modelos de remuneração. Observou-se grupos associados a atendimentos mais simples e padronizados, e outros a maior complexidade assistencial e volume de procedimentos. Identificaram-se associações entre os clusters e características demográficas e estruturais do sistema de saúde, indicando diferenças entre perfis etários e padrões de utilização, sem evidência de relação causal direta com redução de custos. Concluiu-se que a aplicação de técnicas de análise de dados aprimorou a compreensão da dinâmica dos custos assistenciais, oferecendo subsídios para análises e decisões na saúde suplementar.

Palavras-chave: Análise de Correspondência Múltipla; Análise Exploratória; K-means; Padrões de Custos; Segmentação de Dados.

October 05, 2026

Modelo de negócio e viabilidade econômica de produção e comercialização de Crisântemo em Uberlândia-MG

O setor de flores e plantas ornamentais apresentou relevância econômica e crescimento estável no Brasil, com concentração produtiva regional. Observou-se que o atendimento de crisântemos à região do Triângulo Mineiro ocorria principalmente via distribuidores, o que aumentava custos e comprometia a qualidade do produto. Diante desse cenário, desenvolveu-se um modelo de negócio para a produção e comercialização de crisântemos destinados ao mercado de flores de corte, e analisou-se sua viabilidade econômica no município de Uberlândia (MG). O estudo classificou-se como um estudo de caso de natureza aplicada, utilizando métodos mistos (qualitativo e quantitativo). A pesquisa foi estruturada em três etapas: criação do modelo de negócio com Business Model Canvas, estudo de mercado por meio de questionários com potenciais clientes da região, e análise de viabilidade econômica. A avaliação econômica considerou Índice de Lucratividade, Valor Presente Líquido, Taxa Interna de Retorno e Payback, com horizonte de dez anos. Os resultados indicaram que a produção local de crisântemos apresentou potencial de viabilidade econômica, com redução de custos logísticos e melhoria na qualidade do produto. Os indicadores econômicos analisados apresentaram resultados favoráveis, indicando um retorno atrativo. Concluiu-se que a implantação de uma unidade produtiva de crisântemos na região estudada configura-se como uma alternativa promissora, com potencial para contribuir para o desenvolvimento econômico local e para o fortalecimento da cadeia produtiva da floricultura.

Palavras-chave: Análise econômica; Chrysanthemum morifolium; Cultivo protegido; Flor de corte.