Article

October 05, 2026

Contextualização de sentimentos em chats de transmissão ao vivo por LLMs

Contextualização de Sentimentos em Chats de Transmissão ao Vivo por Llms

Gustavo Jose Gomes Meilus; Lauro Marques Vicari

DOI: 10.22167/2675-6528-202602974

Artigo derivado de Trabalho de Conclusão de Curso (TCC), com conteúdo baseado no trabalho original do aluno e adaptado ao formato editorial da Revista E&S com apoio da ferramenta ResumeAI, solução de inteligência artificial desenvolvida pelo Instituto Pecege para síntese e organização textual.

Resumo

A proliferação de plataformas de transmissão ao vivo gerou fluxos contínuos de mensagens curtas em português brasileiro, cujas características linguísticas, como gírias e “emotes”, dificultam a classificação automática de sentimentos. Motivou-se esta investigação pelo interesse em processar dados localmente sem dependência de serviços proprietários. Avaliaram-se modelos de linguagem de grande escala (LLMs) de código aberto, com parâmetros reduzidos, para a classificação de sentimentos em três classes (Positivo, Neutro e Negativo) em mensagens de chat ao vivo do YouTube em português. Aplicaram-se três estratégias de “prompting” (zero-shot, ICL e CoT) em múltiplas execuções independentes, sobre um conjunto de referência rotulado manualmente. Toda a inferência foi executada via plataforma Colab, buscando a viabilidade de LLMs de código aberto para análise de sentimentos em ambientes com infraestrutura de média capacidade. As características do modelo, como forma de treinamento, responderam pela maior parcela da variância de desempenho, superando o efeito da estratégia de “prompting”. O melhor resultado foi obtido por um modelo da família Qwen 2.5 com ICL. Modelos treinados para raciocínio matemático e de código apresentaram desempenho abaixo do esperado, revelando incompatibilidade entre regime de treinamento e classificação de texto curto. A classe Neutro permaneceu o principal gargalo em todos os modelos, e o consenso entre modelos não se mostrou um substituto válido para a anotação humana. Os resultados indicaram a viabilidade de LLMs de código aberto de pequena escala para análise de sentimentos em português, com implicações para aplicações que exigem processamento local ou restrições de custo computacional, embora não sustentem o uso autônomo como substitutos da interpretação humana.

Palavras-chave: Aprendizado em contexto; Cadeia de raciocínio; Classificação de texto curto; Inferência local; Variabilidade de modelo.

1. Introdução

A Análise de Sentimentos percorreu uma trajetória longa, evoluindo de sistemas baseados em léxicos e regras manuais para arquiteturas de aprendizado profundo que dominaram a área na década de 2010. A emergência dos Grandes Modelos de Linguagem (LLMs) marcou um ponto de inflexão, pois esses modelos operam sobre representações semânticas densas, permitindo generalizar para domínios e idiomas com escassa disponibilidade de dados rotulados (Gupta et al., 2024).

Embora LLMs tenham demonstrado desempenho competitivo em configurações de poucos exemplos para tarefas de análise de sentimentos, eles ainda são inferiores a modelos ajustados especificamente para tarefas complexas. As avaliações disponíveis até então concentraram-se predominantemente em modelos proprietários, na língua inglesa, e em domínios de texto relativamente bem-comportados, como resenhas de produtos (Zhang et al., 2024). Esta concentração evidencia uma lacuna na compreensão do desempenho de LLMs em contextos mais desafiadores.

O português brasileiro em chats de transmissão ao vivo representa um caso distinto e particularmente complexo. As transmissões ao vivo em plataformas como o YouTube geram fluxos densos de mensagens curtas, caracterizadas por emojis, abreviações, gírias de comunidade e referências em tempo real ao conteúdo transmitido. A classificação de sentimentos nesse ambiente é desafiadora devido à forte dependência contextual, onde o sentido de uma mensagem pode ser alterado pela interação precedente (Carvalho et al., 2023). Termos que em outros domínios teriam conotação positiva, como “absurdo” ou “insano”, podem funcionar como elogios intensos nesse ambiente específico (Zhao et al., 2024), levando modelos treinados genericamente a classificações errôneas.

Além dos desafios linguísticos e contextuais, a análise de sentimentos em transmissões ao vivo possui uma utilidade prática significativa. Ela permite sintetizar a reação de uma audiência que produz um volume de mensagens incompatível com a inspeção manual contínua. Em contextos como o esportivo, a classificação de sentimentos pode apoiar a identificação de períodos de maior engajamento do público, diferenciar avaliações sobre o conteúdo ou apresentador, e priorizar trechos para revisão humana. A execução dessa análise com modelos de código aberto e de menor porte amplia a viabilidade desse processamento em infraestrutura limitada.

Para abordar a classificação de sentimentos em LLMs sem a necessidade de ajuste fino supervisionado, a literatura recente explorou estratégias de prompting. Entre elas, destacam-se a inferência direta sem exemplos (zero-shot), o aprendizado em contexto com exemplos do domínio (in-context learning [ICL]) e o raciocínio encadeado (chain-of-thought [CoT]). Wei et al. (2022) demonstraram que forçar o modelo a verbalizar etapas intermediárias melhora a acurácia em tarefas complexas, enquanto Xu et al. (2024) evidenciaram a eficácia do ICL na indução de comportamentos específicos. Contudo, a aplicação dessas estratégias em modelos de código aberto de escala reduzida, especialmente em mensagens de chat em português, ainda carece de investigação aprofundada.

Um problema adicional, menos discutido, é a variabilidade de saída dos próprios modelos. Herrera-Poyatos et al. (2025) caracterizaram o Problema de Variabilidade do Modelo (MVP), onde prompts idênticos submetidos ao mesmo modelo em execuções independentes podem gerar classificações divergentes. Esse fenômeno compromete a confiabilidade de sistemas que exigem consistência analítica e é acentuado em modelos menores com menor capacidade de avaliação semântica. A medição explícita dessa variabilidade é fundamental para validar comparações entre modelos e estratégias de prompting.

Diante desse cenário, a presente pesquisa se justifica pela necessidade de evidências empíricas sobre a viabilidade de LLMs de código aberto de pequena escala para a análise de sentimentos em português, especificamente em ambientes de chat de transmissão ao vivo com restrições de custo computacional e infraestrutura. Assim, o objetivo deste trabalho é avaliar nove LLMs open-source com parâmetros entre 1,5 e 9 bilhões em uma tarefa de classificação de sentimentos de três classes (Positivo, Negativo e Neutro) aplicada a mensagens de chat ao vivo do YouTube em português brasileiro em conteúdo de futebol, aplicando três cenários de prompting (zero-shot, ICL e CoT) e investigando a variabilidade de saída dos modelos.

2. Material e Métodos

A presente pesquisa caracterizou-se como um estudo de natureza quantitativa e experimental, com o objetivo de avaliar o desempenho de modelos de linguagem de grande escala (LLMs) de código aberto em uma tarefa de classificação de sentimentos. O objeto empírico consistiu em mensagens de chat ao vivo da plataforma YouTube, especificamente em português brasileiro e relacionadas ao domínio de futebol.

A coleta de dados foi realizada a partir de oito transmissões ao vivo publicadas no YouTube. Utilizou-se o módulo “yt-chat-downloader” para recuperar as mensagens disponíveis nos replays dos chats, consultando o “endpoint” empregado pelo reprodutor da plataforma. As transmissões incluíram partidas de futebol e coberturas esportivas, abrangendo conteúdo internacional e nacional, sem restrição a uma única equipe ou competição.

Para a construção do conjunto de referência humano, foram extraídas 400 mensagens das oito transmissões por meio de amostragem temporal estratificada. Cada vídeo foi dividido em cinco faixas temporais de duração equivalente, e 10 mensagens foram amostradas aleatoriamente dentro de cada faixa, totalizando 50 mensagens por vídeo. Esse procedimento garantiu a representação de diferentes momentos do conteúdo transmitido.

As 400 mensagens amostradas foram rotuladas manualmente com um entre três rótulos de sentimento: Positivo, Negativo ou Neutro. Os critérios para o rótulo Positivo incluíram expressões de alegria e excitação, como “bora” e “gol”, e elogios. Para o rótulo Negativo, foram consideradas expressões de frustração, como “não teve nem chance” e “joga muito mal”. Mensagens ambíguas ou que não se enquadravam nessas regras foram classificadas como Neutras.

Antes da inferência ou amostragem, todas as mensagens passaram por um pipeline de pré-processamento composto por oito etapas sequenciais. Essas etapas incluíram a remoção de tags HTML, normalização Unicode, conversão de emojis para descrição textual, substituição de URLs por um token [URL], anonimização de menções de usuário por [USER], normalização de repetição de caracteres, conversão de texto para minúsculas e normalização de espaços em branco.

Adicionalmente, aplicou-se uma filtragem para excluir mensagens compostas exclusivamente por comandos de robôs, mensagens ou reações com poucos caracteres, endereços sem contexto, e mensagens formadas apenas por dígitos ou sequências de risada pura. Esse pipeline foi aplicado de forma idêntica a todas as mensagens, tanto na construção do conjunto de referência quanto na etapa de inferência pelos modelos.

Foram avaliados nove modelos de linguagem de grande escala (LLMs) de código aberto, com parâmetros variando entre 1,5 e 9 bilhões. Os modelos incluíram versões das famílias Qwen 2.5 (3B e 7B), Qwen 3.5 (4B), Phi 4 (3,8B Mini), Gemma 2 (2B e 9B), Llama 3.2 (3B) e DeepSeek-R1 (1,5B e 7B). Os modelos DeepSeek-R1 foram treinados com aprendizado por reforço focado em raciocínio encadeado, como matemática e geração de código (DeepSeek-AI, 2025).

Toda a inferência foi executada via Ollama, utilizando o “backend” llama.cpp, em um ambiente Google Colab com núcleos L4. Para cada modelo, aplicaram-se três estratégias de “prompting”: zero-shot, in-context learning (ICL) e chain-of-thought (CoT). Essas estratégias foram selecionadas com base em sua eficácia documentada na literatura para tarefas de classificação sem ajuste fino (Wei et al., 2022; Xu et al., 2024).

O cenário zero-shot empregou um “prompt” de instrução completo, com orientações de domínio para o português brasileiro, incluindo um glossário de abreviações, tratamento de sarcasmo e definições detalhadas de seis aspectos de anotação. O “prompt” recebeu apenas a mensagem a ser classificada. O cenário ICL utilizou um “prompt” de instrução mínimo, com a enumeração dos rótulos e aspectos, e incluiu seis exemplos rotulados (dois por classe de sentimento) antes da mensagem a classificar. Os exemplos foram extraídos de um “pool” de 18 mensagens, amostradas da anotação humana e excluídas do conjunto de avaliação, com a ordem de apresentação variando entre execuções (Lu et al., 2022).

O cenário CoT utilizou o mesmo “prompt” de instrução do zero-shot, mas foi acrescido de um “scaffolding” explícito de raciocínio em três etapas: identificação de palavras de sentimento, determinação do aspecto e ponderação final para atribuição do rótulo. Os “prompts” zero-shot e CoT incorporaram instruções específicas do domínio de futebol, como a interpretação de profanidades como expressão de excitamento positivo e um glossário de abreviações. O “prompt” ICL omitiu essas instruções, pois os exemplos visavam criar uma relação implícita entre expressões e polaridade.

Todos os modelos foram executados com o parâmetro “temperature” em 0,3, para tornar as respostas mais determinísticas, e “max_tokens” em 512, limitando o comprimento máximo da saída. A saída foi definida por um “schema” Pydantic, que especificou os campos obrigatórios e os tipos de dados esperados na resposta JSON: “label” (rótulo de sentimento), “aspect” (aspecto anotado), “confidence” (confiança declarada pelo modelo) e “reasoning” (justificativa textual). A conformidade foi forçada via “StructuredOutputsParams” do Ollama.

Os seis aspectos de anotação disponíveis para o campo “aspect” foram: “content” (conteúdo transmitido), “presenter” (apresentador), “community” (comunidade do chat), “audio_video” (qualidade de áudio ou vídeo), “meta” (aspectos da plataforma ou da transmissão em si) e “unknown” (sem aspecto identificável). Cada mensagem recebeu um rótulo e um aspecto por execução. O “design” experimental adotou cinco execuções independentes para cada combinação de modelo e cenário, totalizando 135 células experimentais (9 modelos × 3 cenários × 5 execuções).

A repetição das execuções foi implementada para quantificar a variabilidade de saída dos modelos, fenômeno descrito por Herrera-Poyatos et al. (2025) como Problema de Variabilidade do Modelo. Dentro de cada execução, os parâmetros de “prompt” permaneceram idênticos, variando apenas a semente de seleção de exemplos no cenário ICL. As execuções zero-shot e CoT produziram variação apenas pela amostragem estocástica interna do modelo à “temperature” de 0,3. Seis pares (modelo, cenário) foram excluídos da análise inferencial por apresentarem falha estrutural na geração de saída JSON válida, resultando em 105 observações válidas para os testes estatísticos.

A métrica principal de avaliação adotada foi o F1-macro, calculado como a média aritmética dos valores F1 das três classes (Positivo, Negativo e Neutro) sem ponderação pela frequência, tratando-as de forma equânime. Adicionalmente, registraram-se a acurácia, o Kappa de Cohen para medir a consistência interna de cada modelo entre suas cinco execuções, e o Kappa de Fleiss para mensurar o grau de acordo inter-modelo entre os nove modelos. O acordo percentual entre execuções foi computado como a proporção de mensagens em que todas as cinco execuções produziram o mesmo rótulo. Para a análise de desacordo, calculou-se a entropia de Shannon por mensagem, quantificando a distribuição das predições entre as classes.

Uma validação “proxy” foi conduzida comparando o F1 de cada par (modelo, cenário) calculado contra o “ground truth” humano e contra um “ground truth” de consenso, construído por votação majoritária dos nove modelos. A correlação de Pearson entre os dois vetores de F1 serviu de critério para verificar se o consenso de modelos poderia substituir a anotação humana em avaliações futuras. A escala de interpretação do Kappa seguiu Landis e Koch (1977).

A comparação de desempenho entre modelos e cenários foi realizada com o teste de Kruskal-Wallis, adotado após a verificação de violação do pressuposto de homogeneidade de variâncias pelo teste de Levene. Foram testados separadamente dois efeitos principais: o efeito de modelo (nove grupos, 105 observações) e o efeito de cenário (três grupos, mesmas observações). O nível de significância adotado foi α=0,05. As estatísticas H e o tamanho de efeito ε² foram calculados conforme as formulações de Tomczak e Tomczak (2014).

3. Resultados e Discussão

A avaliação dos modelos de linguagem de grande escala (LLMs) de código aberto para a classificação de sentimentos em mensagens de chat ao vivo do YouTube revelou padrões de desempenho distintos, influenciados primariamente pelas características intrínsecas dos modelos e, em menor grau, pelas estratégias de *prompting* empregadas. Os resultados indicaram a viabilidade de LLMs de pequena escala para essa tarefa em português, embora com desafios notáveis, especialmente na identificação da classe Neutro. A análise detalhada permitiu identificar as configurações mais eficazes e os fatores que limitam a acurácia e a consistência, fornecendo subsídios para o desenvolvimento de aplicações que demandam processamento local e eficiente.

Desempenho geral dos modelos

O F1-macro médio, calculado sobre as cinco execuções independentes para cada combinação de modelo e cenário, demonstrou que a configuração de maior desempenho foi o modelo qwen2.5-3b com a estratégia de *In-Context Learning* (ICL), alcançando um F1-macro médio de 0,603 com desvio padrão de 0,035. A melhor execução individual para esta configuração atingiu um F1 de 0,659. Em contraste, o modelo deepseek-r1-7b apresentou um desempenho máximo de F1=0,340, inferior a todos os modelos na faixa de 2 a 4 bilhões de parâmetros, evidenciando uma discrepância significativa que será discutida adiante. Esses valores foram computados em relação a um conjunto de referência humano de 400 mensagens, ou 382 no cenário ICL devido à remoção do *pool* de exemplos.

O segundo melhor desempenho foi observado no modelo gemma2-9b com a estratégia *Chain-of-Thought* (CoT), que obteve um F1-macro de 0,585 com um desvio padrão de 0,005. Este resultado, embora ligeiramente inferior ao qwen2.5-3b/ICL em termos de acurácia média, destacou-se pela consistência significativamente maior entre as execuções, com um desvio padrão sete vezes menor. Essa diferença sugere que, para aplicações onde a reprodutibilidade é crítica, o gemma2-9b/CoT pode ser uma escolha preferível. Ambos os modelos com F1-macro acima de 0,58 situam-se na faixa de 3 a 9 bilhões de parâmetros, indicando que modelos de maior porte tendem a apresentar melhor desempenho, embora com variações importantes.

Apesar do desempenho competitivo dos LLMs em configurações de poucos exemplos, o F1-macro máximo de 0,603 ainda se manteve abaixo dos resultados alcançados por métodos supervisionados em língua portuguesa, como os modelos baseados em BERT ajustados para o domínio, conforme relatado por Goularte et al. (2024). Contudo, a principal vantagem da abordagem adotada neste estudo reside na ausência completa de ajuste fino. Todo o desempenho foi obtido por inferência *zero-shot* ou com um número limitado de exemplos no *prompt*, sem a necessidade de atualização de pesos ou custos adicionais de GPU, o que é crucial para a viabilidade em ambientes com infraestrutura limitada.

Efeito da estratégia de *prompting*

O teste de Kruskal-Wallis, aplicado para avaliar o efeito da estratégia de *prompting* no F1-macro, resultou em um valor H de 4,12 e um p-valor de 0,127, com um tamanho de efeito epsilon-quadrado de 0,040. Esses dados indicam que a escolha da estratégia de *prompting*, quando considerada isoladamente, não produziu variações estatisticamente significativas no F1-macro para o conjunto total de modelos. Este achado refuta a hipótese H1, que postulava um efeito principal da estratégia de *prompting*, e sugere que o impacto da estratégia é secundário em comparação com as características do modelo.

Apesar da ausência de um efeito principal estatisticamente significativo, os padrões descritivos revelaram um claro efeito de interação entre o modelo e a estratégia de *prompting*. A estratégia ICL, por exemplo, melhorou o F1-macro em sete dos nove modelos avaliados, com ganhos expressivos de até +0,117 no gemma2-9b e +0,110 no qwen2.5-3b. Em contrapartida, o ICL afetou negativamente o deepseek-r1-7b em -0,077 e o qwen3.5-4b em -0,036. Essa variabilidade no impacto do ICL é consistente com as observações de Zhang et al. (2024), que destacaram a dependência do ganho do ICL na capacidade do modelo de extrair padrões implícitos dos exemplos fornecidos.

A estratégia CoT beneficiou os modelos que demonstraram capacidade suficiente para sustentar o raciocínio encadeado, como o gemma2-9b, que obteve um ganho de +0,136, e o qwen2.5-3b, com +0,091. No entanto, o CoT causou falhas estruturais nos modelos menores, que não conseguiram completar o *scaffolding* de três etapas. A hipótese H5, que previa a superioridade do ICL sobre o *zero-shot* para a maioria dos modelos, foi amplamente suportada, com sete dos nove modelos exibindo ganhos positivos. A hipótese H4, que esperava melhoria do CoT para modelos capazes, também foi suportada pelos dados, especialmente para aqueles com cobertura de raciocínio encadeado superior a 98%.

O comportamento do CoT revelou um limiar prático: modelos com aproximadamente 3 a 4 bilhões de parâmetros, ou aqueles com treinamento incompatível para classificação estruturada, não conseguiram sustentar o *scaffolding*, resultando em falhas de saída em mais de 85% das mensagens. Por exemplo, o llama3.2-3b completou apenas 22,6% das mensagens no CoT, e o phi4-mini (3,8B) alcançou 83,8%. Em contraste, o qwen2.5-3b, com 3 bilhões de parâmetros, completou 99,5% das mensagens, indicando que o sucesso do CoT não depende exclusivamente do tamanho do modelo, mas também do regime de treinamento. Esse achado corrobora estudos como o de Amin et al. (2024), que observaram que o CoT beneficia mais modelos de código fechado do que os abertos em línguas de baixo recurso.

Efeito do modelo e *task-training mismatch*

O efeito do modelo foi o fator mais determinante no estudo, com um valor H de 69,0 e um p-valor aproximado de zero, resultando em um tamanho de efeito epsilon-quadrado de 0,663. Isso significa que a identidade do modelo explicou 66% da variância de ranqueamento no F1-macro, superando significativamente o impacto da estratégia de *prompting*. Este resultado está em consonância com a interpretação de Zhang et al. (2024), que apontaram que as diferenças de capacidade entre os modelos dominam o desempenho em tarefas de análise de sentimentos, especialmente quando não há ajuste fino para o domínio específico.

A hipótese H2, que postulava uma correlação entre o tamanho do modelo e a acurácia, foi parcialmente suportada. Observou-se uma distinção clara entre os modelos de 1,5 bilhão de parâmetros, como o deepseek-r1-1.5b, que apresentou F1-macro inferior a 0,30 em configurações válidas, e os modelos de 2 bilhões de parâmetros ou mais. Contudo, na faixa de 7 bilhões de parâmetros, o padrão se inverteu: o deepseek-r1-7b alcançou um F1-macro máximo de 0,340, valor inferior ao de todos os modelos entre 2 e 4 bilhões de parâmetros. O qwen2.5-3b, com 3 bilhões de parâmetros, superou consistentemente o deepseek-r1-7b por um fator de aproximadamente 1,8x em F1 médio.

A explicação para essa inversão de desempenho reside no regime de treinamento do DeepSeek-R1. Este modelo foi ajustado com aprendizado por reforço para maximizar o raciocínio encadeado em tarefas matemáticas e de geração de código, conforme documentado por DeepSeek-AI (2025), e não para a classificação de textos curtos. Ao processar mensagens de chat com poucos caracteres, o modelo gerou extensas cadeias de raciocínio, um *overhead* computacional que não resultou em ganhos de F1. No cenário CoT, o desempenho piorou ativamente em -0,059 em relação ao *zero-shot*, e no ICL, a queda foi ainda mais acentuada, -0,077, sugerindo que os exemplos foram interpretados como elos adicionais de raciocínio em vez de âncoras de classificação.

Esse fenômeno de *task-training mismatch* foi também documentado por Ghatora et al. (2024), que observaram que modelos otimizados para processamento de texto longo ficam em desvantagem em textos curtos, pois o sinal de sentimento está concentrado em poucos *tokens*, e o mecanismo de atenção distribui peso desnecessário em posições vazias. A comparação entre qwen2.5-3b e llama3.2-3b, ambos com aproximadamente 3 bilhões de parâmetros, reforça a importância do regime de treinamento. Enquanto o qwen2.5-3b atingiu F1-macro entre 0,49 e 0,60, o llama3.2-3b ficou entre 0,35 e 0,42. Essa diferença de 0,14 a 0,18 pontos de F1 entre modelos de mesmo porte indica que o número de parâmetros é uma variável pouco promissora para a seleção de modelos, e que o alinhamento do treinamento com a tarefa é crucial para evitar diferenças de F1 superiores a 40%.

Análise por classe de sentimento

A análise desagregada do F1-macro revelou uma assimetria marcante no desempenho por classe, com o *recall* da classe Neutro sendo o ponto mais fraco em todos os modelos e cenários. A média do *recall* Neutro sobre os 27 pares (modelo, cenário) foi de 0,238, indicando que os modelos identificaram corretamente menos de uma em cada quatro mensagens genuinamente neutras. O valor mais alto para o *recall* Neutro, 0,538, obtido pelo phi4-mini no cenário ICL, permaneceu abaixo de 0,54 em todos os modelos. Em contraste, o *recall* Positivo excedeu 0,77 em todos os modelos de melhor desempenho, e o *recall* Negativo alcançou 0,838 no qwen2.5-3b/ICL, demonstrando maior facilidade na detecção dessas polaridades.

O padrão de confusão dominante foi a classificação de mensagens Neutras como Positivas. No qwen2.5-3b/ICL, 99 das 238 mensagens neutras do conjunto de avaliação (41,6%) foram rotuladas como Positivo. No deepseek-r1-7b/*zero-shot*, essa proporção atingiu 72%. No total, 24 dos 27 pares (88,9%) predisseram mais mensagens Positivas do que o *ground truth* humano, configurando um viés positivo generalizado. Este viés contrasta com o fenômeno inverso documentado por Springer et al. (2025), onde modelos mais restritivos tendem a sobreprever a classe Neutro por excesso de cautela. Os modelos abertos avaliados neste estudo operaram no extremo oposto, convertendo a ambiguidade em Positivo.

A explicação para o viés positivo pode estar parcialmente na assimetria do *design* do *prompt* no cenário *zero-shot*, que incluía a instrução de que profanidades brasileiras frequentemente expressam excitamento positivo. Essa orientação pode ter induzido um viés nos modelos para o polo positivo em conteúdo emocionalmente ambíguo. A análise de entropia de Shannon por mensagem adicionou uma perspectiva complementar: das 582 mensagens do *pool* de *ground truth*, 38 (6,5%) apresentaram entropia superior a 1,5, indicando que os nove modelos estavam quase maximamente divididos sobre o rótulo correto. Dessas mensagens de máximo desacordo, 50% tinham rótulo humano Neutro, contra 13,2% na distribuição modal do consenso entre modelos, o que significa que a classe Neutro está 3,8 vezes sobre-representada nos casos de maior discordância entre modelos.

A classe Negativo, por sua vez, demonstrou ser a mais fácil de detectar, com 70,1% das mensagens unânimes (entropia=0,0) recebendo o rótulo Negativo de todos os nove modelos. Isso sugere que marcadores lexicais explícitos para sentimentos negativos são captados de forma convergente por todas as arquiteturas. Em contraste, a classe Neutro, caracterizada pela ausência de um sinal positivo ou negativo claro, gerou a máxima divergência entre os modelos. Carvalho et al. (2023) destacaram que mensagens isoladas de diálogo perdem informação contextual crucial para a classificação, o que é especialmente grave para mensagens neutras, cujo sentido muitas vezes depende de uma cadeia conversacional que o *prompt* não fornece. O teto prático do F1-macro, portanto, ficou limitado pela dificuldade em classificar a classe Neutro, e elevar seu *recall* de 0,416 para 0,700 seria a intervenção de maior retorno para superar o patamar de 0,60 observado.

Estabilidade entre execuções

A análise da estabilidade entre as execuções revelou diferenças significativas entre as estratégias de *prompting*. O desvio padrão médio do F1-macro entre as cinco execuções foi de 0,007 para CoT, 0,010 para *zero-shot* e 0,053 para ICL. Isso indica que o ICL foi 7,5 vezes mais variável que o CoT e 5,3 vezes mais variável que o *zero-shot*. A célula mais instável foi qwen3.5-4b/ICL, que atingiu um desvio padrão de 0,107, enquanto a mesma célula em *zero-shot* ficou em 0,019, ilustrando como o ICL pode amplificar a variância em modelos sensíveis à ordem dos exemplos, um fenômeno documentado por Lu et al. (2022) para tarefas de poucos exemplos.

A hipótese H3, que previa maior consistência em modelos maiores, foi parcialmente suportada. Modelos de 7 bilhões de parâmetros, como deepseek-r1-7b e qwen2.5-7b, e o gemma2-9b, alcançaram o Tier 1 de consistência (acordo ≥ 90% entre execuções) nos cenários *zero-shot* e CoT. Contudo, o qwen2.5-3b, com 3 bilhões de parâmetros, também atingiu o Tier 1 nesses cenários, demonstrando que o tamanho não é uma condição suficiente para a estabilidade, e que o alinhamento de treinamento é um fator confundidor. O llama3.2-3b, por exemplo, ficou no Tier 3 (acordo entre 70% e 79%) mesmo no cenário ICL, enquanto o qwen2.5-3b, de porte similar, ficou no Tier 2, evidenciando que a consistência está mais associada à arquitetura e ao regime de treinamento do que ao tamanho absoluto.

O destaque negativo foi o qwen3.5-4b no ICL, com um colapso de execução individual a 41,2% de acordo e uma variação de 0,254 pontos de F1 entre a execução mais alta e a mais baixa da mesma célula. Esse comportamento sugere que o modelo possui um regime de treinamento por RLHF que o torna hipersensível à ordem dos exemplos, transformando o ICL em uma estratégia de alto risco. Para aplicações de produção que exigem reprodutibilidade, o ICL deve ser submetido a testes de estabilidade rigorosos. Wang et al. (2023) propuseram a autoconsistência para estabilizar o raciocínio encadeado, o que explica a menor variância do CoT, onde o *scaffolding* força o modelo a externalizar o raciocínio intermediário. Herrera-Poyatos et al. (2025) identificaram a temperatura como o principal *driver* de variância, e o uso de *temperature*=0,3 neste estudo produziu réplicas quase-determinísticas em algumas células *zero-shot*, subestimando a verdadeira variabilidade em condições de temperatura mais alta.

A latência média de inferência, medida em milissegundos por mensagem, é um fator crucial para a adoção em produção. Os modelos foram ordenados por latência média ascendente no cenário ICL. O qwen2.5-3b apresentou a menor latência no ICL, com 27 ms, seguido pelo phi4-mini com 36 ms. Em contraste, o gemma2-9b teve a maior latência no *zero-shot*, com 4923 ms, e o qwen3.5-4b apresentou latências elevadas em todos os cenários, com 1135 ms no ICL. A classificação dos pares (modelo, cenário) em *tiers* de consistência revelou que deepseek-r1-7b/CoT (96,1%) e qwen2.5-3b/*zero-shot* (96,0%) estavam no Tier 1 (≥ 90% de acordo), enquanto qwen3.5-4b/ICL (54,2%) ficou abaixo do Tier 3 (< 70%), reforçando sua instabilidade.

Validação *proxy* e acordo inter-modelo

O Kappa de Fleiss, calculado sobre 390 mensagens no cenário *zero-shot*/execução 1 onde todos os nove modelos produziram predições, foi de 0,287. De acordo com a escala de Landis e Koch (1977), este valor se situa na faixa de “concordância razoável” (0,21 a 0,40), indicando que os modelos não convergiram para um padrão de classificação compartilhado. O maior Kappa de Cohen por par foi observado entre gemma2-9b e qwen2.5-7b (0,546, “concordância moderada”), enquanto o deepseek-r1-1.5b exibiu um Kappa próximo de zero contra os demais modelos (0,018 a 0,074), sugerindo que suas predições foram funcionalmente aleatórias em relação ao consenso dos outros oito modelos.

A correlação de Pearson entre o F1-macro calculado contra o *ground truth* humano e o F1-macro calculado contra um *ground truth* de consenso (construído por votação majoritária dos nove modelos) foi de r=0,606 (p=0,0008, n=27). Este valor ficou abaixo do limiar pré-estabelecido para validação do *proxy* (r ≥ 0,70 a 0,85), o que significa que o consenso dos modelos não foi validado como um substituto confiável para a anotação humana. A baixa concordância entre os próprios modelos, refletida no Kappa de Fleiss, explica essa incerteza e a falta de correlação suficiente com o F1 humano.

Adicionalmente, observou-se que os modelos pontuaram sistematicamente mais alto contra o consenso do que contra o anotador humano. No caso mais extremo, o gemma2-9b/*zero-shot* alcançou F1=0,447 contra o *ground truth* humano e F1=0,941 contra o consenso, uma diferença de 0,494 pontos, com o *score* de consenso sendo 2,1 vezes maior. Esse padrão se repetiu em todos os 27 pares avaliados, indicando que os modelos convergem para um padrão de rotulagem compartilhado entre si que diverge sistematicamente do julgamento humano, principalmente na classe Neutro. Este achado confirma a advertência de Wang et al. (2024) de que rótulos gerados por LLMs não devem ser assumidos como aproximações da anotação humana sem validação explícita, especialmente em categorias de interpretação ambígua, como a classe Neutro em mensagens de chat em português brasileiro.

Limitações do estudo

Uma limitação estatística importante do estudo reside na ausência de um termo de interação no modelo de análise. Os testes de Kruskal-Wallis avaliaram o modelo e o cenário como efeitos principais independentes, mas os padrões descritivos indicaram uma interação significativa, onde o ICL beneficiou as famílias Qwen e Gemma, enquanto prejudicou os modelos DeepSeek-R1. Uma análise formal com Scheirer-Ray-Hare ou ART ANOVA poderia ter fornecido uma interpretação mais precisa, qualificando o veredito da hipótese H1 como condicional. Além disso, as comparações *post-hoc* por pares de modelos com correção de Holm-Bonferroni não foram executadas, o que significa que afirmações como “qwen2.5-3b supera deepseek-r1-7b” permanecem descritivas e não são apoiadas por testes formais de significância.

O uso de *temperature*=0,3 introduziu uma segunda limitação. Em modelos capazes no *zero-shot*, como qwen2.5-3b e gemma2-9b (com desvio padrão inferior a 0,005), as cinco execuções foram réplicas quase-determinísticas, em vez de amostras estocásticas independentes. As estimativas de variância para essas células podem subestimar a verdadeira variabilidade que seria observada em produção com *temperature* mais alta ou amostragem nuclear. Qualquer inferência sobre a estabilidade real do modelo nessas configurações deve ser feita com cautela. Por outro lado, uma *temperature* mais alta poderia amplificar o ruído em células já instáveis, como qwen3.5-4b/ICL, aumentando tanto o sinal de variância quanto o piso de F1.

A generalização dos resultados é restrita a mensagens de chat em português brasileiro de plataformas de transmissão ao vivo. O *corpus* de oito transmissões concentrou-se em conteúdo esportivo relacionado ao futebol, com características linguísticas específicas como *code-switching*, gírias e reações de torcida, que podem não estar presentes em *chats* de outras plataformas ou contextos. Goularte et al. (2024) observaram que a análise de sentimentos multi-gênero em português apresenta variação significativa de desempenho conforme o gênero textual, o que exige cautela na transferência dos valores de F1 reportados para outros domínios. A ausência de anotação por múltiplos anotadores humanos também limitou a possibilidade de calcular a concordância inter-anotador, o que teria tornado o *ground truth* mais confiável, especialmente para a classe Neutro, que concentrou a maior parte do desacordo entre os modelos.

O *pool* de exemplos do ICL, composto por 18 mensagens (seis por classe) extraídas do *ground truth* humano, é pequeno em termos absolutos. Lu et al. (2022) demonstraram que a sensibilidade à ordem e ao conteúdo dos exemplos aumenta conforme a fonte de seleção é menor, pois a diversidade de escolhas possíveis é limitada. O *design* atual confunde a variação de conteúdo dos exemplos com a variação de ordem, pois ambas mudam a cada execução. Para atribuir a parcela de variância do ICL a cada fonte, seria necessário isolar esses fatores em um estudo de ablação específico, com a fixação do conteúdo e variação apenas da ordem e vice-versa, o que o presente experimento não permite.

Em síntese, a pesquisa demonstrou a viabilidade de LLMs de código aberto de pequena escala para a análise de sentimentos em português brasileiro em chats de transmissão ao vivo, com o modelo qwen2.5-3b/ICL apresentando o melhor equilíbrio entre desempenho e estabilidade. Contudo, a classe Neutro emergiu como o principal gargalo, e a variabilidade de saída dos modelos, especialmente no ICL, ressaltou a importância de considerar a consistência e o alinhamento do treinamento com a tarefa. Os achados indicam que, embora esses modelos não substituam a anotação humana, podem atuar como uma camada de apoio analítico para priorizar a revisão humana e sintetizar a reação da audiência, respondendo ao objetivo de avaliar a aplicabilidade desses modelos em cenários de infraestrutura limitada.

4. Conclusão

Este trabalho avaliou a viabilidade de modelos de linguagem de grande escala (LLMs) de código aberto, com parâmetros reduzidos, para a classificação de sentimentos em mensagens de chat ao vivo do YouTube em português brasileiro, aplicando diferentes estratégias de prompting. Verificou-se que a identidade do modelo e seu regime de treinamento foram os fatores mais determinantes para o desempenho, explicando 66% da variância no F1-macro, superando o impacto da estratégia de prompting. O modelo qwen2.5-3b, utilizando In-Context Learning (ICL), alcançou o melhor F1-macro médio de 0,603, demonstrando um equilíbrio favorável entre acurácia e latência de inferência, com 27 ms por mensagem. Este achado ressalta a aplicabilidade de LLMs de pequena escala em ambientes com infraestrutura limitada e restrições de custo computacional, oferecendo uma solução para sintetizar a reação da audiência em tempo real e priorizar a revisão humana em fluxos de mensagens densos.

Apesar da viabilidade demonstrada, a classe Neutro permaneceu o principal gargalo em todos os modelos, com baixo recall e um viés positivo generalizado, indicando que a ausência de marcadores explícitos de sentimento é mais difícil de detectar. Além disso, o consenso entre os modelos não se mostrou um substituto válido para a anotação humana, pois os modelos convergiram para um padrão de rotulagem que diverge do julgamento humano. As limitações do estudo incluíram a ausência de um termo de interação na análise estatística e a restrição da generalização a mensagens de chat de futebol em português brasileiro. Para estudos futuros, sugere-se a redefinição operacional da classe Neutro para contextos de chat, a exploração de pools de exemplos ICL mais diversos e a investigação de protocolos de anotação semi-automática que concentrem a revisão humana em casos de alta incerteza, visando otimizar o custo de construção de conjuntos de referência.

Referências Bibliográficas

Amin, M.N.; Islam, M.A.; Hossain, M.S.; Rahman, M.M.; Sarker, I.H. 2024. Evaluation of open and closed-source LLMs for low-resource language with zero-shot, few-shot, and chain-of-thought prompting. Natural Language Processing Journal 9: 100113.

Carvalho, I.; Silva, C.; Goncalo Oliveira, H. 2023. The importance of context for sentiment analysis in dialogues. IEEE Access 11: 87140-87155.

DeepSeek-Al. 2025. DeepSeek-R1: incentivizing reasoning capability in LLMs via reinforcement learning. arXiv preprint 2501.12948. Disponível em: <https://arxiv.org/abs/2501.12948>. Acesso em: 03 mar. 2026.

Ghatora, P.S.; Hosseini, S.E.; Pervez, S.; Iqbal, M.J.; Shaukat, N. 2024. Sentiment analysis of product reviews using machine learning and pre-trained LLM. Big Data and Cognitive Computing 8(12): 199.

Goularte, F.B.; Martins, B.E.G.; Carvalho, P.C.Q.F.; Won, M. 2024. SentPT: a customized solution for multi-genre sentiment analysis of Portuguese-language texts. Expert Systems with Applications 245: 123075.

Gupta, S.; Ranjan, R.; Singh, S.N. 2024. Comprehensive study on sentiment analysis: from rule-based to modern LLM based system. arXiv preprint 2409.09989. Disponível em: <https://arxiv.org/abs/2409.09989>. Acesso em: 5 mar. 2026.

Herrera-Poyatos, D.; Pelaez-Gonzalez, C.; Zuheros, C.; Herrera-Poyatos, A.; Tejedor, V.; Herrera, F.; Montes, R. 2025. An overview of model uncertainty and variability in LLM-based sentiment analysis: challenges, mitigation strategies and the role of explainability. Frontiers in Artificial Intelligence 8: 1609097.

Landis, J.R.; Koch, G.G. 1977. The measurement of observer agreement for categorical data. Biometrics 33(1): 159-174.

Lu, Y.; Bartolo, M.; Moore, A.; Riedel, S.; Stenetorp, P. 2022. Fantastically ordered prompts and where to find them: overcoming few-shot prompt order sensitivity. In: Annual Meeting of the Association for Computational Linguistics, 60., 2022, Dublin, Irlanda. Anais… p. 8086-8098.

Springer, L.; Waldherr, A.; Maier, D. 2025. A bias towards neutrality? How LLM guardrail sensitivity affects classification. Communication and Change. Ahead of print. Disponível em: <https://doi.org/10.1007/s44382-025-00013-0>. Acesso em: 7 mar. 2026.

Tomczak, M.; Tomczak, E. 2014. The need to report effect size estimates revisited. An overview of some recommended measures of effect size. Trends in Sport Sciences 1(21): 19-25.

Wang, X.; Kim, H.; Rahman, S.; Mitra, K.; Miao, Z. 2024. Human-LLM collaborative annotation through effective verification of LLM labels. In: CHI Conference on Human Factors in Computing Systems, 2024, Honolulu, HI, EUA. Anais… p. 1-21.

Wang, X.; Wei, J.; Schuurmans, D.; Le, Q.V.; Chi, E.H.; Narang, S.; Chowdhery, A.; Zhou, D. 2023. Self-consistency improves chain of thought reasoning in language models. In: International Conference on Learning Representations, 11., 2023, Kigali, Ruanda. Anais… Disponível em: <https://openreview.net/forum?id=1PL1NIMMrw>. Acesso em: 15 mar. 2026.

Wei, J.; Wang, X.; Schuurmans, D.; Bosma, M.; Ichter, B.; Xia, F.; Chi, E.; Le, Q.V.; Zhou, D. 2022. Chain-of-thought prompting elicits reasoning in large language models. In: Conference on Neural Information Processing Systems, 35., 2022, New Orleans, LA, EUA. Anais… Disponível em: <https://proceedings.neurips.cc/paper/2022/hash/9d5609613524ecf4f15af0f7b31abca4-Abstract-Conference.html>. Acesso em: 5 mar. 2026.

Xu, H.; Wang, Q.; Zhang, Y.; Yang, M.; Zeng, X.; Qin, B.; Xu, R. 2024. Improving in-context learning with prediction feedback for sentiment analysis. In: Findings of the Association for Computational Linguistics: ACL, 2024, Bangkok, Tailandia. Anais… p. 3879-3890.

Zhang, W.; Deng, Y.; Liu, B.; Pan, S.; Bing, L. 2024. Sentiment analysis in the era of large language models: a reality check. In: Findings of the Association for Computational Linguistics: NAACL, 2024, Cidade do Mexico, Mexico. Anais… p. 3881-3906.

Zhao, B.; Ni, J.; Li, Z.; Li, J.; Peng, Q.; Miao, Y. 2024. EECSA: enhancing textual sentiment analysis through emotion-enriched contextual integration and self-adaptive prompting optimization. In: Asian Conference on Artificial Intelligence Technology, 8., 2024, Fuzhou, China. Anais… p. [S.p.].

Artigo oriundo de Trabalho de Conclusão de Curso da Especialização em Data Science e Analytics do MBA USP/Esalq

Para saber mais sobre o curso, clique aqui e acesse a plataforma MBX Academy

You may also like

Neuroscience And Learning In Education

October 05, 2026

Elaboração de material educativo sobre higiene do sono para cuidadores de crianças com Transtorno do Espectro Autista

O sono exerce papel fundamental nos processos de aprendizagem e no funcionamento cognitivo, e evidências indicam que crianças com Transtorno do Espectro Autista (TEA) apresentam alterações significativas na arquitetura do sono, com possíveis repercussões no comportamento e no desempenho escolar. Diante desses desafios, objetivou-se elaborar um material educativo direcionado a cuidadores, contendo orientações práticas sobre higiene do sono em crianças com TEA, considerando seus impactos cognitivos, comportamentais e educacionais. O estudo caracterizou-se como um relato de experiência de natureza aplicada, com abordagem qualitativa, descritiva e reflexiva. O desenvolvimento do material baseou-se em dois eixos: a experiência clínica fonoaudiológica do pesquisador, por meio de observações e registros reflexivos, e o embasamento em evidências científicas, através de revisão da literatura sobre a neurociência do sono e o desenvolvimento neurocognitivo no TEA. A análise dos registros clínicos possibilitou a identificação de padrões recorrentes relacionados às dificuldades na higiene do sono em crianças com TEA, como resistência ao adormecer e despertares noturnos. A partir desses achados, elaborou-se uma cartilha educativa com orientações práticas sobre higiene do sono. Espera-se que o material contribua para a orientação de cuidadores na promoção de hábitos de sono adequados, favorecendo melhorias no comportamento, na aprendizagem e na qualidade de vida das crianças, além de auxiliar na redução da sobrecarga parental e na condução mais efetiva da rotina de sono.

Palavras-chave: Aprendizagem; Neurociências; Sono; Transtorno do Espectro Autista.

October 05, 2026

Aplicação do método de compressão de cronograma em projeto logístico e-commerce

Um estudo analisou a aplicação de técnicas de compressão de cronograma em um projeto de implantação logística de e-commerce, com o objetivo de avaliar seus impactos sobre prazo, custos, riscos e execução operacional. A pesquisa foi conduzida como um estudo de caso qualitativo, utilizando dados de cronogramas, estimativas, registros de projeto e participação direta na execução. Inicialmente, elaborou-se o planejamento do projeto com ferramentas estruturadas, como Estrutura Analítica do Projeto (EAP), sequenciamento de atividades, estimativa de duração por três pontos e alocação de recursos. Posteriormente, aplicou-se um método de priorização para definir as entregas críticas. A compressão do cronograma foi implementada por meio das técnicas de crashing e fast-tracking, focando nas atividades do caminho crítico. Como resultado, a duração total do projeto foi reduzida de seis para três meses, mantendo o escopo original. A análise indicou um aumento de custos, devido à intensificação do uso de recursos, e uma ampliação dos riscos operacionais, decorrente da execução paralela de atividades e da maior complexidade na coordenação. Observou-se que a aplicação dessas técnicas exige avaliação prévia da viabilidade operacional e definição de critérios de aceitação para custo e risco. O estudo contribuiu ao apresentar evidências empíricas da aplicação dessas técnicas em um contexto logístico, ressaltando a importância do alinhamento entre planejamento, execução e controle.

Palavras-chave: Compressão de cronograma; E-commerce; Gerenciamento de projetos; Logística; Riscos operacionais.

October 05, 2026

Infraestrutura Sanitária e Saúde Pública com Modelo de Dados em Painel

O acesso ao saneamento básico é um fator determinante para a saúde comunitária, influenciando a incidência de doenças de veiculação hídrica e relacionadas ao saneamento ambiental inadequado. Este estudo objetivou estimar a relação entre a expansão da infraestrutura de saneamento básico e os casos de diarreia em municípios paulistas entre 2010 e 2020. Utilizou-se um painel balanceado de 371 municípios e estimou-se um modelo de contagem com efeitos fixos (Poisson QMLE) para controlar especificidades locais. Os resultados indicaram que o aumento das ligações de esgoto no ano anterior associou-se à redução das internações (IRR = 0,9952; p = 0,003), enquanto o aumento das ligações de água não apresentou significância estatística (IRR = 1,0035; p = 0,144). Como desenvolvimento adicional, construiu-se uma variável de déficit de esgoto (GAP) em relação às ligações de água, e simulou-se o impacto da equalização desses volumes. A eliminação do déficit de esgoto evitaria aproximadamente 12.650 internações no período, representando uma redução de 17,96%. Uma análise de robustez com modelo binomial negativo confirmou a direção dos coeficientes, mas sem significância estatística para o GAP. Concluiu-se que a universalização dos serviços de esgotamento sanitário é uma estratégia efetiva de saúde pública para a redução das internações por diarreia.

Palavras-chave: Diarreia; Efeitos Fixos; Saneamento básico.

October 05, 2026

Índices de desempenho por posição em jogadores de futebol mediante análise de componentes principais

A crescente disponibilidade de dados no futebol impulsionou a necessidade de métodos para sintetizar indicadores de desempenho em medidas objetivas e interpretáveis. O estudo objetivou construir índices sintéticos de desempenho para jogadores de futebol, aplicando a Análise de Componentes Principais (PCA) a estatísticas individuais da Premier League 2024/2025. Utilizaram-se dados públicos de jogadores de linha da Premier League 2024/2025, excluindo-se goleiros e adotando-se um mínimo de 30% de participação nos minutos da temporada. As variáveis de contagem foram normalizadas por 90 minutos, as percentuais mantidas e todas padronizadas pelo método z-score. A PCA foi aplicada separadamente para defensores, meio-campistas e atacantes, com verificação de adequação pelo teste de esfericidade de Bartlett, retenção de fatores pelo critério de Kaiser e rotação ortogonal Varimax. Os resultados demonstraram a adequação da técnica para os três grupos posicionais, permitindo reter fatores interpretáveis que explicaram parcela expressiva da variância total dos dados. Os índices construídos revelaram que o desempenho posicional resultou da combinação de múltiplas dimensões, como participação defensiva, circulação, progressão com bola, produção ofensiva e objetividade nas ações de ataque. A abordagem adotada sintetizou o desempenho de forma coerente com as funções exercidas em campo, constituindo uma alternativa útil para análises comparativas entre atletas de uma mesma posição.

Palavras-chave: Análise multivariada; Avaliação posicional; Estatística aplicada; Premier League; Redução de dimensionalidade.

October 05, 2026

Detecção de novas disfuncionalidades em políticas públicas utilizando monitoramento de anomalias sobre manifestações de usuários

A plataforma Fala.BR consolidou-se como o principal canal de comunicação entre a sociedade e a Administração Pública Federal, registrando milhões de manifestações anualmente. Reconheceu-se a oportunidade de utilizar as percepções dos usuários para verificar a qualidade dos serviços públicos e identificar disfunções. O objetivo foi desenvolver e implantar um sistema de detecção de anomalias para identificar novos problemas ou agravamentos atípicos na prestação de serviços públicos, analisando séries históricas de manifestações no Fala.BR. Realizou-se um estudo exploratório e quantitativo, utilizando dados secundários extraídos diretamente do sistema Fala.BR, abrangendo 421 entidades de 2014 a 2025. Implementou-se um sistema em Python com um ensemble de 15 detectores de anomalias, com decisão por Votação Não Ponderada (EVNP), e métricas de priorização, como a DS_1M, além de uma ferramenta de identificação de temas baseada em LLM. O sistema demonstrou ser eficaz ao capturar problemas relevantes, como impactos de alterações regulatórias e interrupções de serviços, que geraram aumentos atípicos nas manifestações. Concluiu-se que o sistema implementado atingiu seu objetivo, sendo capaz de identificar disfuncionalidades novas e relevantes, e pode servir como base para um sistema de monitoramento permanente, auxiliando a Administração Pública na atuação tempestiva.

Palavras-chave: Eficiência institucional; Fala.BR; Ouvidoria; Serviços públicos; Tomada de decisão.

October 05, 2026

Web Scraping e NLP aplicados à análise de reclamações de seguradoras no site Reclame Aqui

O mercado segurador desempenha um papel crucial na economia, mas enfrenta desafios relacionados à satisfação do consumidor. Buscou-se analisar e categorizar as principais fontes de insatisfação dos consumidores no mercado segurador brasileiro. Para isso, aplicaram-se técnicas de Web Scraping e Processamento de Linguagem Natural (NLP) a dados textuais não estruturados, extraídos da plataforma Reclame Aqui, referentes a reclamações contra cinco seguradoras independentes. Realizou-se a coleta de aproximadamente 2.500 reclamações, que foram pré-processadas e submetidas à análise exploratória de dados, classificação temática e análise de sentimentos para mensurar a gravidade da insatisfação. Os resultados revelaram que temas como cancelamento, cobrança indevida e vendas irregulares concentram a maior parte das insatisfações, com alta frequência e elevada gravidade. A análise de Pareto confirmou que seis temas prioritários abrangem 81% das reclamações graves. Concluiu-se que a metodologia empregada gerou insights valiosos para a gestão da qualidade, permitindo a identificação de vulnerabilidades operacionais e a formulação de recomendações estratégicas para aprimorar a experiência do cliente e fortalecer a reputação corporativa.

Palavras-chave: Análise de dados textuais; Mercado segurador; Processamento de linguagem natural; Satisfação do consumidor.

October 05, 2026

Previsão da cobertura vacinal de hepatite A infantil no Paraná: rumo à meta ODS 2030

A vacinação infantil contra a hepatite A é uma ferramenta essencial de saúde pública, com crianças sendo as principais transmissoras silenciosas da doença. No contexto da Agenda 2030, a Meta 3.b dos Objetivos de Desenvolvimento Sustentável (ODS) promove inovações tecnológicas no Sistema Único de Saúde para prevenir doenças transmissíveis. Contudo, o declínio da cobertura vacinal no Brasil após 2015 impôs desafios. Diante desse cenário, o estudo objetivou desenvolver modelos estatísticos clássicos de séries temporais para prever a cobertura vacinal contra a hepatite A infantil nos municípios do Paraná até 2030. Adicionalmente, a pesquisa contemplou a visualização das predições em dashboards de Business Intelligence para monitoramento estratégico dos indicadores municipais. A metodologia compreendeu o processamento de grandes volumes de dados, seguido por uma abordagem comparativa entre os modelos de Suavização Exponencial Simples (SES) e Médias Móveis Integradas Autorregressivas (ARIMA). Os resultados revelaram que o modelo ARIMA(1,0,1) obteve a melhor acurácia para a projeção estadual, indicando uma tendência de estabilização da cobertura em 90,3%, patamar inferior à meta ideal de 95%. A análise municipal identificou 180 cidades (45%) como Pontos de Atenção, com riscos de não conformidade com as metas globais. Concluiu-se que o uso de ferramentas preditivas atua como um sistema de alerta antecipado crucial para o fortalecimento das políticas de imunização e a redução de desigualdades regionais.

Palavras-chave: Análise preditiva; Cobertura vacinal; Hepatite A; Modelos estatísticos clássicos; Séries temporais.

October 05, 2026

Custos assistenciais referentes ao autismo na Saúde Suplementar: Uma abordagem com algoritmos não supervisionados

O crescimento dos casos de Transtorno do Espectro Autista (TEA) e a ampliação da cobertura assistencial na saúde suplementar têm gerado impactos relevantes nos custos das operadoras, tornando necessária a compreensão dos padrões associados a esses gastos. Identificou-se e caracterizou-se perfis distintos de custos ambulatoriais relacionados ao tratamento do TEA em operadoras de planos privados de saúde no estado de São Paulo, utilizando dados de 2023 e algoritmos de aprendizado não supervisionado. A metodologia empregou a construção e tratamento de uma base de mais de quatro milhões de registros, aplicou o algoritmo k-means para identificar agrupamentos e utilizou a Análise de Correspondência Múltipla para explorar associações entre variáveis categóricas. Os resultados revelaram a existência de diferentes perfis de custo, com padrões distintos na intensidade de utilização dos serviços, composição dos procedimentos e modelos de remuneração. Observou-se grupos associados a atendimentos mais simples e padronizados, e outros a maior complexidade assistencial e volume de procedimentos. Identificaram-se associações entre os clusters e características demográficas e estruturais do sistema de saúde, indicando diferenças entre perfis etários e padrões de utilização, sem evidência de relação causal direta com redução de custos. Concluiu-se que a aplicação de técnicas de análise de dados aprimorou a compreensão da dinâmica dos custos assistenciais, oferecendo subsídios para análises e decisões na saúde suplementar.

Palavras-chave: Análise de Correspondência Múltipla; Análise Exploratória; K-means; Padrões de Custos; Segmentação de Dados.

October 05, 2026

Modelo de negócio e viabilidade econômica de produção e comercialização de Crisântemo em Uberlândia-MG

O setor de flores e plantas ornamentais apresentou relevância econômica e crescimento estável no Brasil, com concentração produtiva regional. Observou-se que o atendimento de crisântemos à região do Triângulo Mineiro ocorria principalmente via distribuidores, o que aumentava custos e comprometia a qualidade do produto. Diante desse cenário, desenvolveu-se um modelo de negócio para a produção e comercialização de crisântemos destinados ao mercado de flores de corte, e analisou-se sua viabilidade econômica no município de Uberlândia (MG). O estudo classificou-se como um estudo de caso de natureza aplicada, utilizando métodos mistos (qualitativo e quantitativo). A pesquisa foi estruturada em três etapas: criação do modelo de negócio com Business Model Canvas, estudo de mercado por meio de questionários com potenciais clientes da região, e análise de viabilidade econômica. A avaliação econômica considerou Índice de Lucratividade, Valor Presente Líquido, Taxa Interna de Retorno e Payback, com horizonte de dez anos. Os resultados indicaram que a produção local de crisântemos apresentou potencial de viabilidade econômica, com redução de custos logísticos e melhoria na qualidade do produto. Os indicadores econômicos analisados apresentaram resultados favoráveis, indicando um retorno atrativo. Concluiu-se que a implantação de uma unidade produtiva de crisântemos na região estudada configura-se como uma alternativa promissora, com potencial para contribuir para o desenvolvimento econômico local e para o fortalecimento da cadeia produtiva da floricultura.

Palavras-chave: Análise econômica; Chrysanthemum morifolium; Cultivo protegido; Flor de corte.