Artigo

Engenharia De Software

07 de outubro de 2026

Aplicação de Inteligência Artificial para Análise de Sentimento em Mensagens de Texto

Aplicação de Inteligência Artificial para Análise de Sentimento em Mensagens de Texto

Isabel Priscila Chaves da Silva Rebello; Marcos Jardel Henriques

DOI: 10.22167/2675-6528-202603004

Artigo derivado de Trabalho de Conclusão de Curso (TCC), com conteúdo baseado no trabalho original do aluno e adaptado ao formato editorial da Revista E&S com apoio da ferramenta ResumeAI, solução de inteligência artificial desenvolvida pelo Instituto Pecege para síntese e organização textual.

Resumo

A análise de sentimentos em mensagens de texto de clientes de e-commerce é crucial para a tomada de decisões empresariais. Este estudo implementou modelos de inteligência artificial com o objetivo de comparar seus desempenhos na avaliação dessas mensagens. A metodologia consistiu na aplicação de um conjunto de dados de 4664 registros em quatro experimentos distintos: GPT 3.5 Turbo com Zero-shot, GPT 3.5 Turbo com Few-shot, BERT Multilingual Sentiment e BERTimbau com Fine tuning. Os resultados obtidos indicaram que o modelo especializado com Fine tuning apresentou as melhores métricas de avaliação, uma matriz de confusão mais consistente e o menor tempo de processamento. Em contraste, o modelo BERT Multilingual Sentiment demonstrou dificuldades em interpretar textos no idioma português. Os experimentos com GPT 3.5 Turbo, particularmente a abordagem Few-shot, revelaram-se promissores, configurando-se como uma alternativa viável em cenários onde o Fine tuning não pode ser aplicado. Concluiu-se que a estratégia de Fine tuning em modelos pré-treinados, como o BERTimbau, oferece vantagens significativas em precisão e eficiência para análise de sentimentos em larga escala.

Palavras-chave: Análise de Sentimentos; Fine Tuning; Inteligência Artificial; LLM; Processamento de Linguagem Natural.

1. Introdução

A análise de sentimentos (AS), também conhecida como análise de opinião ou mineração de opinião, tornou-se um conceito de grande importância para empresas, governos e organizações. Compreender como clientes e usuários percebem produtos e serviços é fundamental para a tomada de decisão estratégica (SÁNCHEZ-RADA E IGLESIAS, 2019).

Apesar de sua relevância, apurar e analisar o feedback do consumidor apresenta desafios significativos. O conteúdo gerado por clientes é frequentemente composto por dados não estruturados, como mensagens de texto livres, que podem abordar diversos temas e conter expressões coloquiais, erros ortográficos e linguagem informal. Essa natureza dos dados dificulta o processo de AS e o tratamento eficaz das informações (TAN, 2023).

No contexto do e-commerce, a análise de sentimentos é uma ferramenta poderosa e com vasto potencial. Empresas que buscam manter a competitividade no mercado necessitam apurar e analisar os feedbacks dos consumidores. A AS permite obter informações valiosas sobre as opiniões dos clientes, auxiliando na detecção de pontos de melhoria, no aperfeiçoamento de produtos e serviços, e nos ajustes estratégicos para satisfazer as exigências do mercado (Soares, 2023). Além disso, possibilita aos clientes fazer escolhas de compra mais informadas. Com o grande volume de dados não estruturados gerados diariamente, uma ferramenta capaz de extrair informações em larga escala é essencial para uma compreensão ágil da percepção dos consumidores, gerando vantagens estratégicas e operacionais.

A análise de sentimentos é um segmento do Processamento de Linguagem Natural (PLN) que visa identificar e categorizar automaticamente sentimentos e emoções expressos em textos (TAN, 2023). Historicamente, métodos tradicionais como Bag-of-Words e TF-IDF classificavam textos pela frequência de palavras, mas ignoravam o contexto e a semântica, limitando sua eficácia. A evolução levou ao desenvolvimento de modelos como Word2Vec e GloVe, que capturam o significado semântico, embora ainda enfrentem desafios com palavras desconhecidas e a necessidade de grandes conjuntos de dados (KOKAB ET AL, 2022). Mais recentemente, abordagens baseadas em aprendizado por transferência, como o BERT, e Large Language Models (LLMs), como o GPT 3.5 Turbo, surgiram, demonstrando alta capacidade de generalização e precisão em tarefas de AS, inclusive com estratégias de zero-shot e few-shot (Souza et al., 2022).

Diante da complexidade e da diversidade de modelos de inteligência artificial disponíveis para análise de sentimentos, e considerando a importância do feedback do cliente para o e-commerce brasileiro, torna-se crucial investigar qual abordagem oferece o melhor desempenho para mensagens de texto em português. A comparação entre modelos de linguagem grandes (LLMs) com abordagens zero-shot e few-shot e modelos pré-treinados com fine tuning, como o BERTimbau, é fundamental para identificar a solução mais eficaz em termos de precisão e eficiência de processamento para este domínio específico.

Nesse contexto, o presente trabalho busca comparar o desempenho de diferentes modelos de Inteligência Artificial na análise de sentimentos em mensagens de texto de clientes de um e-commerce.

2. Material e Métodos

Com o intuito de atingir os objetivos propostos, este estudo foi conduzido por meio de uma abordagem comparativa e experimental. Realizou-se uma revisão bibliográfica para identificar modelos de inteligência artificial promissores, seguida pela definição e aplicação desses modelos a um conjunto de dados de mensagens de texto de clientes. Posteriormente, procedeu-se à comparação dos modelos através de uma avaliação experimental e à análise dos resultados obtidos.

A unidade de análise consistiu em um conjunto de 4664 mensagens de texto reais, coletadas de avaliações de clientes de um e-commerce. Essas mensagens continham feedback sobre vendedores, produtos e serviços de entrega, representando dados não estruturados gerados por consumidores (WANKHADE ET AL, 2022). A natureza desses dados permitiu observar o desempenho dos modelos diante de expressões coloquiais, erros ortográficos e linguagem informal.

O pré-processamento dos dados foi uma etapa fundamental para estruturar os textos. Este processo incluiu a remoção de caracteres especiais, como símbolos (exceto números) e URLs, e a tokenização, que segmentou o texto em unidades menores (PALOMINO, 2022; TAN ET AL, 2023). Adicionalmente, mensagens com avaliações numéricas de 0 a 10 foram tratadas para delimitar esses valores, auxiliando na assimilação do modelo.

Após o pré-processamento, as 4664 mensagens de texto foram rotuladas manualmente em três categorias de sentimento: positivo, negativo e neutro. A rotulagem foi realizada por um único avaliador, priorizando mensagens com conteúdo textual explícito. Em casos de ambiguidade, a classe negativa foi adotada como critério de desempate. As regras de rotulagem estabeleceram como positivo notas acima de sete ou elogios, como negativo notas abaixo de seis com críticas diretas, e como neutro notas entre seis e sete ou mensagens não relacionadas aos serviços.

Para a análise de sentimentos, foram empregados três modelos de inteligência artificial distintos, avaliados em quatro configurações experimentais. Os modelos incluíram o GPT 3.5 Turbo, o nlptown/bert-base-multilingual-uncased-sentiment (uma adaptação do BERT para análise de sentimentos multilíngue), e o neuralmind/bert-base-portuguese-cased, conhecido como BERTimbau, treinado especificamente para o português brasileiro (Souza et al., 2022).

A implementação do GPT 3.5 Turbo ocorreu em duas configurações. Na abordagem zero-shot, o modelo classificou o sentimento (positivo, negativo ou neutro) com base apenas na descrição da tarefa fornecida no prompt, sem exemplos prévios. Na configuração few-shot, um conjunto de exemplos foi fornecido ao modelo para orientar seu comportamento, utilizando o contexto para aprimorar a qualidade das inferências.

O modelo BERT Multilingual Sentiment foi utilizado em seu formato pré-treinado. Já o modelo BERTimbau foi aplicado com a técnica de fine-tuning, que envolveu o treinamento do modelo com o conjunto de dados rotulado. Para este processo, o conjunto de dados foi dividido em partições de treino e teste, com 70% e 20% dos dados, respectivamente, sendo a partição de validação não utilizada para a avaliação direta do modelo.

Os hiperparâmetros empregados no fine-tuning do BERTimbau incluíram o modelo base neuralmind/bert-base-portuguese-cased (BERTimbau Base), três épocas de treinamento, uma taxa de aprendizado de 2×10-5, e um tamanho de lote (batch size) de oito para treino e avaliação. O comprimento máximo de 512 tokens foi definido, e o otimizador AdamW, juntamente com a função de perda de entropia cruzada, foram utilizados conforme os padrões da biblioteca Transformers (Hugging Face).

A avaliação do desempenho dos modelos foi realizada por meio de um conjunto de métricas estatísticas amplamente reconhecidas na literatura de classificação. As métricas calculadas incluíram Acurácia, Coeficiente Kappa, Precisão Macro, Revocação Macro, F1 Macro, Precisão Ponderada, Revocação Ponderada e F1 Ponderado. Adicionalmente, empregou-se a matriz de confusão como ferramenta gráfica para visualizar a quantidade de classificações corretas em cada classe de sentimento.

3. Resultados e Discussão

A análise comparativa do desempenho de diferentes modelos de inteligência artificial na avaliação de sentimentos em mensagens de texto de clientes de e-commerce revelou variações significativas nas métricas de avaliação, na consistência da classificação e na eficiência de processamento. Os experimentos foram conduzidos com quatro abordagens distintas: GPT 3.5 Turbo com Zero-shot, GPT 3.5 Turbo com Few-shot, BERT Multilingual Sentiment e BERTimbau com Fine tuning. Os resultados obtidos permitiram identificar a estratégia mais eficaz para o contexto específico de mensagens em português, conforme o objetivo central deste estudo.

Inicialmente, observou-se que o modelo BERTimbau com Fine tuning demonstrou o desempenho mais robusto em todas as métricas estatísticas avaliadas. Este modelo alcançou uma acurácia de 0,9154, um coeficiente Kappa de 0,8701, precisão Macro de 0,9076, revocação Macro de 0,9114 e F1 Macro de 0,9085. As métricas ponderadas também seguiram essa tendência, com precisão ponderada de 0,9162, revocação ponderada de 0,9154 e F1 ponderado de 0,9149. Esses valores consistentemente elevados indicam uma capacidade superior de classificação e uma compreensão aprofundada das nuances contextuais e semânticas da língua portuguesa, o que é crucial para a análise de sentimentos em dados de e-commerce.

Em contraste, o modelo BERT Multilingual Sentiment apresentou o pior desempenho entre todas as abordagens testadas. Suas métricas foram notavelmente baixas, com acurácia de 0,5491, coeficiente Kappa de 0,3311, precisão Macro de 0,5548, revocação Macro de 0,5675 e F1 Macro de 0,5126. As métricas ponderadas também foram inferiores, com precisão ponderada de 0,5785, revocação ponderada de 0,5491 e F1 ponderado de 0,522. Este resultado sugere que, apesar de ser um modelo projetado para análise de sentimento e com suporte para múltiplos idiomas, ele não conseguiu capturar de forma eficiente as particularidades semânticas do português brasileiro, corroborando observações de Souza et al. (2022) sobre as limitações de modelos multilingues para idiomas específicos.

As abordagens com GPT 3.5 Turbo ocuparam uma faixa intermediária de desempenho. O modelo GPT 3.5 Turbo Zero-shot obteve acurácia de 0,7562, Kappa de 0,625, precisão Macro de 0,7477, revocação Macro de 0,7556 e F1 Macro de 0,7512. As métricas ponderadas foram similares, com precisão ponderada de 0,7551, revocação ponderada de 0,7562 e F1 ponderado de 0,7553. Embora demonstre a alta capacidade de um Large Language Model (LLM) em realizar classificações com informações mínimas, a ausência de exemplos específicos para a tarefa resultou em um desempenho inferior em comparação com abordagens mais adaptadas.

A aplicação da estratégia Few-shot ao GPT 3.5 Turbo resultou em uma melhoria notável em relação à abordagem Zero-shot. Este modelo alcançou acurácia de 0,8218, Kappa de 0,7311, precisão Macro de 0,8153, revocação Macro de 0,8303 e F1 Macro de 0,8108. As métricas ponderadas também foram superiores, com precisão ponderada de 0,8431, revocação ponderada de 0,8218 e F1 ponderado de 0,8224. A inclusão de exemplos no prompt forneceu um contexto mais claro para o modelo, aprimorando a qualidade das inferências e evidenciando o potencial dos LLMs quando orientados com dados específicos, mesmo sem um fine tuning completo, conforme apontado por Fatouros (2023).

Além das métricas de desempenho, a capacidade de processamento dos modelos foi um fator crítico na avaliação. Os modelos baseados em BERT, tanto o Multilingual Sentiment quanto o BERTimbau com Fine Tuning, demonstraram uma eficiência significativamente maior. O BERT Multilingual Sentiment processou os dados em 2 minutos e 11 segundos, enquanto o BERTimbau com Fine Tuning, que utilizou 934 registros para teste, completou a tarefa em apenas 25 segundos. Isso se traduz em um tempo médio por registro de aproximadamente 0,028 segundos para o BERT Multilingual e 0,027 segundos para o BERTimbau, indicando uma alta velocidade de processamento para ambos.

Em contrapartida, os experimentos com GPT 3.5 Turbo apresentaram tempos de processamento consideravelmente mais longos. A abordagem Zero-shot levou 150 minutos e 1 segundo para processar 4557 registros, resultando em um tempo médio de 1,975 segundos por registro. A abordagem Few-shot teve um desempenho similar, com 150 minutos e 41 segundos para 4601 registros, totalizando 1,965 segundos por registro. Essa diferença de tempo, cerca de 73 vezes maior para os LLMs por registro, destaca uma vantagem operacional significativa dos modelos específicos em cenários de larga escala, onde a agilidade no processamento é essencial para a compreensão em tempo real da percepção dos consumidores.

Outro aspecto relevante na avaliação dos modelos GPT 3.5 Turbo foi a ocorrência de erros de requisição. A abordagem Zero-shot registrou 2,30% de erros, enquanto a Few-shot apresentou 1,35% de erros. Esses erros indicam que, apesar das boas métricas, parte dos dados pode não ser classificada, resultando em perda de informação. A menor taxa de erro na abordagem Few-shot pode ser atribuída ao tamanho do prompt, que, por conter exemplos, exige mais da API e do modelo, mas também oferece um direcionamento mais robusto, minimizando falhas de requisição em comparação com a abordagem Zero-shot, que depende exclusivamente do conhecimento pré-existente do modelo.

Matriz de Confusão

A análise das matrizes de confusão forneceu uma visão detalhada sobre os tipos de erros de classificação cometidos por cada modelo. Para o modelo BERT Multilingual Sentiment, a matriz revelou um número elevado de classificações incorretas. Embora tenha acertado grande parte das instâncias negativas (1022), o modelo errou substancialmente nas classes positivas e neutras. Por exemplo, classificou 740 mensagens neutras como negativas e 552 mensagens positivas como negativas. Essa tendência em classificar sentenças como negativas sugere um viés do modelo quando aplicado a dados em português, o que reforça a dificuldade em lidar com as especificidades linguísticas do idioma.

A matriz de confusão do modelo BERTimbau com Fine Tuning, por sua vez, demonstrou uma alta capacidade de classificação em todas as classes. Com um número reduzido de erros, o modelo acertou 217 classificações negativas, 251 neutras e 387 positivas. Os erros foram mínimos, com apenas 13 negativas classificadas como neutras, 2 como positivas; 34 neutras como negativas, 16 como positivas; e 1 positiva como negativa, 13 como neutra. Essa consistência na matriz de confusão evidencia a eficácia do fine tuning em um modelo monolíngue para o português, permitindo uma adaptação precisa às características do conjunto de dados.

Para o modelo GPT 3.5 Turbo Zero-shot, a matriz de confusão indicou que, apesar de um número razoável de acertos, o modelo apresentou uma tendência ao erro entre as classes intermediárias e as mais extremas. Observou-se que 240 mensagens neutras foram classificadas como negativas e 31 positivas também foram classificadas como negativas. Além disso, 338 mensagens positivas foram classificadas como neutras. Essa confusão sugere que o modelo, sem exemplos específicos, tem dificuldade em diferenciar nuances de sentimento, classificando positivos ou negativos como neutros, ou vice-versa, o que pode levar a interpretações ambíguas em contextos complexos de e-commerce.

A matriz de confusão do GPT 3.5 Turbo com estratégia Few-shot mostrou uma melhora significativa nos acertos em comparação com a abordagem Zero-shot. O modelo classificou corretamente 1098 mensagens negativas, 980 neutras e 1703 positivas. Contudo, ainda se notou certa confusão ao classificar neutros como negativos (456) e positivos como neutros (231). Essa confusão, embora menor, indica que, mesmo com exemplos, o modelo pode ter desafios em contextos onde as fronteiras entre os sentimentos são mais sutis. A possibilidade de corrigir esses erros por meio da análise de sentenças problemáticas e fornecimento de novos exemplos é uma vantagem dessa estratégia, permitindo um aprimoramento contínuo do modelo.

Em síntese, os resultados da pesquisa demonstram que a estratégia de Fine tuning em modelos pré-treinados, como o BERTimbau, oferece a maior precisão e consistência na análise de sentimentos em mensagens de texto de clientes de e-commerce em português, além de um tempo de processamento significativamente menor. As abordagens com GPT 3.5 Turbo, especialmente a Few-shot, mostraram-se promissoras e representam uma alternativa viável em cenários onde o fine tuning não é aplicável, apesar de apresentarem maior tempo de processamento e alguma confusão na classificação. O modelo BERT Multilingual Sentiment, por sua vez, revelou-se inadequado para o idioma português, evidenciando a importância da especificidade linguística para a eficácia da análise de sentimentos.

4. Conclusão

O presente estudo buscou comparar o desempenho de diferentes modelos de inteligência artificial na análise de sentimentos em mensagens de texto de clientes de um e-commerce. Verificou-se que o modelo BERTimbau com Fine tuning demonstrou o desempenho mais robusto, alcançando as melhores métricas estatísticas de avaliação e uma matriz de confusão consistente, além de apresentar o menor tempo de processamento. Em contraste, o modelo BERT Multilingual Sentiment revelou dificuldades significativas em interpretar textos no idioma português, resultando nas métricas mais baixas entre as abordagens testadas. As implementações com GPT 3.5 Turbo, tanto na modalidade Zero-shot quanto Few-shot, situaram-se em uma faixa intermediária de desempenho. A estratégia Few-shot, em particular, evidenciou uma melhoria notável em relação à Zero-shot, configurando-se como uma alternativa promissora em cenários onde o Fine tuning não pode ser aplicado. Contudo, observou-se que os modelos baseados em BERT processaram os dados de forma significativamente mais rápida, cerca de 73 vezes mais ágil por registro, em comparação com as abordagens de LLMs, que também registraram erros de requisição, indicando potencial perda de dados.

Apesar dos resultados promissores, identificou-se que a utilização de Large Language Models como o GPT 3.5 Turbo pode implicar em custos associados às requisições e na ocorrência de erros que resultam em perda de dados, aspectos que demandam consideração em aplicações de larga escala. Sugere-se, para estudos futuros, o rastreamento detalhado dos custos operacionais das requisições ao GPT 3.5 Turbo para uma análise de viabilidade econômica mais aprofundada. Recomenda-se também a investigação de estratégias para aprimorar o desempenho dos modelos por meio da análise de padrões de erro em mensagens classificadas incorretamente e a utilização de exemplos anonimizados, bem como a exploração de questões relacionadas à Lei Geral de Proteção de Dados Pessoais (LGPD) no tratamento de dados de clientes. A principal contribuição deste estudo reside na demonstração de que a estratégia de Fine tuning em modelos pré-treinados, como o BERTimbau, oferece vantagens significativas em precisão e eficiência para a análise de sentimentos em português, fornecendo uma ferramenta valiosa para empresas de e-commerce no monitoramento ágil da percepção dos consumidores e no aprimoramento contínuo de produtos e serviços.

Referências Bibliográficas

FATOUROS, Georgios; SOLDATOS, John; KOUROUMALI, Kalliopi; MAKRIDIS, Georgios; KYRIAZIS, Dimosthenis. (2023). Transforming sentiment analysis in the financial domain with ChatGPT. Machine Learning with Applications, v. 14, 100508.

KOKAB, Sayyida Tabinda; ASGHAR, Sohail; NAZ, Shehneela. (2022). Transformer-based deep learning models for the sentiment analysis of social media data. Array, v. 14, p. 100157.

PALOMINO, Marco A.; AIDER, Farida. (2022). Evaluating the Effectiveness of Text Pre-Processing in Sentiment Analysis. Applied Sciences, v. 12, n. 17, p. 8875.

SOARES, William Destefani. (2023). Avaliação de produtos baseada em análise de sentimentos aplicada a postagens textuais em redes sociais. 114 f. Trabalho de Conclusão de Curso (Graduação em Sistemas de Informação) – Instituto Federal do Espírito Santo, Campus Cachoeiro de Itapemirim.

SOUZA, F. C.; NOGUEIRA, R. F.; LOTUFO, R. A. (2022). BERT models for Brazilian Portuguese: pretraining, evaluation and tokenization analysis. In: Proceedings of the 9th Brazilian Conference on Intelligent Systems (BRACIS).

SÁNCHEZ-RADA, J. F.; IGLESIAS, C. A. (2019). Social context in sentiment analysis: formal definition, overview of current trends and framework for comparison. Information Fusion, v. 52, p. 344-356.

TAN, Kian Long; LEE, Chin Poo; LIM, Kian Ming. (2023). A Survey of Sentiment Analysis: Approaches, Datasets, and Future Research. Applied Sciences, v. 13, n. 7, p. 4550.

WANKHADE, Mayur; RAO, Annavarapu Chandra Sekhara; KULKARNI, Chaitanya. (2022). A survey on sentiment analysis methods, applications, and challenges. Artificial Intelligence Review, v. 55, p. 5731-5780.

Artigo oriundo de Trabalho de Conclusão de Curso da Especialização em Engenharia de Software do MBA USP/Esalq

Para saber mais sobre o curso, clique aqui e acesse a plataforma MBX Academy

Você também pode gostar

Engenharia De Software

09 de outubro de 2026

O papel da densidade de texto instrutivo na eficiência de uma aplicação web.

O desenvolvimento de aplicações web se conecta à experiência do usuário, e este trabalho investigou como o uso excessivo de textos instrutivos pode retardar a conclusão de tarefas e impactar a eficiência da aplicação. O objetivo foi identificar o impacto da densidade textual do conteúdo instrutivo na eficiência de uma aplicação web, utilizando como principal referência a terceira lei de usabilidade de Krug. A pesquisa, de caráter exploratório e delineamento experimental quantitativo, empregou um teste A/B em uma aplicação web responsiva, onde a única variável controlada foi a densidade textual (alta vs. baixa, definida pela contagem de palavras). Participaram 25 usuários, e os dados foram coletados via Datadog RUM, mensurando tempo de conclusão, erros de submissão e taxa de conversão. Os resultados revelaram que a variante com densidade textual reduzida (variante B) apresentou uma taxa de conversão superior (58,3% contra 33,3% da variante A) e um tempo médio de conclusão significativamente menor (1:38 minutos contra 4:58 minutos da variante A), representando um aumento de 67,12% na eficiência. O teste t de Welch (p=0,042) confirmou que a redução da densidade textual impactou a eficiência. Concluiu-se que a redução da densidade textual afeta a eficiência e a taxa de conversão, reforçando a importância de conteúdo objetivo e conciso. Contudo, a baixa densidade textual, por si só, não garantiu o pleno entendimento, sendo essencial a comunicação clara e objetiva das instruções, validando a relevância do UX Writing.

Palavras-chave: Eficiência; Experiência de usuário; Teste A/B; Texto Instrutivo; Usabilidade.

Engenharia De Software

09 de outubro de 2026

Implementação de sistemas de analytics em ambientes de automação na indústria de processos

A digitalização de plantas de processo depende de coleta e armazenamento estruturados de dados, sem os quais não há visibilidade da operação. Chama-se analytics industrial a cadeia que percorre esses dados desde a aquisição do sinal no instrumento de campo, passando pelo armazenamento ordenado no tempo, até a disponibilização para análise e para outros sistemas. Softwares industriais proprietários cobrem hoje essa cadeia, e os custos de licenciamento e manutenção restringem sua adoção. O estudo teve por objetivo arquitetar, implementar e validar um sistema dessa natureza, empregando técnicas correntes de desenvolvimento de software e componentes sem custo de licenciamento. O sistema, denominado Sistema de Aquisição e Tratamento de Informações de Processo (SATIP), foi estruturado em três camadas independentes, tendo como fonte de dados um simulador de reator farmacêutico que executou uma receita de oito etapas e gerou séries temporais com variação estocástica. O simulador foi escrito em Go, linguagem adotada por gerar binários autocontidos, adequados à execução em equipamentos de borda. O armazenamento utilizou o TimescaleDB e a disponibilização foi realizada por meio de uma interface REST com um painel web. O sistema processou cerca de 414 mil registros por execução, com tendência multivariável, registro de alarmes e correlação temporal entre instrumentos. A arquitetura mostrou-se reproduzível e sem custo de licenciamento, e a identificação da degradação exigiu apenas as leituras já armazenadas pelo sistema.

Palavras-chave: Arquitetura de software; Digitalização; Integração IT/OT; Manutenção preditiva; Séries temporais.

Engenharia De Software

09 de outubro de 2026

Utilização da voz em conjunto a grandes modelos de linguagem como ferramenta à acessibilidade digital

A fala é uma base essencial para a interação humana, e para pessoas com deficiência, pode representar a principal forma de comunicação com o ambiente externo. Diante da crescente influência tecnológica, a identificação de comandos de voz emergiu como uma estratégia promissora para a interação homem-máquina. O trabalho explorou como a voz, em conjunto com Grandes Modelos de Linguagem (LLMs), pode ser utilizada de forma eficiente, natural e precisa. Para tal, empregaram-se diversos padrões de projetos e a linguagem Python, visando maior extensibilidade. Utilizou-se o Gemini como provedor de LLM, enviando o áudio diretamente e aproveitando sua capacidade de chamada de função para interagir com o dispositivo. Desenvolveu-se um sistema capaz de compreender a intenção do usuário e convertê-la em ações, cujo diferencial foi a capacidade de visão computacional baseada em capturas de tela e um sistema de malha para orientação da LLM. Os testes revelaram uma taxa de compreensão da intenção do usuário de 91,81% e uma taxa de sucesso na execução de 75,45% com o modelo “Flash-3” (top p 0,5 e top k 5). O sistema proposto validou a premissa de que a integração de LLMs a interfaces de voz aumenta a autonomia de usuários com deficiência motora, cumprindo o propósito de ser uma Tecnologia Assistiva moderna e eficaz. Contudo, foram levantadas questões sobre os custos da IA e a segurança dos dados do usuário, indicando a necessidade de aprimoramento.

Palavras-chave: Chamada de função; Interação homem-máquina; Reconhecimento de voz; Visão computacional.

Engenharia De Software

09 de outubro de 2026

ReasonGuard: Uma Plataforma de Auditoria de Raciocínio para Modelos de Linguagem Baseada em Decomposição Estruturada de Pensamento

Apresentou-se o ReasonGuard, uma plataforma de auditoria de raciocínio de Inteligência Artificial, desenvolvida como middleware de observabilidade entre aplicações cliente e modelos de linguagem de grande escala (LLMs). O trabalho teve como objetivo oferecer transparência e rastreabilidade para processos de tomada de decisão baseados em IA, abordando a lacuna na operacionalização de técnicas de raciocínio estruturado para fins de auditoria. O sistema interceptou, analisou e documentou interações com LLMs por meio de cinco módulos fundamentados nos paradigmas Chain-of-Thought (CoT), Tree-of-Thought (ToT) e Graph-of-Thought (GoT). Esses módulos capturaram trilhas de raciocínio, detectaram falhas lógicas estruturais, avaliaram a consistência de respostas e geraram relatórios de auditoria direcionados a diferentes perfis de stakeholders. A plataforma implementou-se com FastAPI (Python) no backend, React com TypeScript no frontend e PostgreSQL como banco de dados relacional, seguindo arquitetura modularizada com isolamento multitenancy por usuário. Os resultados demonstraram a viabilidade técnica da abordagem proposta, com todos os cinco módulos operacionais e integrados. Concluiu-se que o ReasonGuard contribui para a governança de IA ao instrumentalizar paradigmas de raciocínio estruturado como ferramentas de observabilidade e auditoria, preenchendo uma lacuna na literatura.

Palavras-chave: Auditoria de IA; Chain-of-Thought; Governança de IA; Modelos de Linguagem de Grande Escala; Transparência Algorítmica.

Engenharia De Software

09 de outubro de 2026

EngTT: software para motor de frete rodoviário baseado em custos operacionais e parâmetros ANTT

O transporte rodoviário representa a principal modalidade logística do Brasil, com a composição dos custos de frete regulada pela Agência Nacional de Transportes Terrestres (ANTT). Diante da ausência de uma metodologia estruturada para o cálculo de frete e da dependência de planilhas isoladas no setor, desenvolveu-se o software EngTT. O objetivo foi criar uma ferramenta de apoio à decisão que integrasse variáveis operacionais, calculasse o custo total por rota e comparasse os resultados com o piso mínimo da ANTT, identificando cenários de não conformidade e compressão de margem antes da precificação. A metodologia adotada foi aplicada, quantitativa e experimental, com construção incremental orientada ao conceito de Produto Mínimo Viável (MVP). O sistema foi estruturado em três modos de uso – Montar Rota Visual, Batch por planilha e Scrape de rotas – compartilhando um motor de cálculo desacoplado e parâmetros centralizados. Os resultados obtidos demonstraram que o software atendeu ao objetivo proposto, evidenciando variações de margem e conformidade regulatória entre as rotas analisadas. Observou-se que rotas de maior extensão, como Ribeirão Preto × Guarujá, apresentaram incremento de custo devido à necessidade de diárias adicionais do motorista, enquanto rotas mais curtas, como Cajamar × Guarujá, mostraram maior aderência ao piso regulatório da ANTT. Concluiu-se que a solução desenvolvida é aplicável ao setor de transporte rodoviário de cargas como ferramenta eficaz de precificação e gestão operacional.

Palavras-chave: ANTT; Carga conteinerizada; Engenharia de software; Frete rodoviário; Python.

Engenharia De Software

08 de outubro de 2026

Pipeline de dados para o monitoramento de ações considerando a metodologia fundamentalista

O cenário financeiro brasileiro enfrenta desafios como o endividamento familiar, a baixa literacia financeira e a descentralização de informações para análise de investimentos. Diante disso, o objetivo da pesquisa consistiu em desenvolver um pipeline de dados financeiros, fundamentado em boas práticas de Engenharia de Dados, para estruturar, processar e disponibilizar informações relevantes que apoiassem a tomada de decisão de investidores individuais na análise de ações. Implementou-se uma arquitetura medalhão, utilizando MinIO S3 para armazenamento em camadas bronze, silver e gold, com Delta Lake para governança de dados. Empregou-se Apache Spark para processamento distribuído, Prometheus para monitoramento e Power BI para visualização analítica. Os dados foram majoritariamente demonstrações financeiras da Comissão de Valores Mobiliários (CVM). Construiu-se uma carteira teórica de investimentos com base nos princípios de Benjamin Graham (2017), aplicando filtros de seleção e validação de dados. Os resultados indicaram um retorno positivo de 32,88% para a carteira teórica, superando o índice Ibovespa (4,25%) no período de 2021 a 2024, embora inferior à taxa Selic (46,96%). Qualitativamente, o pipeline processou conjuntos de dados volumosos, com reduções significativas de redundâncias, como 99,27% na tabela BPA e 94,29% na DRE, após a aplicação de filtros. Evidenciaram-se ganhos em organização, rastreabilidade e qualidade dos dados, possibilitando análises financeiras estruturadas e mais robustas.

Palavras-chave: Arquitetura Medalhão; Engenharia de Dados; Investimentos; Pipeline de Dados.

Engenharia De Software

08 de outubro de 2026

Desempenho e Custo Total de Propriedade de Bancos de Dados em Nuvem e Infraestrutura Local

O presente estudo analisou o desempenho de operações de banco de dados em infraestruturas de nuvem e local, correlacionando o comportamento técnico com a projeção do Custo Total de Propriedade. A pesquisa caracterizou-se como um estudo quantitativo e experimental, no qual um sistema de testes submeteu instâncias isoladas de bancos de dados a cargas progressivas de execução, mensurando o impacto da latência de rede e do consumo computacional. Para a análise financeira, elaborou-se uma modelagem de investimentos e despesas operacionais diluídos em um ciclo de trinta e seis meses. Os resultados técnicos revelaram que o acúmulo da latência da internet causou severa degradação de tempo nas execuções em nuvem, apesar de a infraestrutura remota operar com alta ociosidade de processamento, registrando quase 98% de inatividade da CPU. Em contrapartida, o ambiente local obteve desempenho superior amparado pela comunicação de rede quase instantânea. No aspecto financeiro, a consolidação dos custos demonstrou um empate empírico entre o modelo de aquisição física e o de assinatura de serviço em um horizonte de três anos, mas o ambiente local mostrou-se mais vantajoso em um ciclo de sessenta meses. Concluiu-se que a degradação na nuvem não decorreu da capacidade computacional, mas da interação entre a latência de rota e o padrão de comunicação unitário da aplicação. A adoção da nuvem exige otimização profunda da arquitetura do sistema para minimizar a dependência de comunicação constante com o servidor remoto. Sem essa modernização, a infraestrutura local consolidou-se como a estratégia mais viável, garantindo alto desempenho, previsibilidade orçamentária e soberania dos dados.

Palavras-chave: Despesas operacionais (OPEX); Escalabilidade transacional; Latência de rede; Sistemas legados.

Engenharia De Software

08 de outubro de 2026

Integração assíncrona Slack-Jira via “middleware” de filas: comparação de soluções de “cloud computing”

A latência e a interoperabilidade entre sistemas corporativos distribuídos constituíram o problema investigado, motivado pelos custos e fragilidades das integrações manuais entre plataformas de colaboração e gestão de projetos. Desenvolveu-se e validou-se um “middleware” de integração assíncrona entre Slack e Jira, com o objetivo de reduzir o tempo de resposta percebido pelo usuário e garantir a estabilidade do sistema sob carga. A metodologia consistiu na construção de uma arquitetura de software orientada a eventos em Python, utilizando os padrões “producer-consumer” e “adapter” para isolar a interface do usuário do processamento de “backend”. A solução evoluiu para uma arquitetura agnóstica de nuvem, baseada em funções “serverless”, e foi submetida a testes de estresse em ambientes local, de rede real e de produção em duas nuvens. A arquitetura reduziu o tempo de espera do usuário de uma estimativa síncrona de 2.000 milissegundos para uma média local de 8,96 milissegundos. Sob carga de 50 requisições simultâneas, ambos os provedores de nuvem mostraram-se viáveis: a Amazon Web Services registrou menor latência média na camada de recepção (951,35 ms) e o dobro da vazão, enquanto a Microsoft Azure executou o processamento em segundo plano com mediana de 113 ms. A aplicação de “optimistic UI” assegurou fluidez de uso, e o nivelamento de carga por filas dispensou o sobredimensionamento de infraestrutura. O “middleware” consolidou-se como um modelo de referência corporativa escalável, resiliente e protegido contra o aprisionamento tecnológico.

Palavras-chave: Arquitetura orientada a eventos; Desacoplamento temporal; Eficiência operacional; Gestão de serviços de tecnologia da informação; Interoperabilidade de sistemas.

Engenharia De Software

05 de outubro de 2026

Usando IA generativa para escolha de banco de dados: Um framework orientado a requisitos para geração de Architecture Decision Records (ADRs)

O crescimento de aplicações intensivas em dados e a adoção da arquitetura de microsserviços ampliaram a necessidade da persistência poliglota, impondo uma alta carga cognitiva aos arquitetos de software na escolha e justificação de tecnologias de banco de dados. Este trabalho teve como objetivo propor e desenvolver um framework baseado em agentes de Inteligência Artificial (IA) para guiar a seleção tecnológica e gerar Architecture Decision Records (ADRs) fundamentadas. Empregou-se uma metodologia experimental e aplicada para construir uma base de conhecimento técnico. A técnica de Retrieval-Augmented Generation (RAG), juntamente com as bibliotecas LangChain e LangGraph, foi utilizada para orquestrar agentes e ancorar as respostas de um Large Language Model (LLM). O framework extraiu requisitos em linguagem natural, enriqueceu-os com RAG e os enviou ao LLM, que gerou ADRs para auxiliar na avaliação de trade-offs teóricos. Os resultados demonstraram que o agente com RAG reduziu respostas genéricas, aumentando o embasamento teórico e a rastreabilidade. A abordagem RAG comprovou sua eficácia frente a prompts convencionais (zero-shot), favorecendo a geração de ADRs com menor nível de alucinação e alto nível de rastreabilidade teórica. Concluiu-se que a ferramenta automatizada cumpriu a função de mapeamento de requisitos, resultando em documentos técnicos empiricamente embasados e auxiliando a governança e tomada de decisões em arquitetura de software.

Palavras-chave: Bancos de Dados; Inteligência Artificial; LangGraph; LLM; RAG.

Inscreva-se em nossa newsletter!

Receba conteúdos e fique sempre atualizado sobre as novidades em gestão, liderança e carreira com a Revista E&S.

Ao preencher o formulário você está ciente de que podemos enviar comunicações e conteúdos da Revista E&S. Confira nossa Política de Privacidade