Engenharia De Software
07 de outubro de 2026
Aplicação de Inteligência Artificial para Análise de Sentimento em Mensagens de Texto
Aplicação de Inteligência Artificial para Análise de Sentimento em Mensagens de Texto
Isabel Priscila Chaves da Silva Rebello; Marcos Jardel Henriques
DOI: 10.22167/2675-6528-202603004
Artigo derivado de Trabalho de Conclusão de Curso (TCC), com conteúdo baseado no trabalho original do aluno e adaptado ao formato editorial da Revista E&S com apoio da ferramenta ResumeAI, solução de inteligência artificial desenvolvida pelo Instituto Pecege para síntese e organização textual.
Resumo
A análise de sentimentos em mensagens de texto de clientes de e-commerce é crucial para a tomada de decisões empresariais. Este estudo implementou modelos de inteligência artificial com o objetivo de comparar seus desempenhos na avaliação dessas mensagens. A metodologia consistiu na aplicação de um conjunto de dados de 4664 registros em quatro experimentos distintos: GPT 3.5 Turbo com Zero-shot, GPT 3.5 Turbo com Few-shot, BERT Multilingual Sentiment e BERTimbau com Fine tuning. Os resultados obtidos indicaram que o modelo especializado com Fine tuning apresentou as melhores métricas de avaliação, uma matriz de confusão mais consistente e o menor tempo de processamento. Em contraste, o modelo BERT Multilingual Sentiment demonstrou dificuldades em interpretar textos no idioma português. Os experimentos com GPT 3.5 Turbo, particularmente a abordagem Few-shot, revelaram-se promissores, configurando-se como uma alternativa viável em cenários onde o Fine tuning não pode ser aplicado. Concluiu-se que a estratégia de Fine tuning em modelos pré-treinados, como o BERTimbau, oferece vantagens significativas em precisão e eficiência para análise de sentimentos em larga escala.
Palavras-chave: Análise de Sentimentos; Fine Tuning; Inteligência Artificial; LLM; Processamento de Linguagem Natural.
1. Introdução
A análise de sentimentos (AS), também conhecida como análise de opinião ou mineração de opinião, tornou-se um conceito de grande importância para empresas, governos e organizações. Compreender como clientes e usuários percebem produtos e serviços é fundamental para a tomada de decisão estratégica (SÁNCHEZ-RADA E IGLESIAS, 2019).
Apesar de sua relevância, apurar e analisar o feedback do consumidor apresenta desafios significativos. O conteúdo gerado por clientes é frequentemente composto por dados não estruturados, como mensagens de texto livres, que podem abordar diversos temas e conter expressões coloquiais, erros ortográficos e linguagem informal. Essa natureza dos dados dificulta o processo de AS e o tratamento eficaz das informações (TAN, 2023).
No contexto do e-commerce, a análise de sentimentos é uma ferramenta poderosa e com vasto potencial. Empresas que buscam manter a competitividade no mercado necessitam apurar e analisar os feedbacks dos consumidores. A AS permite obter informações valiosas sobre as opiniões dos clientes, auxiliando na detecção de pontos de melhoria, no aperfeiçoamento de produtos e serviços, e nos ajustes estratégicos para satisfazer as exigências do mercado (Soares, 2023). Além disso, possibilita aos clientes fazer escolhas de compra mais informadas. Com o grande volume de dados não estruturados gerados diariamente, uma ferramenta capaz de extrair informações em larga escala é essencial para uma compreensão ágil da percepção dos consumidores, gerando vantagens estratégicas e operacionais.
A análise de sentimentos é um segmento do Processamento de Linguagem Natural (PLN) que visa identificar e categorizar automaticamente sentimentos e emoções expressos em textos (TAN, 2023). Historicamente, métodos tradicionais como Bag-of-Words e TF-IDF classificavam textos pela frequência de palavras, mas ignoravam o contexto e a semântica, limitando sua eficácia. A evolução levou ao desenvolvimento de modelos como Word2Vec e GloVe, que capturam o significado semântico, embora ainda enfrentem desafios com palavras desconhecidas e a necessidade de grandes conjuntos de dados (KOKAB ET AL, 2022). Mais recentemente, abordagens baseadas em aprendizado por transferência, como o BERT, e Large Language Models (LLMs), como o GPT 3.5 Turbo, surgiram, demonstrando alta capacidade de generalização e precisão em tarefas de AS, inclusive com estratégias de zero-shot e few-shot (Souza et al., 2022).
Diante da complexidade e da diversidade de modelos de inteligência artificial disponíveis para análise de sentimentos, e considerando a importância do feedback do cliente para o e-commerce brasileiro, torna-se crucial investigar qual abordagem oferece o melhor desempenho para mensagens de texto em português. A comparação entre modelos de linguagem grandes (LLMs) com abordagens zero-shot e few-shot e modelos pré-treinados com fine tuning, como o BERTimbau, é fundamental para identificar a solução mais eficaz em termos de precisão e eficiência de processamento para este domínio específico.
Nesse contexto, o presente trabalho busca comparar o desempenho de diferentes modelos de Inteligência Artificial na análise de sentimentos em mensagens de texto de clientes de um e-commerce.
2. Material e Métodos
Com o intuito de atingir os objetivos propostos, este estudo foi conduzido por meio de uma abordagem comparativa e experimental. Realizou-se uma revisão bibliográfica para identificar modelos de inteligência artificial promissores, seguida pela definição e aplicação desses modelos a um conjunto de dados de mensagens de texto de clientes. Posteriormente, procedeu-se à comparação dos modelos através de uma avaliação experimental e à análise dos resultados obtidos.
A unidade de análise consistiu em um conjunto de 4664 mensagens de texto reais, coletadas de avaliações de clientes de um e-commerce. Essas mensagens continham feedback sobre vendedores, produtos e serviços de entrega, representando dados não estruturados gerados por consumidores (WANKHADE ET AL, 2022). A natureza desses dados permitiu observar o desempenho dos modelos diante de expressões coloquiais, erros ortográficos e linguagem informal.
O pré-processamento dos dados foi uma etapa fundamental para estruturar os textos. Este processo incluiu a remoção de caracteres especiais, como símbolos (exceto números) e URLs, e a tokenização, que segmentou o texto em unidades menores (PALOMINO, 2022; TAN ET AL, 2023). Adicionalmente, mensagens com avaliações numéricas de 0 a 10 foram tratadas para delimitar esses valores, auxiliando na assimilação do modelo.
Após o pré-processamento, as 4664 mensagens de texto foram rotuladas manualmente em três categorias de sentimento: positivo, negativo e neutro. A rotulagem foi realizada por um único avaliador, priorizando mensagens com conteúdo textual explícito. Em casos de ambiguidade, a classe negativa foi adotada como critério de desempate. As regras de rotulagem estabeleceram como positivo notas acima de sete ou elogios, como negativo notas abaixo de seis com críticas diretas, e como neutro notas entre seis e sete ou mensagens não relacionadas aos serviços.
Para a análise de sentimentos, foram empregados três modelos de inteligência artificial distintos, avaliados em quatro configurações experimentais. Os modelos incluíram o GPT 3.5 Turbo, o nlptown/bert-base-multilingual-uncased-sentiment (uma adaptação do BERT para análise de sentimentos multilíngue), e o neuralmind/bert-base-portuguese-cased, conhecido como BERTimbau, treinado especificamente para o português brasileiro (Souza et al., 2022).
A implementação do GPT 3.5 Turbo ocorreu em duas configurações. Na abordagem zero-shot, o modelo classificou o sentimento (positivo, negativo ou neutro) com base apenas na descrição da tarefa fornecida no prompt, sem exemplos prévios. Na configuração few-shot, um conjunto de exemplos foi fornecido ao modelo para orientar seu comportamento, utilizando o contexto para aprimorar a qualidade das inferências.
O modelo BERT Multilingual Sentiment foi utilizado em seu formato pré-treinado. Já o modelo BERTimbau foi aplicado com a técnica de fine-tuning, que envolveu o treinamento do modelo com o conjunto de dados rotulado. Para este processo, o conjunto de dados foi dividido em partições de treino e teste, com 70% e 20% dos dados, respectivamente, sendo a partição de validação não utilizada para a avaliação direta do modelo.
Os hiperparâmetros empregados no fine-tuning do BERTimbau incluíram o modelo base neuralmind/bert-base-portuguese-cased (BERTimbau Base), três épocas de treinamento, uma taxa de aprendizado de 2×10-5, e um tamanho de lote (batch size) de oito para treino e avaliação. O comprimento máximo de 512 tokens foi definido, e o otimizador AdamW, juntamente com a função de perda de entropia cruzada, foram utilizados conforme os padrões da biblioteca Transformers (Hugging Face).
A avaliação do desempenho dos modelos foi realizada por meio de um conjunto de métricas estatísticas amplamente reconhecidas na literatura de classificação. As métricas calculadas incluíram Acurácia, Coeficiente Kappa, Precisão Macro, Revocação Macro, F1 Macro, Precisão Ponderada, Revocação Ponderada e F1 Ponderado. Adicionalmente, empregou-se a matriz de confusão como ferramenta gráfica para visualizar a quantidade de classificações corretas em cada classe de sentimento.
3. Resultados e Discussão
A análise comparativa do desempenho de diferentes modelos de inteligência artificial na avaliação de sentimentos em mensagens de texto de clientes de e-commerce revelou variações significativas nas métricas de avaliação, na consistência da classificação e na eficiência de processamento. Os experimentos foram conduzidos com quatro abordagens distintas: GPT 3.5 Turbo com Zero-shot, GPT 3.5 Turbo com Few-shot, BERT Multilingual Sentiment e BERTimbau com Fine tuning. Os resultados obtidos permitiram identificar a estratégia mais eficaz para o contexto específico de mensagens em português, conforme o objetivo central deste estudo.
Inicialmente, observou-se que o modelo BERTimbau com Fine tuning demonstrou o desempenho mais robusto em todas as métricas estatísticas avaliadas. Este modelo alcançou uma acurácia de 0,9154, um coeficiente Kappa de 0,8701, precisão Macro de 0,9076, revocação Macro de 0,9114 e F1 Macro de 0,9085. As métricas ponderadas também seguiram essa tendência, com precisão ponderada de 0,9162, revocação ponderada de 0,9154 e F1 ponderado de 0,9149. Esses valores consistentemente elevados indicam uma capacidade superior de classificação e uma compreensão aprofundada das nuances contextuais e semânticas da língua portuguesa, o que é crucial para a análise de sentimentos em dados de e-commerce.
Em contraste, o modelo BERT Multilingual Sentiment apresentou o pior desempenho entre todas as abordagens testadas. Suas métricas foram notavelmente baixas, com acurácia de 0,5491, coeficiente Kappa de 0,3311, precisão Macro de 0,5548, revocação Macro de 0,5675 e F1 Macro de 0,5126. As métricas ponderadas também foram inferiores, com precisão ponderada de 0,5785, revocação ponderada de 0,5491 e F1 ponderado de 0,522. Este resultado sugere que, apesar de ser um modelo projetado para análise de sentimento e com suporte para múltiplos idiomas, ele não conseguiu capturar de forma eficiente as particularidades semânticas do português brasileiro, corroborando observações de Souza et al. (2022) sobre as limitações de modelos multilingues para idiomas específicos.
As abordagens com GPT 3.5 Turbo ocuparam uma faixa intermediária de desempenho. O modelo GPT 3.5 Turbo Zero-shot obteve acurácia de 0,7562, Kappa de 0,625, precisão Macro de 0,7477, revocação Macro de 0,7556 e F1 Macro de 0,7512. As métricas ponderadas foram similares, com precisão ponderada de 0,7551, revocação ponderada de 0,7562 e F1 ponderado de 0,7553. Embora demonstre a alta capacidade de um Large Language Model (LLM) em realizar classificações com informações mínimas, a ausência de exemplos específicos para a tarefa resultou em um desempenho inferior em comparação com abordagens mais adaptadas.
A aplicação da estratégia Few-shot ao GPT 3.5 Turbo resultou em uma melhoria notável em relação à abordagem Zero-shot. Este modelo alcançou acurácia de 0,8218, Kappa de 0,7311, precisão Macro de 0,8153, revocação Macro de 0,8303 e F1 Macro de 0,8108. As métricas ponderadas também foram superiores, com precisão ponderada de 0,8431, revocação ponderada de 0,8218 e F1 ponderado de 0,8224. A inclusão de exemplos no prompt forneceu um contexto mais claro para o modelo, aprimorando a qualidade das inferências e evidenciando o potencial dos LLMs quando orientados com dados específicos, mesmo sem um fine tuning completo, conforme apontado por Fatouros (2023).
Além das métricas de desempenho, a capacidade de processamento dos modelos foi um fator crítico na avaliação. Os modelos baseados em BERT, tanto o Multilingual Sentiment quanto o BERTimbau com Fine Tuning, demonstraram uma eficiência significativamente maior. O BERT Multilingual Sentiment processou os dados em 2 minutos e 11 segundos, enquanto o BERTimbau com Fine Tuning, que utilizou 934 registros para teste, completou a tarefa em apenas 25 segundos. Isso se traduz em um tempo médio por registro de aproximadamente 0,028 segundos para o BERT Multilingual e 0,027 segundos para o BERTimbau, indicando uma alta velocidade de processamento para ambos.
Em contrapartida, os experimentos com GPT 3.5 Turbo apresentaram tempos de processamento consideravelmente mais longos. A abordagem Zero-shot levou 150 minutos e 1 segundo para processar 4557 registros, resultando em um tempo médio de 1,975 segundos por registro. A abordagem Few-shot teve um desempenho similar, com 150 minutos e 41 segundos para 4601 registros, totalizando 1,965 segundos por registro. Essa diferença de tempo, cerca de 73 vezes maior para os LLMs por registro, destaca uma vantagem operacional significativa dos modelos específicos em cenários de larga escala, onde a agilidade no processamento é essencial para a compreensão em tempo real da percepção dos consumidores.
Outro aspecto relevante na avaliação dos modelos GPT 3.5 Turbo foi a ocorrência de erros de requisição. A abordagem Zero-shot registrou 2,30% de erros, enquanto a Few-shot apresentou 1,35% de erros. Esses erros indicam que, apesar das boas métricas, parte dos dados pode não ser classificada, resultando em perda de informação. A menor taxa de erro na abordagem Few-shot pode ser atribuída ao tamanho do prompt, que, por conter exemplos, exige mais da API e do modelo, mas também oferece um direcionamento mais robusto, minimizando falhas de requisição em comparação com a abordagem Zero-shot, que depende exclusivamente do conhecimento pré-existente do modelo.
Matriz de Confusão
A análise das matrizes de confusão forneceu uma visão detalhada sobre os tipos de erros de classificação cometidos por cada modelo. Para o modelo BERT Multilingual Sentiment, a matriz revelou um número elevado de classificações incorretas. Embora tenha acertado grande parte das instâncias negativas (1022), o modelo errou substancialmente nas classes positivas e neutras. Por exemplo, classificou 740 mensagens neutras como negativas e 552 mensagens positivas como negativas. Essa tendência em classificar sentenças como negativas sugere um viés do modelo quando aplicado a dados em português, o que reforça a dificuldade em lidar com as especificidades linguísticas do idioma.
A matriz de confusão do modelo BERTimbau com Fine Tuning, por sua vez, demonstrou uma alta capacidade de classificação em todas as classes. Com um número reduzido de erros, o modelo acertou 217 classificações negativas, 251 neutras e 387 positivas. Os erros foram mínimos, com apenas 13 negativas classificadas como neutras, 2 como positivas; 34 neutras como negativas, 16 como positivas; e 1 positiva como negativa, 13 como neutra. Essa consistência na matriz de confusão evidencia a eficácia do fine tuning em um modelo monolíngue para o português, permitindo uma adaptação precisa às características do conjunto de dados.
Para o modelo GPT 3.5 Turbo Zero-shot, a matriz de confusão indicou que, apesar de um número razoável de acertos, o modelo apresentou uma tendência ao erro entre as classes intermediárias e as mais extremas. Observou-se que 240 mensagens neutras foram classificadas como negativas e 31 positivas também foram classificadas como negativas. Além disso, 338 mensagens positivas foram classificadas como neutras. Essa confusão sugere que o modelo, sem exemplos específicos, tem dificuldade em diferenciar nuances de sentimento, classificando positivos ou negativos como neutros, ou vice-versa, o que pode levar a interpretações ambíguas em contextos complexos de e-commerce.
A matriz de confusão do GPT 3.5 Turbo com estratégia Few-shot mostrou uma melhora significativa nos acertos em comparação com a abordagem Zero-shot. O modelo classificou corretamente 1098 mensagens negativas, 980 neutras e 1703 positivas. Contudo, ainda se notou certa confusão ao classificar neutros como negativos (456) e positivos como neutros (231). Essa confusão, embora menor, indica que, mesmo com exemplos, o modelo pode ter desafios em contextos onde as fronteiras entre os sentimentos são mais sutis. A possibilidade de corrigir esses erros por meio da análise de sentenças problemáticas e fornecimento de novos exemplos é uma vantagem dessa estratégia, permitindo um aprimoramento contínuo do modelo.
Em síntese, os resultados da pesquisa demonstram que a estratégia de Fine tuning em modelos pré-treinados, como o BERTimbau, oferece a maior precisão e consistência na análise de sentimentos em mensagens de texto de clientes de e-commerce em português, além de um tempo de processamento significativamente menor. As abordagens com GPT 3.5 Turbo, especialmente a Few-shot, mostraram-se promissoras e representam uma alternativa viável em cenários onde o fine tuning não é aplicável, apesar de apresentarem maior tempo de processamento e alguma confusão na classificação. O modelo BERT Multilingual Sentiment, por sua vez, revelou-se inadequado para o idioma português, evidenciando a importância da especificidade linguística para a eficácia da análise de sentimentos.
4. Conclusão
O presente estudo buscou comparar o desempenho de diferentes modelos de inteligência artificial na análise de sentimentos em mensagens de texto de clientes de um e-commerce. Verificou-se que o modelo BERTimbau com Fine tuning demonstrou o desempenho mais robusto, alcançando as melhores métricas estatísticas de avaliação e uma matriz de confusão consistente, além de apresentar o menor tempo de processamento. Em contraste, o modelo BERT Multilingual Sentiment revelou dificuldades significativas em interpretar textos no idioma português, resultando nas métricas mais baixas entre as abordagens testadas. As implementações com GPT 3.5 Turbo, tanto na modalidade Zero-shot quanto Few-shot, situaram-se em uma faixa intermediária de desempenho. A estratégia Few-shot, em particular, evidenciou uma melhoria notável em relação à Zero-shot, configurando-se como uma alternativa promissora em cenários onde o Fine tuning não pode ser aplicado. Contudo, observou-se que os modelos baseados em BERT processaram os dados de forma significativamente mais rápida, cerca de 73 vezes mais ágil por registro, em comparação com as abordagens de LLMs, que também registraram erros de requisição, indicando potencial perda de dados.
Apesar dos resultados promissores, identificou-se que a utilização de Large Language Models como o GPT 3.5 Turbo pode implicar em custos associados às requisições e na ocorrência de erros que resultam em perda de dados, aspectos que demandam consideração em aplicações de larga escala. Sugere-se, para estudos futuros, o rastreamento detalhado dos custos operacionais das requisições ao GPT 3.5 Turbo para uma análise de viabilidade econômica mais aprofundada. Recomenda-se também a investigação de estratégias para aprimorar o desempenho dos modelos por meio da análise de padrões de erro em mensagens classificadas incorretamente e a utilização de exemplos anonimizados, bem como a exploração de questões relacionadas à Lei Geral de Proteção de Dados Pessoais (LGPD) no tratamento de dados de clientes. A principal contribuição deste estudo reside na demonstração de que a estratégia de Fine tuning em modelos pré-treinados, como o BERTimbau, oferece vantagens significativas em precisão e eficiência para a análise de sentimentos em português, fornecendo uma ferramenta valiosa para empresas de e-commerce no monitoramento ágil da percepção dos consumidores e no aprimoramento contínuo de produtos e serviços.
Referências Bibliográficas
FATOUROS, Georgios; SOLDATOS, John; KOUROUMALI, Kalliopi; MAKRIDIS, Georgios; KYRIAZIS, Dimosthenis. (2023). Transforming sentiment analysis in the financial domain with ChatGPT. Machine Learning with Applications, v. 14, 100508.
KOKAB, Sayyida Tabinda; ASGHAR, Sohail; NAZ, Shehneela. (2022). Transformer-based deep learning models for the sentiment analysis of social media data. Array, v. 14, p. 100157.
PALOMINO, Marco A.; AIDER, Farida. (2022). Evaluating the Effectiveness of Text Pre-Processing in Sentiment Analysis. Applied Sciences, v. 12, n. 17, p. 8875.
SOARES, William Destefani. (2023). Avaliação de produtos baseada em análise de sentimentos aplicada a postagens textuais em redes sociais. 114 f. Trabalho de Conclusão de Curso (Graduação em Sistemas de Informação) – Instituto Federal do Espírito Santo, Campus Cachoeiro de Itapemirim.
SOUZA, F. C.; NOGUEIRA, R. F.; LOTUFO, R. A. (2022). BERT models for Brazilian Portuguese: pretraining, evaluation and tokenization analysis. In: Proceedings of the 9th Brazilian Conference on Intelligent Systems (BRACIS).
SÁNCHEZ-RADA, J. F.; IGLESIAS, C. A. (2019). Social context in sentiment analysis: formal definition, overview of current trends and framework for comparison. Information Fusion, v. 52, p. 344-356.
TAN, Kian Long; LEE, Chin Poo; LIM, Kian Ming. (2023). A Survey of Sentiment Analysis: Approaches, Datasets, and Future Research. Applied Sciences, v. 13, n. 7, p. 4550.
WANKHADE, Mayur; RAO, Annavarapu Chandra Sekhara; KULKARNI, Chaitanya. (2022). A survey on sentiment analysis methods, applications, and challenges. Artificial Intelligence Review, v. 55, p. 5731-5780.
Artigo oriundo de Trabalho de Conclusão de Curso da Especialização em Engenharia de Software do MBA USP/Esalq
Para saber mais sobre o curso, clique aqui e acesse a plataforma MBX Academy

