Artigo

28 de julho de 2026

Percepção de profissionais de Tl sobre o uso de LLMs na geração de casos de testes

Davina Flávia Gonçalves dos Anjos; Mônica Mancini

DOI: 10.22167/2675-6528-202600706

Artigo elaborado pela ferramenta ResumeAI, solução de inteligência artificial desenvolvida pelo Instituto Pecege voltada à síntese e redação.

Resumo

O aumento da complexidade dos sistemas de software e a crescente demanda por qualidade e eficiência impulsionaram a adoção de tecnologias de Inteligência Artificial, como as Large Language Models (LLMs), na automação de testes. Este estudo analisou a percepção de profissionais da área de software sobre o uso de LLMs na geração de casos de teste, buscando identificar barreiras à adoção, benefícios percebidos e expectativas quanto à sua aplicabilidade prática. A pesquisa foi de natureza exploratória e descritiva, com abordagem quantitativa e qualitativa. Aplicou-se um questionário online estruturado a 60 profissionais de Quality Assurance e Engenharia de Software, e os dados foram analisados por estatística descritiva e análise de conteúdo. Os resultados revelaram uma percepção majoritariamente positiva em relação ao uso de LLMs. Como barreiras, destacaram-se a necessidade de capacitação técnica, a dependência da qualidade dos prompts e os riscos da automação sem validação humana. Entre os benefícios, evidenciou-se a redução do esforço manual, o aumento da produtividade e o potencial de melhoria da qualidade do software. As expectativas indicaram uma tendência de ampliação do uso dessas ferramentas como apoio complementar às atividades de teste. Concluiu-se que as LLMs possuem potencial significativo em Quality Assurance, desde que empregadas de forma crítica, supervisionada e integrada aos processos existentes.

Palavras-chave: Automação; Engenharia de Software; Inteligência Artificial; Qualidade; Teste de Software.

1. Introdução

O cenário atual do desenvolvimento de software é marcado por uma crescente complexidade dos sistemas computacionais, o que impulsiona a busca contínua por abordagens inovadoras. Essas abordagens visam assegurar maior confiabilidade, escalabilidade e produtividade, elementos cruciais para garantir a funcionalidade robusta e uma experiência satisfatória para o usuário final. Nesse contexto, a Inteligência Artificial (IA) emerge como um recurso tecnológico promissor, capaz de automatizar funções essenciais no ciclo de vida do software, como a criação de casos de teste (Zhang, 2024).

A automação viabilizada pela IA não apenas contribui para a redução do esforço manual, mas também impacta positivamente a qualidade e a abrangência dos testes de software. A efetividade desses testes é frequentemente mensurada por métricas de cobertura, que indicam o quão exaustivamente os casos de teste exercem um determinado programa. Estudos recentes apontam que a qualidade e a abrangência dos testes estão intrinsecamente ligadas às características do código-fonte, sublinhando a importância de integrar métodos inteligentes para otimizar tanto a criação quanto a execução dos testes (Imran et al., 2025).

A medição automatizada da cobertura de testes em sistemas baseados em microsserviços, abrangendo desde o nível de Application Programming Interface (API) até testes de ponta a ponta (E2E), é uma prática estratégica. Ela permite identificar lacunas nos testes e otimizar os processos de validação, resultando em software mais confiável e eficiente (Abdelfattah et al., 2024). Dentro desse panorama, as Large Language Models (LLMs) se destacam como uma solução com grande potencial para apoiar a geração automatizada de casos de teste.

As LLMs oferecem a possibilidade de reduzir o esforço manual, aumentar a cobertura dos testes e agilizar os ciclos de desenvolvimento. A elaboração de casos de teste é uma tarefa que demanda conhecimento detalhado do sistema, compreensão dos requisitos e atenção à cobertura de código, requisitos e cenários de negócio. Esses aspectos são fundamentais para garantir que o software atenda às expectativas funcionais e não funcionais (Hadzhikoleva et al., 2024). Pesquisas de Fontes e Gay (2024) demonstram que as LLMs podem gerar casos de teste com níveis significativos de cobertura de código e requisitos, complementando a análise humana nos processos de Quality Assurance (QA) e promovendo maior eficiência operacional.

Apesar do crescente interesse e do potencial evidente das LLMs, ainda existem lacunas significativas no entendimento sobre como os profissionais da Tecnologia da Informação (TI) percebem o uso dessas ferramentas e sua aplicabilidade prática no ambiente de trabalho (Amann et al., 2025). Essa percepção é crucial, pois a adoção efetiva das LLMs não depende apenas da tecnologia em si, mas também da confiança, do conhecimento e da experiência dos profissionais envolvidos, especialmente em tarefas críticas de QA (Kour & Shilpa, 2025).

A integração dessas ferramentas com métricas de cobertura de teste, como cobertura de linhas, instruções, decisões, caminhos e requisitos, permite avaliar a efetividade e a abrangência dos testes gerados. Isso oferece uma base sólida para decisões estratégicas na gestão da qualidade e inovação em software. O acompanhamento dessas métricas possibilita identificar lacunas, priorizar esforços de automação e monitorar o impacto da adoção de LLMs, especialmente em projetos de grande escala e sistemas críticos (Amann et al., 2025).

As métricas de cobertura de teste desempenham um papel central na avaliação da efetividade dos casos de teste gerados. A cobertura de linhas e instruções verifica quais trechos do código-fonte foram executados, enquanto a cobertura de decisões ou “branches” avalia se todas as possibilidades lógicas de estruturas condicionais foram exercitadas. A cobertura de caminhos mensura a execução dos diferentes fluxos possíveis, e a cobertura de requisitos foca no alinhamento entre os testes e os requisitos funcionais e não funcionais definidos. Em conjunto, essas métricas proporcionam uma visão abrangente da qualidade e robustez do processo de teste, sendo essenciais para analisar o impacto da adoção de LLMs na geração automatizada de casos de teste.

A justificativa para este estudo reside na necessidade de compreender a percepção dos profissionais de TI sobre o uso das LLMs na geração de casos de teste. A aplicação da inteligência artificial em testes de software ainda é um campo em consolidação, enfrentando desafios relacionados à efetividade e à adoção no ambiente profissional (Fontes & Gay, 2024). Embora as LLMs demonstrem potencial promissor para a automação de testes, existem limitações quanto à confiabilidade e à aplicabilidade prática dessas ferramentas (Hadzhikoleva et al., 2024). Assim, o objetivo geral desta pesquisa é analisar a percepção de profissionais da área de software quanto ao uso de LLMs na geração de casos de teste, identificando barreiras a sua adoção, os benefícios percebidos e as expectativas quanto à aplicabilidade prática dessas ferramentas.

2. Material e Métodos

A presente pesquisa foi delineada com uma natureza exploratória e descritiva, empregando uma abordagem metodológica mista, que combinou elementos quantitativos e qualitativos. A fase exploratória buscou proporcionar uma compreensão inicial e aprofundada do fenômeno em estudo, que é a percepção de profissionais de TI sobre o uso de Large Language Models (LLMs) na geração de casos de teste, permitindo o levantamento de percepções e tendências ainda em consolidação (Theodorson, 1970). Complementarmente, a fase descritiva teve como finalidade identificar, registrar e analisar as características desse grupo de profissionais, possibilitando a compreensão de suas percepções, comportamentos e opiniões relacionadas ao tema (Perovano, 2014).

A abordagem quantitativa foi aplicada para a mensuração e análise de dados numéricos, utilizando técnicas estatísticas para identificar padrões, relações e tendências observadas na amostra, visando uma compreensão estruturada dos resultados (Creswell, 2014). Paralelamente, a abordagem qualitativa buscou compreender os fenômenos de forma aprofundada, considerando os aspectos subjetivos, as percepções e os significados atribuídos pelos participantes. Essa perspectiva permitiu uma análise mais interpretativa e contextualizada das informações coletadas (Minayo, 2010).

A amostra do estudo foi composta por 60 profissionais que atuam nas áreas de Quality Assurance (QA) e Engenharia de Software. Esses participantes possuíam diferentes níveis de experiência e formação acadêmica, contribuindo para a diversidade de perspectivas. A amostragem adotada foi do tipo não probabilística, por conveniência, sendo constituída exclusivamente por profissionais que aceitaram participar voluntariamente da pesquisa de forma anônima, conforme os princípios estabelecidos por Gil (2019).

O instrumento de coleta de dados consistiu em um questionário online estruturado, desenvolvido na plataforma Google Forms. O questionário foi composto por 17 questões fechadas e 3 questões abertas, organizadas em cinco blocos temáticos. Esses blocos incluíram: Caracterização do respondente; Experiência com LLMs; Percepção sobre o uso de LLMs na geração de casos de teste; Métricas de cobertura de teste; e Barreiras, benefícios e expectativas relacionadas ao uso de LLMs.

A coleta de dados foi realizada de forma remota, no período compreendido entre 20 de dezembro de 2025 e 20 de março de 2026. Para tanto, disponibilizou-se um link de acesso ao questionário, que foi amplamente divulgado em redes profissionais e comunidades online da área de software. Esse procedimento resultou na obtenção de 60 respostas anônimas. Todas as questões fechadas eram de preenchimento obrigatório, enquanto as questões abertas eram de resposta opcional.

Para a análise dos dados, as respostas às questões fechadas foram submetidas à análise estatística descritiva, com o cálculo de frequências e percentuais. Os resultados foram organizados em dashboards desenvolvidos com o auxílio da ferramenta Excel, o que facilitou a visualização e a interpretação dos dados. As respostas obtidas nas questões abertas foram analisadas qualitativamente, por meio da técnica de análise de conteúdo, que envolveu a categorização das respostas e a identificação de padrões recorrentes.

Os cuidados éticos foram rigorosamente observados, garantindo a participação voluntária e o anonimato de todos os profissionais envolvidos na pesquisa. A coleta de dados foi conduzida de forma online, sem vínculo direto com qualquer instituição ou empresa específica. A divulgação dos questionários ocorreu em plataformas digitais amplamente utilizadas por profissionais da área de tecnologia, como LinkedIn, fóruns especializados e grupos de estudo e profissionais de engenharia de software no WhatsApp.

3. Resultados e Discussão

A presente seção de Resultados e Discussão tem como propósito apresentar e interpretar os achados da pesquisa, conectando-os ao problema de estudo e aos objetivos propostos. Os dados coletados por meio do questionário online, aplicado a profissionais de Quality Assurance e Engenharia de Software, foram analisados por estatística descritiva e análise de conteúdo, revelando percepções e tendências significativas sobre o uso de Large Language Models na geração de casos de teste. Inicialmente, a caracterização dos respondentes oferece um panorama do perfil dos participantes, seguido pela análise de sua experiência e familiaridade com as LLMs. Posteriormente, são detalhadas as percepções sobre a aplicabilidade das LLMs na redução do esforço manual, na melhoria da cobertura e produtividade, e na confiança em seu uso. A discussão prossegue abordando a relação das LLMs com as métricas de cobertura de teste e, finalmente, as barreiras, benefícios e expectativas dos profissionais em relação a essa tecnologia.

Caracterização do Respondente

A amostra do estudo foi composta por 60 profissionais, predominantemente da área de desenvolvimento de software, que representaram 62% dos respondentes. Outras áreas de atuação incluíram arquitetura de software, com 3%, Quality Assurance, com 7%, e gestão ou liderança técnica, com 8%, além de 20% de outras áreas. Essa distribuição sugere que a maioria dos participantes possui uma base tecnológica sólida e está diretamente envolvida com o ciclo de vida do software, o que confere relevância às suas percepções sobre as LLMs. A diversidade de atuação, embora com predominância do desenvolvimento, permite uma visão multifacetada sobre a integração dessas ferramentas em diferentes etapas do processo de criação de software.

Em relação ao tempo de experiência profissional na área de software, a amostra demonstrou uma distribuição variada, com 32% dos respondentes possuindo até dois anos de experiência, 28% entre três e cinco anos, 20% entre seis e dez anos, e 20% com mais de dez anos. Essa variedade de perfis, desde profissionais em início de carreira até aqueles com vasta experiência, é crucial para a coleta de diferentes perspectivas sobre a adoção e o impacto das LLMs. A presença de profissionais com diferentes níveis de senioridade contribui para uma análise mais robusta, abrangendo tanto a visão de quem está começando a interagir com novas tecnologias quanto a de quem já possui um histórico consolidado no setor.

Quanto ao tipo de organização em que atuam, 40% dos respondentes trabalham em empresas de grande porte, 15% em médio porte e 13% em pequeno porte. Adicionalmente, 18% atuam em consultorias ou fábricas de software, 10% em startups e 2% em pesquisa acadêmica, enquanto 2% não estão trabalhando atualmente. Essa diversidade de ambientes organizacionais reflete a consolidação da tecnologia da informação em diferentes escalas de negócio e sugere que a percepção sobre LLMs pode variar conforme o contexto e a maturidade tecnológica de cada empresa. A representatividade de grandes corporações e consultorias, por exemplo, pode indicar uma visão mais estratégica sobre a implementação de inovações.

O nível de envolvimento dos respondentes com atividades de teste de software também foi investigado, revelando que apenas 5% não possuem envolvimento com essa atividade. Os demais se distribuíram em 32% com alto envolvimento, 33% com envolvimento médio e 30% com baixo envolvimento. Esses dados sublinham a importância intrínseca da atividade de teste no trabalho dos profissionais de TI, independentemente de sua área principal de atuação. A alta proporção de envolvimento com testes reforça a relevância de compreender a percepção desses profissionais sobre ferramentas que prometem otimizar e automatizar essa etapa crucial do desenvolvimento de software, que agrega qualidade e confiabilidade ao produto final.

Experiência com LLMs

A pesquisa revelou uma ampla adoção de Large Language Models entre os profissionais participantes. Um total de 90% dos respondentes afirmou utilizar LLMs frequentemente em suas atividades profissionais, enquanto 10% as utilizam ocasionalmente. É notável que nenhum participante declarou ter deixado de utilizá-las após uma experiência prévia ou nunca as ter utilizado. Esse dado sugere que o uso de LLMs, como ChatGPT, Copilot e Gemini, está se consolidando de forma contínua e duradoura no contexto profissional da área de software, alinhando-se a estudos que indicam a crescente exploração dessas ferramentas em setores críticos (Chen et al., 2024).

A análise das atividades em que as LLMs são mais utilizadas pelos profissionais demonstrou que a escrita de código é a mais aderente, com 75% dos respondentes. A revisão de código segue com 68,3%, e a geração de casos de teste com 65%. Esses percentuais evidenciam a aplicabilidade dessas ferramentas no desenvolvimento diário de software, mostrando que as LLMs já são integradas em tarefas essenciais. A análise de documentação técnica foi mencionada por 63,3% dos participantes, e a análise de requisitos por 40%. Apenas 3,3% dos respondentes declararam não utilizar LLMs em nenhuma das atividades listadas, reforçando a percepção de sua utilidade prática.

No que tange ao nível de familiaridade com o uso de LLMs especificamente em testes de software, os resultados indicaram que 35% dos participantes possuem um nível intermediário de domínio, e outros 35% um nível básico. Um grupo de 22% considera ter um nível avançado, enquanto 8% acreditam não possuir nenhum conhecimento sobre a aplicação de LLMs em testes. Essa distribuição sugere que, embora a adoção das LLMs seja ampla, o aprofundamento no conhecimento de sua aplicação em testes de software ainda está em desenvolvimento. A predominância de níveis básico e intermediário aponta para a necessidade de mais capacitação e experiência prática para explorar plenamente o potencial dessas ferramentas em Quality Assurance.

Percepção sobre LLMs na Geração de Casos de Teste

A percepção dos profissionais sobre a capacidade das LLMs em reduzir o esforço manual na criação de casos de teste é majoritariamente positiva. Mais da metade dos respondentes, 51,7%, concordou totalmente com essa afirmação, e outros 26,7% atribuíram nota 4 em uma escala Likert de 1 a 5. Apenas uma pequena parcela, 1,7%, discordou totalmente. Essa tendência de concordância sugere que as LLMs são vistas como ferramentas eficazes para otimizar o tempo e os recursos dedicados à elaboração de testes, liberando os desenvolvedores para tarefas mais complexas e estratégicas, o que pode impulsionar a eficiência operacional nos processos de desenvolvimento de software.

Em relação à cobertura funcional dos casos de teste gerados por LLMs, a maioria dos participantes demonstrou elevada confiança. Um total de 41,7% dos respondentes atribuiu nota 4, e 23,3% atribuíram nota 5, indicando um alto nível de confiança na qualidade dos resultados. Embora 1,7% tenha atribuído nota 1 e outro 1,7% nota 2, a percepção predominante é de que as LLMs são capazes de gerar testes com boa abrangência funcional. Essa confiança é fundamental para a adoção dessas ferramentas, pois a efetividade dos testes é um pilar da garantia da qualidade do software, e a capacidade das LLMs de contribuir para essa efetividade é um fator decisivo para sua aceitação no ambiente profissional.

A contribuição das LLMs para o aumento da produtividade das equipes de Quality Assurance também foi amplamente reconhecida. A pesquisa revelou que 41,7% dos respondentes atribuíram nota 5 e 38,3% atribuíram nota 4, indicando uma forte concordância com a afirmação. É relevante notar que nenhum participante discordou totalmente. Essa percepção reforça o potencial das LLMs como catalisadores de eficiência, permitindo que as equipes de QA otimizem seus fluxos de trabalho e entreguem resultados mais rapidamente. O aumento da produtividade é um benefício tangível que pode justificar investimentos na integração dessas tecnologias nos processos de teste de software.

A confiança na utilização de LLMs como apoio à geração de casos de teste é favorável, com 35% dos participantes atribuindo nota 4 e 28,3% atribuindo nota 5. Contudo, 30% dos respondentes atribuíram nota 3, indicando uma certa hesitação ou neutralidade. Uma parcela minoritária, 5%, atribuiu nota 2 e 1,7% atribuiu nota 1. Esses resultados sugerem que, embora a percepção geral seja positiva, ainda há espaço para o fortalecimento da confiança. A hesitação pode estar ligada à necessidade de maior clareza sobre as capacidades e limitações das LLMs, bem como à experiência prática e à validação dos resultados gerados por essas ferramentas em cenários reais de teste.

Uma concordância amplamente predominante foi observada na afirmação de que as LLMs devem ser utilizadas como complemento, e não substituição, da análise humana. Um expressivo 76,7% dos participantes atribuíram nota 5, e 13,3% atribuíram nota 4, enquanto 10% atribuíram nota 3. Nenhum respondente atribuiu notas 1 ou 2. Esses dados evidenciam que os profissionais de TI reconhecem o potencial das LLMs como ferramentas de apoio, mas enfatizam a importância da supervisão e do julgamento humano. Essa visão equilibrada é crucial para uma adoção responsável, garantindo que a criticidade e o conhecimento do domínio humano permaneçam centrais nas decisões de teste.

A necessidade de capacitação técnica específica para a adoção de LLMs em Quality Assurance foi amplamente reconhecida pelos respondentes. Um total de 38,3% atribuiu nota 5 e 35% atribuiu nota 4, indicando um forte entendimento de que o uso eficaz dessas ferramentas demanda conhecimentos técnicos aprofundados. Isso inclui a formulação de prompts, a interpretação dos resultados gerados, a validação dos artefatos produzidos e a integração das LLMs aos processos de teste existentes. Apenas uma pequena parcela discordou, reforçando a ideia de que a qualificação técnica é um fator crítico para a implementação bem-sucedida das LLMs em ambientes de QA.

A percepção de que o uso de LLMs pode impactar positivamente a qualidade do software entregue foi expressiva. A maioria dos participantes, 55%, atribuiu nota 5, e 30% atribuiu nota 4, indicando uma forte crença no potencial dessas ferramentas. Não houve registros de discordância, com 15% atribuindo nota 3. Esses resultados corroboram a literatura que associa a qualidade do software à eficácia dos processos de teste (Pressman e Maxim, 2016). A alta concordância sugere que as LLMs são vistas como um recurso capaz de apoiar a identificação antecipada de falhas, ampliar a cobertura de cenários e reduzir inconsistências humanas, alinhando-se às diretrizes da engenharia de software.

Em relação às métricas de cobertura de teste mais utilizadas ou conhecidas, a cobertura de requisitos e a cobertura de linhas foram as opções mais assinaladas, ambas com 50% das menções. A cobertura de decisões ou “branches” foi mencionada por 36,7% dos respondentes, enquanto a cobertura de instruções obteve 31,7% e a cobertura de caminhos 21,7%. É relevante notar que 21,7% dos respondentes declararam não utilizar métricas de cobertura de teste. Esse cenário indica uma preocupação tanto com o alinhamento dos testes aos requisitos funcionais quanto com a verificação da execução do código-fonte, mas também aponta para a necessidade de maior disseminação e uso consistente de métricas mais complexas, especialmente em sistemas de maior porte.

Métricas de Cobertura de Teste

A crença de que as LLMs podem contribuir para melhorar as métricas de cobertura de teste é amplamente difundida entre os profissionais. Um total de 87% dos respondentes afirmou acreditar positivamente nesse aspecto, enquanto 11% declararam não possuir elementos suficientes para avaliar o impacto, e apenas 2% discordaram. Essa predominância de respostas afirmativas sugere que os profissionais reconhecem o potencial das LLMs em apoiar a identificação de cenários não triviais, ampliar o escopo de testes e reduzir lacunas de cobertura, especialmente em contextos de maior complexidade. Essa percepção alinha-se à literatura que destaca a automação e o uso de ferramentas de apoio aos testes para maior confiabilidade e consistência (Myers, Sandler e Badgett, 2011).

Ao serem questionados sobre quais métricas se beneficiariam mais do uso de LLMs, a cobertura de código foi a mais apontada, com 51% dos respondentes. Em seguida, a cobertura de requisitos foi indicada por 17% dos participantes, e a cobertura de cenários de negócio por 13%. Curiosamente, 17% dos respondentes afirmaram não saber avaliar o impacto das LLMs sobre métricas de cobertura, e 2% indicaram que nenhuma métrica se beneficiaria. Esses resultados mostram que os profissionais percebem maior contribuição das LLMs em métricas de natureza técnica, relacionadas à análise de código. Métricas que exigem maior compreensão de regras de negócio e contexto funcional, como a cobertura de cenários de negócio, apresentaram menor destaque, sugerindo que essas áreas ainda são vistas como mais dependentes da análise humana.

Barreiras, Benefícios e Expectativas

Os participantes identificaram diversos benefícios do uso de LLMs na geração de casos de teste. Entre os principais, destacou-se a possibilidade de obter uma visão mais ampla dos cenários testáveis, considerando um conjunto diversificado de experiências prévias utilizadas como base pelas LLMs. Também foi enfatizado o aumento significativo da quantidade de casos de teste gerados, com potencial impacto positivo na cobertura, especialmente sob a perspectiva do negócio. Além disso, foram mencionados ganhos relacionados ao aumento da produtividade, à melhoria da cobertura de testes, à padronização dos casos gerados e à redução de erros repetitivos normalmente associados à atuação humana. Esses fatores reforçam o potencial das LLMs como instrumentos de apoio estratégico ao Quality Assurance, especialmente em contextos que demandam volume, consistência e rapidez na criação de casos de teste.

Apesar dos benefícios, os respondentes também apontaram barreiras e riscos significativos para a adoção de LLMs em atividades de Quality Assurance. O principal risco identificado é a confiança excessiva na Inteligência Artificial sem a devida revisão humana, o que pode resultar em testes incompletos, falsos positivos ou cenários que não contemplam todas as funcionalidades do sistema. Mencionou-se que a qualidade dos resultados gerados depende fortemente do contexto fornecido à ferramenta e do nível de maturidade do processo de QA. A necessidade de validação por profissionais com conhecimento técnico adequado também foi ressaltada, pois a IA pode não considerar variáveis eventuais ou fora do padrão, exigindo a revisão humana para garantir coerência entre os casos de teste e a funcionalidade avaliada.

Em relação às expectativas sobre a ampla adoção das LLMs nos processos de teste de software nos próximos anos, os participantes demonstraram uma percepção majoritariamente positiva. É apontado que, mesmo no estágio atual e ainda apresentando falhas, essas ferramentas já são capazes de economizar tempo e auxiliar na escrita de código e testes, especialmente quando utilizados bons prompts, o que contribui para o aumento da confiabilidade. Os respondentes também ressaltam que a adoção tende a ser mais efetiva em ambientes com padrões de teste bem definidos, nos quais as LLMs podem apoiar a adaptação de casos de teste, sugerir variações e identificar cenários não considerados, atuando como ferramenta de suporte ao QA com a necessária revisão humana. Essa expectativa favorável está ligada aos ganhos de produtividade, eficiência e melhoria da cobertura de testes, mas com uma visão equilibrada que compreende as LLMs como ferramentas de apoio que dependem de bons prompts, padrões de teste consolidados e validação humana para garantir a qualidade e a confiabilidade dos resultados gerados.

Em síntese, os resultados desta pesquisa revelam uma percepção predominantemente positiva dos profissionais de software sobre o uso de Large Language Models na geração de casos de teste. Evidenciou-se que as LLMs são amplamente adotadas em atividades profissionais, como escrita e revisão de código, e especialmente na geração de testes, sendo reconhecidas por seu potencial em reduzir o esforço manual, aumentar a produtividade das equipes de QA e melhorar a cobertura funcional dos testes. Contudo, a adoção plena e eficaz dessas ferramentas é condicionada pela necessidade de capacitação técnica específica, pela dependência da qualidade dos prompts e pela indispensável supervisão humana, que garante a validação crítica dos resultados e a integração contextualizada aos processos de Quality Assurance existentes. As LLMs são vistas como um complemento valioso, não uma substituição, ao trabalho humano, com uma expectativa favorável de sua ampliação nos próximos anos, desde que empregadas de forma estratégica e consciente de suas limitações.

4. Conclusão

Este estudo buscou analisar a percepção de profissionais da área de software sobre o uso de Large Language Models (LLMs) na geração de casos de teste, identificando barreiras à sua adoção, os benefícios percebidos e as expectativas quanto à sua aplicabilidade prática. Verificou-se uma percepção majoritariamente positiva entre os profissionais, que já empregam LLMs frequentemente em atividades como escrita e revisão de código, e especialmente na geração de testes. Os principais achados indicaram que as LLMs são reconhecidas por seu potencial em reduzir o esforço manual, aumentar a produtividade das equipes de Quality Assurance e melhorar a cobertura funcional dos testes. Contudo, observou-se que a adoção plena e eficaz dessas ferramentas é condicionada pela necessidade de capacitação técnica específica, pela dependência da qualidade dos prompts e pela indispensável supervisão humana. Os profissionais enfatizaram que as LLMs devem atuar como um complemento valioso ao trabalho humano, e não como uma substituição, garantindo a validação crítica dos resultados e a integração contextualizada aos processos de garantia da qualidade existentes. A principal contribuição deste trabalho reside em oferecer um panorama detalhado das perspectivas dos profissionais, fornecendo subsídios para a implementação estratégica e consciente das LLMs em ambientes de desenvolvimento de software, maximizando seus benefícios e mitigando os riscos associados.

Apesar dos resultados promissores, o estudo apresentou limitações decorrentes da utilização de uma amostra não probabilística por conveniência, o que restringe a generalização dos achados para a totalidade dos profissionais de TI. Adicionalmente, a coleta de dados realizada exclusivamente em ambiente online pode ter introduzido um viés na amostra, favorecendo a participação de indivíduos com maior familiaridade e engajamento com tecnologias digitais. Para estudos futuros, recomenda-se a ampliação do escopo da pesquisa, incluindo amostras mais diversificadas em termos de localização geográfica, setores de atuação e níveis de maturidade em Quality Assurance. Sugere-se também a realização de estudos de caso que avaliem, de forma prática, o impacto do uso de LLMs na geração de casos de teste e nas métricas de cobertura, bem como investigações comparativas entre diferentes ferramentas e abordagens de uso dessas tecnologias no contexto de testes de software.

Referências Bibliográficas

Abdelfattah, A. S.; Cerny, T.; Yero, J.; Song, E.; Taibi, D. Test Coverage in Microservice Systems: An Automated Approach to E2E and API Test Coverage Metrics. Electronics, v. 13, art. n° 1913, 2024. Disponível em: <https://doi.org/10.3390/electronics13101913>. Acesso em: 13 out. 2025.

Amann, O.; Garousi, V.; Irving, R.; Sahaf, Z. 2025 An intelligent test management system for optimizing decision making during software testing. Journal of Systems and Software, v. 219, p. 112202.

Chen, Zhiyu Zoey et al. A survey on large language models for critical societal domains: finance, healthcare, and law. arXiv preprint, 2024. Disponível em: https://arxiv.org/abs/2405.01769. Acesso em: 20 out. 2025.

Creswell, John W. 2014 Research Design: Qualitative, Quantitative, and Mixed Methods Approaches. 4. ed. Thousand Oaks: SAGE Publications. Nebraska – Lincoln – US.

Fontes, A.; Gay, G. Artificial Intelligence Applied to Software Testing: A Tertiary Study. ACM Computing Surveys, v. 56, n. 3, mar. 2024.

Gil, Antonio Carlos. 2019. Métodos e técnicas de pesquisa social. 7. ed. São Paulo, SP, Brasil.

Hadzhikoleva, S.; Rachovski, T.; Ivanov, I.; Hadzhikolev, E.; Dimitrov, G. Automated Test Creation Using Large Language Models: A Practical Application. Applied Sciences, v. 14, n. 19, art. 9125, 2024.

Imran, M.; Cortellessa, V.; Di Ruscio, D.; et al. Is code coverage of performance tests related to source code features? An empirical study on open-source Java systems. Empirical Software Engineering, v. 30, art. 157, 2025. Disponivel em <https://doi.org/10.1007/s10664-025-10712-3> Acesso em: 13 out. 2025.

Kour, M.; Shilpa, E.R. Intelligent Test Management Systems for Optimizing Decision-Making During Software Testing: A Narrative Review. Journal of Science Engineering Technology and Management Science, v. 2, n. 7, 2025.

Minayo, Maria Cecília de Souza. 2010. O desafio do conhecimento: pesquisa qualitativa em saúde. 12. ed. São Paulo: Hucitec.

Myers, Glenford J.; Sandler, Corey; Badgett, Tom. The art of software testing. 2011. 3. ed. Hoboken: John Wiley & Sons.

Perovano, D. G. 2014. Manual de metodologia científica para a segurança pública e defesa social. Juruá, Curitiba, PR, Brasil.

Pressman, Roger S.; Maxim, Bruce R. 2016 Engenharia de software: uma abordagem profissional. 8. ed. Porto Alegre, RS, Brasil.

Theodorson, G. A. 1970. A modern dictionary of sociology. London, Methuen.

Zhang, Y. New Approaches to Automated Software Testing Based on Artificial Intelligence. 2024 5th International Conference on Artificial Intelligence and Computer Engineering (ICAICE), 2024. Disponível em: <https://ieeexplore.ieee.org/document/10863866> Acesso em: 13 out. 2025.

Artigo oriundo de Trabalho de Conclusão de Curso da Especialização em Engenharia de Software do MBA USP/Esalq

Para saber mais sobre o curso, clique aqui e acesse a plataforma MBX Academy

Você também pode gostar

Compliance E Esg

11 de setembro de 2026

Inteligência Artificial na Gestão Contratual: Supervisão Humana, Riscos Jurídicos e Governança Algorítmica

O advento da inteligência artificial como tecnologia disruptiva reconfigurou processos econômicos, institucionais e jurídicos, conferindo centralidade à automação contratual na gestão de relações complexas. A automação contratual revelou-se um fenômeno juridicamente não neutro, com opacidade decisória, geração automatizada de cláusulas abusivas e dificuldades de atribuição de responsabilidade, deslocando a elaboração contratual para o domínio jurídico-normativo. O estudo analisou como a inteligência artificial na automação contratual intensificou a colisão entre eficiência tecnológica e segurança jurídica, e em que medida mecanismos de supervisão humana significativa e de governança algorítmica funcionaram como instrumentos de ponderação normativa para preservar princípios do direito contratual brasileiro. A pesquisa adotou abordagem qualitativa de estudo de casos múltiplos, com análise documental de quatro casos paradigmáticos: Moffatt v. Air Canada, United States v. RealPage, Deloitte/DEWR e INSS/TRF-4ª Região, representando os contextos consumerista, concorrencial, consultivo-contratual e administrativo. A análise identificou cinco padrões estruturais recorrentes – opacidade decisória, substituição da racionalidade normativa por inferências probabilísticas, accountability gap, assimetria informacional e incompreensão semântica – que emergiram de forma sistêmica. O desfecho fragmentado do caso RealPage reforçou a conclusão de que a jurisprudência sobre automação decisória permanece em formação. A governança algorítmica eficaz demonstrou exigir a integração de mecanismos de auditabilidade, responsabilização e supervisão humana, conforme as normas ISO 31000, COSO ERM e ISO 37301, como condição necessária à legitimidade dos sistemas automatizados de gestão contratual.

Palavras-chave: Contratos; Governança algorítmica; Inteligência artificial; Segurança jurídica; Supervisão humana.

Compliance E Esg

11 de setembro de 2026

Rituais de Verificação sob Pressão: Categorias de Ação ESG Relatadas por Grande Grupo Frigorífico Antes e Após Operação Deflagrada Pela Polícia Federal e Seus Desdobramentos, em Passado Recente

Relatórios de sustentabilidade são amplamente empregados como instrumentos de gestão da legitimidade corporativa, mas sua função como mecanismo de reorganização cognitiva em contextos de crise reputacional permaneceu subexplorada na literatura. O estudo analisou as transformações nas categorias de ação ESG reportadas pela Empresa JBS em seus relatórios anuais de sustentabilidade de 2015 a 2018, período que compreendeu dois anos anteriores e dois anos posteriores à Operação Carne Fraca e seus desdobramentos. O objetivo foi investigar como a organização alterou sua estrutura cognitiva após a crise reputacional, por meio de um de seus sistemas de reporte. Empregou-se um processo de catalogação sistemática de 1.088 práticas relatadas, classificadas por pilar ESG, tema material e categoria de ação. O referencial teórico mobilizou Mary Douglas (1986), Michael Power (1997), Meyer e Rowan (1977) e Edelman (2016) para interpretar os fenômenos observados. Os resultados evidenciaram um crescimento exigido em governança, que coexistiu com o colapso do pilar social, o desaparecimento de categorias substantivas e a substituição de ações voltadas a prêmios por ações que ressignificaram as relações da organização e seu posicionamento no mercado. Além disso, treinamentos de liderança migraram do tema de cultura para compliance, campanhas de comunicação cederam lugar a canais estruturais permanentes, e investidores tornaram-se a audiência de maior crescimento proporcional. Concluiu-se que a sofisticação do esforço de legitimação residiu não no que a empresa necessariamente fez, mas na consistência com que reorganizou quem ela diz ser e para quem, a partir das categorias de ação que relatou.

Palavras-chave: Crise reputacional; ESG; Pensamento institucional; Relatórios de sustentabilidade; Estratégia organizacional.

Gestão Escolar

11 de setembro de 2026

Liderança Escolar à Luz da Teoria U: um Diálogo com as Lideranças Transformacional e Servidora.

A integração de diferentes modelos de liderança mostrou-se um caminho relevante para instituições de ensino que buscaram inovar e alcançar excelência em suas práticas educacionais. Contudo, foram escassas as pesquisas empíricas que investigaram a aplicação da Teoria U na gestão escolar associada às abordagens Transformacional e Servidora, o que configurou uma lacuna na literatura. Este estudo buscou compreender como gestores educacionais perceberam e aplicaram princípios da Teoria U — escuta generativa, presencing e cocriação — em diálogo com as abordagens teóricas da Liderança Transformacional e da Liderança Servidora em suas práticas de gestão. A pesquisa, de natureza qualitativa e exploratória, foi realizada em uma instituição de ensino privada, localizada na cidade de São Paulo, que abrangeu desde a Educação Básica até a Pós-Graduação. Os dados foram coletados por meio de um roteiro de perguntas semiestruturadas, aplicado a sete gestores educacionais, e foram analisados com base na Análise de Conteúdo de Bardin. Os resultados evidenciaram aproximações entre as práticas observadas e os pressupostos teóricos dos modelos estudados, com a escuta destacando-se como a competência que melhor articulou as três abordagens no contexto investigado. Também foram identificadas algumas tensões entre os referenciais teóricos e o cotidiano da gestão. O estudo contribuiu para uma reflexão crítica sobre as possibilidades e os limites da integração desses diferentes modelos de liderança em ambientes escolares, ampliando o debate e oferecendo subsídios relevantes para o fortalecimento do campo da gestão educacional.

Palavras-chave: Análise de Conteúdo; Escuta Generativa; Estudo de Caso; Gestão Escolar; Liderança.

10 de setembro de 2026

Desempenho de Modelos de Machine Learning na Seleção de Ações da Bolsa de Valores Brasileira

O mercado acionário brasileiro, caracterizado por elevada volatilidade e restrições de liquidez, impõe desafios à aplicação de modelos de aprendizado de máquina na previsão de retornos e na construção de estratégias de investimento. O estudo comparou o desempenho preditivo e econômico de modelos de aprendizado de máquina e métodos estatísticos tradicionais na estimação de retornos futuros e na formação de carteiras baseadas em ranking de ativos. Utilizaram-se dados históricos de ações da B3, com variáveis técnicas e financeiras derivadas de preços e volume. Avaliaram-se modelos lineares (Regressão Linear, Ridge, LASSO, Elastic Net), de ensemble (Random Forest, XGBoost, LightGBM) e uma rede neural (Multilayer Perceptron). A avaliação preditiva ocorreu por métricas de erro em conjunto de teste, e a econômica por backtest de estratégias long-only, com custos operacionais baseados no turnover para análise de retornos brutos e líquidos. Os resultados revelaram baixa capacidade preditiva em todos os modelos, com R² negativos e erros elevados. Embora diferenças marginais nas previsões tenham gerado variações no desempenho econômico, estas foram de baixa magnitude e instáveis. O modelo LightGBM obteve o melhor desempenho econômico, mas com ganhos limitados em relação ao benchmark após a inclusão de custos operacionais. Não se observou evidência consistente de geração de retorno ajustado ao risco superior.

Palavras-chave: aprendizado de máquina; backtest; mercado acionário; previsão de retornos; seleção de ativos.

10 de setembro de 2026

Precificação Hedônica de Imóveis na Grande Florianópolis: Uso e Comparação de Modelos de “Machine Learning”

O mercado imobiliário da Grande Florianópolis tem experimentado valorização acelerada, impulsionada pelo crescimento populacional e pela demanda turística e de investimento. Este estudo analisou os determinantes do valor de imóveis residenciais e comparou o desempenho preditivo de modelos de aprendizado de máquina, especificamente Random Forest e Gradient Boosting (XGBoost), com uma regressão por Mínimos Quadrados Ordinários (MQO). Os dados foram coletados via web scraping de dois portais imobiliários em março de 2026, abrangendo os municípios de Florianópolis, São José, Palhoça e Biguaçu, resultando em 8.056 observações válidas após limpeza. Avaliou-se o desempenho dos modelos por meio das métricas R², RMSE e MAPE. O XGBoost apresentou o melhor desempenho preditivo geral (R² = 0,742, RMSE = R$ 927.113), enquanto o Random Forest obteve o menor erro relativo (MAPE = 25,69%). Os principais determinantes do preço identificados foram a área construída, a região de localização e o número de banheiros. Uma análise complementar por segmento de mercado revelou que o MQO dependeu dos valores extremos para sustentar seu ajuste, enquanto os modelos ensemble mantiveram desempenho estável. Concluiu-se que os métodos de aprendizado de máquina são mais robustos para precificação hedônica em mercados imobiliários heterogêneos, especialmente na presença de imóveis atípicos.

Palavras-chave: Ensemble; Imobiliário; Regressão; Residencial; Web Scraping.

Neurociência E Aprendizagem Na Educação

10 de setembro de 2026

A Produção de Memes como Estratégia de Formação Literária e Multiletramentos no Ensino Fundamental Ii

A leitura de obras literárias clássicas apresenta desafios no contexto escolar contemporâneo, devido ao distanciamento entre a linguagem dos textos e o repertório dos estudantes. Investigou-se como a utilização de memes contribuiu para a construção de sentidos na leitura da obra Senhora, de José de Alencar, no Ensino Fundamental II. A pesquisa adotou uma abordagem qualitativa, com caráter de pesquisa participante, e foi desenvolvida com duas turmas de 9º ano de uma escola privada em Volta Redonda, Rio de Janeiro. Os dados foram coletados por meio de questionários e das produções dos estudantes, e analisados à luz da análise de conteúdo. Os resultados indicaram que a utilização de memes favoreceu a aproximação dos alunos com o texto literário, reduziu a resistência inicial e ampliou o engajamento com a leitura. Observou-se, também, o avanço progressivo na compreensão da narrativa, evidenciado pela capacidade de interpretar fatos, analisar personagens, identificar relações implícitas e elaborar posicionamentos críticos. As produções revelaram a articulação entre o conteúdo da obra e o repertório sociocultural dos estudantes, indicando a construção de aprendizagens com significado. Concluiu-se que a integração entre literatura e cultura digital potencializou a mediação pedagógica, contribuindo para a formação de leitores mais ativos e interpretativamente autônomos.

Palavras-chave: aprendizagem significativa; cultura digital; leitura literária; multiletramentos; neurociência.

Gestão Tributária

10 de setembro de 2026

Definição de Insumos para Fins de Aproveitamento de Créditos de Pis e Cofins

O estudo analisou a interpretação e a aplicação da definição de insumos para fins de creditamento do Programa de Integração Social (PIS) e da Contribuição para o Financiamento da Seguridade Social (COFINS) no regime não cumulativo, à luz do entendimento firmado pelo Superior Tribunal de Justiça (STJ) no julgamento do Recurso Especial n.º 1.221.170 (Tema 779). Objetivou-se examinar os limites jurídicos da utilização desses créditos, considerando os critérios de essencialidade ou relevância estabelecidos pela jurisprudência do STJ. Realizou-se pesquisa documental e jurisprudencial, com análise de acórdãos representativos do Conselho Administrativo de Recursos Fiscais (CARF) e do STJ, abrangendo períodos anteriores e posteriores ao Tema 779. Complementarmente, conduziu-se pesquisa bibliográfica e estudos de dois casos concretos do CARF, com abordagem qualitativa, para verificar a aplicação prática dos critérios. Constatou-se que o STJ afastou a aplicação automática da definição de insumo do IPI, consolidando os critérios de essencialidade e relevância. Entretanto, a análise dos julgados do CARF evidenciou que, embora houvesse reconhecimento formal do precedente do STJ, sua incidência foi modulada conforme a natureza da atividade empresarial, mostrando-se mais restritiva para empresas de revenda. Os casos concretos ilustraram que creditamentos de fretes foram tratados de forma distinta, dependendo da vinculação do gasto à produção ou à revenda. Concluiu-se que a definição de insumos permanece um ponto sensível do sistema tributário, e a correta utilização dos créditos demanda análise casuística rigorosa, pautada na observância dos precedentes judiciais e dos limites normativos vigentes, para evitar glosas e penalidades.

Palavras-chave: COFINS; Creditamento; Insumos; PIS.

Gestão Tributária

10 de setembro de 2026

Fiscalização Delegada do ITR: Desestímulo aos Convênios, Reflexos na Arrecadação e Desinteresse Processual da União

O Imposto Territorial Rural (ITR), de competência da União, pode ter sua fiscalização e cobrança delegadas aos Municípios e ao Distrito Federal. Este trabalho examinou a adesão municipal a esses convênios e o impacto na arrecadação, analisou se os entraves processuais para os Municípios remeterem demandas aos órgãos federais desestimulavam a celebração de acordos, e avaliou o interesse processual da União em litígios de ITR sob delegação, à luz da Teoria Eclética da Ação, bem como a efetividade da diretriz constitucional de desestímulo a propriedades improdutivas. A pesquisa utilizou um estudo de caso, com base em dados e relatórios oficiais da Receita Federal do Brasil e referencial doutrinário jurídico. Os resultados indicaram baixa adesão municipal aos convênios, com quase 75% dos municípios sem acordo. A arrecadação do ITR, mesmo integralmente repassada, não justificou os investimentos municipais, e a manutenção da atuação processual pela União desestimulou a continuidade dos ajustes. Verificou-se que a União carecia de interesse processual nessas demandas, dada a ínfima representatividade do ITR na arrecadação federal e a ausência de proveito econômico-financeiro, o que impediu o cumprimento efetivo da diretriz constitucional de desestímulo à improdutividade rural. Concluiu-se que são necessárias modificações legislativas para que o ITR alcance seus objetivos de arrecadação e função social.

Palavras-chave: Arrecadação; Eficiência; Fiscalização; ITR; Municípios.

10 de setembro de 2026

Governança de Dados e Risco Financeiro no Setor Florestal: Evidências Empíricas em Perspectiva Brasil-Finlândia

A fragmentação informacional no setor florestal brasileiro constituiu o ponto de partida desta pesquisa, que investigou como a governança de dados impactou a capacidade analítica, o risco financeiro e a competitividade da gestão florestal, por meio de um estudo comparativo entre Brasil e Finlândia. Submeteram-se 332 documentos, incluindo 307 informativos CEPEA/Esalq/USP (2001–2025) e 25 relatórios setoriais (Bracelpa, ABRAF, Ibá, 2003–2025), a um pipeline de extração automatizado baseado em OCR, mineração de texto e expressões regulares, obtendo-se 13.059 registros estruturados. Realizou-se análise de sensibilidade do Valor Presente Líquido (VPL) e análise de sentimento léxica. Apenas 12,1% dos registros de custo continham Custo Operacional Efetivo preenchido, e nenhum apresentou margem líquida calculável. A incerteza nos dados de entrada oscilou o VPL de um projeto florestal em mais de R$ 20.000/ha, evidenciando a distorção da decisão orientada por dados quando a sofisticação algorítmica não substituiu a qualidade dos dados de origem. A análise de sentimento léxica confirmou a transição dos relatórios setoriais brasileiros de formato estatístico para promocional. Em contraste, o modelo finlandês demonstrou a viabilidade de uma governança integrada, com o inventário florestal consolidado como pilar de inteligência industrial. Os resultados indicaram que o fortalecimento da governança de dados constituiu pré-requisito para a transição do setor para um sistema de planejamento sustentado por evidências.

Palavras-chave: competitividade; fragmentação informacional; inteligência artificial; soberania digital; tomada de decisão.

Inscreva-se em nossa newsletter!

Receba conteúdos e fique sempre atualizado sobre as novidades em gestão, liderança e carreira com a Revista E&S.

Ao preencher o formulário você está ciente de que podemos enviar comunicações e conteúdos da Revista E&S. Confira nossa Política de Privacidade