Artigo

Engenharia De Software

09 de outubro de 2026

Utilização da voz em conjunto a grandes modelos de linguagem como ferramenta à acessibilidade digital

Utilização da Voz em Conjunto a Grandes Modelos de Linguagem como Ferramenta à Acessibilidade Digital

Luiz Gustavo Fernandes Salvador; Ariel da Silva Dias

DOI: 10.22167/2675-6528-202603214

Artigo derivado de Trabalho de Conclusão de Curso (TCC), com conteúdo baseado no trabalho original do aluno e adaptado ao formato editorial da Revista E&S com apoio da ferramenta ResumeAI, solução de inteligência artificial desenvolvida pelo Instituto Pecege para síntese e organização textual.

Resumo

A fala é uma base essencial para a interação humana, e para pessoas com deficiência, pode representar a principal forma de comunicação com o ambiente externo. Diante da crescente influência tecnológica, a identificação de comandos de voz emergiu como uma estratégia promissora para a interação homem-máquina. O trabalho explorou como a voz, em conjunto com Grandes Modelos de Linguagem (LLMs), pode ser utilizada de forma eficiente, natural e precisa. Para tal, empregaram-se diversos padrões de projetos e a linguagem Python, visando maior extensibilidade. Utilizou-se o Gemini como provedor de LLM, enviando o áudio diretamente e aproveitando sua capacidade de chamada de função para interagir com o dispositivo. Desenvolveu-se um sistema capaz de compreender a intenção do usuário e convertê-la em ações, cujo diferencial foi a capacidade de visão computacional baseada em capturas de tela e um sistema de malha para orientação da LLM. Os testes revelaram uma taxa de compreensão da intenção do usuário de 91,81% e uma taxa de sucesso na execução de 75,45% com o modelo “Flash-3” (top p 0,5 e top k 5). O sistema proposto validou a premissa de que a integração de LLMs a interfaces de voz aumenta a autonomia de usuários com deficiência motora, cumprindo o propósito de ser uma Tecnologia Assistiva moderna e eficaz. Contudo, foram levantadas questões sobre os custos da IA e a segurança dos dados do usuário, indicando a necessidade de aprimoramento.

Palavras-chave: Chamada de função; Interação homem-máquina; Reconhecimento de voz; Visão computacional.

1. Introdução

A comunicação constitui uma das bases fundamentais para a evolução da espécie humana, permitindo não apenas a troca de informações essenciais para a sobrevivência, mas também o desenvolvimento de relações sociais e a facilitação da cooperação (Smith, 2010). Dentre as formas mais expressivas de comunicação, a fala destaca-se por sua capacidade de transmitir não somente uma mensagem, mas também a emoção do locutor (Loan et al., 2022). Ao extrapolar a relação homem-homem, que impulsionou a sociedade humana ao seu estágio evolutivo atual, é possível reconhecer que a tecnologia viabiliza a exploração da voz como uma via para a interação homem-máquina (Seaborn et al., 2021).

O avanço tecnológico das últimas décadas é notável, impactando diretamente a vida cotidiana, os hábitos e as relações sociais. Evidencia-se esse impacto no aumento significativo do tempo médio dedicado ao uso de computadores e smartphones, em comparação com hobbies e atividades offline (Vilhelmson et al., 2017). Muitas dessas interações online estão ligadas à socialização e ao entretenimento, com plataformas como YouTube, Instagram e Snapchat figurando entre as mais populares, especialmente entre os jovens (Dienlin e Johannes, 2020). Adicionalmente, a educação remota experimentou um crescimento expressivo, particularmente durante e após a pandemia de COVID-19, com o Ensino a Distância (EaD) passando de 18,4% das inscrições em 2011 para 62,8% uma década depois (INEP, 2022). Tais transformações ressaltam a necessidade de desenvolver interfaces mais intuitivas e integradoras (Hott e Fraz, 2019), tornando a identificação de comandos de voz uma estratégia promissora para uma interação homem-máquina mais natural e eficiente (Norda et al., 2024).

No Brasil, aproximadamente 45 milhões de habitantes possuem alguma deficiência, sendo que 28,8% enfrentam dificuldades motoras (Biblioteca Virtual em Saúde Ministério da Saúde, n.d.). Indivíduos nessas condições podem ter limitações no acesso à tecnologia, o que pode dificultar o acesso a informações e impactar a vida acadêmica e profissional (Muhammad et al., 2015). Em resposta a essas questões, diversas empresas buscam desenvolver dispositivos ou softwares que visam aumentar a compatibilidade de pessoas com deficiência em certas tarefas, conhecidas como Tecnologias Assistivas (Freitas et al., 2022). Contudo, em alguns casos, como pacientes com atrofia espinhal, tecnologias que apenas ampliam as capacidades motoras podem não ser suficientes, exigindo novas estratégias para a inclusão tecnológica dessas pessoas (Lunn e Wang, 2008).

A tentativa de utilizar a voz como entrada de dados não é recente, com exemplos que datam de 1990, como o PlainTalk da Apple (Kumar, 2020). No entanto, desafios como a necessidade de cadência, linguagem e terminologia específicas persistem, diminuindo a naturalidade e dificultando o aprendizado dessas tecnologias (Rogers et al., 2022). Nesse contexto, a utilização de Large Language Models (LLMs) é sugerida como intermediária para transmitir as intenções do usuário ao sistema, o que reduziria a necessidade de familiaridade com o software e permitiria uma interação mais natural entre homem e máquina (Mahmood et al., 2025).

Grandes Modelos de Linguagem, ou Large Language Models (LLMs), são modelos de inteligência artificial (IA) dedicados à interpretação de linguagem natural. Suas capacidades abrangem desde a manutenção de conversas e a análise de dados até a interação com outros sistemas (Chang et al., 2018). Embora tenham ganhado destaque recentemente, a pesquisa sobre modelos estatísticos que descrevem e preveem respostas em linguagem natural remonta a 1950, com Shannon (1948) investigando a capacidade dos modelos Word n-gram de predizer ou comprimir a linguagem (Minaee et al., 2024). Com o advento da internet e a vasta disponibilidade de dados, tornou-se viável treinar esses modelos intensivamente, resultando em maior versatilidade, precisão e integração eficaz com outros sistemas (Kaddour et al., 2023).

Considerando os fatores apresentados, torna-se necessário o desenvolvimento de um software capaz de reconhecer comandos de voz e utilizar LLMs como ferramentas para a interface homem-máquina, possibilitando o uso de aplicações por pessoas com mobilidade limitada e promovendo maior integração e acessibilidade no ambiente digital. Assim, essa pesquisa explorou como essa tecnologia pode ser utilizada de forma eficiente, natural e precisa.

2. Material e Métodos

A pesquisa caracterizou-se como um estudo de desenvolvimento de software, com abordagem metodológica focada na engenharia de sistemas e na avaliação de sua eficiência. O objetivo foi criar um sistema de interação homem-máquina por voz, utilizando Grandes Modelos de Linguagem (LLMs) para promover acessibilidade digital a indivíduos com mobilidade limitada. O desenvolvimento foi realizado na linguagem Python, escolhida por sua versatilidade e vasta disponibilidade de bibliotecas (Udrake, 2023; Dhruv et al., 2021).

A arquitetura do software empregou diversos padrões de projeto para garantir modularidade e extensibilidade. O “Registry Factory” foi utilizado para instanciar e retornar classes registradas (Koh, 2020), enquanto o “Strategy” definiu comportamentos de classes (Refactoring Guru, n.d.; Peace, 2024). Adicionalmente, um contêiner “Singleton” gerenciou o compartilhamento de variáveis (Stencel e Wegrzynowicz, 2008), o “Decorator” definiu comportamentos comuns (Peng, Zhang e Hu, 2021), o “Command Pattern” permitiu a execução de funções por classes com interface comum (Nuzzi, 2019), e o “Adapter” garantiu a compatibilidade de dados entre LLMs (Nuzzi, 2019).

O sistema foi dividido em módulos funcionais. O módulo `config` gerenciou as configurações do projeto, persistindo informações em arquivos `.ini` via `configparser` do Python. As configurações incluíram o tipo de entrada, definido como “Áudio”, o provedor de LLM, especificado como “Gemini”, e o modelo de LLM, “Gemini-flash-latest”. A interface gráfica de usuário (GUI) foi desenvolvida com `PyQt6` (Willman, 2020), apresentando um fundo, ícone e campos de texto para interação, executada em uma “Thread” separada.

O módulo `genai` foi responsável pela comunicação com a Inteligência Artificial, utilizando o `google.genai` para adaptar configurações, converter prompts, enviar dados e executar ferramentas. O Google Gemini foi selecionado como provedor de LLM devido à sua capacidade de lidar com diversos tipos de dados, documentação detalhada e custo otimizado por “token” (Salvator, 2025). A funcionalidade de “function calling” da LLM foi essencial, permitindo que a IA interpretasse a intenção do usuário e executasse trechos de código para interagir com o dispositivo (Qu et al., 2025; Wang et al., 2026).

Um modelo Pydantic foi desenvolvido para configurar as LLMs de forma interoperável, abrangendo parâmetros como chave de API, modelo, instruções de sistema, ferramentas disponíveis, manutenção de histórico, nível de pensamento, modo verboso, número máximo de tokens, `top_p`, `top_k`, temperatura e semente. Além disso, foram configuradas as definições de segurança da LLM, que incluíram categorias como assédio, discurso de ódio, conteúdo sexualmente explícito e perigoso, com valor padrão de “Médio e acima”.

A coleta de dados de entrada foi realizada pelo módulo `input_source`, configurado para gravação de áudio via biblioteca `SpeechRecognition` (Amos, n.d.). O processo envolveu a calibração do microfone para o ruído ambiente e a gravação contínua até cinco segundos de silêncio do usuário, quando o arquivo de áudio era salvo. O módulo `input_type` converteu arquivos de áudio e imagem para formatos compatíveis com a LLM. As ferramentas (`tool`) foram desenvolvidas para executar funções no dispositivo, incluindo ações sem interação direta com a tela, como perguntar ao usuário, pressionar teclas e escrever texto.

Para interações com a tela, um sistema de visão computacional foi implementado, pois a LLM não fornecia coordenadas exatas. Duas ferramentas foram criadas: “capturar tela”, que realizou uma captura da tela atual do dispositivo, conforme ilustrado na

, e desenhou uma malha enumerada de 0,0 no canto superior esquerdo a 14,14 no canto inferior direito, como apresentado na

; e “subdividir captura”, que selecionou um talhão da malha anterior, escalonou-o e redesenhou uma grade de 15 por 15 [FIGURA 3 e FIGURA 4]. Este método permitiu à IA identificar a localização de objetos por células da grade, viabilizando a interação do mouse com diversos sistemas.

O fluxo de execução do algoritmo iniciou com a obtenção da entrada do usuário via `input_source` (áudio), processada pelo `genai` e convertida em um `input_type` para a LLM. A LLM, então, processou os dados e determinou quais ferramentas (`tool`) seriam chamadas. Este ciclo se repetiu até a solicitação de interrupção do sistema, conforme ilustrado na

.

A qualidade do software foi assegurada por testes unitários, que avaliaram componentes e funções individuais do código. O módulo `Pytest` (Pytest, n.d.) foi utilizado para a execução desses testes, contribuindo para a detecção precoce de erros e a redução do retrabalho (Eisty et al., 2025; Pressman, 2011; Sommerville, 2013). A eficiência do algoritmo foi mensurada por uma abordagem baseada em tarefas, definindo objetivos reais para os usuários (ABNT, 2002), como o envio de mensagens em redes sociais, a abertura de vídeos online e a redação de parágrafos em softwares de edição de texto. A escolha dessas tarefas baseou-se em atividades populares entre jovens em ambientes virtuais (Dienlin e Johannes, 2020) e na relevância para a integração de alunos com deficiência no ensino a distância.

3. Resultados e Discussão

A implementação da interface gráfica de usuário (GUI) resultou em um ambiente de interação simplificado e objetivo, caracterizado por um fundo transparente. O design inicial da interface foi concebido para ser intuitivo, apresentando um ícone central, um texto de questionário, um texto secundário para detalhes e um texto principal para descrever a ação em curso. Essa estrutura visa fornecer ao usuário uma experiência clara e direta sobre o estado e as ações do sistema, facilitando a compreensão e o uso, especialmente para indivíduos com mobilidade limitada, conforme o objetivo central do projeto.

O sistema desenvolvido opera através de um fluxo contínuo que se inicia com a obtenção de um comando de voz do usuário, capturado por um módulo de entrada de áudio. Este áudio é então processado e convertido em um formato compreensível para o Grande Modelo de Linguagem (LLM) selecionado, neste caso, o Google Gemini. A LLM interpreta a intenção do usuário e determina quais ferramentas, ou “tools”, devem ser acionadas no dispositivo. Esse ciclo de entrada, processamento e execução de ferramentas se repete até que o usuário decida encerrar a interação, garantindo uma comunicação fluida e adaptável.

Para permitir a interação da inteligência artificial com a tela do computador, superando a limitação das LLMs em retornar coordenadas exatas, foram desenvolvidas ferramentas específicas. A primeira, denominada “capturar tela”, realiza uma captura da tela atual do dispositivo e sobrepõe uma malha enumerada, iniciando no índice 0,0 no canto superior esquerdo e progredindo até 14,14 no canto inferior direito. A segunda ferramenta, “subdividir captura”, permite selecionar um talhão dessa malha, escaloná-lo e redesenhar uma nova grade de 15 por 15. Essa abordagem capacita a IA a identificar a localização de objetos na tela por meio de talhões, em vez de coordenadas precisas, possibilitando a movimentação do mouse para o centro de um talhão específico e, assim, a interação com diversos sistemas.

Os testes de funcionalidade do sistema foram realizados com base em tarefas reais que os usuários deveriam tentar alcançar, seguindo a metodologia de testes unitários para garantir a qualidade do software. As tarefas incluíram enviar uma mensagem em uma rede social, abrir um vídeo online e redigir um parágrafo em um software de edição de texto. A escolha dessas tarefas refletiu atividades populares entre jovens em ambientes virtuais, conforme Dienlin e Johannes (2020), e a proposta de integrar alunos com deficiência no ensino a distância, visando validar a eficácia do sistema em cenários de uso prático.

Os resultados dos testes indicaram que, embora a maioria das tentativas tenha sido bem-sucedida, houve momentos em que a inteligência artificial necessitou de assistência para completar as tarefas, exigindo informações adicionais sobre os passos a serem seguidos. Observou-se também que a diminuição dos parâmetros “top p” para 0,5 e “top k” para 5 resultou em maior precisão nas respostas do sistema. Essa otimização dos parâmetros é crucial para refinar a capacidade da LLM de tomar decisões mais assertivas e reduzir a necessidade de intervenção humana.

A escolha do modelo “Flash-3” do Gemini para os testes foi motivada por limitações de uso e o alto custo associado ao modelo “Pro-3”. Além disso, a qualidade da captura de tela foi reduzida pela metade do original, sem que isso comprometesse a eficácia das ações da IA. Essa decisão estratégica permitiu a realização de um número significativo de testes (110 no total) com um custo total de R$ 65,37, fornecendo dados robustos sobre o desempenho do sistema em condições controladas e economicamente viáveis.

A análise detalhada dos testes, utilizando o modelo “Flash-3” com `top k 5` e `top p 0.5`, revelou um desempenho notável em diversas subetapas. Para a tarefa de “Enviar mensagem em rede social”, a subetapa “Abrir rede” obteve nove acertos e um erro, enquanto “Abrir contato” registrou sete acertos, três erros e duas alucinações com erro. A subetapa “Enviar mensagem” alcançou nove acertos e um erro. Na tarefa de “Abrir vídeo ‘online'”, a subetapa “Abrir navegador” teve seis acertos, quatro erros e quatro alucinações com erro, e duas alucinações sem erro, indicando desafios na navegação inicial.

Continuando a análise dos resultados para o modelo “Flash-3” com `top k 5` e `top p 0.5`, a subetapa “Abrir rede de vídeos” na tarefa de “Abrir vídeo ‘online'” obteve dez acertos e duas alucinações sem erro. “Buscar vídeo” e “Abrir vídeo” registraram sete acertos e três erros cada, com três alucinações com erro para “Buscar vídeo” e uma para “Abrir vídeo”. Para a tarefa de “Redigir parágrafo em ‘software’ de edição”, as subetapas “Abrir ‘software'” e “Abrir novo documento” tiveram oito acertos e dois erros cada, com uma alucinação com erro em ambos os casos. A subetapa “Escrever texto” alcançou sete acertos e três erros, enquanto “Salvar documento” apresentou cinco acertos e cinco erros, com quatro alucinações com erro e uma sem erro, evidenciando a complexidade da interação com o salvamento de arquivos.

Em contraste, os testes realizados com o modelo “Flash-3” configurado com `top k 15` e `top p 0.85` apresentaram variações no desempenho. Na tarefa de “Enviar mensagem em rede social”, a subetapa “Abrir rede” obteve seis acertos e quatro erros, com três alucinações com erro e quatro sem erro. “Abrir contato” manteve dez acertos, sem erros ou alucinações. A subetapa “Enviar mensagem” registrou oito acertos e dois erros, com duas alucinações com erro. Esses dados sugerem que a alteração dos parâmetros da LLM influencia diretamente a capacidade de acerto e a ocorrência de alucinações, impactando a robustez da interação.

Prosseguindo com a avaliação do modelo “Flash-3” com `top k 15` e `top p 0.85`, a tarefa de “Abrir vídeo ‘online'” mostrou que a subetapa “Abrir navegador” obteve sete acertos e três erros, com duas alucinações com erro. “Abrir rede de vídeos” registrou seis acertos e quatro erros, com três alucinações com erro e uma sem erro. “Buscar vídeo” também teve seis acertos e quatro erros, com três alucinações com erro e duas sem erro. A subetapa “Abrir vídeo” apresentou apenas três acertos e sete erros, com cinco alucinações com erro, indicando uma performance inferior para esses parâmetros em cenários de navegação e busca de vídeos.

Na tarefa de “Redigir parágrafo em ‘software’ de edição” com o modelo “Flash-3” (`top k 15` e `top p 0.85`), a subetapa “Abrir ‘software'” obteve oito acertos e dois erros, com quatro alucinações sem erro. “Abrir novo documento” registrou nove acertos e um erro, com uma alucinação com erro e duas sem erro. “Escrever texto” alcançou nove acertos e um erro, com uma alucinação com erro e uma sem erro. Por fim, “Salvar documento” teve seis acertos e quatro erros, com quatro alucinações com erro, reforçando a dificuldade persistente na etapa de salvamento, independentemente dos parâmetros específicos da LLM.

A taxa de compreensão da intenção do usuário foi calculada somando-se os acertos e as alucinações com erro, dividindo-se pelo número total de testes. Para o modelo “Flash-3” com `top p 0.5` e `top k 5`, a taxa de compreensão da intenção do usuário atingiu 91,81%, com uma taxa de sucesso na execução de 75,45%. Já com os parâmetros `top p 0.85` e `top k 15`, a taxa de compreensão foi ligeiramente maior, 92,72%, mas a taxa de sucesso na execução foi menor, 70,90%. Esses resultados demonstram a sensibilidade do desempenho do sistema aos parâmetros da LLM, indicando que uma maior compreensão da intenção nem sempre se traduz em maior sucesso na execução das ações.

A inclusão de inteligências artificiais generativas em interfaces de voz, conforme a solução proposta, confere maior autonomia ao usuário, eliminando a necessidade de memorizar palavras-chave específicas para ativar o sistema, um avanço em relação a abordagens anteriores (Avuçlu et al., 2023). O sistema demonstrou ser independente da qualidade do hardware e da posição do usuário, exigindo apenas conexão com a internet, o que o torna uma solução flexível e acessível (Taher et al., 2021). Além disso, o trabalho elimina a etapa de treinamento prévio da inteligência artificial, promovendo uma interação mais direta e acessível, diferentemente de pesquisas que demandam essa fase (Mulfari et al., 2021).

Contudo, algumas considerações importantes foram levantadas. A segurança dos dados do usuário é um ponto crítico, pois as informações são transmitidas a uma LLM corporativa, o que pode permitir seu uso para treinamento da IA, divergindo de soluções que empregam modelos locais e não expõem os dados do usuário (Livero e Santos, 2024). A alta taxa de alucinações na execução das tarefas, em contraste com os dados de Mullfari et al. (2021), foi atribuída principalmente à interação via controle direto do mouse, que é mais suscetível a erros. Adicionalmente, o custo elevado de uso do sistema e a latência no processamento da LLM representam desafios que precisam ser ponderados para aprimoramentos futuros.

Em síntese, o trabalho validou a premissa de que a integração de Grandes Modelos de Linguagem a interfaces de voz representa uma ferramenta eficaz para aumentar a autonomia de usuários com deficiência motora, cumprindo o propósito de ser uma Tecnologia Assistiva moderna e funcional. A arquitetura modular e as ferramentas específicas, como a lógica de grade para interação com a tela, foram cruciais para superar as limitações das LLMs em lidar com coordenadas exatas. Apesar dos desafios relacionados ao custo, tempo de processamento e segurança de dados, os resultados demonstram uma alta taxa de compreensão da intenção do usuário e um sucesso considerável na execução de tarefas, indicando o potencial da solução e a necessidade de otimizações contínuas.

4. Conclusão

A presente pesquisa explorou a utilização da voz em conjunto com Grandes Modelos de Linguagem (LLMs) como uma ferramenta eficiente, natural e precisa para a interação homem-máquina, visando a acessibilidade digital para pessoas com mobilidade limitada. Verificou-se o desenvolvimento de um sistema com interface gráfica simplificada e um fluxo contínuo de interação, onde comandos de voz foram processados por LLMs para acionar ferramentas no dispositivo. Para superar a limitação das LLMs em lidar com coordenadas exatas, implementou-se um sistema de visão computacional baseado em capturas de tela e uma malha enumerada, permitindo à inteligência artificial identificar e interagir com objetos na tela por meio de talhões. Os testes de funcionalidade, realizados com tarefas reais, indicaram uma taxa de compreensão da intenção do usuário de 91,81% e uma taxa de sucesso na execução de 75,45% com o modelo “Flash-3” (top p 0,5 e top k 5). Essa abordagem validou a premissa de que a integração de LLMs a interfaces de voz aumenta significativamente a autonomia de usuários com deficiência motora, estabelecendo-se como uma Tecnologia Assistiva moderna e eficaz.

Contudo, foram identificadas algumas limitações importantes que merecem atenção em estudos futuros. A segurança dos dados do usuário, transmitidos a uma LLM corporativa, levantou preocupações sobre o uso dessas informações para treinamento da IA. Observou-se também uma alta taxa de alucinações na execução das tarefas, atribuída principalmente à interação via controle direto do mouse, que se mostrou suscetível a erros. Adicionalmente, o custo elevado de uso do sistema e a latência no processamento da LLM representam desafios a serem considerados. Sugere-se, portanto, aprimoramentos futuros que incluam a exploração de modelos locais para maior privacidade dos dados, a integração de novas ferramentas para mitigar alucinações e otimizações contínuas para reduzir custos e tempo de processamento, visando aprimorar a robustez e a viabilidade da solução.

Referências Bibliográficas

Dienlin, T.; Johannes, N. 2020. The impact of digital technology use on adolescent well-being. Dialogues in Clinical Neuroscience 22(2): 135-142.

Instituto Nacional de Estudos e Pesquisas Educacionais Anísio Teixeira [INEP]. 2

Seaborn, K.; Miyake, N.P.; Pennefather, P.; Otake-Matsuura, M. 2021. Voice in Human-Agent Interaction: A Survey. ACM Computing Surveys 54: 1-43.

Smith, E.A. 2010. Communication and collective action: language and the evolution of human cooperation. Evolution and human behavior 31(4): 231-245.

Van Loan T.; Le, T.D.T.; Xuan, T.L.; Castelli, E. 2022. Emotional speech recognition using deep neural networks. Sensors 22(4): 1414.

Vilhelmson, B.; Elldér, E.; Thulin, E. 2018. What did we do when the Internet wasn’t around? Variation in free-time activities among three young-adult cohorts from 1990/1991, 2000/2001, and 2010/2011. New Media & Society 20(8): 2898-2916.

Artigo oriundo de Trabalho de Conclusão de Curso da Especialização em Engenharia de Software do MBA USP/Esalq

Para saber mais sobre o curso, clique aqui e acesse a plataforma MBX Academy

Você também pode gostar

Engenharia De Software

09 de outubro de 2026

O papel da densidade de texto instrutivo na eficiência de uma aplicação web.

O desenvolvimento de aplicações web se conecta à experiência do usuário, e este trabalho investigou como o uso excessivo de textos instrutivos pode retardar a conclusão de tarefas e impactar a eficiência da aplicação. O objetivo foi identificar o impacto da densidade textual do conteúdo instrutivo na eficiência de uma aplicação web, utilizando como principal referência a terceira lei de usabilidade de Krug. A pesquisa, de caráter exploratório e delineamento experimental quantitativo, empregou um teste A/B em uma aplicação web responsiva, onde a única variável controlada foi a densidade textual (alta vs. baixa, definida pela contagem de palavras). Participaram 25 usuários, e os dados foram coletados via Datadog RUM, mensurando tempo de conclusão, erros de submissão e taxa de conversão. Os resultados revelaram que a variante com densidade textual reduzida (variante B) apresentou uma taxa de conversão superior (58,3% contra 33,3% da variante A) e um tempo médio de conclusão significativamente menor (1:38 minutos contra 4:58 minutos da variante A), representando um aumento de 67,12% na eficiência. O teste t de Welch (p=0,042) confirmou que a redução da densidade textual impactou a eficiência. Concluiu-se que a redução da densidade textual afeta a eficiência e a taxa de conversão, reforçando a importância de conteúdo objetivo e conciso. Contudo, a baixa densidade textual, por si só, não garantiu o pleno entendimento, sendo essencial a comunicação clara e objetiva das instruções, validando a relevância do UX Writing.

Palavras-chave: Eficiência; Experiência de usuário; Teste A/B; Texto Instrutivo; Usabilidade.

Engenharia De Software

09 de outubro de 2026

Implementação de sistemas de analytics em ambientes de automação na indústria de processos

A digitalização de plantas de processo depende de coleta e armazenamento estruturados de dados, sem os quais não há visibilidade da operação. Chama-se analytics industrial a cadeia que percorre esses dados desde a aquisição do sinal no instrumento de campo, passando pelo armazenamento ordenado no tempo, até a disponibilização para análise e para outros sistemas. Softwares industriais proprietários cobrem hoje essa cadeia, e os custos de licenciamento e manutenção restringem sua adoção. O estudo teve por objetivo arquitetar, implementar e validar um sistema dessa natureza, empregando técnicas correntes de desenvolvimento de software e componentes sem custo de licenciamento. O sistema, denominado Sistema de Aquisição e Tratamento de Informações de Processo (SATIP), foi estruturado em três camadas independentes, tendo como fonte de dados um simulador de reator farmacêutico que executou uma receita de oito etapas e gerou séries temporais com variação estocástica. O simulador foi escrito em Go, linguagem adotada por gerar binários autocontidos, adequados à execução em equipamentos de borda. O armazenamento utilizou o TimescaleDB e a disponibilização foi realizada por meio de uma interface REST com um painel web. O sistema processou cerca de 414 mil registros por execução, com tendência multivariável, registro de alarmes e correlação temporal entre instrumentos. A arquitetura mostrou-se reproduzível e sem custo de licenciamento, e a identificação da degradação exigiu apenas as leituras já armazenadas pelo sistema.

Palavras-chave: Arquitetura de software; Digitalização; Integração IT/OT; Manutenção preditiva; Séries temporais.

Engenharia De Software

09 de outubro de 2026

ReasonGuard: Uma Plataforma de Auditoria de Raciocínio para Modelos de Linguagem Baseada em Decomposição Estruturada de Pensamento

Apresentou-se o ReasonGuard, uma plataforma de auditoria de raciocínio de Inteligência Artificial, desenvolvida como middleware de observabilidade entre aplicações cliente e modelos de linguagem de grande escala (LLMs). O trabalho teve como objetivo oferecer transparência e rastreabilidade para processos de tomada de decisão baseados em IA, abordando a lacuna na operacionalização de técnicas de raciocínio estruturado para fins de auditoria. O sistema interceptou, analisou e documentou interações com LLMs por meio de cinco módulos fundamentados nos paradigmas Chain-of-Thought (CoT), Tree-of-Thought (ToT) e Graph-of-Thought (GoT). Esses módulos capturaram trilhas de raciocínio, detectaram falhas lógicas estruturais, avaliaram a consistência de respostas e geraram relatórios de auditoria direcionados a diferentes perfis de stakeholders. A plataforma implementou-se com FastAPI (Python) no backend, React com TypeScript no frontend e PostgreSQL como banco de dados relacional, seguindo arquitetura modularizada com isolamento multitenancy por usuário. Os resultados demonstraram a viabilidade técnica da abordagem proposta, com todos os cinco módulos operacionais e integrados. Concluiu-se que o ReasonGuard contribui para a governança de IA ao instrumentalizar paradigmas de raciocínio estruturado como ferramentas de observabilidade e auditoria, preenchendo uma lacuna na literatura.

Palavras-chave: Auditoria de IA; Chain-of-Thought; Governança de IA; Modelos de Linguagem de Grande Escala; Transparência Algorítmica.

Engenharia De Software

09 de outubro de 2026

EngTT: software para motor de frete rodoviário baseado em custos operacionais e parâmetros ANTT

O transporte rodoviário representa a principal modalidade logística do Brasil, com a composição dos custos de frete regulada pela Agência Nacional de Transportes Terrestres (ANTT). Diante da ausência de uma metodologia estruturada para o cálculo de frete e da dependência de planilhas isoladas no setor, desenvolveu-se o software EngTT. O objetivo foi criar uma ferramenta de apoio à decisão que integrasse variáveis operacionais, calculasse o custo total por rota e comparasse os resultados com o piso mínimo da ANTT, identificando cenários de não conformidade e compressão de margem antes da precificação. A metodologia adotada foi aplicada, quantitativa e experimental, com construção incremental orientada ao conceito de Produto Mínimo Viável (MVP). O sistema foi estruturado em três modos de uso – Montar Rota Visual, Batch por planilha e Scrape de rotas – compartilhando um motor de cálculo desacoplado e parâmetros centralizados. Os resultados obtidos demonstraram que o software atendeu ao objetivo proposto, evidenciando variações de margem e conformidade regulatória entre as rotas analisadas. Observou-se que rotas de maior extensão, como Ribeirão Preto × Guarujá, apresentaram incremento de custo devido à necessidade de diárias adicionais do motorista, enquanto rotas mais curtas, como Cajamar × Guarujá, mostraram maior aderência ao piso regulatório da ANTT. Concluiu-se que a solução desenvolvida é aplicável ao setor de transporte rodoviário de cargas como ferramenta eficaz de precificação e gestão operacional.

Palavras-chave: ANTT; Carga conteinerizada; Engenharia de software; Frete rodoviário; Python.

Engenharia De Software

08 de outubro de 2026

Pipeline de dados para o monitoramento de ações considerando a metodologia fundamentalista

O cenário financeiro brasileiro enfrenta desafios como o endividamento familiar, a baixa literacia financeira e a descentralização de informações para análise de investimentos. Diante disso, o objetivo da pesquisa consistiu em desenvolver um pipeline de dados financeiros, fundamentado em boas práticas de Engenharia de Dados, para estruturar, processar e disponibilizar informações relevantes que apoiassem a tomada de decisão de investidores individuais na análise de ações. Implementou-se uma arquitetura medalhão, utilizando MinIO S3 para armazenamento em camadas bronze, silver e gold, com Delta Lake para governança de dados. Empregou-se Apache Spark para processamento distribuído, Prometheus para monitoramento e Power BI para visualização analítica. Os dados foram majoritariamente demonstrações financeiras da Comissão de Valores Mobiliários (CVM). Construiu-se uma carteira teórica de investimentos com base nos princípios de Benjamin Graham (2017), aplicando filtros de seleção e validação de dados. Os resultados indicaram um retorno positivo de 32,88% para a carteira teórica, superando o índice Ibovespa (4,25%) no período de 2021 a 2024, embora inferior à taxa Selic (46,96%). Qualitativamente, o pipeline processou conjuntos de dados volumosos, com reduções significativas de redundâncias, como 99,27% na tabela BPA e 94,29% na DRE, após a aplicação de filtros. Evidenciaram-se ganhos em organização, rastreabilidade e qualidade dos dados, possibilitando análises financeiras estruturadas e mais robustas.

Palavras-chave: Arquitetura Medalhão; Engenharia de Dados; Investimentos; Pipeline de Dados.

Engenharia De Software

08 de outubro de 2026

Desempenho e Custo Total de Propriedade de Bancos de Dados em Nuvem e Infraestrutura Local

O presente estudo analisou o desempenho de operações de banco de dados em infraestruturas de nuvem e local, correlacionando o comportamento técnico com a projeção do Custo Total de Propriedade. A pesquisa caracterizou-se como um estudo quantitativo e experimental, no qual um sistema de testes submeteu instâncias isoladas de bancos de dados a cargas progressivas de execução, mensurando o impacto da latência de rede e do consumo computacional. Para a análise financeira, elaborou-se uma modelagem de investimentos e despesas operacionais diluídos em um ciclo de trinta e seis meses. Os resultados técnicos revelaram que o acúmulo da latência da internet causou severa degradação de tempo nas execuções em nuvem, apesar de a infraestrutura remota operar com alta ociosidade de processamento, registrando quase 98% de inatividade da CPU. Em contrapartida, o ambiente local obteve desempenho superior amparado pela comunicação de rede quase instantânea. No aspecto financeiro, a consolidação dos custos demonstrou um empate empírico entre o modelo de aquisição física e o de assinatura de serviço em um horizonte de três anos, mas o ambiente local mostrou-se mais vantajoso em um ciclo de sessenta meses. Concluiu-se que a degradação na nuvem não decorreu da capacidade computacional, mas da interação entre a latência de rota e o padrão de comunicação unitário da aplicação. A adoção da nuvem exige otimização profunda da arquitetura do sistema para minimizar a dependência de comunicação constante com o servidor remoto. Sem essa modernização, a infraestrutura local consolidou-se como a estratégia mais viável, garantindo alto desempenho, previsibilidade orçamentária e soberania dos dados.

Palavras-chave: Despesas operacionais (OPEX); Escalabilidade transacional; Latência de rede; Sistemas legados.

Engenharia De Software

08 de outubro de 2026

Integração assíncrona Slack-Jira via “middleware” de filas: comparação de soluções de “cloud computing”

A latência e a interoperabilidade entre sistemas corporativos distribuídos constituíram o problema investigado, motivado pelos custos e fragilidades das integrações manuais entre plataformas de colaboração e gestão de projetos. Desenvolveu-se e validou-se um “middleware” de integração assíncrona entre Slack e Jira, com o objetivo de reduzir o tempo de resposta percebido pelo usuário e garantir a estabilidade do sistema sob carga. A metodologia consistiu na construção de uma arquitetura de software orientada a eventos em Python, utilizando os padrões “producer-consumer” e “adapter” para isolar a interface do usuário do processamento de “backend”. A solução evoluiu para uma arquitetura agnóstica de nuvem, baseada em funções “serverless”, e foi submetida a testes de estresse em ambientes local, de rede real e de produção em duas nuvens. A arquitetura reduziu o tempo de espera do usuário de uma estimativa síncrona de 2.000 milissegundos para uma média local de 8,96 milissegundos. Sob carga de 50 requisições simultâneas, ambos os provedores de nuvem mostraram-se viáveis: a Amazon Web Services registrou menor latência média na camada de recepção (951,35 ms) e o dobro da vazão, enquanto a Microsoft Azure executou o processamento em segundo plano com mediana de 113 ms. A aplicação de “optimistic UI” assegurou fluidez de uso, e o nivelamento de carga por filas dispensou o sobredimensionamento de infraestrutura. O “middleware” consolidou-se como um modelo de referência corporativa escalável, resiliente e protegido contra o aprisionamento tecnológico.

Palavras-chave: Arquitetura orientada a eventos; Desacoplamento temporal; Eficiência operacional; Gestão de serviços de tecnologia da informação; Interoperabilidade de sistemas.

Engenharia De Software

05 de outubro de 2026

Usando IA generativa para escolha de banco de dados: Um framework orientado a requisitos para geração de Architecture Decision Records (ADRs)

O crescimento de aplicações intensivas em dados e a adoção da arquitetura de microsserviços ampliaram a necessidade da persistência poliglota, impondo uma alta carga cognitiva aos arquitetos de software na escolha e justificação de tecnologias de banco de dados. Este trabalho teve como objetivo propor e desenvolver um framework baseado em agentes de Inteligência Artificial (IA) para guiar a seleção tecnológica e gerar Architecture Decision Records (ADRs) fundamentadas. Empregou-se uma metodologia experimental e aplicada para construir uma base de conhecimento técnico. A técnica de Retrieval-Augmented Generation (RAG), juntamente com as bibliotecas LangChain e LangGraph, foi utilizada para orquestrar agentes e ancorar as respostas de um Large Language Model (LLM). O framework extraiu requisitos em linguagem natural, enriqueceu-os com RAG e os enviou ao LLM, que gerou ADRs para auxiliar na avaliação de trade-offs teóricos. Os resultados demonstraram que o agente com RAG reduziu respostas genéricas, aumentando o embasamento teórico e a rastreabilidade. A abordagem RAG comprovou sua eficácia frente a prompts convencionais (zero-shot), favorecendo a geração de ADRs com menor nível de alucinação e alto nível de rastreabilidade teórica. Concluiu-se que a ferramenta automatizada cumpriu a função de mapeamento de requisitos, resultando em documentos técnicos empiricamente embasados e auxiliando a governança e tomada de decisões em arquitetura de software.

Palavras-chave: Bancos de Dados; Inteligência Artificial; LangGraph; LLM; RAG.

Inscreva-se em nossa newsletter!

Receba conteúdos e fique sempre atualizado sobre as novidades em gestão, liderança e carreira com a Revista E&S.

Ao preencher o formulário você está ciente de que podemos enviar comunicações e conteúdos da Revista E&S. Confira nossa Política de Privacidade