10 de agosto de 2026
Avaliação da Cognição Visual em Aplicativos Móveis com Grandes Modelos de Visão e Linguagem
Adriana Camargo de Brito; Heinrich Da Solidade Santos
DOI: 10.22167/2675-6528-202600505
Artigo elaborado pela ferramenta ResumeAI, solução de inteligência artificial desenvolvida pelo Instituto Pecege voltada à síntese e redação.
Resumo
Grandes Modelos de Visão e Linguagem (VLMs) oferecem novas perspectivas para a automação da avaliação de Experiência do Usuário (UX), apesar de desafios como limitações cognitivas e vieses culturais. Avaliou-se o desempenho de três VLMs (Maverick, Qwen e LLaVA) na interpretação de interfaces de aplicativos móveis, utilizando um banco de dados internacional consolidado (Screen QA em inglês) e um novo banco de dados brasileiro (Screen QA Portuguese), desenvolvido nesta pesquisa. A metodologia envolveu a análise da complexidade visual (densidade e fragmentação) e a reclassificação taxonômica do Screen QA, mensurando o desempenho por métricas léxicas, similaridade semântica e avaliação por um modelo juiz (LLM-as-a-judge). Os resultados indicaram que, no Screen QA em inglês, Maverick e Qwen apresentaram desempenho superior, com acurácias próximas a 90%, enquanto LLaVA obteve desempenho inferior (61,6%). No Screen QA Portuguese, observou-se uma redução no desempenho dos modelos, com acurácias variando de 5,5% a 16% em relação ao conjunto em inglês, evidenciando dificuldades na interpretabilidade de telas em português. A complexidade visual das telas não apresentou correlação direta com os erros, sugerindo que as falhas estavam mais vinculadas à semântica da interface e à dificuldade dos modelos em lidar com perguntas sem resposta. Concluiu-se que, embora modelos robustos demonstrem alta competência em interfaces, há necessidade de especialização (fine-tuning) com dados locais para aprimorar a assertividade em contextos culturais específicos, destacando a importância de bases de dados focadas em aplicativos brasileiros para mitigar vieses.
Palavras-chave: Aplicativos móveis; Avaliação de desempenho; Experiência do usuário; Inteligência artificial; Modelos de visão e linguagem.
1. Introdução
Os avanços na área de Inteligência Artificial (IA) generativa têm transformado significativamente o cenário tecnológico, impulsionando o desenvolvimento de sistemas capazes de realizar tarefas intelectuais que, até então, eram consideradas exclusivas de seres humanos (Li et al., 2024; Vaswani et al., 2023). Nesse contexto, os Grandes Modelos de Linguagem (LLMs) emergem como ferramentas poderosas. Estes modelos são treinados em vastas quantidades de dados textuais, o que lhes confere a capacidade de prever sequências de ‘tokens’, responder a perguntas em contextos específicos e auxiliar na tomada de decisões de maneira análoga à cognição humana (Swapnil et al., 2024). A evolução desses modelos não se limitou apenas ao texto; avanços científicos recentes permitiram a integração de outras modalidades, resultando em modelos de linguagem capazes de processar e interpretar imagens, sons e vídeos (Guo et al., 2019; C. Zhang et al., 2020).
A alta capacidade de resolução de problemas dos LLMs tem encontrado aplicação no desenvolvimento de software, otimizando a avaliação da experiência do usuário (UX) e testes de usabilidade (J. Liu, 2025; Namoun et al., 2024; Zhao & Silverajan, 2024). Métodos tradicionais de usabilidade, que dependem da interação humana com interfaces gráficas (GUIs) para identificar problemas, são demorados e exigem recursos significativos. LLMs podem agilizar etapas como a criação de personas (Kasiri, 2025; Y. Liu et al., 2025), a definição de cenários (J. Liu, 2025), o aprimoramento de questionários (Graser et al., 2024) e a simulação do comportamento de usuários por agentes autônomos (Hsueh et al., 2024; J. Liu, 2025; Lubos et al., 2025; Namoun et al., 2024; Pourasad & Maalej, 2025; Shin et al., 2025; Swapnil et al., 2024; Turbeville et al., 2024; Zhao & Silverajan, 2024).
A evolução dessas tecnologias permitiu que simulações de comportamento de usuário se tornassem mais sofisticadas, com ferramentas como DroidBot-GPT (Wen et al., 2024), UX-LLM (Pourasad & Maalej, 2025), CogAgent (Hong et al., 2024), UXAgent (Lu et al., 2025) e Iris (Ge et al., 2025) oferecendo capacidade multimodal para análise de interfaces. Contudo, os Grandes Modelos de Visão e Linguagem (VLMs), que integram processamento visual e de linguagem, ainda enfrentam desafios. Pesquisas indicam limitações em sua capacidade cognitiva para tarefas complexas (Lu et al., 2025; Pourasad & Maalej, 2025; Wen et al., 2024) e dificuldades na identificação de problemas de usabilidade (Lazik et al., 2025; Lu et al., 2025; Pourasad & Maalej, 2025). Para serem eficazes, esses modelos precisam emular o comportamento humano, compreender a interface gráfica e extrair informações relevantes, o que nem sempre ocorre com a precisão desejada.
Um aspecto crítico que pode comprometer a validade das avaliações de usabilidade por VLMs são os vieses inerentes aos dados de treinamento, às escolhas de design algorítmico e aos padrões de interação do usuário (Z. Liu, 2023). Fatores como gênero, idade, raça e, especialmente, a cultura, podem introduzir estereótipos ou representações imprecisas (Z. Liu, 2023). A cultura molda profundamente a estrutura de pensamento, o comportamento e os padrões de comunicação (Z. Liu, 2023; Tao et al., 2024). Assim, um modelo treinado predominantemente em uma cultura específica pode refletir esses vieses em suas análises. Embora o uso de VLMs seja promissor na área de UX, suas limitações cognitivas e vieses podem dificultar a compreensão da gramática visual de softwares e aplicativos, particularmente aqueles de ambientes culturais distintos, impondo barreiras a testes preliminares de usabilidade eficazes.
Diante dessa problemática, torna-se um campo de estudo relevante buscar contribuições para o desenvolvimento de modelos mais assertivos na análise de usabilidade de softwares e aplicativos. A necessidade de compreender como esses modelos se comportam em diferentes contextos linguísticos e culturais é fundamental para aprimorar sua aplicabilidade global. Assim, este trabalho tem como objetivo avaliar o desempenho de Grandes Modelos de Visão e Linguagem (VLMs) na análise de entendimento visual de telas de aplicativos móveis utilizando um banco de dados internacional consolidado e um novo banco de dados brasileiro desenvolvido especificamente nesta pesquisa.
2. Material e Métodos
Adotou-se uma abordagem metodológica quantitativa e exploratória, com o objetivo de avaliar o desempenho de Grandes Modelos de Visão e Linguagem (VLMs) na interpretação visual de interfaces de aplicativos móveis. O estudo foi dividido em duas etapas: a primeira utilizou um banco de dados internacional consolidado em inglês, e a segunda envolveu o desenvolvimento e a análise de um novo banco de dados em português, focado em interfaces brasileiras. Para as inferências, utilizou-se a infraestrutura computacional do Google Colab. Foram selecionados três VLMs de código aberto em versões quantizadas: Llava-v1.6-vicuna-7b-hf (Llava, 7B parâmetros, fusão tardia, resolução dinâmica), Qwen2.5-VL-7B-Instruct (Qwen, 7B parâmetros, fusão precoce, resolução dinâmica) e Llama-4-maverick-17b-128e-instruct (Maverick, 17B parâmetros, fusão precoce, resolução dinâmica) (H. Liu et al., 2023, 2024; Xu et al., 2024; J. Bai et al., 2023; S. Bai et al., 2025; D. Zhang et al., 2025; Fan et al., 2024).
Na primeira etapa, utilizou-se o banco de dados público Screen QA (Hsiao et al., 2025), com aproximadamente oito mil pares de perguntas e respostas curtas sobre interfaces de aplicativos Android. Este conjunto, derivado do Rico (Deka et al., 2017), continha 9,7 mil aplicativos Android com informações de hierarquia de visualização. Cerca de dez por cento das perguntas não possuíam resposta.
Um novo conjunto de dados, Screen QA Portuguese, foi desenvolvido, composto por 303 capturas de tela de 36 aplicativos Android (nacionais e localizados em português), coletadas com um celular Samsung A55. A metodologia de coleta seguiu os procedimentos dos bancos de dados RICO e Screen QA, extraindo o XML de hierarquia de visualização e estruturando um JSON com os metadados das telas. A autora formulou 1053 perguntas para cada interface, com cerca de dez por cento sem resposta possível.
Os procedimentos de inferência para os três modelos foram realizados na modalidade zero-shot. Cada modelo recebeu uma captura de tela e uma pergunta correspondente do respectivo banco de dados, e suas respostas foram comparadas com as anotações do gabarito. Para a avaliação do desempenho, empregou-se uma abordagem multicritério, que incluiu métricas léxicas (SQUAD-EM e SQUAD-F1), semânticas (similaridade de cosseno, utilizando embeddings do modelo all-MiniLM-L6-v2) e uma avaliação subjetiva estruturada por um modelo juiz (LLM-as-a-judge, gpt-oss-120b). As respostas foram pré-processadas com normalização, e o limiar de sete foi considerado para a acurácia final do juiz.
A complexidade visual das interfaces foi analisada para identificar variáveis que pudessem influenciar o desempenho dos modelos. As imagens foram pré-processadas (conversão para cinza, OpenCV, CLAHE, filtro Gaussiano) e a detecção de bordas realizada com o algoritmo de Canny. Extraíram-se as métricas de densidade visual e fragmentação (Ge et al., 2025). A partir da distribuição por quartis dos dados do Rico, classificou-se a complexidade das telas em baixa, média e alta. A classificação do tipo de tarefa foi redefinida a partir da taxonomia original do Screen QA, com foco na natureza cognitiva ou funcional da interface, utilizando um comitê de modelos (dois VLMs e um LLM) para votação por maioria e desempate determinístico pelo VLM de maior capacidade.
Para avaliar a associação entre o desempenho dos modelos e as métricas de complexidade da interface, bem como a verbosidade das respostas, aplicou-se o Coeficiente de Correlação de Spearman, utilizando a biblioteca Python SciPy. Antes das análises, realizou-se um pré-processamento geral dos dados, excluindo linhas duplicadas (resultando em 8020 linhas) e mantendo casos de Erros de API (0,1% dos dados) para evidenciar falhas. O conjunto de dados Screen QA Portuguese foi submetido ao mesmo protocolo de análise, com adaptação para o cálculo da similaridade de cosseno em português, utilizando o modelo `sentence-transformers/paraphrase-multilingual-mpnet-base-v2`.
3. Resultados e Discussão
Os resultados da pesquisa revelaram insights importantes sobre o desempenho de Grandes Modelos de Visão e Linguagem (VLMs) na interpretação de interfaces de aplicativos móveis, tanto em um contexto internacional (Screen QA em inglês) quanto em um cenário brasileiro (Screen QA Portuguese). Inicialmente, observou-se uma notável resiliência dos modelos à complexidade visual das telas, um achado que diverge de estudos anteriores. A análise detalhada indicou que, embora modelos robustos demonstrem alta competência na compreensão de interfaces, a performance é significativamente influenciada pelo contexto linguístico e cultural, com uma degradação acentuada ao lidar com o idioma português.
A partir das análises de correlação de Spearman, verificou-se que não houve correlação direta entre a nota média atribuída pelo modelo juiz (GPT) e as métricas de complexidade visual da tela, como densidade e fragmentação, em ambos os conjuntos de dados. Este resultado contrasta com a literatura existente, que frequentemente aponta a alta densidade e fragmentação de interfaces como desafios críticos para a percepção de agentes multimodais (Ge et al., 2025). A resiliência observada nos modelos LLaVA, Qwen e Maverick pode ser atribuída às suas arquiteturas avançadas, que incluem resoluções dinâmicas e mecanismos de fusão multimodal, especialmente a fusão precoce.
A capacidade de resolução dinâmica, presente em Qwen e Maverick, permite o processamento de imagens de diferentes tamanhos e a tokenização proporcional ao conteúdo, o que pode mitigar o impacto negativo da complexidade visual na precisão das respostas. Mesmo o LLaVA, que emprega uma estratégia de fusão tardia, demonstrou que seu desempenho não foi significativamente afetado pela complexidade visual das telas estáticas. Isso sugere que o desafio atual na interpretação de interfaces por IA pode estar se deslocando da percepção visual bruta para a camada de raciocínio lógico-semântico e a gestão de incertezas, em vez de ser primariamente uma questão de carga visual.
No que tange à influência linguística e à variabilidade das métricas de avaliação, o conjunto de dados Screen QA em inglês revelou uma correlação positiva robusta entre a Nota Média do GPT e a Similaridade de Cosseno para os modelos LLaVA (0,91) e Maverick (0,73). Contudo, o modelo Qwen apresentou um comportamento mais prolixo, o que tendeu a penalizar a Similaridade de Cosseno, resultando em uma forte correlação negativa de -0,66 entre a razão de tamanho da resposta e a similaridade semântica. Este fenômeno indica que respostas mais longas, mesmo que semanticamente corretas, podem divergir mecanicamente dos gabaritos, afetando métricas lexicais.
Em contrapartida, no contexto do Screen QA Portuguese, a correlação entre a nota do GPT e a similaridade de cosseno foi inferior para todos os modelos em comparação com a versão em inglês. O LLaVA, por exemplo, atingiu 0,67, enquanto os demais modelos ficaram na ordem de 0,37. Esta redução na força da correlação pode ser atribuída à maior complexidade morfossintática da língua portuguesa, que impõe desafios adicionais ao alinhamento semântico e à correspondência exata de termos. Além disso, a instabilidade multilíngue dos modelos em português se manifestou em uma correlação negativa entre a verbosidade e a similaridade semântica, variando de -0,55 a -0,66.
A avaliação do desempenho dos modelos no Screen QA em inglês demonstrou que Maverick e Qwen apresentaram resultados superiores, com acurácias médias próximas a 90% e notas médias GPT equivalentes. Ambos os modelos exibiram alta capacidade de interpretar o contexto visual das interfaces e realizar o processamento semântico de forma eficaz. O Maverick, em particular, destacou-se pela precisão lexical, com índices de similaridade de 88,4% e métricas SQUAD-EM e SQUAD-F1 de 78,7% e 84,6%, respectivamente, indicando uma alta fidelidade às respostas esperadas.
Por outro lado, o LLaVA obteve um desempenho inferior no conjunto em inglês, com uma acurácia de 61,6% e nota média GPT na mesma ordem, o que aponta dificuldades no processamento semântico de uma parcela significativa das interfaces. A performance do LLaVA pode ser reflexo de sua arquitetura de fusão tardia de elementos multimodais e da resolução dinâmica com limites fixos, que podem comprometer a identificação de elementos de granularidade fina, essenciais em interfaces. Autores como Gadzicki (n.d.) e Willis e Bakos (2025) já apontaram as limitações da fusão tardia, corroborando esses achados.
No Screen QA Portuguese, os modelos mantiveram a hierarquia de desempenho observada no conjunto em inglês, com Maverick e Qwen ainda em destaque, porém todas as métricas sofreram degradação. As métricas de natureza semântica, como a Nota GPT e a Acurácia, mostraram-se mais resilientes, com quedas moderadas de até 5,5% para Maverick e Qwen. O LLaVA, no entanto, demonstrou maior fragilidade, com uma redução de 16% em seu desempenho semântico, evidenciando um impacto mais significativo do idioma em modelos com arquiteturas menos robustas para contextos multimodais.
A disparidade mais acentuada no desempenho em português ocorreu nas métricas lexicais, como Similaridade de Cosseno, SQUAD-F1 e SQUAD-EM, que apresentaram reduções variando entre 10% e 46,7% em comparação com os resultados em inglês. Este fenômeno sugere que, embora os modelos possam compreender o conteúdo semântico da interface em português, a estrutura de suas respostas diverge significativamente da norma lexical do gabarito. A complexidade morfossintática do português e a menor exposição dos modelos a dados de interface nesse idioma elevam o desafio de alinhamento, tornando a avaliação semântica via LLM-as-a-judge um indicador mais confiável do que as métricas lexicais tradicionais.
A análise dos erros cometidos pelos modelos no conjunto em inglês revelou que, para Maverick e Qwen, aproximadamente 35% dos erros corresponderam a perguntas sem resposta. Essa dificuldade em lidar com questões que não possuem uma resposta explícita é um desafio comum para modelos treinados para sempre fornecer uma saída. O LLaVA, embora tenha um número significativamente maior de erros totais, apresentou um desempenho superior nesse aspecto específico, com apenas 21% de seus erros relacionados a perguntas sem resposta, um comportamento similar observado no conjunto em português.
Em relação à distribuição de erros por categoria de tarefa no conjunto em inglês, todos os três modelos apresentaram a maior quantidade de falhas na categoria “Outros”, que frequentemente incluía perguntas sem resposta. O LLaVA demonstrou dificuldades críticas nesta categoria, com uma taxa de erro de 92%. Além disso, o LLaVA falhou em 63,4% dos itens nas tarefas de Reconhecimento Óptico de Caracteres (OCR), indicando uma carência de treinamento especializado em interfaces gráficas e possíveis limitações de sua arquitetura (Fan et al., 2024; Xu et al., 2024), sugerindo a necessidade de ajuste fino para proficiência em interfaces móveis.
Apesar do desempenho superior de Qwen e Maverick, ainda foram identificadas janelas de otimização em tarefas específicas no conjunto em inglês. O Qwen, por exemplo, apresentou 16,8% de erros em tarefas de OCR, enquanto o Maverick registrou 17,2% de erros em tarefas de Navegação e Interface. Esses achados indicam que, mesmo os modelos mais avançados, podem se beneficiar de especialização para aprimorar a assertividade em domínios específicos da avaliação de experiência do usuário.
No conjunto de dados em português, observou-se um agravamento das dificuldades dos modelos em todas as categorias de erro. Na categoria “Outros”, as taxas de erro para Qwen e Maverick subiram para 42,3% e 36,1%, respectivamente, sugerindo que o idioma português amplifica a complexidade de identificar perguntas sem resposta. Outro ponto de preocupação foi a categoria de Navegação e Interface, onde ambos os modelos apresentaram um declínio de desempenho, com erros na ordem de 22%.
Este declínio de desempenho em português aponta para dois fatores críticos. Primeiramente, a dificuldade inerente ao processamento da linguagem portuguesa, com sua complexidade morfossintática, impõe um desafio maior aos modelos treinados predominantemente em outros idiomas. Em segundo lugar, a existência de possíveis vieses culturais ou estruturais em interfaces brasileiras, cujas particularidades de layout e design podem divergir dos padrões presentes nos dados de treinamento estrangeiros, contribui para as falhas observadas.
O LLaVA, em particular, revelou uma degradação generalizada de desempenho no cenário português, com índices de erro superiores a 48% em todas as categorias. O destaque negativo concentrou-se em Raciocínio Quantitativo, onde o modelo falhou em 81,9% das respostas. Esses resultados reforçam que a combinação de uma arquitetura de visão menos granular e a menor exposição a dados multimodais em português comprometem severamente a robustez do modelo em contextos linguísticos e culturais específicos, evidenciando a necessidade de bases de dados locais para mitigar esses vieses.
Em síntese, a pesquisa demonstrou que VLMs robustos como Maverick e Qwen possuem alta competência na interpretação de interfaces móveis em inglês, beneficiando-se de arquiteturas de fusão precoce e resolução dinâmica. Contudo, a transição para o contexto português revelou uma degradação generalizada do desempenho, especialmente nas métricas lexicais, sublinhando o impacto significativo da variabilidade linguística e cultural. A ausência de correlação entre a complexidade visual e o erro sugere que o foco da IA em UX deve se deslocar para a interpretação semântica e a gestão de incertezas, e a necessidade de especialização com dados locais para aprimorar a assertividade em ambientes culturais específicos é crucial para a universalização dessas ferramentas.
4. Conclusão
Este estudo avaliou o desempenho de Grandes Modelos de Visão e Linguagem (VLMs) na análise de entendimento visual de telas de aplicativos móveis, utilizando um banco de dados internacional consolidado e um novo banco de dados brasileiro. Verificou-se que modelos robustos, como Maverick e Qwen, demonstraram alta competência na interpretação de interfaces em inglês, com acurácias próximas a noventa por cento, beneficiando-se de arquiteturas de fusão precoce e resolução dinâmica. Em contraste, o LLaVA obteve desempenho inferior, evidenciando limitações em sua arquitetura de fusão tardia. Um achado crucial foi a resiliência dos modelos mais avançados à complexidade visual das telas, sugerindo que o desafio atual da inteligência artificial em avaliação de experiência do usuário reside mais na interpretação funcional e no raciocínio lógico-semântico do que na carga visual bruta. A principal contribuição deste trabalho reside na criação de um banco de dados inédito, o Screen QA Portuguese, que permitiu a análise do comportamento dos VLMs em um contexto linguístico e cultural distinto.
A introdução do Screen QA Portuguese revelou uma degradação generalizada do desempenho dos modelos, com quedas nas acurácias que variaram de 5,5% a 16% em relação ao conjunto em inglês. Essa redução foi mais acentuada nas métricas lexicais, indicando que a complexidade morfossintática do português e a menor exposição dos modelos a dados nesse idioma comprometem a precisão das respostas, tornando a avaliação semântica via modelo juiz um indicador mais confiável. As limitações do estudo incluem o uso de interfaces estáticas e de gerações anteriores no banco de dados internacional, além dos vieses culturais e linguísticos inerentes aos modelos treinados predominantemente em outros idiomas. Para estudos futuros, sugere-se a necessidade de especialização (fine-tuning) dos VLMs com dados locais e a criação de bases de dados focadas em aplicativos brasileiros. Isso é fundamental para mitigar vieses, aprimorar a assertividade em contextos culturais específicos e desenvolver agentes de UX mais proficientes para o mercado local, universalizando a aplicação dessas ferramentas.
Referências Bibliográficas
Guo, W., Wang, J., & Wang, S. (2019). Deep Multimodal Representation Learning: A Survey. IEEE Access, 7, 63373–63394.
Li, Z., Liu, H., Zhou, D., & Ma, T. (2024). Chain of Thought Empowers Transformers to Solve Inherently Serial Problems.
Liu, J. (2025). Al in Automated and Remote UX Evaluation: A Systematic Review (2014–2024). In Advances in Human-Computer Interaction (Vol. 2025, Issue 1
Swapnil, A., Ge, H., Diagarajan, M. S., & Happonen, A. (2024). Modern State-of-the-Art Generative Al Uses and Practices for Product Innovation, Marketing Strategies, and Enhanced Customer Experience. Proceedings – 2024 7th Asia Conference on Cognitive Engineering and Intelligent Lnteraction, CEII 2024, 261-268.
Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., Kaiser, L., & Polosukhin, I. (2023). Attention Is All You Need.
Zhang, C., Yang, Z., He, X., & Deng, L. (2020). Multimodal Intelligence: Representation Learning, Information Fusion, and Applications.
Artigo oriundo de Trabalho de Conclusão de Curso da Especialização em Engenharia de Software do MBA USP/Esalq
Para saber mais sobre o curso, clique aqui e acesse a plataforma MBX Academy

