Artigo

09 de outubro de 2026

Detecção de Alimentos em Imagens de Refeições por Meio de Redes YOLOv8

Detecção de Alimentos em Imagens de Refeições por Meio de Redes Yolov8

Luis Felipe de Oliveira Bergamim; Gustavo Dantas Lobo

DOI: 10.22167/2675-6528-202603218

Artigo derivado de Trabalho de Conclusão de Curso (TCC), com conteúdo baseado no trabalho original do aluno e adaptado ao formato editorial da Revista E&S com apoio da ferramenta ResumeAI, solução de inteligência artificial desenvolvida pelo Instituto Pecege para síntese e organização textual.

Resumo

O reconhecimento automático de alimentos em imagens de refeições é um problema relevante em áreas como monitoramento nutricional, saúde e sistemas inteligentes, mas apresenta desafios devido à alta variabilidade visual dos alimentos, sobreposição entre itens e ausência de estruturas bem definidas. Nesse contexto, o estudo investigou a viabilidade do uso de técnicas de visão computacional para a detecção automática de alimentos em imagens de refeições. Explorou-se diferentes variantes do modelo YOLOv8 com pesos pré-treinados e ajustes progressivos em hiperparâmetros, arquiteturas e esquemas de congelamento de camadas. O dataset FoodRepo foi adotado para o treinamento, após modificações que reduziram e agruparam classes, tornando-as mais adequadas ao escopo da aplicação. Conduziram-se experimentos comparando arquiteturas nano, small e medium, além de diferentes otimizadores e pesos das funções de perda. Os resultados indicaram desempenho excelente na detecção de pratos e desempenho moderado na detecção de alimentos, coerente com a complexidade visual das classes e a variabilidade do conjunto de dados. Observou-se que a redução de classes aumentou a estabilidade do treinamento e que o congelamento parcial de camadas acelerou o processo sem perda significativa de desempenho. Demonstrou-se a viabilidade técnica do uso de modelos YOLOv8 para detecção automática de alimentos em imagens de refeições, contribuindo para avanços na área de food computing.

Palavras-chave: Detecção de alimentos; Detecção de objetos; Transferência de aprendizado; Visão computacional; YOLOv8.

1. Introdução

Nas últimas décadas, a crescente disponibilidade de alimentos para grande parte da população mundial representou um avanço significativo no combate à fome. Entretanto, esse progresso foi acompanhado por um aumento expressivo nos índices de obesidade e de doenças crônicas não transmissíveis, como diabetes tipo 2 e enfermidades cardiovasculares, amplamente relacionadas ao consumo de produtos ultraprocessados (Popkin, 2015; Monteiro et al., 2013). Esse fenômeno, conhecido como transição nutricional, caracteriza-se pela substituição de dietas tradicionais por padrões alimentares ricos em itens industrializados e hipercalóricos, configurando um desafio de saúde pública em escala global.

A Organização das Nações Unidas, por meio da Agenda 2030, estabeleceu entre seus Objetivos de Desenvolvimento Sustentável o compromisso de assegurar uma vida saudável e promover o bem-estar para todos (ONU, 2015). No contexto brasileiro, tais desafios tornam-se ainda mais evidentes diante da crescente presença de alimentos ultraprocessados na dieta da população e da dificuldade de acesso a ferramentas simplificadas que auxiliem na interpretação da qualidade nutricional das refeições. Nesse cenário, soluções tecnológicas baseadas em visão computacional emergem como alternativas promissoras para apoiar escolhas alimentares mais conscientes.

Nesse contexto, o reconhecimento automático de alimentos em imagens tem se destacado como uma tecnologia promissora para apoiar diferentes aplicações práticas na área da saúde e da nutrição. Sistemas capazes de identificar alimentos a partir de fotografias podem auxiliar no monitoramento da ingestão alimentar, na estimativa da composição nutricional das refeições, no acompanhamento de pacientes com doenças crônicas, em aplicativos de educação alimentar e em estudos epidemiológicos sobre hábitos alimentares. Além disso, a automatização desse processo reduz a necessidade de registros alimentares realizados manualmente, tornando a avaliação nutricional mais rápida, objetiva e escalável.

Modelos de aprendizado profundo, especialmente aqueles fundamentados em redes neurais convolucionais, têm demonstrado desempenho robusto em tarefas de reconhecimento de imagens, incluindo aplicações relacionadas ao setor alimentício. Entre essas abordagens, destaca-se a família de modelos YOLO (“You Only Look Once”), amplamente utilizada para detecção de objetos em tempo real devido ao equilíbrio entre precisão e velocidade (Redmon et al., 2016; Varghese & Sambath, 2024). Essas características tornam o YOLOv8 particularmente adequado para aplicações que demandam processamento eficiente e potencial execução em tempo real, como sistemas automatizados de reconhecimento de alimentos. A disponibilidade de grandes conjuntos de dados anotados, como o FoodRepo, aliado ao avanço de bibliotecas modernas de aprendizado profundo, tem facilitado o desenvolvimento de sistemas capazes de identificar automaticamente itens alimentares presentes em fotografias.

A problemática que orienta este estudo reside na dificuldade de desenvolver modelos capazes de identificar automaticamente os alimentos presentes em imagens de refeições com precisão satisfatória, diante da elevada variabilidade visual entre os itens alimentares, da sobreposição entre objetos e do grande número de categorias possíveis, fatores amplamente reconhecidos como desafiadores na literatura.

A necessidade de ferramentas eficientes para o monitoramento nutricional e a superação dos desafios inerentes à detecção de alimentos em imagens justificam a relevância desta pesquisa. Diante desse contexto, o objetivo deste trabalho é avaliar a viabilidade do uso de modelos de visão computacional baseados na arquitetura YOLOv8 para a detecção automática de alimentos em imagens de refeições. Para isso, foram analisadas diferentes configurações do modelo, incluindo variações de arquitetura, estratégias de transferência de aprendizado e ajustes de hiperparâmetros, com o intuito de identificar a configuração que proporcionasse o melhor equilíbrio entre desempenho e custo computacional na tarefa de detecção de alimentos.

2. Material e Métodos

A pesquisa foi conduzida com caráter aplicado e experimental, empregando métodos quantitativos para o desenvolvimento de uma abordagem de visão computacional. O estudo focou na detecção automática de alimentos em imagens, buscando avaliar a viabilidade técnica de modelos de detecção de objetos aplicados ao reconhecimento de componentes de refeições. A construção e avaliação de um modelo de detecção de alimentos em imagens constituíram o foco exclusivo deste trabalho.

O processo metodológico foi estruturado em etapas sequenciais, abrangendo desde o levantamento bibliográfico e a preparação dos dados até o treinamento e a avaliação experimental dos modelos de detecção de alimentos. Essa abordagem sistemática permitiu a investigação aprofundada das diferentes configurações e parâmetros que influenciam o desempenho dos modelos de visão computacional.

Inicialmente, realizou-se uma revisão da literatura sobre reconhecimento automático de alimentos, nutrição computacional e aprendizado de máquina. O objetivo foi fundamentar teoricamente a pesquisa e orientar a seleção das técnicas empregadas. A revisão destacou a eficácia dos modelos da família YOLO para detecção de objetos em tempo real (Redmon et al., 2016; Jocher et al., 2023) e a relevância do “transfer learning” e “fine-tuning” para otimização do treinamento (Ciocca et al., 2021; Varghese & Sambath, 2024).

Na sequência, procedeu-se à seleção e preparação do conjunto de dados. Utilizou-se o “dataset” público FoodRepo, que contém 54.392 imagens e 100.256 anotações distribuídas em 323 classes alimentares. Este conjunto de dados, já com caixas delimitadoras e segmentações anotadas, foi adaptado para o formato YOLOv8, eliminando a necessidade de criação de um “dataset” próprio e seguindo práticas consolidadas em pesquisas de classificação e segmentação de alimentos (Ciocca et al., 2021).

O conjunto de dados foi inspecionado e padronizado, incluindo ajustes de resolução, normalização e reorganização dos diretórios de treino, validação e teste. Adicionalmente, foram realizadas adaptações nas classes do “dataset” por meio de três esquemas progressivos de agrupamento (v1, v2 e v3). O objetivo foi reduzir redundâncias, minimizar o desbalanceamento entre categorias e aumentar a estabilidade do treinamento.

Cada esquema de agrupamento foi avaliado em duas variantes: uma automática (A), gerada por script com regras predefinidas, e uma manual (M), refinada com base em critérios visuais e nutricionais para reduzir ambiguidades. Seis configurações distintas do “dataset” (v1_A, v1_M, v2_A, v2_M, v3_A e v3_M) foram avaliadas experimentalmente, e a configuração com melhor desempenho foi selecionada para os experimentos subsequentes. Técnicas de “data augmentation”, como variações de iluminação, rotação e escala, foram aplicadas conforme recomendações da literatura (Shorten & Khoshgoftaar, 2019).

A estratégia de transferência de aprendizado foi implementada inicializando os modelos com pesos previamente treinados em grandes conjuntos de dados de detecção de objetos. Durante o treinamento, parte das camadas iniciais da rede foi mantida congelada (“frozen layers”), impedindo a atualização de seus pesos. Essa abordagem visou preservar características visuais genéricas, reduzir o tempo de treinamento e mitigar o risco de sobreajuste (“overfitting”) em conjuntos de dados específicos. Diferentes quantidades de camadas congeladas foram avaliadas para determinar a configuração ideal.

Os experimentos foram realizados no ambiente Google Colab, que oferece suporte a aceleração por GPU, permitindo a execução do treinamento dos modelos dentro das limitações computacionais típicas de ambientes acessíveis. O ajuste dos hiperparâmetros foi conduzido de forma sequencial e experimental, alterando um fator por vez para isolar o impacto individual de cada parâmetro no desempenho do modelo.

Entre os hiperparâmetros avaliados, compararam-se os otimizadores SGD (“Stochastic Gradient Descent”), Adam e AdamW. O SGD realiza atualizações baseadas no gradiente com taxa de aprendizado fixa, enquanto Adam e AdamW combinam estimativas adaptativas dos momentos dos gradientes, com AdamW desacoplando a regularização (“weight decay”). A configuração automática do framework Ultralytics, que corresponde ao uso do AdamW, também foi considerada. As arquiteturas YOLOv8 nano, “small” e “medium” foram comparadas, diferenciando-se pela quantidade de parâmetros, profundidade da rede e custo computacional.

Também se avaliou a influência de diferentes configurações dos pesos das funções de perda (box, cls e dfl) utilizadas pelo YOLOv8 durante o treinamento. O parâmetro “box” controlou a importância do erro de localização das caixas delimitadoras, “cls” ponderou o erro de classificação das classes detectadas e “dfl” ajustou a precisão da regressão das coordenadas. A alteração desses pesos permitiu priorizar aspectos específicos do treinamento, como a precisão na localização ou na classificação.

Os modelos foram treinados por 100 épocas, seguindo a configuração padrão do framework YOLOv8. Para os experimentos com alimentos, registrou-se o tempo total de treinamento, enquanto para o conjunto de pratos, devido à menor complexidade, optou-se por apresentar o tempo médio por época. A avaliação dos modelos foi realizada por meio de métricas amplamente utilizadas em tarefas de detecção de objetos.

As métricas empregadas incluíram precisão (“precision”), revocação (“recall”), F1-Score e “mean Average Precision” (mAP). A precisão mediu a proporção de detecções corretas em relação ao total de detecções, penalizando falsos positivos (Everingham et al., 2015). A revocação representou a proporção de objetos reais corretamente detectados, reduzindo falsos negativos (Everingham et al., 2015).

O F1-Score, que corresponde à média harmônica entre precisão e revocação, foi utilizado como métrica de equilíbrio, sendo útil em cenários com “datasets” desbalanceados (Goodfellow et al., 2016). A mAP, calculada a partir das Average Precisions (AP) individuais, avaliou o desempenho médio entre todas as classes. O mAP50 considerou detecções corretas com IoU maior ou igual a 0,50, enquanto o mAP50-95 avaliou o desempenho para múltiplos limiares de IoU, de 0,50 a 0,95, conforme o benchmark COCO (Lin et al., 2014; Jocher et al., 2023).

3. Resultados e Discussão

A presente seção detalha os experimentos conduzidos com o conjunto de dados FoodRepo para a detecção automática de alimentos em imagens de refeições, apresentando a avaliação do desempenho dos modelos treinados. Os resultados obtidos fornecem uma compreensão aprofundada da viabilidade da arquitetura YOLOv8 para esta tarefa complexa, considerando as variações visuais e a diversidade inerente aos itens alimentares. A análise abrange tanto aspectos quantitativos, por meio de métricas de desempenho, quanto qualitativos, examinando as predições do modelo em cenários reais, o que permite uma avaliação abrangente da eficácia da abordagem proposta.

Resultados Quantitativos

Os resultados quantitativos são apresentados em conformidade com a sequência metodológica adotada, permitindo uma análise sistemática do impacto de cada estratégia de treinamento no desempenho do modelo. Inicialmente, avaliou-se a influência da redução e agrupamento das classes do conjunto de dados FoodRepo, seguido pela comparação entre as arquiteturas YOLOv8, o congelamento de camadas, o ajuste de hiperparâmetros e, por fim, a configuração final dos modelos. Essa abordagem sequencial garante que o efeito de cada modificação possa ser isolado e compreendido em relação ao objetivo geral do estudo.

A primeira etapa experimental concentrou-se na avaliação de diferentes versões da redução do conjunto de dados FoodRepo, visando equilibrar a quantidade de exemplos por classe e minimizar a redundância entre categorias nutricionalmente semelhantes. As agregações foram realizadas com base em critérios visuais e nutricionais, agrupando alimentos com aparência similar ou baixa representatividade para aumentar a estabilidade do treinamento. Foram testados três esquemas de redução (v1, v2 e v3), cada um com variantes automática (A) e manual (M), que incluíram o agrupamento de itens como grãos, vegetais cozidos e outros alimentos pouco frequentes em classes mais amplas, conforme a metodologia descrita.

Os resultados comparativos das versões do conjunto de dados indicaram que a versão v3_M apresentou o melhor desempenho geral. Esta configuração alcançou um mAP50 de 0,3598 e um mAP50-95 de 0,2705, superando significativamente as demais alternativas testadas, que variaram de 0,1366 a 0,2924 para mAP50 e de 0,1048 a 0,2161 para mAP50-95. A superioridade da v3_M pode ser atribuída ao maior nível de consolidação das classes, que reuniu categorias pouco representadas em grupos alimentares mais amplos, promovendo maior estabilidade e representatividade dos dados para o treinamento do modelo. Em função desse desempenho, a versão v3_M foi selecionada para todas as etapas subsequentes do treinamento, garantindo consistência na avaliação dos demais hiperparâmetros.

Após a definição da versão otimizada do conjunto de dados, procedeu-se à comparação entre as arquiteturas YOLOv8, especificamente as variantes nano, “small” e “medium”. O treinamento foi realizado por cem épocas, buscando um equilíbrio entre desempenho e custo computacional para a detecção de alimentos e pratos. Para a detecção de alimentos, a arquitetura “small” demonstrou o melhor compromisso, atingindo um mAP50 de 0,4043 e um mAP50-95 de 0,3104, com um F1-Score de 0,4361, em um tempo de treinamento de duas horas e doze minutos. Embora a variante “medium” tenha apresentado métricas ligeiramente superiores (mAP50 de 0,4350 e mAP50-95 de 0,3360), seu tempo de treinamento foi mais que o dobro, totalizando quatro horas e quarenta e dois minutos, o que justificou a escolha da arquitetura “small” para alimentos devido à sua eficiência.

Para a detecção de pratos, a arquitetura nano revelou um desempenho equivalente ou superior às variantes maiores, com um mAP50 de 0,9926, mAP50-95 de 0,8532 e F1-Score de 0,9781, em apenas treze segundos por época. As arquiteturas “small” e “medium” apresentaram mAP50-95 de 0,8654 e 0,8209, respectivamente, com tempos por época de quinze e vinte e cinco segundos. O desempenho excepcionalmente elevado na detecção de pratos é esperado, pois os pratos são objetos grandes, centralizados e com bordas bem definidas, o que simplifica a tarefa de detecção. Esses achados corroboram a literatura, que sugere que modelos menores tendem a generalizar bem em tarefas mais simples, enquanto modelos intermediários são mais adequados para tarefas multiclasse de maior complexidade.

Em seguida, avaliou-se o impacto da estratégia de congelamento de camadas durante o processo de transferência de aprendizado. Para o conjunto de dados de alimentos, observou-se que o mAP50-95 alcançou 0,309 com uma camada congelada e 0,304 com duas camadas, com o F1-Score correspondente de 0,457 e 0,441. A partir de dez camadas congeladas, o desempenho começou a degradar significativamente, atingindo 0,224 para mAP50-95 e 0,366 para F1-Score, e caindo para 0,097 e 0,262, respectivamente, com vinte e duas camadas. Com base nesses resultados, a configuração de duas camadas congeladas foi selecionada como a ideal para a detecção de alimentos, pois proporcionou um bom equilíbrio entre a adaptação do modelo e a preservação das características pré-treinadas, evitando a perda de desempenho.

Para o conjunto de dados de pratos, o congelamento de camadas também foi analisado, revelando que o mAP50-95 se manteve estável em torno de 0,858 com uma e duas camadas congeladas, e 0,850 com três camadas, com o F1-Score em 0,993, 0,978 e 0,965, respectivamente. A partir de dez camadas congeladas, o desempenho começou a cair, atingindo 0,768 para mAP50-95 e 0,920 para F1-Score, e diminuindo para 0,521 e 0,706 com vinte e duas camadas. A configuração de quatro camadas congeladas foi escolhida para a detecção de pratos, pois demonstrou boa estabilidade e desempenho, aliada à simplicidade do modelo. Esses resultados indicam que o congelamento parcial das camadas é uma estratégia eficaz para otimizar o treinamento, equilibrando a especialização do modelo com a preservação de conhecimentos pré-existentes.

Na etapa de ajuste de hiperparâmetros, foram comparados diferentes algoritmos de otimização. Para a detecção de alimentos, o otimizador automático (AdamW) demonstrou o melhor desempenho, com mAP50 de 0,404, mAP50-95 de 0,309 e F1-Score de 0,457. O SGD e o Adam apresentaram resultados inferiores, com mAP50-95 de 0,290 e 0,279, respectivamente. Para a detecção de pratos, o otimizador SGD superou os demais, alcançando mAP50 de 0,994, mAP50-95 de 0,864 e F1-Score de 0,984. O otimizador automático (AdamW) e o Adam obtiveram mAP50-95 de 0,858, ligeiramente abaixo do SGD. A escolha do otimizador adequado é crucial para a convergência e o desempenho do modelo, e esses achados foram incorporados nas configurações finais.

A avaliação do impacto da alteração dos pesos das funções de perda também foi realizada. Para a detecção de alimentos, a modificação do peso da função de perda de classificação (cls = 1,75) resultou em um mAP50 de 0,408 e mAP50-95 de 0,310, com F1-Score de 0,449, indicando uma leve melhora no mAP50-95 em comparação com os pesos padrão. Para a detecção de pratos, a modificação do peso da função de perda de caixa delimitadora (box = 9,5) melhorou a precisão das caixas, resultando em mAP50 de 0,993, mAP50-95 de 0,869 e F1-Score de 0,975. Essas otimizações nos pesos das funções de perda permitiram refinar o processo de treinamento, priorizando aspectos específicos da detecção para maximizar a acurácia.

A configuração final selecionada para o modelo de detecção de alimentos combinou a arquitetura “small”, o uso de duas camadas congeladas e o otimizador automático (AdamW), com seus respectivos hiperparâmetros e pesos das funções de perda ajustados. Este modelo final obteve uma precisão de 0,520, recall de 0,425, mAP50 de 0,438, mAP50-95 de 0,344 e F1-Score de 0,467. Esse desempenho é considerado moderado, refletindo a alta complexidade visual da tarefa de detecção de alimentos, caracterizada pela diversidade de classes, sobreposição de itens e variações de iluminação, fatores amplamente reconhecidos como desafiadores na literatura (Varghese & Sambath, 2024; Redmon et al., 2016).

Para o modelo de detecção de pratos, a configuração final utilizou a arquitetura nano, com quatro camadas congeladas e o otimizador SGD, também com seus hiperparâmetros e pesos das funções de perda correspondentes. Este modelo alcançou uma precisão de 0,975, recall de 1,000, mAP50 de 0,993, mAP50-95 de 0,887 e F1-Score de 0,987. O desempenho excelente do modelo de pratos demonstra sua alta estabilidade e capacidade de generalização para objetos com características visuais bem definidas, o que é consistente com a menor complexidade intrínseca da tarefa de identificar um prato em comparação com a detecção de múltiplos alimentos em uma refeição.

Análise Qualitativa das Predições do Modelo

Além das métricas quantitativas, foi realizada uma avaliação qualitativa das predições do modelo treinado com a arquitetura “small” em imagens reais de refeições. Esta análise visual complementa os resultados numéricos, permitindo observar o comportamento da rede em situações complexas e validar sua capacidade de detecção em cenários práticos, conforme recomendado pela literatura para modelos de visão computacional (Ciocca et al., 2021; Kawano & Yanai, 2015). A inspeção visual das predições oferece insights sobre as forças e limitações do modelo que não são totalmente capturados pelas métricas agregadas.

Em um exemplo de refeição composta por salada, legumes e outros itens frescos, o modelo conseguiu identificar corretamente diferentes componentes, atribuindo às regiões correspondentes as classes “salad” e “vegetables”. Essa capacidade de discriminar múltiplos grupos alimentares em um único prato reforça o potencial da abordagem baseada em YOLO para apoiar sistemas automáticos de reconhecimento de alimentos em imagens de refeições (Varghese & Sambath, 2024; Redmon et al., 2016). Em outro cenário, com um prato contendo salada, carne e arroz negro, o modelo obteve desempenho satisfatório ao identificar corretamente a salada e classificou o arroz negro como legumes (“vegetables”), de forma consistente com suas classes agrupadas. O modelo também identificou corretamente a carne, demonstrando sua capacidade de reconhecer proteínas animais mesmo em situações de sobreposição visual com outros alimentos.

Contudo, a análise qualitativa também revelou que alguns itens menores ou parcialmente ocultos receberam classificações genéricas. Embora essa classificação não seja semanticamente precisa, ela reflete as limitações decorrentes da estratégia de redução de classes adotada no conjunto de dados, onde alimentos visualmente semelhantes foram agrupados para melhorar a frequência por classe, conforme sugerido pela literatura em cenários com conjuntos de dados desbalanceados (Goodfellow et al., 2016; Shorten & Khoshgoftaar, 2019). Essa observação é compatível com a natureza altamente variável dos alimentos e com os desafios descritos por Bossard et al. (2014) sobre a diversidade intra-classe, que dificulta a distinção de itens específicos em categorias amplas.

Essas análises qualitativas reforçam dois pontos centrais. Primeiramente, o modelo demonstra uma capacidade de generalização adequada para grupos alimentares amplos, exibindo estabilidade na detecção de saladas, legumes e fontes proteicas, o que está em concordância com resultados de estudos anteriores (Ciocca et al., 2021). Em segundo lugar, as limitações observadas, como a classificação genérica de itens específicos, decorrem principalmente da granularidade reduzida das classes utilizada durante a etapa de agrupamento do conjunto de dados, e não de falhas inerentes à arquitetura YOLOv8. Isso evidencia o impacto significativo das decisões de preparação dos dados no desempenho final do modelo, destacando a importância de um balanceamento cuidadoso entre a simplificação das classes e a preservação da especificidade para aplicações futuras.

Em síntese, os experimentos demonstraram a viabilidade técnica do uso de modelos YOLOv8 para a detecção automática de alimentos em imagens de refeições. A redução progressiva das classes do conjunto de dados e a seleção criteriosa da arquitetura “small” para alimentos e “nano” para pratos, juntamente com o congelamento parcial de camadas e o ajuste de hiperparâmetros, foram cruciais para otimizar o desempenho. Embora o modelo tenha alcançado um desempenho moderado na detecção de alimentos devido à complexidade visual e diversidade de classes, ele apresentou resultados excelentes na detecção de pratos, confirmando sua capacidade de identificar objetos bem definidos. As limitações observadas estão mais relacionadas à granularidade das classes do conjunto de dados do que a falhas intrínsecas à arquitetura, indicando que a preparação dos dados é um fator determinante para o sucesso da aplicação.

4. Conclusão

Este trabalho investigou a viabilidade da utilização de modelos de visão computacional baseados na arquitetura YOLOv8 para a detecção automática de alimentos em imagens de refeições, diante da elevada variabilidade visual e da complexidade inerente à tarefa. Por meio de uma avaliação experimental sistemática, que explorou diferentes variantes do modelo YOLOv8, ajustes em hiperparâmetros, arquiteturas e esquemas de congelamento de camadas, verificou-se a viabilidade técnica da abordagem. Os experimentos evidenciaram desempenho excelente na detecção de pratos, com valores de mAP50-95 próximos de 0,89, e desempenho moderado na detecção de alimentos, refletindo a maior complexidade da tarefa. Observou-se que a redução progressiva das classes do conjunto de dados FoodRepo contribuiu para aumentar a estabilidade do treinamento, e o congelamento parcial de camadas acelerou o processo sem perda significativa de desempenho. A arquitetura “small” apresentou o melhor equilíbrio entre desempenho e custo computacional para a detecção de alimentos, enquanto a arquitetura nano mostrou-se suficiente para a detecção de pratos. Assim, o estudo contribui para a área de “food computing” ao demonstrar como a preparação adequada dos dados e a seleção criteriosa dos hiperparâmetros são fatores determinantes para otimizar o desempenho desses modelos.

Entre as limitações identificadas, destacam-se a elevada variabilidade visual dos alimentos e o desbalanceamento entre as classes do conjunto de dados, o que exigiu o agrupamento de categorias pouco representadas e pode reduzir a capacidade do modelo de distinguir alimentos específicos. Adicionalmente, a avaliação foi realizada exclusivamente com o dataset FoodRepo, não sendo investigado o desempenho do modelo em outros conjuntos de dados ou em imagens obtidas em condições reais de uso. Como trabalhos futuros, sugere-se a evolução do modelo desenvolvido para uma aplicação prática de reconhecimento automático de refeições. Isso inclui o desenvolvimento de um aplicativo capaz de identificar alimentos em imagens, estimar informações nutricionais como calorias e macronutrientes, e fornecer uma avaliação da qualidade da refeição, visando auxiliar usuários no monitoramento alimentar e na promoção de hábitos mais saudáveis.

Referências Bibliográficas

Bossard, L.; Guillaumin, M.; Van Gool, L. “Food-101: Mining Discriminative Components with Random Forests”. In: European Conference on Computer Vision (ECCV), 2014.

Ciocca, G.; Napoletano, P.; Scalfati, S. “Food recognition and leftover estimation for smart diet monitoring”. Pattern Recognition Letters, v. 143, p. 37–43, 2021.

Everingham, M.; Eslami, S. M. A.; Van Gool, L.; Williams, C. K. I.; Winn, J.; Zisserman, A. “The Pascal visual object classes challenge: a retrospective”. International Journal of Computer Vision, v. 111, p. 98–136, 2015.

Goodfellow, I.; Bengio, Y.; Courville, A. “Deep learning”. Cambridge: MIT Press, 2016.

Jocher, G.; Chaurasia, A.; Qiu, J. “Ultralytics YOLOv8”. 2023. Disponível em: <https://github.com/ultralytics/ultralytics>. Acesso em: 4 out. 2025.

Kawano, Y.; Yanai, K. “Food image recognition with deep convolutional features”. In: Proceedings of the 2015 ACM International Joint Conference on Pervasive and Ubiquitous Computing (UbiComp), 2015.

Lin, T.-Y.; Maire, M.; Belongie, S.; Bourdev, L.; Girshick, R.; Hays, J.; Perona, P.; Ramanan, D.; Dollár, P.; Zitnick, C. L. “Microsoft COCO: Common Objects in Context”. In: Proceedings of the European Conference on Computer Vision (ECCV), 2014.

Monteiro, C. A.; Moubarac, J.-C.; Cannon, G.; Ng, S. W.; Popkin, B. “Ultra-processed products are becoming dominant in the global food system”. Obesity Reviews, v. 14(Suppl. 2), p. 21-28, 2013.

ONU Organização das Nações Unidas. “Agenda 2030 para o desenvolvimento sustentável”. Nova York: ONU, 2015. Disponível em: <https://brasil.un.org/pt-br/sdgs>. Acesso em: 4 out. 2025.

Popkin, B. M. “Nutrition transition and the global diabetes epidemic”. Current Diabetes Reports, v. 15, n. 9, p. 64, 2015.

Redmon, J.; Divvala, S.; Girshick, R.; Farhadi, A. “You Only Look Once: Unified, Real-Time Object Detection”. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2016.

Shorten, C.; Khoshgoftaar, T. M. “A survey on image data augmentation for deep learning”. Journal of Big Data, v. 6, n. 1, p. 60, 2019.

Varghese, R.; Sambath, M. 2024. “YOLOv8: a novel object detection algorithm with enhanced performance and robustness”. In: International Conference on Advances in Data Engineering and Intelligent Computing Systems (ADICS), 2024, Chennai, Índia. Anais… p. 1 6.

Artigo oriundo de Trabalho de Conclusão de Curso da Especialização em Data Science e Analytics do MBA USP/Esalq

Para saber mais sobre o curso, clique aqui e acesse a plataforma MBX Academy

Você também pode gostar

09 de outubro de 2026

Baixa Produção de Conteúdo Gerado Pelo Usuário em Colaborações de Cosméticos nas Plataformas Digitais

Este estudo analisou a relação entre colaborações de marcas, conhecidas como “collabs”, no setor de cosméticos e a produção de conteúdo gerado pelo usuário (UGC) em plataformas digitais. A pesquisa abordou a relevância do tema diante do crescimento do mercado de beleza e da intensificação das estratégias de “co-branding” como ferramenta de diferenciação e inovação. O objetivo principal foi compreender de que forma essas colaborações influenciaram o comportamento do consumidor digital, com foco na criação de UGC e na intenção de compra. Para isso, a metodologia adotada foi exploratória e descritiva, com a aplicação de um questionário online a 493 respondentes da região Sudeste do Brasil. Os dados coletados foram analisados por meio de estatística descritiva. Os resultados indicaram que, embora as “collabs” gerassem engajamento entre os consumidores, a produção de UGC ativo foi baixa, predominando interações passivas como curtidas, salvamentos e reações rápidas. Adicionalmente, as colaborações demonstraram influência limitada na intenção de compra e na disposição a pagar mais pelos produtos. Concluiu-se que, apesar do potencial estratégico das “collabs” para o mercado de cosméticos, sua efetividade dependeu de fatores como a relevância percebida, a identificação com a marca e a presença de estímulos adicionais para a criação de conteúdo pelo usuário.

Palavras-chave: Comportamento online; Co-branding; Engajamento do consumidor; Intenção de compra; Interação digital.

09 de outubro de 2026

Ferramentas e técnicas de gestão do tempo utilizadas por técnicos da capacitação profissional rural e promoção social

A gestão do tempo configura-se como um elemento essencial para a melhoria da produtividade e da qualidade das entregas, ao permitir a organização, priorização e execução eficiente das atividades, contribuindo diretamente para o alcance de metas e a otimização dos resultados no contexto profissional e pessoal. Objetivou-se compreender como práticas, ferramentas e técnicas de gestão do tempo, adotadas por instrutores de formação profissional rural e de promoção social, se associaram a dois desfechos centrais: a realização das atividades diárias planejadas e a percepção do impacto dessas práticas no bem-estar e produtividade. Os dados foram coletados por meio de questionário on-line estruturado, composto por 18 questões, e as análises foram realizadas no ambiente Python com bibliotecas estatísticas. Os resultados revelaram que a elevada formação acadêmica e maturidade profissional não se traduziu em maior eficácia na gestão do tempo. Observou-se amplo conhecimento sobre ferramentas e técnicas, mas sua utilização prática foi limitada e desigual. Ferramentas mais simples e intuitivas, como listas de tarefas, apresentaram maior adesão, enquanto técnicas que exigem transformações comportamentais, como a Técnica Pomodoro, tiveram baixa aplicação. Houve predominância do uso de soluções digitais, com destaque para o Google Agenda. Evidenciou-se uma percepção quase unânime de que a gestão do tempo influencia diretamente a produtividade e o bem-estar. Concluiu-se que a melhoria da gestão do tempo não dependeu exclusivamente da adoção de ferramentas e técnicas, mas, sobretudo, do desenvolvimento de habilidades práticas e comportamentais, aliado a ajustes nas condições de trabalho.

Palavras-chave: 5W2H; Matriz de Eisenhower; Matriz GUT; Multitarefa; Procrastinação.

09 de outubro de 2026

Análise de Correspondência Aplicada a Dados Periciais: Identificação de Padrões Para Melhoria dos Serviços de Atendimento

A necessidade de otimizar recursos e compreender a complexa dinâmica criminal motivou a exploração de dados periciais, frequentemente subutilizados em laudos textuais. Aplicou-se a Análise de Correspondência Múltipla (ACM) em atendimentos periciais na Macrorregião de Bauru, SP. O objetivo foi investigar e identificar padrões de associação entre o tipo de ocorrência, o período do dia, o dia da semana e a localização, visando subsidiar decisões operacionais. Utilizaram-se dados da Superintendência da Polícia Técnico-Científica (SPTC), coletados entre maio de 2023 e janeiro de 2026. A metodologia englobou a limpeza, transformação e categorização das variáveis, além da construção de matrizes de contingência processadas em Python. A análise descritiva inicial revelou que furtos e colisões predominaram no volume total de ocorrências, enquanto crimes violentos, como homicídios, estupros e feminicídios, representaram uma parcela menor, mas demandaram tempos de resposta significativamente maiores. A ACM mapeou visualmente as correlações estruturais, demonstrando associações claras entre crimes noturnos e de finais de semana com regiões específicas. Identificaram-se dois agrupamentos principais: um perfil noturno e de fim de semana, associado a choques, atropelamentos e suicídios, com destaque para Bauru; e um perfil diurno em dias úteis, dominado por furtos e danos à propriedade. Demonstrou-se que o uso de técnicas exploratórias de aprendizado de máquina transformou dados periciais brutos em informações estratégicas vitais, fornecendo subsídios para a alocação eficiente de equipes e fundamentando a elaboração de políticas públicas baseadas em evidências.

Palavras-chave: Crimes violentos; Matriz de contingência; Priorização de serviços; Python; Tempos de resposta.

09 de outubro de 2026

O comportamento das gerações de consumidores digitais de materiais para construção: análise da Geração X

Analisou-se o comportamento da Geração X na compra de materiais para construção, considerando a articulação entre canais digitais e físicos e as percepções de varejistas e indústrias sobre esse processo. O objetivo foi investigar como esse público utiliza os canais digitais e físicos no processo decisório e relacionar os achados às respostas de varejistas e indústrias. Realizou-se uma pesquisa descritiva e exploratória, com abordagem quantitativa e interpretação qualitativa, por meio de três questionários aplicados a 37 consumidores, 25 varejistas e 25 representantes da indústria. Os dados de cada grupo foram analisados separadamente e, em seguida, relacionados por eixos temáticos. Os resultados indicaram que os consumidores da Geração X utilizam meios digitais para pesquisa e comparação, mas valorizam a loja física para contato com o produto, confiança e atendimento consultivo. Os varejistas reconheceram a transformação, mas apresentaram diferentes níveis de adaptação, enquanto as indústrias relataram uso heterogêneo de tecnologias e reconheceram seu papel de apoio ao varejo. Concluiu-se que o comportamento da Geração X se caracteriza por uma jornada híbrida, que exige maior integração entre os canais e os agentes da cadeia de materiais para construção.

Palavras-chave: Comportamento do consumidor; Geração X; Jornada de compra híbrida; Transformação digital; Varejo de materiais para construção.

Neurociência E Aprendizagem Na Educação

09 de outubro de 2026

Fundamentos para estruturação de currículos baseados em habilidades de raciocínio

Nas últimas décadas, observou-se uma transição educacional de modelos focados em conteúdo para o desenvolvimento de competências, impulsionada pela ubiquidade da informação. Nesse contexto, as habilidades de raciocínio tornaram-se pedagogicamente cruciais por embasarem a compreensão, relação e adaptação de conteúdos em cenários complexos. Com base nessa perspectiva, buscou-se consolidar um modelo detalhado das habilidades que compõem o raciocínio cognitivo, visando servir de base para a elaboração de currículos e programas pedagógicos. Para tanto, realizou-se uma pesquisa qualitativa e exploratória, que envolveu uma síntese multidisciplinar de conhecimentos da filosofia da mente, epistemologia, semiótica, psicologia cognitiva e neurociência. Essa abordagem proporcionou uma visão abrangente da natureza e das funções do raciocínio humano. O modelo resultante classificou as habilidades em quatro funções cognitivas principais, subdivididas em níveis crescentes de complexidade, que acompanharam o desenvolvimento cognitivo humano. A estrutura final mostrou-se bem fundamentada e aplicável à elaboração de currículos e programas pedagógicos, oferecendo uma taxonomia de habilidades do raciocínio diretamente utilizável no sequenciamento instrucional e na avaliação de competências cognitivas.

Palavras-chave: Currículo baseado em competências; Desenvolvimento cognitivo; Habilidades cognitivas; Pensamento crítico; Raciocínio cognitivo.

Inscreva-se em nossa newsletter!

Receba conteúdos e fique sempre atualizado sobre as novidades em gestão, liderança e carreira com a Revista E&S.

Ao preencher o formulário você está ciente de que podemos enviar comunicações e conteúdos da Revista E&S. Confira nossa Política de Privacidade