09 de outubro de 2026
Detecção de Alimentos em Imagens de Refeições por Meio de Redes YOLOv8
Detecção de Alimentos em Imagens de Refeições por Meio de Redes Yolov8
Luis Felipe de Oliveira Bergamim; Gustavo Dantas Lobo
DOI: 10.22167/2675-6528-202603218
Artigo derivado de Trabalho de Conclusão de Curso (TCC), com conteúdo baseado no trabalho original do aluno e adaptado ao formato editorial da Revista E&S com apoio da ferramenta ResumeAI, solução de inteligência artificial desenvolvida pelo Instituto Pecege para síntese e organização textual.
Resumo
O reconhecimento automático de alimentos em imagens de refeições é um problema relevante em áreas como monitoramento nutricional, saúde e sistemas inteligentes, mas apresenta desafios devido à alta variabilidade visual dos alimentos, sobreposição entre itens e ausência de estruturas bem definidas. Nesse contexto, o estudo investigou a viabilidade do uso de técnicas de visão computacional para a detecção automática de alimentos em imagens de refeições. Explorou-se diferentes variantes do modelo YOLOv8 com pesos pré-treinados e ajustes progressivos em hiperparâmetros, arquiteturas e esquemas de congelamento de camadas. O dataset FoodRepo foi adotado para o treinamento, após modificações que reduziram e agruparam classes, tornando-as mais adequadas ao escopo da aplicação. Conduziram-se experimentos comparando arquiteturas nano, small e medium, além de diferentes otimizadores e pesos das funções de perda. Os resultados indicaram desempenho excelente na detecção de pratos e desempenho moderado na detecção de alimentos, coerente com a complexidade visual das classes e a variabilidade do conjunto de dados. Observou-se que a redução de classes aumentou a estabilidade do treinamento e que o congelamento parcial de camadas acelerou o processo sem perda significativa de desempenho. Demonstrou-se a viabilidade técnica do uso de modelos YOLOv8 para detecção automática de alimentos em imagens de refeições, contribuindo para avanços na área de food computing.
Palavras-chave: Detecção de alimentos; Detecção de objetos; Transferência de aprendizado; Visão computacional; YOLOv8.
1. Introdução
Nas últimas décadas, a crescente disponibilidade de alimentos para grande parte da população mundial representou um avanço significativo no combate à fome. Entretanto, esse progresso foi acompanhado por um aumento expressivo nos índices de obesidade e de doenças crônicas não transmissíveis, como diabetes tipo 2 e enfermidades cardiovasculares, amplamente relacionadas ao consumo de produtos ultraprocessados (Popkin, 2015; Monteiro et al., 2013). Esse fenômeno, conhecido como transição nutricional, caracteriza-se pela substituição de dietas tradicionais por padrões alimentares ricos em itens industrializados e hipercalóricos, configurando um desafio de saúde pública em escala global.
A Organização das Nações Unidas, por meio da Agenda 2030, estabeleceu entre seus Objetivos de Desenvolvimento Sustentável o compromisso de assegurar uma vida saudável e promover o bem-estar para todos (ONU, 2015). No contexto brasileiro, tais desafios tornam-se ainda mais evidentes diante da crescente presença de alimentos ultraprocessados na dieta da população e da dificuldade de acesso a ferramentas simplificadas que auxiliem na interpretação da qualidade nutricional das refeições. Nesse cenário, soluções tecnológicas baseadas em visão computacional emergem como alternativas promissoras para apoiar escolhas alimentares mais conscientes.
Nesse contexto, o reconhecimento automático de alimentos em imagens tem se destacado como uma tecnologia promissora para apoiar diferentes aplicações práticas na área da saúde e da nutrição. Sistemas capazes de identificar alimentos a partir de fotografias podem auxiliar no monitoramento da ingestão alimentar, na estimativa da composição nutricional das refeições, no acompanhamento de pacientes com doenças crônicas, em aplicativos de educação alimentar e em estudos epidemiológicos sobre hábitos alimentares. Além disso, a automatização desse processo reduz a necessidade de registros alimentares realizados manualmente, tornando a avaliação nutricional mais rápida, objetiva e escalável.
Modelos de aprendizado profundo, especialmente aqueles fundamentados em redes neurais convolucionais, têm demonstrado desempenho robusto em tarefas de reconhecimento de imagens, incluindo aplicações relacionadas ao setor alimentício. Entre essas abordagens, destaca-se a família de modelos YOLO (“You Only Look Once”), amplamente utilizada para detecção de objetos em tempo real devido ao equilíbrio entre precisão e velocidade (Redmon et al., 2016; Varghese & Sambath, 2024). Essas características tornam o YOLOv8 particularmente adequado para aplicações que demandam processamento eficiente e potencial execução em tempo real, como sistemas automatizados de reconhecimento de alimentos. A disponibilidade de grandes conjuntos de dados anotados, como o FoodRepo, aliado ao avanço de bibliotecas modernas de aprendizado profundo, tem facilitado o desenvolvimento de sistemas capazes de identificar automaticamente itens alimentares presentes em fotografias.
A problemática que orienta este estudo reside na dificuldade de desenvolver modelos capazes de identificar automaticamente os alimentos presentes em imagens de refeições com precisão satisfatória, diante da elevada variabilidade visual entre os itens alimentares, da sobreposição entre objetos e do grande número de categorias possíveis, fatores amplamente reconhecidos como desafiadores na literatura.
A necessidade de ferramentas eficientes para o monitoramento nutricional e a superação dos desafios inerentes à detecção de alimentos em imagens justificam a relevância desta pesquisa. Diante desse contexto, o objetivo deste trabalho é avaliar a viabilidade do uso de modelos de visão computacional baseados na arquitetura YOLOv8 para a detecção automática de alimentos em imagens de refeições. Para isso, foram analisadas diferentes configurações do modelo, incluindo variações de arquitetura, estratégias de transferência de aprendizado e ajustes de hiperparâmetros, com o intuito de identificar a configuração que proporcionasse o melhor equilíbrio entre desempenho e custo computacional na tarefa de detecção de alimentos.
2. Material e Métodos
A pesquisa foi conduzida com caráter aplicado e experimental, empregando métodos quantitativos para o desenvolvimento de uma abordagem de visão computacional. O estudo focou na detecção automática de alimentos em imagens, buscando avaliar a viabilidade técnica de modelos de detecção de objetos aplicados ao reconhecimento de componentes de refeições. A construção e avaliação de um modelo de detecção de alimentos em imagens constituíram o foco exclusivo deste trabalho.
O processo metodológico foi estruturado em etapas sequenciais, abrangendo desde o levantamento bibliográfico e a preparação dos dados até o treinamento e a avaliação experimental dos modelos de detecção de alimentos. Essa abordagem sistemática permitiu a investigação aprofundada das diferentes configurações e parâmetros que influenciam o desempenho dos modelos de visão computacional.
Inicialmente, realizou-se uma revisão da literatura sobre reconhecimento automático de alimentos, nutrição computacional e aprendizado de máquina. O objetivo foi fundamentar teoricamente a pesquisa e orientar a seleção das técnicas empregadas. A revisão destacou a eficácia dos modelos da família YOLO para detecção de objetos em tempo real (Redmon et al., 2016; Jocher et al., 2023) e a relevância do “transfer learning” e “fine-tuning” para otimização do treinamento (Ciocca et al., 2021; Varghese & Sambath, 2024).
Na sequência, procedeu-se à seleção e preparação do conjunto de dados. Utilizou-se o “dataset” público FoodRepo, que contém 54.392 imagens e 100.256 anotações distribuídas em 323 classes alimentares. Este conjunto de dados, já com caixas delimitadoras e segmentações anotadas, foi adaptado para o formato YOLOv8, eliminando a necessidade de criação de um “dataset” próprio e seguindo práticas consolidadas em pesquisas de classificação e segmentação de alimentos (Ciocca et al., 2021).
O conjunto de dados foi inspecionado e padronizado, incluindo ajustes de resolução, normalização e reorganização dos diretórios de treino, validação e teste. Adicionalmente, foram realizadas adaptações nas classes do “dataset” por meio de três esquemas progressivos de agrupamento (v1, v2 e v3). O objetivo foi reduzir redundâncias, minimizar o desbalanceamento entre categorias e aumentar a estabilidade do treinamento.
Cada esquema de agrupamento foi avaliado em duas variantes: uma automática (A), gerada por script com regras predefinidas, e uma manual (M), refinada com base em critérios visuais e nutricionais para reduzir ambiguidades. Seis configurações distintas do “dataset” (v1_A, v1_M, v2_A, v2_M, v3_A e v3_M) foram avaliadas experimentalmente, e a configuração com melhor desempenho foi selecionada para os experimentos subsequentes. Técnicas de “data augmentation”, como variações de iluminação, rotação e escala, foram aplicadas conforme recomendações da literatura (Shorten & Khoshgoftaar, 2019).
A estratégia de transferência de aprendizado foi implementada inicializando os modelos com pesos previamente treinados em grandes conjuntos de dados de detecção de objetos. Durante o treinamento, parte das camadas iniciais da rede foi mantida congelada (“frozen layers”), impedindo a atualização de seus pesos. Essa abordagem visou preservar características visuais genéricas, reduzir o tempo de treinamento e mitigar o risco de sobreajuste (“overfitting”) em conjuntos de dados específicos. Diferentes quantidades de camadas congeladas foram avaliadas para determinar a configuração ideal.
Os experimentos foram realizados no ambiente Google Colab, que oferece suporte a aceleração por GPU, permitindo a execução do treinamento dos modelos dentro das limitações computacionais típicas de ambientes acessíveis. O ajuste dos hiperparâmetros foi conduzido de forma sequencial e experimental, alterando um fator por vez para isolar o impacto individual de cada parâmetro no desempenho do modelo.
Entre os hiperparâmetros avaliados, compararam-se os otimizadores SGD (“Stochastic Gradient Descent”), Adam e AdamW. O SGD realiza atualizações baseadas no gradiente com taxa de aprendizado fixa, enquanto Adam e AdamW combinam estimativas adaptativas dos momentos dos gradientes, com AdamW desacoplando a regularização (“weight decay”). A configuração automática do framework Ultralytics, que corresponde ao uso do AdamW, também foi considerada. As arquiteturas YOLOv8 nano, “small” e “medium” foram comparadas, diferenciando-se pela quantidade de parâmetros, profundidade da rede e custo computacional.
Também se avaliou a influência de diferentes configurações dos pesos das funções de perda (box, cls e dfl) utilizadas pelo YOLOv8 durante o treinamento. O parâmetro “box” controlou a importância do erro de localização das caixas delimitadoras, “cls” ponderou o erro de classificação das classes detectadas e “dfl” ajustou a precisão da regressão das coordenadas. A alteração desses pesos permitiu priorizar aspectos específicos do treinamento, como a precisão na localização ou na classificação.
Os modelos foram treinados por 100 épocas, seguindo a configuração padrão do framework YOLOv8. Para os experimentos com alimentos, registrou-se o tempo total de treinamento, enquanto para o conjunto de pratos, devido à menor complexidade, optou-se por apresentar o tempo médio por época. A avaliação dos modelos foi realizada por meio de métricas amplamente utilizadas em tarefas de detecção de objetos.
As métricas empregadas incluíram precisão (“precision”), revocação (“recall”), F1-Score e “mean Average Precision” (mAP). A precisão mediu a proporção de detecções corretas em relação ao total de detecções, penalizando falsos positivos (Everingham et al., 2015). A revocação representou a proporção de objetos reais corretamente detectados, reduzindo falsos negativos (Everingham et al., 2015).
O F1-Score, que corresponde à média harmônica entre precisão e revocação, foi utilizado como métrica de equilíbrio, sendo útil em cenários com “datasets” desbalanceados (Goodfellow et al., 2016). A mAP, calculada a partir das Average Precisions (AP) individuais, avaliou o desempenho médio entre todas as classes. O mAP50 considerou detecções corretas com IoU maior ou igual a 0,50, enquanto o mAP50-95 avaliou o desempenho para múltiplos limiares de IoU, de 0,50 a 0,95, conforme o benchmark COCO (Lin et al., 2014; Jocher et al., 2023).
3. Resultados e Discussão
A presente seção detalha os experimentos conduzidos com o conjunto de dados FoodRepo para a detecção automática de alimentos em imagens de refeições, apresentando a avaliação do desempenho dos modelos treinados. Os resultados obtidos fornecem uma compreensão aprofundada da viabilidade da arquitetura YOLOv8 para esta tarefa complexa, considerando as variações visuais e a diversidade inerente aos itens alimentares. A análise abrange tanto aspectos quantitativos, por meio de métricas de desempenho, quanto qualitativos, examinando as predições do modelo em cenários reais, o que permite uma avaliação abrangente da eficácia da abordagem proposta.
Resultados Quantitativos
Os resultados quantitativos são apresentados em conformidade com a sequência metodológica adotada, permitindo uma análise sistemática do impacto de cada estratégia de treinamento no desempenho do modelo. Inicialmente, avaliou-se a influência da redução e agrupamento das classes do conjunto de dados FoodRepo, seguido pela comparação entre as arquiteturas YOLOv8, o congelamento de camadas, o ajuste de hiperparâmetros e, por fim, a configuração final dos modelos. Essa abordagem sequencial garante que o efeito de cada modificação possa ser isolado e compreendido em relação ao objetivo geral do estudo.
A primeira etapa experimental concentrou-se na avaliação de diferentes versões da redução do conjunto de dados FoodRepo, visando equilibrar a quantidade de exemplos por classe e minimizar a redundância entre categorias nutricionalmente semelhantes. As agregações foram realizadas com base em critérios visuais e nutricionais, agrupando alimentos com aparência similar ou baixa representatividade para aumentar a estabilidade do treinamento. Foram testados três esquemas de redução (v1, v2 e v3), cada um com variantes automática (A) e manual (M), que incluíram o agrupamento de itens como grãos, vegetais cozidos e outros alimentos pouco frequentes em classes mais amplas, conforme a metodologia descrita.
Os resultados comparativos das versões do conjunto de dados indicaram que a versão v3_M apresentou o melhor desempenho geral. Esta configuração alcançou um mAP50 de 0,3598 e um mAP50-95 de 0,2705, superando significativamente as demais alternativas testadas, que variaram de 0,1366 a 0,2924 para mAP50 e de 0,1048 a 0,2161 para mAP50-95. A superioridade da v3_M pode ser atribuída ao maior nível de consolidação das classes, que reuniu categorias pouco representadas em grupos alimentares mais amplos, promovendo maior estabilidade e representatividade dos dados para o treinamento do modelo. Em função desse desempenho, a versão v3_M foi selecionada para todas as etapas subsequentes do treinamento, garantindo consistência na avaliação dos demais hiperparâmetros.
Após a definição da versão otimizada do conjunto de dados, procedeu-se à comparação entre as arquiteturas YOLOv8, especificamente as variantes nano, “small” e “medium”. O treinamento foi realizado por cem épocas, buscando um equilíbrio entre desempenho e custo computacional para a detecção de alimentos e pratos. Para a detecção de alimentos, a arquitetura “small” demonstrou o melhor compromisso, atingindo um mAP50 de 0,4043 e um mAP50-95 de 0,3104, com um F1-Score de 0,4361, em um tempo de treinamento de duas horas e doze minutos. Embora a variante “medium” tenha apresentado métricas ligeiramente superiores (mAP50 de 0,4350 e mAP50-95 de 0,3360), seu tempo de treinamento foi mais que o dobro, totalizando quatro horas e quarenta e dois minutos, o que justificou a escolha da arquitetura “small” para alimentos devido à sua eficiência.
Para a detecção de pratos, a arquitetura nano revelou um desempenho equivalente ou superior às variantes maiores, com um mAP50 de 0,9926, mAP50-95 de 0,8532 e F1-Score de 0,9781, em apenas treze segundos por época. As arquiteturas “small” e “medium” apresentaram mAP50-95 de 0,8654 e 0,8209, respectivamente, com tempos por época de quinze e vinte e cinco segundos. O desempenho excepcionalmente elevado na detecção de pratos é esperado, pois os pratos são objetos grandes, centralizados e com bordas bem definidas, o que simplifica a tarefa de detecção. Esses achados corroboram a literatura, que sugere que modelos menores tendem a generalizar bem em tarefas mais simples, enquanto modelos intermediários são mais adequados para tarefas multiclasse de maior complexidade.
Em seguida, avaliou-se o impacto da estratégia de congelamento de camadas durante o processo de transferência de aprendizado. Para o conjunto de dados de alimentos, observou-se que o mAP50-95 alcançou 0,309 com uma camada congelada e 0,304 com duas camadas, com o F1-Score correspondente de 0,457 e 0,441. A partir de dez camadas congeladas, o desempenho começou a degradar significativamente, atingindo 0,224 para mAP50-95 e 0,366 para F1-Score, e caindo para 0,097 e 0,262, respectivamente, com vinte e duas camadas. Com base nesses resultados, a configuração de duas camadas congeladas foi selecionada como a ideal para a detecção de alimentos, pois proporcionou um bom equilíbrio entre a adaptação do modelo e a preservação das características pré-treinadas, evitando a perda de desempenho.
Para o conjunto de dados de pratos, o congelamento de camadas também foi analisado, revelando que o mAP50-95 se manteve estável em torno de 0,858 com uma e duas camadas congeladas, e 0,850 com três camadas, com o F1-Score em 0,993, 0,978 e 0,965, respectivamente. A partir de dez camadas congeladas, o desempenho começou a cair, atingindo 0,768 para mAP50-95 e 0,920 para F1-Score, e diminuindo para 0,521 e 0,706 com vinte e duas camadas. A configuração de quatro camadas congeladas foi escolhida para a detecção de pratos, pois demonstrou boa estabilidade e desempenho, aliada à simplicidade do modelo. Esses resultados indicam que o congelamento parcial das camadas é uma estratégia eficaz para otimizar o treinamento, equilibrando a especialização do modelo com a preservação de conhecimentos pré-existentes.
Na etapa de ajuste de hiperparâmetros, foram comparados diferentes algoritmos de otimização. Para a detecção de alimentos, o otimizador automático (AdamW) demonstrou o melhor desempenho, com mAP50 de 0,404, mAP50-95 de 0,309 e F1-Score de 0,457. O SGD e o Adam apresentaram resultados inferiores, com mAP50-95 de 0,290 e 0,279, respectivamente. Para a detecção de pratos, o otimizador SGD superou os demais, alcançando mAP50 de 0,994, mAP50-95 de 0,864 e F1-Score de 0,984. O otimizador automático (AdamW) e o Adam obtiveram mAP50-95 de 0,858, ligeiramente abaixo do SGD. A escolha do otimizador adequado é crucial para a convergência e o desempenho do modelo, e esses achados foram incorporados nas configurações finais.
A avaliação do impacto da alteração dos pesos das funções de perda também foi realizada. Para a detecção de alimentos, a modificação do peso da função de perda de classificação (cls = 1,75) resultou em um mAP50 de 0,408 e mAP50-95 de 0,310, com F1-Score de 0,449, indicando uma leve melhora no mAP50-95 em comparação com os pesos padrão. Para a detecção de pratos, a modificação do peso da função de perda de caixa delimitadora (box = 9,5) melhorou a precisão das caixas, resultando em mAP50 de 0,993, mAP50-95 de 0,869 e F1-Score de 0,975. Essas otimizações nos pesos das funções de perda permitiram refinar o processo de treinamento, priorizando aspectos específicos da detecção para maximizar a acurácia.
A configuração final selecionada para o modelo de detecção de alimentos combinou a arquitetura “small”, o uso de duas camadas congeladas e o otimizador automático (AdamW), com seus respectivos hiperparâmetros e pesos das funções de perda ajustados. Este modelo final obteve uma precisão de 0,520, recall de 0,425, mAP50 de 0,438, mAP50-95 de 0,344 e F1-Score de 0,467. Esse desempenho é considerado moderado, refletindo a alta complexidade visual da tarefa de detecção de alimentos, caracterizada pela diversidade de classes, sobreposição de itens e variações de iluminação, fatores amplamente reconhecidos como desafiadores na literatura (Varghese & Sambath, 2024; Redmon et al., 2016).
Para o modelo de detecção de pratos, a configuração final utilizou a arquitetura nano, com quatro camadas congeladas e o otimizador SGD, também com seus hiperparâmetros e pesos das funções de perda correspondentes. Este modelo alcançou uma precisão de 0,975, recall de 1,000, mAP50 de 0,993, mAP50-95 de 0,887 e F1-Score de 0,987. O desempenho excelente do modelo de pratos demonstra sua alta estabilidade e capacidade de generalização para objetos com características visuais bem definidas, o que é consistente com a menor complexidade intrínseca da tarefa de identificar um prato em comparação com a detecção de múltiplos alimentos em uma refeição.
Análise Qualitativa das Predições do Modelo
Além das métricas quantitativas, foi realizada uma avaliação qualitativa das predições do modelo treinado com a arquitetura “small” em imagens reais de refeições. Esta análise visual complementa os resultados numéricos, permitindo observar o comportamento da rede em situações complexas e validar sua capacidade de detecção em cenários práticos, conforme recomendado pela literatura para modelos de visão computacional (Ciocca et al., 2021; Kawano & Yanai, 2015). A inspeção visual das predições oferece insights sobre as forças e limitações do modelo que não são totalmente capturados pelas métricas agregadas.
Em um exemplo de refeição composta por salada, legumes e outros itens frescos, o modelo conseguiu identificar corretamente diferentes componentes, atribuindo às regiões correspondentes as classes “salad” e “vegetables”. Essa capacidade de discriminar múltiplos grupos alimentares em um único prato reforça o potencial da abordagem baseada em YOLO para apoiar sistemas automáticos de reconhecimento de alimentos em imagens de refeições (Varghese & Sambath, 2024; Redmon et al., 2016). Em outro cenário, com um prato contendo salada, carne e arroz negro, o modelo obteve desempenho satisfatório ao identificar corretamente a salada e classificou o arroz negro como legumes (“vegetables”), de forma consistente com suas classes agrupadas. O modelo também identificou corretamente a carne, demonstrando sua capacidade de reconhecer proteínas animais mesmo em situações de sobreposição visual com outros alimentos.
Contudo, a análise qualitativa também revelou que alguns itens menores ou parcialmente ocultos receberam classificações genéricas. Embora essa classificação não seja semanticamente precisa, ela reflete as limitações decorrentes da estratégia de redução de classes adotada no conjunto de dados, onde alimentos visualmente semelhantes foram agrupados para melhorar a frequência por classe, conforme sugerido pela literatura em cenários com conjuntos de dados desbalanceados (Goodfellow et al., 2016; Shorten & Khoshgoftaar, 2019). Essa observação é compatível com a natureza altamente variável dos alimentos e com os desafios descritos por Bossard et al. (2014) sobre a diversidade intra-classe, que dificulta a distinção de itens específicos em categorias amplas.
Essas análises qualitativas reforçam dois pontos centrais. Primeiramente, o modelo demonstra uma capacidade de generalização adequada para grupos alimentares amplos, exibindo estabilidade na detecção de saladas, legumes e fontes proteicas, o que está em concordância com resultados de estudos anteriores (Ciocca et al., 2021). Em segundo lugar, as limitações observadas, como a classificação genérica de itens específicos, decorrem principalmente da granularidade reduzida das classes utilizada durante a etapa de agrupamento do conjunto de dados, e não de falhas inerentes à arquitetura YOLOv8. Isso evidencia o impacto significativo das decisões de preparação dos dados no desempenho final do modelo, destacando a importância de um balanceamento cuidadoso entre a simplificação das classes e a preservação da especificidade para aplicações futuras.
Em síntese, os experimentos demonstraram a viabilidade técnica do uso de modelos YOLOv8 para a detecção automática de alimentos em imagens de refeições. A redução progressiva das classes do conjunto de dados e a seleção criteriosa da arquitetura “small” para alimentos e “nano” para pratos, juntamente com o congelamento parcial de camadas e o ajuste de hiperparâmetros, foram cruciais para otimizar o desempenho. Embora o modelo tenha alcançado um desempenho moderado na detecção de alimentos devido à complexidade visual e diversidade de classes, ele apresentou resultados excelentes na detecção de pratos, confirmando sua capacidade de identificar objetos bem definidos. As limitações observadas estão mais relacionadas à granularidade das classes do conjunto de dados do que a falhas intrínsecas à arquitetura, indicando que a preparação dos dados é um fator determinante para o sucesso da aplicação.
4. Conclusão
Este trabalho investigou a viabilidade da utilização de modelos de visão computacional baseados na arquitetura YOLOv8 para a detecção automática de alimentos em imagens de refeições, diante da elevada variabilidade visual e da complexidade inerente à tarefa. Por meio de uma avaliação experimental sistemática, que explorou diferentes variantes do modelo YOLOv8, ajustes em hiperparâmetros, arquiteturas e esquemas de congelamento de camadas, verificou-se a viabilidade técnica da abordagem. Os experimentos evidenciaram desempenho excelente na detecção de pratos, com valores de mAP50-95 próximos de 0,89, e desempenho moderado na detecção de alimentos, refletindo a maior complexidade da tarefa. Observou-se que a redução progressiva das classes do conjunto de dados FoodRepo contribuiu para aumentar a estabilidade do treinamento, e o congelamento parcial de camadas acelerou o processo sem perda significativa de desempenho. A arquitetura “small” apresentou o melhor equilíbrio entre desempenho e custo computacional para a detecção de alimentos, enquanto a arquitetura nano mostrou-se suficiente para a detecção de pratos. Assim, o estudo contribui para a área de “food computing” ao demonstrar como a preparação adequada dos dados e a seleção criteriosa dos hiperparâmetros são fatores determinantes para otimizar o desempenho desses modelos.
Entre as limitações identificadas, destacam-se a elevada variabilidade visual dos alimentos e o desbalanceamento entre as classes do conjunto de dados, o que exigiu o agrupamento de categorias pouco representadas e pode reduzir a capacidade do modelo de distinguir alimentos específicos. Adicionalmente, a avaliação foi realizada exclusivamente com o dataset FoodRepo, não sendo investigado o desempenho do modelo em outros conjuntos de dados ou em imagens obtidas em condições reais de uso. Como trabalhos futuros, sugere-se a evolução do modelo desenvolvido para uma aplicação prática de reconhecimento automático de refeições. Isso inclui o desenvolvimento de um aplicativo capaz de identificar alimentos em imagens, estimar informações nutricionais como calorias e macronutrientes, e fornecer uma avaliação da qualidade da refeição, visando auxiliar usuários no monitoramento alimentar e na promoção de hábitos mais saudáveis.
Referências Bibliográficas
Bossard, L.; Guillaumin, M.; Van Gool, L. “Food-101: Mining Discriminative Components with Random Forests”. In: European Conference on Computer Vision (ECCV), 2014.
Ciocca, G.; Napoletano, P.; Scalfati, S. “Food recognition and leftover estimation for smart diet monitoring”. Pattern Recognition Letters, v. 143, p. 37–43, 2021.
Everingham, M.; Eslami, S. M. A.; Van Gool, L.; Williams, C. K. I.; Winn, J.; Zisserman, A. “The Pascal visual object classes challenge: a retrospective”. International Journal of Computer Vision, v. 111, p. 98–136, 2015.
Goodfellow, I.; Bengio, Y.; Courville, A. “Deep learning”. Cambridge: MIT Press, 2016.
Jocher, G.; Chaurasia, A.; Qiu, J. “Ultralytics YOLOv8”. 2023. Disponível em: <https://github.com/ultralytics/ultralytics>. Acesso em: 4 out. 2025.
Kawano, Y.; Yanai, K. “Food image recognition with deep convolutional features”. In: Proceedings of the 2015 ACM International Joint Conference on Pervasive and Ubiquitous Computing (UbiComp), 2015.
Lin, T.-Y.; Maire, M.; Belongie, S.; Bourdev, L.; Girshick, R.; Hays, J.; Perona, P.; Ramanan, D.; Dollár, P.; Zitnick, C. L. “Microsoft COCO: Common Objects in Context”. In: Proceedings of the European Conference on Computer Vision (ECCV), 2014.
Monteiro, C. A.; Moubarac, J.-C.; Cannon, G.; Ng, S. W.; Popkin, B. “Ultra-processed products are becoming dominant in the global food system”. Obesity Reviews, v. 14(Suppl. 2), p. 21-28, 2013.
ONU Organização das Nações Unidas. “Agenda 2030 para o desenvolvimento sustentável”. Nova York: ONU, 2015. Disponível em: <https://brasil.un.org/pt-br/sdgs>. Acesso em: 4 out. 2025.
Popkin, B. M. “Nutrition transition and the global diabetes epidemic”. Current Diabetes Reports, v. 15, n. 9, p. 64, 2015.
Redmon, J.; Divvala, S.; Girshick, R.; Farhadi, A. “You Only Look Once: Unified, Real-Time Object Detection”. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2016.
Shorten, C.; Khoshgoftaar, T. M. “A survey on image data augmentation for deep learning”. Journal of Big Data, v. 6, n. 1, p. 60, 2019.
Varghese, R.; Sambath, M. 2024. “YOLOv8: a novel object detection algorithm with enhanced performance and robustness”. In: International Conference on Advances in Data Engineering and Intelligent Computing Systems (ADICS), 2024, Chennai, Índia. Anais… p. 1 6.
Artigo oriundo de Trabalho de Conclusão de Curso da Especialização em Data Science e Analytics do MBA USP/Esalq
Para saber mais sobre o curso, clique aqui e acesse a plataforma MBX Academy

