09 de octubre de 2026
Detección de Alimentos en Imágenes de Comidas por Medio de Redes YOLOv8
Detección de Alimentos en Imágenes de Comidas por Medio de Redes Yolov8
Luis Felipe de Oliveira Bergamim; Gustavo Dantas Lobo
DOI: 10.22167/2675-6528-202603218
Artículo derivado del Trabajo de Conclusión de Curso (TCC), con contenido basado en el trabajo original del alumno y adaptado al formato editorial de la Revista E&S con el apoyo de la herramienta ResumeAI, solución de inteligencia artificial desarrollada por el Instituto Pecege para síntesis y organización textual.
Resumen
El reconocimiento automático de alimentos en imágenes de comidas es un problema relevante en áreas como el monitoreo nutricional, la salud y los sistemas inteligentes, pero presenta desafíos debido a la alta variabilidad visual de los alimentos, la superposición entre elementos y la ausencia de estructuras bien definidas. En este contexto, el estudio investigó la viabilidad del uso de técnicas de visión computacional para la detección automática de alimentos en imágenes de comidas. Se exploraron diferentes variantes del modelo YOLOv8 con pesos pre-entrenados y ajustes progresivos en hiperparámetros, arquitecturas y esquemas de congelamiento de capas. Se adoptó el dataset FoodRepo para el entrenamiento, tras modificaciones que redujeron y agruparon clases, haciéndolas más adecuadas al alcance de la aplicación. Se condujeron experimentos comparando arquitecturas nano, small y medium, además de diferentes optimizadores y pesos de las funciones de pérdida. Los resultados indicaron un desempeño excelente en la detección de platos y un desempeño moderado en la detección de alimentos, coherente con la complejidad visual de las clases y la variabilidad del conjunto de datos. Se observó que la reducción de clases aumentó la estabilidad del entrenamiento y que el congelamiento parcial de capas aceleró el proceso sin pérdida significativa de desempeño. Se demostró la viabilidad técnica del uso de modelos YOLOv8 para la detección automática de alimentos en imágenes de comidas, contribuyendo a avances en el área de food computing.
Palabras clave: Detección de alimentos; Detección de objetos; Transferencia de aprendizaje; Visión por computadora; YOLOv8.
1. Introducción
En las últimas décadas, la creciente disponibilidad de alimentos para gran parte de la población mundial ha representado un avance significativo en la lucha contra el hambre. Sin embargo, este progreso ha ido acompañado de un aumento expresivo en los índices de obesidad y de enfermedades crónicas no transmisibles, como la diabetes tipo 2 y las enfermedades cardiovasculares, ampliamente relacionadas con el consumo de productos ultraprocesados (Popkin, 2015; Monteiro et al., 2013). Este fenómeno, conocido como transición nutricional, se caracteriza por la sustitución de dietas tradicionales por patrones alimentarios ricos en artículos industrializados e hipercalóricos, configurando un desafío de salud pública a escala global.
La Organización de las Naciones Unidas, a través de la Agenda 2030, estableció entre sus Objetivos de Desarrollo Sostenible el compromiso de garantizar una vida sana y promover el bienestar para todos (ONU, 2015). En el contexto brasileño, tales desafíos se vuelven aún más evidentes ante la creciente presencia de alimentos ultraprocesados en la dieta de la población y la dificultad de acceso a herramientas simplificadas que ayuden a interpretar la calidad nutricional de las comidas. En este escenario, soluciones tecnológicas basadas en visión computacional emergen como alternativas prometedoras para apoyar elecciones alimentarias más conscientes.
En este contexto, el reconocimiento automático de alimentos en imágenes se ha destacado como una tecnología prometedora para apoyar diferentes aplicaciones prácticas en el área de la salud y la nutrición. Los sistemas capaces de identificar alimentos a partir de fotografías pueden ayudar en el monitoreo de la ingesta alimentaria, en la estimación de la composición nutricional de las comidas, en el seguimiento de pacientes con enfermedades crónicas, en aplicaciones de educación alimentaria y en estudios epidemiológicos sobre hábitos alimentarios. Además, la automatización de este proceso reduce la necesidad de registros alimentarios realizados manualmente, haciendo la evaluación nutricional más rápida, objetiva y escalable.
Los modelos de aprendizaje profundo, especialmente aquellos basados en redes neuronales convolucionales, han demostrado un rendimiento robusto en tareas de reconocimiento de imágenes, incluidas aplicaciones relacionadas con el sector alimentario. Entre estos enfoques, destaca la familia de modelos YOLO (“You Only Look Once”), ampliamente utilizada para la detección de objetos en tiempo real debido al equilibrio entre precisión y velocidad (Redmon et al., 2016; Varghese & Sambath, 2024). Estas características hacen que YOLOv8 sea particularmente adecuado para aplicaciones que requieren un procesamiento eficiente y una posible ejecución en tiempo real, como sistemas automatizados de reconocimiento de alimentos. La disponibilidad de grandes conjuntos de datos anotados, como FoodRepo, junto con el avance de bibliotecas modernas de aprendizaje profundo, ha facilitado el desarrollo de sistemas capaces de identificar automáticamente artículos alimenticios presentes en fotografías.
La problemática que orienta este estudio reside en la dificultad de desarrollar modelos capaces de identificar automáticamente los alimentos presentes en imágenes de comidas con precisión satisfactoria, ante la elevada variabilidad visual entre los ítems alimentarios, la superposición entre objetos y el gran número de categorías posibles, factores ampliamente reconocidos como desafiantes en la literatura.
La necesidad de herramientas eficientes para el monitoreo nutricional y la superación de los desafíos inherentes a la detección de alimentos en imágenes justifican la relevancia de esta investigación. Ante este contexto, el objetivo de este trabajo es evaluar la viabilidad del uso de modelos de visión computacional basados en la arquitectura YOLOv8 para la detección automática de alimentos en imágenes de comidas. Para ello, se analizaron diferentes configuraciones del modelo, incluyendo variaciones de arquitectura, estrategias de transferencia de aprendizaje y ajustes de hiperparámetros, con el fin de identificar la configuración que proporcionara el mejor equilibrio entre rendimiento y costo computacional en la tarea de detección de alimentos.
2. Material y Métodos
La investigación se llevó a cabo con carácter aplicado y experimental, empleando métodos cuantitativos para el desarrollo de un enfoque de visión computacional. El estudio se centró en la detección automática de alimentos en imágenes, buscando evaluar la viabilidad técnica de modelos de detección de objetos aplicados al reconocimiento de componentes de comidas. La construcción y evaluación de un modelo de detección de alimentos en imágenes constituyeron el foco exclusivo de este trabajo.
El proceso metodológico se estructuró en etapas secuenciales, abarcando desde la revisión bibliográfica y la preparación de los datos hasta el entrenamiento y la evaluación experimental de los modelos de detección de alimentos. Este enfoque sistemático permitió la investigación en profundidad de las diferentes configuraciones y parámetros que influyen en el rendimiento de los modelos de visión computacional.
Inicialmente, se realizó una revisión de la literatura sobre reconocimiento automático de alimentos, nutrición computacional y aprendizaje automático. El objetivo fue fundamentar teóricamente la investigación y orientar la selección de las técnicas empleadas. La revisión destacó la eficacia de los modelos de la familia YOLO para la detección de objetos en tiempo real (Redmon et al., 2016; Jocher et al., 2023) y la relevancia del “transfer learning” y “fine-tuning” para la optimización del entrenamiento (Ciocca et al., 2021; Varghese & Sambath, 2024).
A continuación, se procedió a la selección y preparación del conjunto de datos. Se utilizó el “dataset” público FoodRepo, que contiene 54.392 imágenes y 100.256 anotaciones distribuidas en 323 clases de alimentos. Este conjunto de datos, ya con cajas delimitadoras y segmentaciones anotadas, fue adaptado al formato YOLOv8, eliminando la necesidad de crear un “dataset” propio y siguiendo prácticas consolidadas en investigaciones de clasificación y segmentación de alimentos (Ciocca et al., 2021).
El conjunto de datos fue inspeccionado y estandarizado, incluyendo ajustes de resolución, normalización y reorganización de los directorios de entrenamiento, validación y prueba. Adicionalmente, se realizaron adaptaciones en las clases del “dataset” mediante tres esquemas progresivos de agrupamiento (v1, v2 y v3). El objetivo fue reducir redundancias, minimizar el desbalanceo entre categorías y aumentar la estabilidad del entrenamiento.
Cada esquema de agrupamiento fue evaluado en dos variantes: una automática (A), generada por script con reglas predefinidas, y una manual (M), refinada con base en criterios visuales y nutricionales para reducir ambigüedades. Seis configuraciones distintas del “dataset” (v1_A, v1_M, v2_A, v2_M, v3_A y v3_M) fueron evaluadas experimentalmente, y la configuración con mejor rendimiento fue seleccionada para los experimentos subsiguientes. Técnicas de “data augmentation”, como variaciones de iluminación, rotación y escala, fueron aplicadas conforme a las recomendaciones de la literatura (Shorten & Khoshgoftaar, 2019).
La estrategia de transferencia de aprendizaje se implementó inicializando los modelos con pesos previamente entrenados en grandes conjuntos de datos de detección de objetos. Durante el entrenamiento, parte de las capas iniciales de la red se mantuvo congelada (“frozen layers”), impidiendo la actualización de sus pesos. Este enfoque tuvo como objetivo preservar características visuales genéricas, reducir el tiempo de entrenamiento y mitigar el riesgo de sobreajuste (“overfitting”) en conjuntos de datos específicos. Se evaluaron diferentes cantidades de capas congeladas para determinar la configuración ideal.
Los experimentos se realizaron en el entorno Google Colab, que ofrece soporte para aceleración por GPU, permitiendo la ejecución del entrenamiento de los modelos dentro de las limitaciones computacionales típicas de entornos accesibles. El ajuste de los hiperparámetros se llevó a cabo de forma secuencial y experimental, alterando un factor a la vez para aislar el impacto individual de cada parámetro en el rendimiento del modelo.
Entre los hiperparámetros evaluados, se compararon los optimizadores SGD (“Stochastic Gradient Descent”), Adam y AdamW. El SGD realiza actualizaciones basadas en el gradiente con tasa de aprendizaje fija, mientras que Adam y AdamW combinan estimaciones adaptativas de los momentos de los gradientes, con AdamW desacoplando la regularización (“weight decay”). La configuración automática del framework Ultralytics, que corresponde al uso del AdamW, también fue considerada. Las arquitecturas YOLOv8 nano, “small” y “medium” fueron comparadas, diferenciándose por la cantidad de parámetros, profundidad de la red y costo computacional.
También se evaluó la influencia de diferentes configuraciones de los pesos de las funciones de pérdida (box, cls y dfl) utilizadas por YOLOv8 durante el entrenamiento. El parámetro “box” controló la importancia del error de localización de las cajas delimitadoras, “cls” ponderó el error de clasificación de las clases detectadas y “dfl” ajustó la precisión de la regresión de las coordenadas. La alteración de estos pesos permitió priorizar aspectos específicos del entrenamiento, como la precisión en la localización o en la clasificación.
Los modelos fueron entrenados durante 100 épocas, siguiendo la configuración por defecto del framework YOLOv8. Para los experimentos con alimentos, se registró el tiempo total de entrenamiento, mientras que para el conjunto de platos, debido a su menor complejidad, se optó por presentar el tiempo medio por época. La evaluación de los modelos se realizó mediante métricas ampliamente utilizadas en tareas de detección de objetos.
Las métricas empleadas incluyeron precisión (“precision”), revocación (“recall”), F1-Score y “mean Average Precision” (mAP). La precisión midió la proporción de detecciones correctas en relación al total de detecciones, penalizando falsos positivos (Everingham et al., 2015). La revocación representó la proporción de objetos reales correctamente detectados, reduciendo falsos negativos (Everingham et al., 2015).
El F1-Score, que corresponde a la media armónica entre precisión y recall, se utilizó como métrica de equilibrio, siendo útil en escenarios con “datasets” desbalanceados (Goodfellow et al., 2016). El mAP, calculado a partir de las Average Precisions (AP) individuales, evaluó el rendimiento medio entre todas las clases. El mAP50 consideró detecciones correctas con IoU mayor o igual a 0,50, mientras que el mAP50-95 evaluó el rendimiento para múltiples umbrales de IoU, de 0,50 a 0,95, conforme al benchmark COCO (Lin et al., 2014; Jocher et al., 2023).
3. Resultados y Discusión
La presente sección detalla los experimentos llevados a cabo con el conjunto de datos FoodRepo para la detección automática de alimentos en imágenes de comidas, presentando la evaluación del rendimiento de los modelos entrenados. Los resultados obtenidos proporcionan una comprensión profunda de la viabilidad de la arquitectura YOLOv8 para esta tarea compleja, considerando las variaciones visuales y la diversidad inherente a los artículos alimentarios. El análisis abarca tanto aspectos cuantitativos, a través de métricas de rendimiento, como cualitativos, examinando las predicciones del modelo en escenarios reales, lo que permite una evaluación exhaustiva de la eficacia del enfoque propuesto.
Resultados Cuantitativos
Los resultados cuantitativos se presentan de acuerdo con la secuencia metodológica adoptada, lo que permite un análisis sistemático del impacto de cada estrategia de entrenamiento en el rendimiento del modelo. Inicialmente, se evaluó la influencia de la reducción y agrupación de las clases del conjunto de datos FoodRepo, seguido de la comparación entre las arquitecturas YOLOv8, la congelación de capas, el ajuste de hiperparámetros y, finalmente, la configuración final de los modelos. Este enfoque secuencial garantiza que el efecto de cada modificación pueda aislarse y comprenderse en relación con el objetivo general del estudio.
La primera etapa experimental se centró en la evaluación de diferentes versiones de la reducción del conjunto de datos FoodRepo, con el objetivo de equilibrar la cantidad de ejemplos por clase y minimizar la redundancia entre categorías nutricionalmente similares. Las agregaciones se realizaron basándose en criterios visuales y nutricionales, agrupando alimentos con apariencia similar o baja representatividad para aumentar la estabilidad del entrenamiento. Se probaron tres esquemas de reducción (v1, v2 y v3), cada uno con variantes automática (A) y manual (M), que incluyeron el agrupamiento de ítems como granos, vegetales cocidos y otros alimentos poco frecuentes en clases más amplias, según la metodología descrita.
Los resultados comparativos de las versiones del conjunto de datos indicaron que la versión v3_M presentó el mejor rendimiento general. Esta configuración alcanzó un mAP50 de 0,3598 y un mAP50-95 de 0,2705, superando significativamente las demás alternativas probadas, que variaron de 0,1366 a 0,2924 para mAP50 y de 0,1048 a 0,2161 para mAP50-95. La superioridad de la v3_M puede atribuirse al mayor nivel de consolidación de las clases, que reunió categorías poco representadas en grupos alimentarios más amplios, promoviendo mayor estabilidad y representatividad de los datos para el entrenamiento del modelo. En función de este rendimiento, la versión v3_M fue seleccionada para todas las etapas subsecuentes del entrenamiento, garantizando consistencia en la evaluación de los demás hiperparámetros.
Tras la definición de la versión optimizada del conjunto de datos, se procedió a la comparación entre las arquitecturas YOLOv8, específicamente las variantes nano, “small” y “medium”. El entrenamiento se realizó durante cien épocas, buscando un equilibrio entre rendimiento y coste computacional para la detección de alimentos y platos. Para la detección de alimentos, la arquitectura “small” demostró el mejor compromiso, alcanzando un mAP50 de 0,4043 y un mAP50-95 de 0,3104, con un F1-Score de 0,4361, en un tiempo de entrenamiento de dos horas y doce minutos. Aunque la variante “medium” presentó métricas ligeramente superiores (mAP50 de 0,4350 y mAP50-95 de 0,3360), su tiempo de entrenamiento fue más del doble, totalizando cuatro horas y cuarenta y dos minutos, lo que justificó la elección de la arquitectura “small” para alimentos debido a su eficiencia.
Para la detección de platos, la arquitectura nano reveló un rendimiento equivalente o superior a las variantes mayores, con un mAP50 de 0,9926, mAP50-95 de 0,8532 y F1-Score de 0,9781, en solo trece segundos por época. Las arquitecturas “small” y “medium” presentaron mAP50-95 de 0,8654 y 0,8209, respectivamente, con tiempos por época de quince y veinticinco segundos. El rendimiento excepcionalmente elevado en la detección de platos es esperado, ya que los platos son objetos grandes, centralizados y con bordes bien definidos, lo que simplifica la tarea de detección. Estos hallazgos corroboran la literatura, que sugiere que los modelos menores tienden a generalizar bien en tareas más simples, mientras que los modelos intermedios son más adecuados para tareas multiclase de mayor complejidad.
A continuación, se evaluó el impacto de la estrategia de congelación de capas durante el proceso de transferencia de aprendizaje. Para el conjunto de datos de alimentos, se observó que el mAP50-95 alcanzó 0,309 con una capa congelada y 0,304 con dos capas, con el F1-Score correspondiente de 0,457 y 0,441. A partir de diez capas congeladas, el rendimiento comenzó a degradarse significativamente, alcanzando 0,224 para mAP50-95 y 0,366 para F1-Score, y cayendo a 0,097 y 0,262, respectivamente, con veintidós capas. Con base en estos resultados, la configuración de dos capas congeladas se seleccionó como la ideal para la detección de alimentos, ya que proporcionó un buen equilibrio entre la adaptación del modelo y la preservación de las características pre-entrenadas, evitando la pérdida de rendimiento.
Para el conjunto de datos de platos, también se analizó la congelación de capas, revelando que el mAP50-95 se mantuvo estable en torno a 0,858 con una y dos capas congeladas, y 0,850 con tres capas, con el F1-Score en 0,993, 0,978 y 0,965, respectivamente. A partir de diez capas congeladas, el rendimiento comenzó a disminuir, alcanzando 0,768 para mAP50-95 y 0,920 para F1-Score, y cayendo a 0,521 y 0,706 con veintidós capas. Se eligió la configuración de cuatro capas congeladas para la detección de platos, ya que demostró buena estabilidad y rendimiento, junto con la simplicidad del modelo. Estos resultados indican que la congelación parcial de capas es una estrategia eficaz para optimizar el entrenamiento, equilibrando la especialización del modelo con la preservación de conocimientos preexistentes.
En la etapa de ajuste de hiperparámetros, se compararon diferentes algoritmos de optimización. Para la detección de alimentos, el optimizador automático (AdamW) demostró el mejor rendimiento, con mAP50 de 0,404, mAP50-95 de 0,309 y F1-Score de 0,457. El SGD y el Adam presentaron resultados inferiores, con mAP50-95 de 0,290 y 0,279, respectivamente. Para la detección de platos, el optimizador SGD superó a los demás, alcanzando mAP50 de 0,994, mAP50-95 de 0,864 y F1-Score de 0,984. El optimizador automático (AdamW) y el Adam obtuvieron mAP50-95 de 0,858, ligeramente por debajo del SGD. La elección del optimizador adecuado es crucial para la convergencia y el rendimiento del modelo, y estos hallazgos se incorporaron en las configuraciones finales.
La evaluación del impacto de la alteración de los pesos de las funciones de pérdida también se realizó. Para la detección de alimentos, la modificación del peso de la función de pérdida de clasificación (cls = 1,75) resultó en un mAP50 de 0,408 y mAP50-95 de 0,310, con un F1-Score de 0,449, indicando una leve mejora en el mAP50-95 en comparación con los pesos estándar. Para la detección de platos, la modificación del peso de la función de pérdida de la caja delimitadora (box = 9,5) mejoró la precisión de las cajas, resultando en mAP50 de 0,993, mAP50-95 de 0,869 y F1-Score de 0,975. Estas optimizaciones en los pesos de las funciones de pérdida permitieron refinar el proceso de entrenamiento, priorizando aspectos específicos de la detección para maximizar la precisión.
La configuración final seleccionada para el modelo de detección de alimentos combinó la arquitectura “small”, el uso de dos capas congeladas y el optimizador automático (AdamW), con sus respectivos hiperparámetros y pesos de las funciones de pérdida ajustados. Este modelo final obtuvo una precisión de 0,520, recall de 0,425, mAP50 de 0,438, mAP50-95 de 0,344 y F1-Score de 0,467. Este rendimiento se considera moderado, reflejando la alta complejidad visual de la tarea de detección de alimentos, caracterizada por la diversidad de clases, la superposición de elementos y las variaciones de iluminación, factores ampliamente reconocidos como desafiantes en la literatura (Varghese & Sambath, 2024; Redmon et al., 2016).
Para el modelo de detección de platos, la configuración final utilizó la arquitectura nano, con cuatro capas congeladas y el optimizador SGD, también con sus hiperparámetros y pesos de las funciones de pérdida correspondientes. Este modelo alcanzó una precisión de 0,975, recall de 1,000, mAP50 de 0,993, mAP50-95 de 0,887 y F1-Score de 0,987. El excelente rendimiento del modelo de platos demuestra su alta estabilidad y capacidad de generalización para objetos con características visuales bien definidas, lo que es consistente con la menor complejidad intrínseca de la tarea de identificar un plato en comparación con la detección de múltiples alimentos en una comida.
Análisis Cualitativo de las Predicciones del Modelo
Además de las métricas cuantitativas, se realizó una evaluación cualitativa de las predicciones del modelo entrenado con la arquitectura “small” en imágenes reales de comidas. Este análisis visual complementa los resultados numéricos, permitiendo observar el comportamiento de la red en situaciones complejas y validar su capacidad de detección en escenarios prácticos, según lo recomendado por la literatura para modelos de visión computacional (Ciocca et al., 2021; Kawano & Yanai, 2015). La inspección visual de las predicciones ofrece información sobre las fortalezas y limitaciones del modelo que no se capturan completamente con las métricas agregadas.
En un ejemplo de comida compuesta por ensalada, verduras y otros elementos frescos, el modelo logró identificar correctamente diferentes componentes, atribuyendo a las regiones correspondientes las clases “salad” y “vegetables”. Esta capacidad de discriminar múltiples grupos de alimentos en un solo plato refuerza el potencial del enfoque basado en YOLO para apoyar sistemas automáticos de reconocimiento de alimentos en imágenes de comidas (Varghese & Sambath, 2024; Redmon et al., 2016). En otro escenario, con un plato que contenía ensalada, carne y arroz negro, el modelo obtuvo un rendimiento satisfactorio al identificar correctamente la ensalada y clasificó el arroz negro como verduras (“vegetables”), de forma consistente con sus clases agrupadas. El modelo también identificó correctamente la carne, demostrando su capacidad para reconocer proteínas animales incluso en situaciones de superposición visual con otros alimentos.
Sin embargo, el análisis cualitativo también reveló que algunos elementos menores o parcialmente ocultos recibieron clasificaciones genéricas. Aunque esta clasificación no es semánticamente precisa, refleja las limitaciones derivadas de la estrategia de reducción de clases adoptada en el conjunto de datos, donde alimentos visualmente similares se agruparon para mejorar la frecuencia por clase, según lo sugerido por la literatura en escenarios con conjuntos de datos desequilibrados (Goodfellow et al., 2016; Shorten & Khoshgoftaar, 2019). Esta observación es compatible con la naturaleza altamente variable de los alimentos y con los desafíos descritos por Bossard et al. (2014) sobre la diversidad intra-clase, que dificulta la distinción de elementos específicos en categorías amplias.
Estos análisis cualitativos refuerzan dos puntos centrales. En primer lugar, el modelo demuestra una capacidad de generalización adecuada para grupos alimentarios amplios, exhibiendo estabilidad en la detección de ensaladas, legumbres y fuentes proteicas, lo que concuerda con los resultados de estudios anteriores (Ciocca et al., 2021). En segundo lugar, las limitaciones observadas, como la clasificación genérica de ítems específicos, se derivan principalmente de la granularidad reducida de las clases utilizada durante la etapa de agrupamiento del conjunto de datos, y no de fallos inherentes a la arquitectura YOLOv8. Esto evidencia el impacto significativo de las decisiones de preparación de los datos en el rendimiento final del modelo, destacando la importancia de un balanceo cuidadoso entre la simplificación de las clases y la preservación de la especificidad para aplicaciones futuras.
En resumen, los experimentos demostraron la viabilidad técnica del uso de modelos YOLOv8 para la detección automática de alimentos en imágenes de comidas. La reducción progresiva de las clases del conjunto de datos y la selección criteriosa de la arquitectura “small” para alimentos y “nano” para platos, junto con la congelación parcial de capas y el ajuste de hiperparámetros, fueron cruciales para optimizar el rendimiento. Aunque el modelo alcanzó un rendimiento moderado en la detección de alimentos debido a la complejidad visual y diversidad de clases, presentó resultados excelentes en la detección de platos, confirmando su capacidad para identificar objetos bien definidos. Las limitaciones observadas están más relacionadas con la granularidad de las clases del conjunto de datos que con fallos intrínsecos a la arquitectura, lo que indica que la preparación de los datos es un factor determinante para el éxito de la aplicación.
4. Conclusión
Este trabajo investigó la viabilidad de la utilización de modelos de visión computacional basados en la arquitectura YOLOv8 para la detección automática de alimentos en imágenes de comidas, ante la elevada variabilidad visual y la complejidad inherente a la tarea. Por medio de una evaluación experimental sistemática, que exploró diferentes variantes del modelo YOLOv8, ajustes en hiperparámetros, arquitecturas y esquemas de congelamiento de capas, se verificó la viabilidad técnica del enfoque. Los experimentos evidenciaron un desempeño excelente en la detección de platos, con valores de mAP50-95 cercanos a 0,89, y un desempeño moderado en la detección de alimentos, reflejando la mayor complejidad de la tarea. Se observó que la reducción progresiva de las clases del conjunto de datos FoodRepo contribuyó a aumentar la estabilidad del entrenamiento, y el congelamiento parcial de capas aceleró el proceso sin pérdida significativa de desempeño. La arquitectura “small” presentó el mejor equilibrio entre desempeño y costo computacional para la detección de alimentos, mientras que la arquitectura nano se mostró suficiente para la detección de platos. Así, el estudio contribuye al área de “food computing” al demostrar cómo la preparación adecuada de los datos y la selección criteriosa de los hiperparámetros son factores determinantes para optimizar el desempeño de estos modelos.
Entre las limitaciones identificadas, destacan la alta variabilidad visual de los alimentos y el desequilibrio entre las clases del conjunto de datos, lo que exigió la agrupación de categorías poco representadas y puede reducir la capacidad del modelo para distinguir alimentos específicos. Adicionalmente, la evaluación se realizó exclusivamente con el dataset FoodRepo, no investigándose el rendimiento del modelo en otros conjuntos de datos o en imágenes obtenidas en condiciones reales de uso. Como trabajos futuros, se sugiere la evolución del modelo desarrollado para una aplicación práctica de reconocimiento automático de comidas. Esto incluye el desarrollo de una aplicación capaz de identificar alimentos en imágenes, estimar información nutricional como calorías y macronutrientes, y proporcionar una evaluación de la calidad de la comida, con el objetivo de ayudar a los usuarios en el monitoreo alimentario y la promoción de hábitos más saludables.
Referencias Bibliográficas
Bossard, L.; Guillaumin, M.; Van Gool, L. “Food-101: Mining Discriminative Components with Random Forests”. In: European Conference on Computer Vision (ECCV), 2014.
Ciocca, G.; Napoletano, P.; Scalfati, S. “Food recognition and leftover estimation for smart diet monitoring”. Pattern Recognition Letters, v. 143, p. 37–43, 2021.
Everingham, M.; Eslami, S. M. A.; Van Gool, L.; Williams, C. K. I.; Winn, J.; Zisserman, A. “The Pascal visual object classes challenge: a retrospective”. International Journal of Computer Vision, v. 111, p. 98–136, 2015.
Goodfellow, I.; Bengio, Y.; Courville, A. “Deep learning”. Cambridge: MIT Press, 2016.
Jocher, G.; Chaurasia, A.; Qiu, J. “Ultralytics YOLOv8”. 2023. Disponível em: <https://github.com/ultralytics/ultralytics>. Acesso em: 4 out. 2025.
Kawano, Y.; Yanai, K. “Food image recognition with deep convolutional features”. In: Proceedings of the 2015 ACM International Joint Conference on Pervasive and Ubiquitous Computing (UbiComp), 2015.
Lin, T.-Y.; Maire, M.; Belongie, S.; Bourdev, L.; Girshick, R.; Hays, J.; Perona, P.; Ramanan, D.; Dollár, P.; Zitnick, C. L. “Microsoft COCO: Common Objects in Context”. In: Proceedings of the European Conference on Computer Vision (ECCV), 2014.
Monteiro, C. A.; Moubarac, J.-C.; Cannon, G.; Ng, S. W.; Popkin, B. “Ultra-processed products are becoming dominant in the global food system”. Obesity Reviews, v. 14(Suppl. 2), p. 21-28, 2013.
ONU Organização das Nações Unidas. “Agenda 2030 para o desenvolvimento sustentável”. Nova York: ONU, 2015. Disponível em: <https://brasil.un.org/pt-br/sdgs>. Acesso em: 4 out. 2025.
Popkin, B. M. “Nutrition transition and the global diabetes epidemic”. Current Diabetes Reports, v. 15, n. 9, p. 64, 2015.
Redmon, J.; Divvala, S.; Girshick, R.; Farhadi, A. “You Only Look Once: Unified, Real-Time Object Detection”. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2016.
Shorten, C.; Khoshgoftaar, T. M. “A survey on image data augmentation for deep learning”. Journal of Big Data, v. 6, n. 1, p. 60, 2019.
Varghese, R.; Sambath, M. 2024. “YOLOv8: a novel object detection algorithm with enhanced performance and robustness”. In: International Conference on Advances in Data Engineering and Intelligent Computing Systems (ADICS), 2024, Chennai, Índia. Anais… p. 1 6.
Artículo originado del Trabajo de Conclusión de Curso de la Especialización en Data Science y Analytics del MBA USP/Esalq
Para saber más sobre el curso, haga clic aquí y acceda a la plataforma MBX Academy