02 de octubre de 2026
Determinantes de la ubicación de supermercados en São Paulo
Determinantes de la Ubicación de Supermercados en São Paulo
Fernando Lima Trambacos; Hugo Bampi
DOI: 10.22167/2675-6528-202602900
Artículo derivado de Trabajo de Fin de Curso (TCC), con contenido basado en el trabajo original del estudiante y adaptado al formato editorial de la Revista E&S con el apoyo de la herramienta ResumeAI, una solución de inteligencia artificial desarrollada por el Instituto Pecege para la síntesis y organización textual.
Resumen
Un estudio investigó los factores determinantes de la ubicación de supermercados en el estado de São Paulo, con el objetivo de investigar los factores que explican la presencia y expansión de estos establecimientos, considerando dimensiones socioeconómicas, demográficas y de mercado. Se utilizaron datos de los Censos Demográficos de 2010 y 2022 del IBGE y información del Cadastro Nacional de Pessoas Jurídicas de la Receita Federal do Brasil para construir una base de datos georreferenciada. Se aplicó un modelo de clasificación Random Forest, ajustado por grid search con validación cruzada, priorizando la métrica recall-macro debido al desbalanceo de la variable dependiente, que representó la presencia o ausencia de supermercados en un buffer de 50 metros. Los resultados indicaron que la ubicación de supermercados está fuertemente asociada a características demográficas, de ingresos y de población en el entorno. El análisis de importancia de las variables evidenció que factores sociodemográficos, como alfabetización de ancianos, ingresos familiares y la presencia de otros establecimientos de alimentación, ejercieron una influencia significativa, especialmente en el entorno inmediato. Los hallazgos reforzaron la hipótesis de que la distribución espacial de supermercados no es aleatoria, siendo condicionada por características socioeconómicas y por la estructura comercial del territorio, ofreciendo subsidios para decisiones empresariales y planificación urbana.
Palabras clave: Análisis espacial; Aprendizaje automático; Expansión; Ubicación comercial; Supermercados.
1. Introducción
El comercio minorista constituye uno de los sectores más relevantes de la economía brasileña, destacándose tanto por su impacto en el Producto Interno Bruto (PIB) como por su contribución social en la generación de empleos e ingresos. En 2023, el segmento generó una facturación neta operativa de 7,3 billones de reales (IBGE, 2023), consolidándose como uno de los principales motores de la actividad económica nacional. Además de su expresividad macroeconómica, el sector se destaca por su capacidad de absorber mano de obra, empleando a cerca de 10,6 millones de personas en 2024 (MTE, 2024), lo que representa una parte significativa de la fuerza laboral brasileña. Esta característica confiere al comercio minorista una gran importancia para el desarrollo económico y social, no solo por el volumen movilizado, sino también por su presencia capilarizada en prácticamente todos los municipios del país, alcanzando diversos estratos sociales y regiones del territorio.
Desde el punto de vista teórico y práctico, el comercio minorista está directamente asociado al comportamiento de consumo de las familias, funcionando como un eslabón esencial entre la producción y la demanda final. La proximidad con el consumidor final hace que sus dinámicas operativas reflejen, de forma sensible, variaciones en el poder adquisitivo, tendencias de consumo, transformaciones urbanas y políticas de desarrollo regional. En este sentido, el comercio minorista trasciende la esfera económica, configurándose como un fenómeno social y territorial cuya comprensión es fundamental para analizar la organización del espacio urbano y las dinámicas regionales de Brasil.
Entre los diversos segmentos que componen el sector minorista, el supermercado ocupa una posición destacada, siendo el mayor de ellos. Los supermercados reúnen características que los hacen estratégicos para la economía y la sociedad. Este formato de negocio concentra una gran diversidad de productos, especialmente géneros alimenticios, atendiendo a una necesidad básica y universal de la población. Su relevancia en el abastecimiento cotidiano confiere a los supermercados un papel singular, convirtiéndolos en elementos estructurantes del consumo masivo y agentes de organización del espacio urbano. La instalación y expansión de estos establecimientos no solo impactan la circulación de personas y mercancías, sino que también influyen directamente en el desarrollo inmobiliario y la configuración de las centralidades comerciales en las ciudades.
A pesar de la relevancia del sector, la literatura académica aún no ha abordado en profundidad los factores determinantes de la ubicación de supermercados en Brasil. La ausencia de estudios sistemáticos sobre el tema representa una brecha significativa, ya que la comprensión de las variables que explican la instalación y expansión de este segmento puede generar información valiosa para diferentes públicos. Dicha brecha impide un análisis más completo de las dinámicas urbanas y económicas asociadas a este tipo de comercio.
Para los gestores privados, la comprensión de estos factores constituye un insumo estratégico para las decisiones de expansión territorial y asignación de inversiones. Para los formuladores de políticas públicas urbanísticas y económicas, el entendimiento de estos elementos ayuda en la planificación de las ciudades y en la promoción de un acceso más equitativo de la población a bienes de consumo esenciales. Este trabajo busca suplir esta laguna, con foco en el estado de São Paulo, por medio de la integración de bases de datos oficiales, como los Censos Demográficos de 2010 y 2022 del Instituto Brasileño de Geografía y Estadística (IBGE) y el Cadastro Nacional de Pessoas Jurídicas de la Receita Federal do Brasil, utilizando técnicas modernas de análisis de datos, en especial la metodología de bosque aleatorio. El objetivo general de este estudio es investigar los factores que explican la presencia y la expansión de supermercados en el territorio del estado de São Paulo, considerando dimensiones socioeconómicas, demográficas y de mercado.
2. Material y Métodos
La metodología de este estudio se caracterizó por un enfoque cuantitativo, que combinó la recopilación, integración y análisis de datos secundarios con el uso de técnicas avanzadas de modelado. El objetivo fue investigar los factores que explican la presencia y expansión de supermercados en el territorio del estado de São Paulo, según lo delineado en la introducción. Los procedimientos se estructuraron para capturar y analizar información sociodemográfica, de ingresos y de presencia de establecimientos comerciales en diferentes escalas espaciales.
Para la construcción de la base de datos, se utilizaron fuentes públicas oficiales. Las principales fueron los Censos Demográficos de 2010 (IBGE, 2011) y 2022 (IBGE, 2023), que proporcionaron datos sociodemográficos y de renta. Adicionalmente, se empleó la base de datos del Cadastro Nacional de Pessoas Jurídicas (CNPJ) de la Receita Federal do Brasil (RFB, 2025), que posibilitó la identificación de la ubicación y del perfil de las empresas brasileñas.
La recopilación y organización de los datos se realizaron en etapas secuenciales. Inicialmente, se obtuvieron los datos de los Censos Demográficos de 2010 y 2022 y se agregaron al nivel de sector censal. A partir de estas bases, se seleccionaron variables representativas de características sociodemográficas, como población, hogares, tipos de hogar, género, grupo de edad y alfabetización, y de ingresos de la población, incluyendo cantidad de hogares por grupo de ingresos e ingreso medio de los hogares.
En la siguiente etapa, se extrajeron las direcciones de los CNPJ activos de la base de datos de la Receita Federal do Brasil (RFB, 2025). Se consideraron segmentos específicos del comercio minorista y de servicios, como alimentación, atacarejo, carnicería y pescadería, farmacia, e hiper y supermercado, entre otros. Estas direcciones fueron geocodificadas a través de la API de geolocalización de ArcGIS (ESRI, 2025), permitiendo la identificación precisa de su ubicación espacial en el estado de São Paulo.
A continuación, se creó una malla teórica de 1.242.215 puntos, espaciados cada 50 metros, cubriendo todos los sectores censales clasificados como urbanos en el Censo Demográfico de 2022 (IBGE, 2023) en el estado de São Paulo. Para cada uno de estos puntos, se construyeron buffers, que son áreas circulares con radios de 50, 500, 1.000, 2.000, 3.000, 4.000 y 5.000 metros, con el propósito de capturar información del entorno inmediato y ampliado de cada ubicación teórica.
La información censal se agregó a cada buffer, con proporcionalización para sectores parcialmente contenidos. Para los datos empresariales, se realizó el recuento de CNPJs de cada segmento comercial dentro de cada buffer. La base de datos final, con 1.029 variables, sintetizó información sociodemográfica, de ingresos y de presencia de establecimientos comerciales para cada punto teórico y diferentes buffers. La variable dependiente se definió como binaria (1 para existencia, 0 para ausencia de supermercados en el buffer de 50 metros), con ajuste a un valor máximo de 1, dada la improbabilidad de múltiples establecimientos distintos en un área tan restringida y el enfoque del estudio en la presencia o ausencia.
Para el análisis de los datos, se utilizó un método de aprendizaje automático de tipo Random Forest clasificatoria. Este algoritmo, basado en árboles de decisión, se empleó para estimar la probabilidad de presencia de supermercados, agregando predicciones individuales para mayor robustez y reducción de sobreajuste. La capacidad del Random Forest de capturar relaciones no lineales y manejar grandes volúmenes de datos fue un factor determinante para su elección.
Con el objetivo de optimizar el rendimiento del modelo, se realizó un procedimiento de búsqueda en cuadrícula con validación cruzada (tres folds, cv = 3). Se buscó la combinación de hiperparámetros que maximizara la métrica recall-macro, elegida debido al fuerte desbalanceo de la variable dependiente. Esta métrica garantizó la correcta identificación de las áreas con ocurrencia de supermercados, priorizando la reducción de falsos negativos.
Los hiperparámetros ajustados en la búsqueda en cuadrícula incluyeron: `n_estimators` (50, 100, 150), `max_depth` (6, 10, 14), `min_samples_split` (10, 50, 100) y `min_samples_leaf` (5, 20, 50). Adicionalmente, para mitigar los efectos del desbalanceo de la base de datos, se adoptó el procedimiento de `sample_weight`, ajustando los pesos de las observaciones. Las categorías menos frecuentes recibieron pesos proporcionalmente mayores, confiriendo mayor relevancia relativa a la presencia de supermercados.
3. Resultados y Discusión
La investigación reveló insights significativos sobre los factores que determinan la ubicación de supermercados en el estado de São Paulo, confirmando la hipótesis de que su distribución no es aleatoria, sino sistemáticamente influenciada por características territoriales específicas. La aplicación del modelo de clasificación Random Forest permitió la identificación e interpretación de factores socioeconómicos, demográficos y de mercado cruciales. Estos hallazgos ofrecen una comprensión integral de la compleja interacción de variables que moldean los patrones espaciales de la presencia de supermercados, contribuyendo tanto a la literatura académica como a decisiones prácticas en planificación urbana y estrategias de expansión del comercio minorista. La capacidad del modelo para capturar estas relaciones intrincadas subraya su utilidad para el objetivo central del estudio.
El proceso de optimización del modelo Random Forest, realizado mediante una búsqueda en cuadrícula con validación cruzada en tres pliegues, identificó una configuración de hiperparámetros que maximizó la métrica recall-macro. Esta configuración incluyó una profundidad máxima de los árboles de seis, un mínimo de cinco observaciones por hoja, un mínimo de diez observaciones para división y cincuenta árboles estimadores. La elección del recall-macro como métrica principal fue esencial debido al desequilibrio de la clase en la base de datos, donde la ausencia de supermercados era significativamente más frecuente. Este enfoque garantizó que el modelo priorizara la identificación correcta de las áreas con supermercados, minimizando falsos negativos y alineándose al objetivo de mapear potenciales lugares de instalación.
La evaluación del rendimiento del modelo en la base de entrenamiento demostró una precisión de 0,7162, con un recall-macro elevado de 0,8058, indicando una buena capacidad para identificar correctamente las clases asociadas a la presencia de supermercados. Aunque la precisión-macro fue relativamente baja, en 0,5152, reflejando la dificultad inherente a la distinción entre categorías en un contexto de fuerte desbalanceo, el F1-score ponderado de 0,8249 sugirió un buen rendimiento global. Esta métrica ponderada ofrece una evaluación equilibrada del desempeño del modelo, considerando tanto la precisión como el recall, lo cual es fundamental en escenarios con clases desiguales.
En la base de prueba, los resultados se mantuvieron consistentes con los observados en el entrenamiento, presentando una precisión de 0,7151 y un F1-score ponderado de 0,8243. Esta estabilidad entre las bases de entrenamiento y prueba indica una ausencia de sobreajuste relevante, demostrando la capacidad de generalización del modelo para datos no observados anteriormente. Hubo una pequeña reducción en el recall-macro a 0,7971 en la base de prueba, señalando una dificultad marginalmente mayor en identificar correctamente todas las clases de ocurrencia de supermercados fuera de la muestra de entrenamiento. Sin embargo, la consistencia general de las métricas refuerza la robustez del modelo para los propósitos exploratorios y analíticos del estudio.
El análisis de la matriz de confusión para la base de datos de prueba ilustró la distribución de las clasificaciones del modelo. Para la clase mayoritaria, que representa la ausencia de supermercados (clase 0), el modelo clasificó correctamente 263.148 observaciones, mientras que 105.727 fueron falsos positivos, es decir, áreas sin supermercado predichas erróneamente como si tuvieran uno. Para la clase minoritaria, que indica la presencia de supermercados (clase 1), el modelo identificó correctamente 3.338 observaciones, pero clasificó 452 como falsos negativos, es decir, áreas con supermercado predichas como si no tuvieran uno. Esta predominancia de clasificaciones en la clase mayoritaria, incluso con los ajustes metodológicos, refleja la dificultad para discriminar eventos menos frecuentes en un contexto de fuerte desbalanceo de los datos.
A pesar de las limitaciones en la precisión para la clase minoritaria, los resultados globales confirman la idoneidad del Random Forest como herramienta exploratoria y explicativa para el fenómeno estudiado. Los indicadores de desempeño, especialmente el recall-macro, demuestran que el modelo es capaz de capturar patrones consistentes asociados a la localización de supermercados. Esta capacidad es particularmente valiosa para estimar las probabilidades de ocurrencia de estos establecimientos en el territorio urbano, conforme a los objetivos del estudio. La metodología empleada, con el ajuste de los pesos de las muestras, contribuyó a mitigar los efectos del desbalanceo, permitiendo un análisis más enfocado en la identificación de las áreas con mayor potencial de instalación de supermercados.
Importancia de las variables
El análisis de las medidas de importancia de las variables, uno de los principales resultados del modelo Random Forest, proporcionó evidencias robustas sobre los factores determinantes de la localización de supermercados. Las métricas indicaron que variables relacionadas con el perfil sociodemográfico y el capital humano de la población figuran entre las más relevantes, ejerciendo una influencia significativa en la ocurrencia de estos establecimientos. Esta relevancia se acentúa particularmente para los datos observados en los buffers más inmediatos, de 50 y 500 metros, sugiriendo que las características del entorno cercano son cruciales para la decisión de instalación. La identificación de estas variables más importantes permite comprender qué atributos del territorio son más predictivos para la presencia de supermercados, alineándose directamente con el objetivo de investigar los factores explicativos.
Entre las variables de mayor importancia, la alfabetización de personas con 60 años o más, conforme al Censo de 2022, se destacó como la variable individual más relevante en el buffer de 50 metros. Este hallazgo sugiere que la presencia de una población de mayor edad y con mayor nivel de escolaridad en el entorno inmediato es un factor significativo para la localización de supermercados. Esta correlación puede indicar que estas áreas poseen una demanda más estable por productos de consumo diario, además de una mayor capacidad de planificación de compras y acceso a información, lo que las hace más atractivas para el sector supermercadista. La presencia de capital humano más desarrollado en la vecindad inmediata parece ser un atractivo importante para la instalación de estos establecimientos.
La variable asociada a la presencia de otros establecimientos del sector de la alimentación también resultó altamente relevante, ocupando la segunda posición en importancia en el buffer de 500 metros y una posición destacada en el buffer de 50 metros. Esta constatación sugiere que los supermercados tienden a instalarse en áreas ya consolidadas como polos comerciales, beneficiándose de las economías de aglomeración. La coexistencia con otros negocios de alimentación puede indicar una complementariedad de actividades y un mayor flujo de consumidores, lo que potencia el éxito del nuevo emprendimiento. Este patrón refuerza la idea de que la ubicación es estratégica y busca sinergias comerciales, optimizando el acceso a una base de clientes ya establecida.
Las variables relacionadas con los ingresos del hogar también destacaron entre las más importantes, con énfasis en los ingresos totales de la clase C1 en el buffer de 50 metros. Además, los indicadores de ingresos y el número de hogares de las clases C2 y DE también figuraron como variables explicativas, aunque con menor peso relativo. La predominancia de estas variables en escalas espaciales restringidas indica que el segmento de supermercados prioriza áreas con una masa crítica de consumidores y un poder adquisitivo compatible con su modelo de negocio. Esta elección estratégica tiene como objetivo garantizar un flujo de clientes con capacidad de consumo adecuada, optimizando el potencial de mercado en el entorno inmediato de la instalación y asegurando la viabilidad económica del emprendimiento.
La relevancia de variables asociadas a la densidad de personas y hogares fue igualmente notable. La cantidad de hogares particulares permanentes del Censo de 2010 y la cantidad de hogares particulares permanentes ocupados del Censo de 2022, ambas en el buffer de 50 metros, demostraron alta importancia. Específicamente, la población de 60 años o más en el buffer de 50 metros también se mostró como un factor relevante. Estos hallazgos sugieren que una mayor concentración de potenciales consumidores en la inmediación de los supermercados genera una demanda más regular por compras de proximidad, haciendo estas áreas más atractivas para la instalación de nuevos establecimientos y para la sostenibilidad del negocio.
El análisis de la importancia de las variables reveló que las características del entorno más inmediato, específicamente en los buffers de 50 y 500 metros, ejercen una influencia preponderante en la explicación de la ubicación de los supermercados. Esto sugiere que las decisiones de expansión e instalación son altamente sensibles a las condiciones micro-locales, como el perfil sociodemográfico del vecindario, el nivel de ingresos y la estructura comercial existente. La capacidad del modelo para identificar estos patrones en diferentes escalas espaciales, con destaque para la proximidad, refuerza la comprensión de que la distribución espacial de los supermercados es un fenómeno complejo, guiado por una combinación estratégica de factores que buscan optimizar el acceso al mercado consumidor.
En resumen, los resultados empíricos obtenidos refuerzan la hipótesis central del estudio de que la ubicación de supermercados en el estado de São Paulo no es un evento aleatorio. Por el contrario, la presencia de estos establecimientos está fuertemente condicionada por una combinación de características sociodemográficas, como la alfabetización de ancianos y la densidad poblacional, además del nivel de ingresos de los hogares y la estructura comercial del entorno, especialmente la presencia de otros establecimientos de alimentación. La predominancia del entorno más inmediato en la explicación de estos patrones subraya la importancia de un análisis detallado de las condiciones locales para decisiones estratégicas de ubicación, proporcionando subsidios valiosos para la planificación urbana y para el sector minorista.
4. Conclusión
Este estudio investigó los factores determinantes de la ubicación de supermercados en el estado de São Paulo, considerando dimensiones socioeconómicas, demográficas y de mercado. Se verificó que la distribución espacial de estos establecimientos no ocurre de forma aleatoria, siendo fuertemente condicionada por características territoriales específicas. El análisis de los hallazgos, obtenidos a través de un modelo de clasificación Random Forest, evidenció que factores sociodemográficos, como la alfabetización de personas mayores de 60 años, la renta familiar, especialmente de la clase C1, y la densidad de hogares y población en el entorno inmediato, ejercieron una influencia significativa. Se observó, además, que la presencia de otros establecimientos del sector de alimentación en las proximidades también se mostró como un factor relevante, sugiriendo que los supermercados tienden a instalarse en áreas ya consolidadas como polos comerciales, beneficiándose de economías de aglomeración y de un flujo de consumidores ya establecido. La predominancia de las características del entorno más inmediato, en los buffers de 50 y 500 metros, subraya la sensibilidad de las decisiones de ubicación a las condiciones micro-locales.
La metodología empleada, basada en el bosque aleatorio y ajustada para priorizar la métrica recall-macro, demostró ser adecuada para manejar la elevada dimensionalidad de los datos y las relaciones no lineales entre las variables explicativas. Aunque el modelo presentó limitaciones en términos de precisión para clases menos frecuentes, su desempeño general y la estabilidad entre las bases de entrenamiento y prueba indicaron robustez suficiente para los propósitos exploratorios y analíticos del estudio. Los resultados ofrecen una contribución práctica sustancial, proporcionando subsidios valiosos para empresas del sector supermercado en la orientación de estrategias de expansión territorial y en la identificación de áreas con mayor potencial de mercado. Para el sector público, las evidencias producidas contribuyen a la comprensión de la relación entre la distribución de servicios esenciales y la estructura socioespacial de las ciudades, pudiendo apoyar políticas de planificación urbana y la promoción de un acceso más equitativo de la población a bienes de consumo.
Referencias Bibliográficas
ESRI. ArcGIS Geocoding service | ArcGIS REST APIs. Disponível em: https://developers.arcgis.com/rest/geocode/. Acesso em: 01/10/2025.
Instituto Brasileiro de Geografia e Estatística [IBGE]. 2010. Censo Demográfico 2010: resultados gerais da população e domicílios. IBGE, Rio de Janeiro, IBGE, RJ. Disponível em: https://www.ibge.gov.br/estatisticas/sociais/populacao/9662-censo-demografico-2010.html. Acesso em: 21/10/2025.
Instituto Brasileiro de Geografia e Estatística [IBGE]. 2023. Censo Demográfico 2022: resultados preliminares/população. IBGE, Rio de Janeiro, RJ. Disponível em: https://www.ibge.gov.br/estatisticas/sociais/populacao/27069-censo-demografico-2022.html. Acesso em: 21/10/2025.
Ministério do Trabalho e Emprego [MTE]. 2025. RAIS 2024: Sumário Executivo (Parcial). Ministério do Trabalho e Emprego, Brasília, DF. Disponível em: https://www.gov.br/trabalho-e-emprego/pt-br/assuntos/estatisticas-trabalho/rais/rais-2024/rais-2024-parcial/sumario-executivo_rais-2024-parcial.pdf. Acesso em: 21/10/2025.
Receita Federal do Brasil [RFB]. 2025. Cadastro Nacional da Pessoa Jurídica (CNPJs) [base de dados]. Receita Federal do Brasil, Brasília, DF. Disponível em: https://www.gov.br/receitafederal/pt-br/assuntos/orientacao-tributaria/cadastros/cnpj. Acesso em: 21/10/2025.
Artículo originario del Trabajo de Conclusión de Curso de la Especialización en Data Science y Analytics del MBA USP/Esalq
Para saber más sobre el curso, haz clic aquí y accede a la plataforma MBX Academy