02 de outubro de 2026
Determinantes da localização de supermercados em São Paulo
Determinantes da Localização de Supermercados em São Paulo
Fernando Lima Trambacos; Hugo Bampi
DOI: 10.22167/2675-6528-202602900
Artigo derivado de Trabalho de Conclusão de Curso (TCC), com conteúdo baseado no trabalho original do aluno e adaptado ao formato editorial da Revista E&S com apoio da ferramenta ResumeAI, solução de inteligência artificial desenvolvida pelo Instituto Pecege para síntese e organização textual.
Resumo
Um estudo investigou os fatores determinantes da localização de supermercados no estado de São Paulo, com o objetivo de investigar os fatores que explicam a presença e a expansão desses estabelecimentos, considerando dimensões socioeconômicas, demográficas e mercadológicas. Utilizaram-se dados dos Censos Demográficos de 2010 e 2022 do IBGE e informações do Cadastro Nacional de Pessoas Jurídicas da Receita Federal do Brasil para construir um banco de dados georreferenciado. Aplicou-se um modelo de classificação Random Forest, ajustado por grid search com validação cruzada, priorizando a métrica recall-macro devido ao desbalanceamento da variável dependente, que representou a presença ou ausência de supermercados em um buffer de 50 metros. Os resultados indicaram que a localização de supermercados está fortemente associada a características demográficas, de renda e de população no entorno. A análise de importância das variáveis evidenciou que fatores sociodemográficos, como alfabetização de idosos, renda domiciliar e a presença de outros estabelecimentos de alimentação, exerceram influência significativa, especialmente no entorno imediato. Os achados reforçaram a hipótese de que a distribuição espacial de supermercados não é aleatória, sendo condicionada por características socioeconômicas e pela estrutura comercial do território, oferecendo subsídios para decisões empresariais e planejamento urbano.
Palavras-chave: Análise espacial; Aprendizado de máquina; Expansão; Localização comercial; Supermercados.
1. Introdução
O varejo constitui um dos setores mais relevantes da economia brasileira, destacando-se tanto pelo seu impacto no Produto Interno Bruto (PIB) quanto pela sua contribuição social na geração de empregos e renda. Em 2023, o segmento gerou uma receita operacional líquida de 7,3 trilhões de reais (IBGE, 2023), consolidando-se como um dos principais motores da atividade econômica nacional. Além de sua expressividade macroeconômica, o setor se sobressai pela capacidade de absorver mão de obra, empregando cerca de 10,6 milhões de pessoas em 2024 (MTE, 2024), o que representa uma parcela significativa da força de trabalho brasileira. Essa característica confere ao varejo uma grande importância para o desenvolvimento econômico e social, não apenas pelo volume movimentado, mas também por sua presença capilarizada em praticamente todos os municípios do país, alcançando diversos estratos sociais e regiões do território.
Do ponto de vista teórico e prático, o varejo está diretamente associado ao comportamento de consumo das famílias, funcionando como um elo essencial entre a produção e a demanda final. A proximidade com o consumidor final faz com que suas dinâmicas operacionais reflitam, de forma sensível, variações no poder de compra, tendências de consumo, transformações urbanas e políticas de desenvolvimento regional. Nesse sentido, o varejo transcende a esfera econômica, configurando-se como um fenômeno social e territorial cuja compreensão é fundamental para analisar a organização do espaço urbano e as dinâmicas regionais do Brasil.
Entre os diversos segmentos que compõem o setor varejista, o supermercadista ocupa uma posição de destaque, sendo o maior deles. Os supermercados reúnem características que os tornam estratégicos para a economia e a sociedade. Este formato de negócio concentra uma grande diversidade de produtos, especialmente gêneros alimentícios, atendendo a uma necessidade básica e universal da população. Sua relevância no abastecimento cotidiano confere aos supermercados um papel singular, tornando-os elementos estruturantes do consumo de massa e agentes de organização do espaço urbano. A instalação e expansão desses estabelecimentos não apenas impactam a circulação de pessoas e mercadorias, mas também influenciam diretamente o desenvolvimento imobiliário e a configuração das centralidades comerciais nas cidades.
Apesar da relevância do setor, a literatura acadêmica ainda não abordou de forma aprofundada os fatores determinantes da localização de supermercados no Brasil. A ausência de estudos sistemáticos sobre o tema representa uma lacuna significativa, pois a compreensão das variáveis que explicam a instalação e a expansão desse segmento pode gerar informações valiosas para diferentes públicos. Tal lacuna impede uma análise mais completa das dinâmicas urbanas e econômicas associadas a este tipo de comércio.
Para gestores privados, a compreensão desses fatores constitui um insumo estratégico para decisões de expansão territorial e alocação de investimentos. Para formuladores de políticas públicas urbanísticas e econômicas, o entendimento desses elementos auxilia no planejamento das cidades e na promoção de um acesso mais equitativo da população a bens de consumo essenciais. Este trabalho busca suprir essa lacuna, com foco no estado de São Paulo, por meio da integração de bases de dados oficiais, como os Censos Demográficos de 2010 e 2022 do Instituto Brasileiro de Geografia e Estatística (IBGE) e o Cadastro Nacional de Pessoas Jurídicas da Receita Federal do Brasil, utilizando técnicas modernas de análise de dados, em especial a metodologia de floresta randômica. O objetivo geral deste estudo é investigar os fatores que explicam a presença e a expansão de supermercados no território do estado de São Paulo, considerando dimensões socioeconômicas, demográficas e mercadológicas.
2. Material e Métodos
A metodologia deste estudo caracterizou-se por uma abordagem quantitativa, combinando a coleta, integração e análise de dados secundários com o emprego de técnicas avançadas de modelagem. O objetivo foi investigar os fatores que explicam a presença e a expansão de supermercados no território do estado de São Paulo, conforme delineado na introdução. Os procedimentos foram estruturados para capturar e analisar informações sociodemográficas, de renda e de presença de estabelecimentos comerciais em diferentes escalas espaciais.
Para a construção da base de dados, utilizaram-se fontes públicas oficiais. As principais foram os Censos Demográficos de 2010 (IBGE, 2011) e 2022 (IBGE, 2023), que forneceram dados sociodemográficos e de renda. Adicionalmente, empregou-se a base de dados do Cadastro Nacional de Pessoas Jurídicas (CNPJ) da Receita Federal do Brasil (RFB, 2025), que possibilitou a identificação da localização e do perfil das empresas brasileiras.
A coleta e organização dos dados ocorreram em etapas sequenciais. Inicialmente, os dados dos Censos Demográficos de 2010 e 2022 foram obtidos e agregados ao nível de setor censitário. A partir dessas bases, selecionaram-se variáveis representativas de características sociodemográficas, como população, domicílios, tipos de domicílio, gênero, faixa etária e alfabetização, e de renda da população, incluindo quantidade de domicílios por faixa de renda e renda média domiciliar.
Na etapa subsequente, extraíram-se os endereços dos CNPJs ativos da base da Receita Federal do Brasil (RFB, 2025). Foram considerados segmentos específicos do varejo e serviços, como alimentação, atacarejo, açougue e peixaria, farmácia, e hiper e supermercado, entre outros. Esses endereços foram geocodificados por meio da API de geolocalização do ArcGIS (ESRI, 2025), permitindo a identificação precisa de sua localização espacial no estado de São Paulo.
Em seguida, criou-se uma malha teórica de 1.242.215 pontos, espaçados a cada 50 metros, cobrindo todos os setores censitários classificados como urbanos no Censo Demográfico de 2022 (IBGE, 2023) no estado de São Paulo. Para cada um desses pontos, construíram-se buffers, que são áreas circulares com raios de 50, 500, 1.000, 2.000, 3.000, 4.000 e 5.000 metros, com o propósito de capturar informações do entorno imediato e ampliado de cada localização teórica.
As informações censitárias foram agregadas a cada buffer, com proporcionalização para setores parcialmente contidos. Para os dados empresariais, realizou-se a contagem de CNPJs de cada segmento comercial dentro de cada buffer. O banco de dados final, com 1.029 variáveis, sintetizou informações sociodemográficas, de renda e de presença de estabelecimentos comerciais para cada ponto teórico e diferentes buffers. A variável dependente foi definida como binária (1 para existência, 0 para ausência de supermercados no buffer de 50 metros), com ajuste para valor máximo de 1, dada a improbabilidade de múltiplos estabelecimentos distintos em área tão restrita e o foco do estudo na presença ou ausência.
Para a análise dos dados, utilizou-se um método de aprendizado de máquina do tipo Random Forest classificatória. Este algoritmo, baseado em árvores de decisão, foi empregado para estimar a probabilidade de presença de supermercados, agregando previsões individuais para maior robustez e redução de sobreajuste. A capacidade do Random Forest de capturar relações não lineares e lidar com grandes volumes de dados foi um fator determinante para sua escolha.
Com o objetivo de otimizar o desempenho do modelo, realizou-se um procedimento de grid search com validação cruzada (três folds, cv = 3). Buscou-se a combinação de hiperparâmetros que maximizasse a métrica recall-macro, escolhida devido ao forte desbalanceamento da variável dependente. Essa métrica garantiu a correta identificação das áreas com ocorrência de supermercados, priorizando a redução de falsos negativos.
Os hiperparâmetros ajustados no grid search incluíram: `n_estimators` (50, 100, 150), `max_depth` (6, 10, 14), `min_samples_split` (10, 50, 100) e `min_samples_leaf` (5, 20, 50). Adicionalmente, para mitigar os efeitos do desbalanceamento da base de dados, adotou-se o procedimento de `sample_weight`, ajustando os pesos das observações. Categorias menos frequentes receberam pesos proporcionalmente maiores, conferindo maior relevância relativa à presença de supermercados.
3. Resultados e Discussão
A pesquisa revelou insights significativos sobre os fatores que determinam a localização de supermercados no estado de São Paulo, confirmando a hipótese de que sua distribuição não é aleatória, mas sistematicamente influenciada por características territoriais específicas. A aplicação do modelo de classificação Random Forest permitiu a identificação e interpretação de fatores socioeconômicos, demográficos e mercadológicos cruciais. Esses achados oferecem uma compreensão abrangente da complexa interação de variáveis que moldam os padrões espaciais da presença de supermercados, contribuindo tanto para a literatura acadêmica quanto para decisões práticas em planejamento urbano e estratégias de expansão do varejo. A capacidade do modelo em capturar essas relações intrincadas sublinha sua utilidade para o objetivo central do estudo.
O processo de otimização do modelo Random Forest, realizado por meio de um grid search com validação cruzada em três folds, identificou uma configuração de hiperparâmetros que maximizou a métrica recall-macro. Essa configuração incluiu uma profundidade máxima das árvores de seis, um mínimo de cinco observações por folha, um mínimo de dez observações para divisão e cinquenta árvores estimadoras. A escolha do recall-macro como métrica principal foi essencial devido ao desbalanceamento da classe na base de dados, onde a ausência de supermercados era significativamente mais frequente. Essa abordagem garantiu que o modelo priorizasse a identificação correta das áreas com supermercados, minimizando falsos negativos e alinhando-se ao objetivo de mapear potenciais locais de instalação.
A avaliação do desempenho do modelo na base de treinamento demonstrou uma acurácia de 0,7162, com um recall-macro elevado de 0,8058, indicando uma boa capacidade de identificar corretamente as classes associadas à presença de supermercados. Embora a precisão-macro tenha sido relativamente baixa, em 0,5152, refletindo a dificuldade inerente à distinção entre categorias em um contexto de forte desbalanceamento, o F1-score ponderado de 0,8249 sugeriu um bom desempenho global. Essa métrica ponderada oferece uma avaliação equilibrada da performance do modelo, considerando tanto a precisão quanto o recall, o que é fundamental em cenários com classes desiguais.
Na base de teste, os resultados mantiveram-se consistentes com os observados no treinamento, apresentando uma acurácia de 0,7151 e um F1-score ponderado de 0,8243. Essa estabilidade entre as bases de treinamento e teste indica uma ausência de sobreajuste relevante, demonstrando a capacidade de generalização do modelo para dados não observados anteriormente. Houve uma pequena redução no recall-macro para 0,7971 na base de teste, sinalizando uma dificuldade marginalmente maior em identificar corretamente todas as classes de ocorrência de supermercados fora da amostra de treinamento. Contudo, a consistência geral das métricas reforça a robustez do modelo para os propósitos exploratórios e analíticos do estudo.
A análise da matriz de confusão para a base de teste ilustrou a distribuição das classificações do modelo. Para a classe majoritária, que representa a ausência de supermercados (classe 0), o modelo classificou corretamente 263.148 observações, enquanto 105.727 foram falsos positivos, ou seja, áreas sem supermercado erroneamente previstas como tendo um. Para a classe minoritária, indicando a presença de supermercados (classe 1), o modelo identificou corretamente 3.338 observações, mas classificou 452 como falsos negativos, ou seja, áreas com supermercado previstas como não tendo um. Essa predominância de classificações na classe majoritária, mesmo com os ajustes metodológicos, reflete a dificuldade em discriminar eventos menos frequentes em um contexto de forte desbalanceamento dos dados.
Apesar das limitações na precisão para a classe minoritária, os resultados globais confirmam a adequação do Random Forest como ferramenta exploratória e explicativa para o fenômeno estudado. Os indicadores de desempenho, especialmente o recall-macro, demonstram que o modelo é capaz de capturar padrões consistentes associados à localização de supermercados. Essa capacidade é particularmente valiosa para estimar as probabilidades de ocorrência desses estabelecimentos no território urbano, conforme os objetivos do estudo. A metodologia empregada, com o ajuste dos pesos das amostras, contribuiu para mitigar os efeitos do desbalanceamento, permitindo uma análise mais focada na identificação das áreas com maior potencial de instalação de supermercados.
Importância das variáveis
A análise das medidas de importância das variáveis, um dos principais resultados do modelo Random Forest, forneceu evidências robustas sobre os fatores determinantes da localização de supermercados. As métricas indicaram que variáveis relacionadas ao perfil sociodemográfico e ao capital humano da população figuram entre as mais relevantes, exercendo influência significativa na ocorrência desses estabelecimentos. Essa relevância é particularmente acentuada para os dados observados nos buffers mais imediatos, de 50 e 500 metros, sugerindo que as características do entorno próximo são cruciais para a decisão de instalação. A identificação dessas variáveis mais importantes permite compreender quais atributos do território são mais preditivos para a presença de supermercados, alinhando-se diretamente com o objetivo de investigar os fatores explicativos.
Entre as variáveis de maior importância, a alfabetização de pessoas com 60 anos ou mais, conforme o Censo de 2022, destacou-se como a variável individual mais relevante no buffer de 50 metros. Este achado sugere que a presença de uma população mais idosa e com maior nível de escolaridade no entorno imediato é um fator significativo para a localização de supermercados. Essa correlação pode indicar que essas áreas possuem uma demanda mais estável por produtos de consumo diário, além de uma maior capacidade de planejamento de compras e acesso a informações, o que as torna mais atrativas para o setor supermercadista. A presença de capital humano mais desenvolvido na vizinhança imediata parece ser um atrativo importante para a instalação desses estabelecimentos.
A variável associada à presença de outros estabelecimentos do setor de alimentação também se mostrou altamente relevante, ocupando a segunda posição em importância no buffer de 500 metros e uma posição de destaque no buffer de 50 metros. Essa constatação sugere que os supermercados tendem a se instalar em áreas já consolidadas como polos comerciais, beneficiando-se das economias de aglomeração. A coexistência com outros negócios de alimentação pode indicar uma complementaridade de atividades e um maior fluxo de consumidores, o que potencializa o sucesso do novo empreendimento. Esse padrão reforça a ideia de que a localização é estratégica e busca sinergias comerciais, otimizando o acesso a uma base de clientes já estabelecida.
Variáveis relacionadas à renda domiciliar também se destacaram entre as mais importantes, com ênfase na renda total da classe C1 no buffer de 50 metros. Além disso, indicadores de renda e número de domicílios das classes C2 e DE também figuraram como variáveis explicativas, embora com menor peso relativo. A predominância dessas variáveis em escalas espaciais restritas indica que o segmento supermercadista prioriza áreas com uma massa crítica de consumidores e um poder de compra compatível com seu modelo de negócio. Essa escolha estratégica visa garantir um fluxo de clientes com capacidade de consumo adequada, otimizando o potencial de mercado no entorno imediato da instalação e assegurando a viabilidade econômica do empreendimento.
A relevância de variáveis associadas à densidade de pessoas e domicílios foi igualmente notável. A quantidade de domicílios particulares permanentes do Censo de 2010 e a quantidade de domicílios particulares permanentes ocupados do Censo de 2022, ambas no buffer de 50 metros, demonstraram alta importância. Especificamente, a população com 60 anos ou mais no buffer de 50 metros também se mostrou um fator relevante. Esses achados sugerem que uma maior concentração de potenciais consumidores na imediação dos supermercados gera uma demanda mais regular por compras de proximidade, tornando essas áreas mais atrativas para a instalação de novos estabelecimentos e para a sustentabilidade do negócio.
A análise da importância das variáveis revelou que as características do entorno mais imediato, especificamente nos buffers de 50 e 500 metros, exercem uma influência preponderante na explicação da localização de supermercados. Isso sugere que as decisões de expansão e instalação são altamente sensíveis às condições micro-locais, como o perfil sociodemográfico da vizinhança, o nível de renda e a estrutura comercial existente. A capacidade do modelo em identificar esses padrões em diferentes escalas espaciais, com destaque para a proximidade, reforça a compreensão de que a distribuição espacial de supermercados é um fenômeno complexo, guiado por uma combinação estratégica de fatores que visam otimizar o acesso ao mercado consumidor.
Em síntese, os resultados empíricos obtidos reforçam a hipótese central do estudo de que a localização de supermercados no estado de São Paulo não é um evento aleatório. Pelo contrário, a presença desses estabelecimentos é fortemente condicionada por uma combinação de características sociodemográficas, como a alfabetização de idosos e a densidade populacional, além do nível de renda dos domicílios e da estrutura comercial do entorno, especialmente a presença de outros estabelecimentos de alimentação. A predominância do entorno mais imediato na explicação desses padrões sublinha a importância de uma análise detalhada das condições locais para decisões estratégicas de localização, fornecendo subsídios valiosos para o planejamento urbano e para o setor varejista.
4. Conclusão
Este estudo investigou os fatores determinantes da localização de supermercados no estado de São Paulo, considerando dimensões socioeconômicas, demográficas e mercadológicas. Verificou-se que a distribuição espacial desses estabelecimentos não ocorre de forma aleatória, sendo fortemente condicionada por características territoriais específicas. A análise dos achados, obtidos por meio de um modelo de classificação Random Forest, evidenciou que fatores sociodemográficos, como a alfabetização de pessoas com 60 anos ou mais, a renda domiciliar, especialmente da classe C1, e a densidade de domicílios e população no entorno imediato, exerceram influência significativa. Observou-se, ainda, que a presença de outros estabelecimentos do setor de alimentação nas proximidades também se mostrou um fator relevante, sugerindo que os supermercados tendem a se instalar em áreas já consolidadas como polos comerciais, beneficiando-se de economias de aglomeração e de um fluxo de consumidores já estabelecido. A predominância das características do entorno mais imediato, nos buffers de 50 e 500 metros, sublinha a sensibilidade das decisões de localização às condições micro-locais.
A metodologia empregada, baseada na floresta randômica e ajustada para priorizar a métrica recall-macro, demonstrou ser adequada para lidar com a elevada dimensionalidade dos dados e as relações não lineares entre as variáveis explicativas. Embora o modelo tenha apresentado limitações em termos de precisão para classes menos frequentes, seu desempenho geral e a estabilidade entre as bases de treinamento e teste indicaram robustez suficiente para os propósitos exploratórios e analíticos do estudo. Os resultados oferecem uma contribuição prática substancial, fornecendo subsídios valiosos para empresas do setor supermercadista na orientação de estratégias de expansão territorial e na identificação de áreas com maior potencial de mercado. Para o setor público, as evidências produzidas contribuem para a compreensão da relação entre a distribuição de serviços essenciais e a estrutura socioespacial das cidades, podendo apoiar políticas de planejamento urbano e a promoção de um acesso mais equitativo da população a bens de consumo.
Referências Bibliográficas
ESRI. ArcGIS Geocoding service | ArcGIS REST APIs. Disponível em: https://developers.arcgis.com/rest/geocode/. Acesso em: 01/10/2025.
Instituto Brasileiro de Geografia e Estatística [IBGE]. 2010. Censo Demográfico 2010: resultados gerais da população e domicílios. IBGE, Rio de Janeiro, IBGE, RJ. Disponível em: https://www.ibge.gov.br/estatisticas/sociais/populacao/9662-censo-demografico-2010.html. Acesso em: 21/10/2025.
Instituto Brasileiro de Geografia e Estatística [IBGE]. 2023. Censo Demográfico 2022: resultados preliminares/população. IBGE, Rio de Janeiro, RJ. Disponível em: https://www.ibge.gov.br/estatisticas/sociais/populacao/27069-censo-demografico-2022.html. Acesso em: 21/10/2025.
Ministério do Trabalho e Emprego [MTE]. 2025. RAIS 2024: Sumário Executivo (Parcial). Ministério do Trabalho e Emprego, Brasília, DF. Disponível em: https://www.gov.br/trabalho-e-emprego/pt-br/assuntos/estatisticas-trabalho/rais/rais-2024/rais-2024-parcial/sumario-executivo_rais-2024-parcial.pdf. Acesso em: 21/10/2025.
Receita Federal do Brasil [RFB]. 2025. Cadastro Nacional da Pessoa Jurídica (CNPJs) [base de dados]. Receita Federal do Brasil, Brasília, DF. Disponível em: https://www.gov.br/receitafederal/pt-br/assuntos/orientacao-tributaria/cadastros/cnpj. Acesso em: 21/10/2025.
Artigo oriundo de Trabalho de Conclusão de Curso da Especialização em Data Science e Analytics do MBA USP/Esalq
Para saber mais sobre o curso, clique aqui e acesse a plataforma MBX Academy

