Decisões de expansão física — abrir uma loja, uma clínica, uma unidade de franquia — ainda costumam ser tomadas com base em critérios frágeis: "essa cidade parece boa", "tem gente conhecida que foi bem lá", "vamos onde o concorrente já está". Informação pública de qualidade sobre território existe em abundância no Brasil — Censo, CNEFE, dados espaciais abertos — mas raramente chega organizada até quem precisa decidir onde investir.
O GeoInsight nasceu para preencher essa lacuna: um modelo de inteligência territorial que transforma dados públicos brutos em uma leitura objetiva do potencial de expansão de um município. Já mostramos um caso de negócio aplicado com esse modelo; este estudo abre a arquitetura por trás dele — o que é público e o que fica reservado à consultoria.
O que o GeoInsight entrega
A calculadora recebe apenas dois inputs — cidade e UF — e devolve quatro saídas:
| Indicador | O que representa |
|---|---|
| Score de potencial | Posição relativa do município no ranking territorial |
| Potencial de mercado (%) | Estimativa do tamanho de mercado endereçável na região |
| Risco territorial estimado (%) | Indicador de risco associado ao território |
| Classificação | Faixa qualitativa derivada do score |
Um ponto importante de interpretação: o score não é uma nota absoluta. Ele é construído por percentil, não por corte fixo arbitrário. Um município com score 76, por exemplo, não significa "76% de potencial" — significa que ele está posicionado acima de boa parte dos municípios avaliados na base. É uma régua relativa, pensada para comparar e priorizar, não para atribuir um valor absoluto de oportunidade.
As fontes de dados
O modelo é alimentado por três grandes fontes públicas, processadas pelo pipeline sp_spark:
- Censo 2022 (IBGE) — perfil socioeconômico e demográfico por setor censitário
- CNEFE (Cadastro Nacional de Endereços para Fins Estatísticos) — domicílios, estabelecimentos, equipamentos de ensino, saúde e outras estruturas territoriais, georreferenciados
- OSM (OpenStreetMap) — malha espacial e pontos de interesse
Essas três fontes são combinadas e processadas no nível do setor censitário — a unidade geográfica mais granular disponível no Censo — antes de serem agregadas para o nível municipal, que é o que a calculadora expõe.
Como o modelo enxerga o território
Em vez de tratar cada setor censitário como um número isolado, o pipeline agrupa setores com perfil semelhante em personas territoriais — clusters estatísticos (K-Means) que combinam renda mediana, estrutura etária, alfabetização, composição por sexo, indicadores de serviços derivados do CNEFE e indicadores de pontos de interesse derivados do OSM. São 9 clusters:
| Persona | Renda mediana (R$) | % Homens | % Mulheres | Alfabetização | POIs (OSM, total agregado) |
|---|---|---|---|---|---|
| Elite econômica | 11.179 | 46,9% | 53,1% | 100,0% | 4.549 |
| Classe média | 4.785 | 45,9% | 54,1% | 100,0% | 4.535 |
| Alta informalidade | 2.496 | 46,7% | 53,3% | 100,0% | 2.423 |
| Alta concentração infantil | 1.932 | 48,7% | 51,3% | 99,99% | 4.406 |
| Concentração de jovens adultos | 1.665 | 47,7% | 52,3% | 99,98% | 578 |
| Perfil misto | 2.289 | 47,5% | 52,5% | 100,0% | 10.571 |
| Concentração de idosos | 3.252 | 46,6% | 53,4% | 99,99% | 22.743 |
| Alta vulnerabilidade socioeconômica | 2.018 | 52,4% | 47,6% | 99,94% | 4.028 |
| Adensamento e infraestrutura precária | 1.610 | 50,9% | 49,1% | 99,95% | 2.649 |
POIs (OSM) aqui é a soma agregada de pontos de interesse de todos os setores da persona no estado — não uma média por setor. Séries com mais setores (Perfil misto, Concentração de idosos) naturalmente somam mais POIs; não é comparável diretamente entre personas de tamanho muito diferente.
Um padrão que vale destacar: a distribuição por sexo é bem mais equilibrada entre a maioria das personas (todas entre 46% e 49% de homens) do que se poderia esperar — com duas exceções notáveis: Alta vulnerabilidade socioeconômica e Adensamento e infraestrutura precária são as únicas com leve maioria masculina (52,4% e 50,9%). O padrão nacional brasileiro tende a ter mais mulheres em quase toda faixa etária, então essa inversão nessas duas personas específicas é um sinal que vale investigar caso a caso, não necessariamente um padrão estrutural amplo.
Cada ponto é uma persona. Eixo horizontal: total agregado de POIs (OSM) no estado, escala logarítmica dada a diferença de tamanho entre personas. Eixo vertical: renda mediana.
O que cada persona parece representar
Diferente da versão anterior deste modelo, os nomes abaixo já não são leituras interpretativas — cada persona é nomeada exatamente pela variável que a separa das demais no algoritmo. Isso é intencional: preferimos um nome menos "vendável" que descreva com precisão o que gerou aquele grupo, a uma narrativa social que o dado não comprova.
- Elite econômica — maior renda mediana da base (R$ 11.179). Critério: renda mediana.
- Classe média — segunda maior renda mediana (R$ 4.785). Critério: renda mediana.
- Alta informalidade — maior presença comercial física (CNEFE) sem CNPJ vinculado à Receita Federal na região — sinal de comércio informal/pequeno, não necessariamente pobreza extrema (renda mediana R$ 2.496, intermediária na base). Critério: densidade comercial sem registro formal.
- Alta concentração infantil — maior fração de população de 0 a 14 anos. É o maior cluster em população (13,9 milhões de habitantes). Critério: estrutura etária.
- Concentração de jovens adultos — maior fração de população de 15 a 29 anos. Critério: estrutura etária.
- Perfil misto — o maior cluster em número de setores. Por construção, é quem não se destacou em nenhum dos outros critérios (renda, idade, vulnerabilidade, informalidade) — não tem uma característica própria que a defina positivamente, é literalmente "o que sobrou" depois dos demais critérios serem aplicados.
- Concentração de idosos — maior fração de população de 60 anos ou mais. Critério: estrutura etária.
- Alta vulnerabilidade socioeconômica — maior índice de vulnerabilidade (combinação de esgoto, alfabetização, estrutura etária e outros fatores sociais, não só renda). Critério: índice composto de vulnerabilidade.
- Adensamento e infraestrutura precária — maior adensamento domiciliar combinado com maior ausência de rede de esgoto. Critério: adensamento + infraestrutura sanitária.
Essa segmentação é a mesma base territorial usada nos mapas do TSR Lab, o que garante consistência entre os produtos do ecossistema.
A partir daí, o cálculo de potencial combina quatro dimensões diretas — sem depender da composição de persona do município:
- Renda mediana — posição relativa do município na renda mediana por setor, com correção de escala (log) pra não deixar municípios de renda muito alta dominarem a distribuição
- Densidade comercial — pontos de interesse do OpenStreetMap por setor, refletindo quantos estabelecimentos existem espalhados pelo território (não o porte de cada um)
- Cobertura de serviços — presença de estabelecimentos de saúde, educação e outros serviços essenciais, via cadastro oficial do IBGE (CNEFE)
- Vulnerabilidade socioeconômica — índice composto (esgoto, alfabetização, estrutura etária, entre outros fatores), entrando invertido no score: mais vulnerabilidade reduz o potencial
🔒 O que fica fechado neste material
A forma exata como essas dimensões são ponderadas e combinadas — os pesos, a normalização e a transformação final em percentil — faz parte da metodologia proprietária do modelo. Essa camada é detalhada apenas em contexto de consultoria, quando aplicada a um caso real de cliente.
Por que existe uma correção estatística
Municípios pequenos, com poucos setores censitários ou baixa densidade de dados, tendem a gerar estimativas instáveis — um único estabelecimento a mais ou a menos pode distorcer a leitura de forma desproporcional. Para isso, o modelo aplica uma correção estatística por shrinkage, uma técnica que reduz a influência de estimativas locais pouco confiáveis, aproximando-as de uma referência mais estável quando a base de dados do território é pequena.
O objetivo é simples: evitar que municípios com pouca informação apareçam artificialmente no topo ou no fundo do ranking só por ruído estatístico. Novamente, a implementação exata — variável tratada, grupo de referência, peso aplicado — não é aberta neste material.
Um exemplo aplicado
Em uma simulação aplicada ao setor de academias, o modelo cruzou densidade populacional, renda e concorrência para priorizar localidades de expansão. O GeoInsight identificou um conjunto de municípios prioritários diferente daquele obtido por uma regra baseada exclusivamente no tamanho populacional — e a comparação indicou uma diferença de 32% no potencial de receita estimado a favor das localidades selecionadas pelo modelo.
É importante deixar claro o que esse número é — e o que não é. Trata-se de uma simulação baseada em dados públicos e proxies estatísticos, não de uma validação causal com dados transacionais reais de um negócio. O GeoInsight não tem acesso a faturamento real de empresas; ele trabalha com indicadores públicos que funcionam como proxies de potencial. O resultado sugere que uma priorização orientada a dados pode produzir uma seleção diferente — e potencialmente mais informada — do que uma heurística baseada exclusivamente no tamanho populacional. Não é uma prova de causalidade nem uma projeção de receita real.
O que ainda não afirmamos
Seguindo o princípio de transparência metodológica do TSR Insights, vale registrar os limites atuais do modelo com a mesma clareza com que registramos suas capacidades:
- O modelo ainda não passou por uma validação preditiva quantitativa formal (holdout, backtesting, métricas como AUC ou RMSE contra desfechos reais de expansão).
- O que existe hoje é uma metodologia auditável, construída sobre dados públicos reais e testada em casos aplicados — não um modelo validado no sentido estatístico estrito de capacidade preditiva.
Achamos mais honesto comunicar isso do que apresentar o score como algo definitivo.
Em resumo
O GeoInsight não é uma calculadora de renda. É um modelo de inteligência territorial que transforma características socioeconômicas e espaciais de setores censitários em uma avaliação relativa do potencial de expansão de municípios — combinando segmentação territorial, estrutura urbana, densidade de pontos de interesse e correção estatística para reduzir distorções em regiões com menos dados disponíveis.
A metodologia detalhada, incluindo parametrização, pesos e calibração, pode ser aplicada e adaptada em projetos de consultoria conforme o contexto específico de cada negócio — uma rede de academias, por exemplo, tem uma função de potencial diferente de um varejo de moda ou de uma clínica, e é nessa camada de customização que a aplicação empresarial se torna relevante.
Esse é o lado territorial da nossa abordagem de segmentação — onde expandir. O lado comportamental, sobre quem já é cliente, está no nosso estudo de RFV e clusterização de clientes, com a mesma disciplina de dado real e código aberto.
Quer avaliar o potencial de expansão do seu negócio? Conheça o GeoInsight ou entre em contato para uma análise personalizada.
Dados: Censo 2022 (IBGE), CNEFE, OpenStreetMap. Pipeline: sp_spark.