← Voltar aos estudos
DADOS PÚBLICOS 9 min de leitura

Construindo um score geográfico utilizando dados públicos

Arquitetura, dados e decisões metodológicas por trás do GeoInsight

Por Thiago Rosa · TSR Insights

Decisões de expansão física — abrir uma loja, uma clínica, uma unidade de franquia — ainda costumam ser tomadas com base em critérios frágeis: "essa cidade parece boa", "tem gente conhecida que foi bem lá", "vamos onde o concorrente já está". Informação pública de qualidade sobre território existe em abundância no Brasil — Censo, CNEFE, dados espaciais abertos — mas raramente chega organizada até quem precisa decidir onde investir.

O GeoInsight nasceu para preencher essa lacuna: um modelo de inteligência territorial que transforma dados públicos brutos em uma leitura objetiva do potencial de expansão de um município. Já mostramos um caso de negócio aplicado com esse modelo; este estudo abre a arquitetura por trás dele — o que é público e o que fica reservado à consultoria.

O que o GeoInsight entrega

A calculadora recebe apenas dois inputs — cidade e UF — e devolve quatro saídas:

IndicadorO que representa
Score de potencialPosição relativa do município no ranking territorial
Potencial de mercado (%)Estimativa do tamanho de mercado endereçável na região
Risco territorial estimado (%)Indicador de risco associado ao território
ClassificaçãoFaixa qualitativa derivada do score

Um ponto importante de interpretação: o score não é uma nota absoluta. Ele é construído por percentil, não por corte fixo arbitrário. Um município com score 76, por exemplo, não significa "76% de potencial" — significa que ele está posicionado acima de boa parte dos municípios avaliados na base. É uma régua relativa, pensada para comparar e priorizar, não para atribuir um valor absoluto de oportunidade.

As fontes de dados

O modelo é alimentado por três grandes fontes públicas, processadas pelo pipeline sp_spark:

Essas três fontes são combinadas e processadas no nível do setor censitário — a unidade geográfica mais granular disponível no Censo — antes de serem agregadas para o nível municipal, que é o que a calculadora expõe.

Como o modelo enxerga o território

Em vez de tratar cada setor censitário como um número isolado, o pipeline agrupa setores com perfil semelhante em personas territoriais — clusters estatísticos (K-Means) que combinam renda mediana, estrutura etária, alfabetização, composição por sexo, indicadores de serviços derivados do CNEFE e indicadores de pontos de interesse derivados do OSM. São 9 clusters:

Elite econômica Classe média Alta informalidade Alta concentração infantil Concentração de jovens adultos Perfil misto Concentração de idosos Alta vulnerabilidade socioeconômica Adensamento e infraestrutura precária
PersonaRenda mediana (R$)% Homens% MulheresAlfabetizaçãoPOIs (OSM, total agregado)
Elite econômica11.17946,9%53,1%100,0%4.549
Classe média4.78545,9%54,1%100,0%4.535
Alta informalidade2.49646,7%53,3%100,0%2.423
Alta concentração infantil1.93248,7%51,3%99,99%4.406
Concentração de jovens adultos1.66547,7%52,3%99,98%578
Perfil misto2.28947,5%52,5%100,0%10.571
Concentração de idosos3.25246,6%53,4%99,99%22.743
Alta vulnerabilidade socioeconômica2.01852,4%47,6%99,94%4.028
Adensamento e infraestrutura precária1.61050,9%49,1%99,95%2.649

POIs (OSM) aqui é a soma agregada de pontos de interesse de todos os setores da persona no estado — não uma média por setor. Séries com mais setores (Perfil misto, Concentração de idosos) naturalmente somam mais POIs; não é comparável diretamente entre personas de tamanho muito diferente.

Um padrão que vale destacar: a distribuição por sexo é bem mais equilibrada entre a maioria das personas (todas entre 46% e 49% de homens) do que se poderia esperar — com duas exceções notáveis: Alta vulnerabilidade socioeconômica e Adensamento e infraestrutura precária são as únicas com leve maioria masculina (52,4% e 50,9%). O padrão nacional brasileiro tende a ter mais mulheres em quase toda faixa etária, então essa inversão nessas duas personas específicas é um sinal que vale investigar caso a caso, não necessariamente um padrão estrutural amplo.

Cada ponto é uma persona. Eixo horizontal: total agregado de POIs (OSM) no estado, escala logarítmica dada a diferença de tamanho entre personas. Eixo vertical: renda mediana.

O que cada persona parece representar

Diferente da versão anterior deste modelo, os nomes abaixo já não são leituras interpretativas — cada persona é nomeada exatamente pela variável que a separa das demais no algoritmo. Isso é intencional: preferimos um nome menos "vendável" que descreva com precisão o que gerou aquele grupo, a uma narrativa social que o dado não comprova.

Essa segmentação é a mesma base territorial usada nos mapas do TSR Lab, o que garante consistência entre os produtos do ecossistema.

A partir daí, o cálculo de potencial combina quatro dimensões diretas — sem depender da composição de persona do município:

🔒 O que fica fechado neste material

A forma exata como essas dimensões são ponderadas e combinadas — os pesos, a normalização e a transformação final em percentil — faz parte da metodologia proprietária do modelo. Essa camada é detalhada apenas em contexto de consultoria, quando aplicada a um caso real de cliente.

Por que existe uma correção estatística

Municípios pequenos, com poucos setores censitários ou baixa densidade de dados, tendem a gerar estimativas instáveis — um único estabelecimento a mais ou a menos pode distorcer a leitura de forma desproporcional. Para isso, o modelo aplica uma correção estatística por shrinkage, uma técnica que reduz a influência de estimativas locais pouco confiáveis, aproximando-as de uma referência mais estável quando a base de dados do território é pequena.

O objetivo é simples: evitar que municípios com pouca informação apareçam artificialmente no topo ou no fundo do ranking só por ruído estatístico. Novamente, a implementação exata — variável tratada, grupo de referência, peso aplicado — não é aberta neste material.

Um exemplo aplicado

Em uma simulação aplicada ao setor de academias, o modelo cruzou densidade populacional, renda e concorrência para priorizar localidades de expansão. O GeoInsight identificou um conjunto de municípios prioritários diferente daquele obtido por uma regra baseada exclusivamente no tamanho populacional — e a comparação indicou uma diferença de 32% no potencial de receita estimado a favor das localidades selecionadas pelo modelo.

É importante deixar claro o que esse número é — e o que não é. Trata-se de uma simulação baseada em dados públicos e proxies estatísticos, não de uma validação causal com dados transacionais reais de um negócio. O GeoInsight não tem acesso a faturamento real de empresas; ele trabalha com indicadores públicos que funcionam como proxies de potencial. O resultado sugere que uma priorização orientada a dados pode produzir uma seleção diferente — e potencialmente mais informada — do que uma heurística baseada exclusivamente no tamanho populacional. Não é uma prova de causalidade nem uma projeção de receita real.

O que ainda não afirmamos

Seguindo o princípio de transparência metodológica do TSR Insights, vale registrar os limites atuais do modelo com a mesma clareza com que registramos suas capacidades:

Achamos mais honesto comunicar isso do que apresentar o score como algo definitivo.

Em resumo

O GeoInsight não é uma calculadora de renda. É um modelo de inteligência territorial que transforma características socioeconômicas e espaciais de setores censitários em uma avaliação relativa do potencial de expansão de municípios — combinando segmentação territorial, estrutura urbana, densidade de pontos de interesse e correção estatística para reduzir distorções em regiões com menos dados disponíveis.

A metodologia detalhada, incluindo parametrização, pesos e calibração, pode ser aplicada e adaptada em projetos de consultoria conforme o contexto específico de cada negócio — uma rede de academias, por exemplo, tem uma função de potencial diferente de um varejo de moda ou de uma clínica, e é nessa camada de customização que a aplicação empresarial se torna relevante.

Esse é o lado territorial da nossa abordagem de segmentação — onde expandir. O lado comportamental, sobre quem já é cliente, está no nosso estudo de RFV e clusterização de clientes, com a mesma disciplina de dado real e código aberto.

Quer avaliar o potencial de expansão do seu negócio? Conheça o GeoInsight ou entre em contato para uma análise personalizada.

Dados: Censo 2022 (IBGE), CNEFE, OpenStreetMap. Pipeline: sp_spark.