Segmentação semântica vs. de instância em imagens aéreas
Publicado em Atualizado em

A segmentação semântica dá uma classe a cada pixel de uma imagem: este pixel é edificação, aquele é via, o próximo é árvore. A segmentação de instância dá um passo além e separa os objetos de uma mesma classe: este pixel é a edificação número 12, aquele é a edificação número 13.
Segmentação semântica e de instância: a diferença em uma linha
A semântica responde “quanto”. A de instância responde “quantos, e qual”. A panóptica, o terceiro termo, responde aos dois no mesmo mapa.
A mesma imagem, rotulada de duas maneiras. A segmentação semântica pinta todas as edificações com a mesma cor. A de instância dá a cada uma o seu contorno e o seu número.

| Semântica | Instância | Panóptica | |
|---|---|---|---|
| Resultado | Uma classe por pixel | Uma máscara por objeto | Uma classe por pixel, mais um ID de objeto nas coisas contáveis |
| Duas casas coladas | Uma máscara | Dois objetos | Dois objetos |
| O que conta como objeto | Nada: uma classe é uma superfície | Cada telhado, copa, piscina ou carro | Cada coisa contável; as superfícies continuam superfícies |
| Dá para contar | Não | Sim | Sim, nas classes contáveis |
| Uso típico em SIG | Cobertura do solo, proporção de copas, superfície impermeável, mudanças | Inventários de edificações, árvores, piscinas e painéis | Mapas completos da cena, talhões agrícolas |
| Modelos típicos | U-Net, DeepLab | Mask R-CNN, a família Segment Anything | Duas cabeças, ou um modelo treinado com rótulos panópticos |
| Para vetor no QGIS | Poligonizar e depois limpar | Já é um polígono por objeto | Poligonizar as classes e manter os IDs de objeto |

O que cada uma entrega em um mapa
Um modelo semântico entrega superfícies para medir, e um modelo de instância entrega objetos para contar.
A semântica é um mapa de cobertura do solo com bordas nítidas: uma máscara de edificações, uma de vias, uma de vegetação. Serve para estatísticas de área, superfície impermeável, cobertura de copas e mudanças entre duas datas. Não serve para nada que exija uma contagem.
A de instância é um inventário. Cada telhado, copa de árvore ou piscina chega como um polígono próprio, com a sua linha na tabela de atributos. Você pode contar, medir cada um e associar uma altura a cada um. O custo é que o modelo precisa decidir onde um objeto termina, o que é difícil em uma fileira de casas geminadas, e as falhas têm essa cara: duas casas fundidas, uma copa dividida em três.
De onde vêm os termos. Os dois vêm da visão computacional. Em 2014, Long, Shelhamer e Darrell mostraram que uma rede treinada “de ponta a ponta, de pixels para pixels” conseguia fazer segmentação semântica. Em 2017, o Mask R-CNN acrescentou a um detector de objetos “um ramo para prever uma máscara de objeto”, o que é segmentação de instância. Em 2023, o Segment Anything foi treinado com “mais de 1 bilhão de máscaras em 11 milhões de imagens licenciadas e que respeitam a privacidade”, e é a família que as ferramentas de instância do QGIS usam hoje.
Segmentação panóptica, o terceiro termo
A segmentação panóptica dá uma classe a cada pixel, como a semântica, e também dá um ID a cada objeto contável, como a de instância. Kirillov e colegas nomearam a tarefa em 2018 e a definiram como a que “unifica as tarefas tipicamente distintas de segmentação semântica (atribuir um rótulo de classe a cada pixel) e de segmentação de instância (detectar e segmentar cada instância de objeto)”.
O artigo divide as classes em dois tipos. Os objetos contáveis (things) são edificações, carros, árvores. As superfícies (stuff) são amorfas: grama, água, pavimento de via. Um mapa panóptico conta os objetos contáveis e mede as superfícies, em uma única camada, sem lacunas e sem sobreposições. O mesmo artigo propôs uma nota única para os dois, a qualidade panóptica (PQ), “para todas as classes (superfícies e objetos contáveis)”.
Onde o SIG usa isso. Os talhões agrícolas são o caso mais claro. O PASTIS, um benchmark francês, reúne 124.422 talhões agrícolas em 2.433 séries temporais do Sentinel-2 a 10 m por pixel, cobrindo cerca de 4.000 km² da França. Cada pixel traz o tipo de cultura e o índice do talhão. Um modelo semântico treinado nele diz “trigo aqui”. Um panóptico diz “trigo, talhão 57”, e você pode contar os campos e medir cada um. O artigo por trás dele chama a segmentação panóptica de talhões, com precisão de pixel, de uma tarefa com “grandes implicações econômicas e ambientais”.
Na prática, uma equipe de geoprocessamento raramente precisa de um modelo panóptico. Rode uma ferramenta de instância para os objetos contáveis, uma semântica para as superfícies, e empilhe as duas camadas no QGIS. Isso dá o mesmo mapa em duas etapas.
O que uma máscara semântica conta: três blocos franceses, medidos
Se você poligonizar uma máscara semântica de edificações, vai contar manchas, não edificações: em 1 km² do centro de Lens, o mapa de cobertura do solo por IA do IGN, feito a partir de fotos aéreas de 20 cm, dá 269 manchas de edificações onde o cadastro nacional de edificações tem 3.006. Medimos isso em 23 de setembro de 2026 em três blocos de 1 km², cada um conferido com as edificações da BD TOPO do IGN.
| Em um bloco de 1 km² | Lens, centro | Liévin, casas de vila mineira | Paris 11e |
|---|---|---|---|
| Edificações na BD TOPO (20 m² ou mais) | 3.006 | 952 | 1.759 |
| Manchas na máscara de IA de 20 cm (IGN CoSIA) | 269 | 558 | 95 |
| Edificações encontradas que dividem a mancha | 97,5% | 63% | 99,5% |
| Mediana de edificações por mancha | 30 | 2 | 31 |
| Manchas na cobertura do solo de 10 m (ESA WorldCover) | 1 | 29 | 1 |
| Área, máscara de IA / contornos / “área construída” de 10 m | 40,5 / 36,3 / 87,2 ha | 14,4 / 12,3 / 46,3 ha | 58,4 / 54,7 / 96,3 ha |
Uma máscara mais fina não resolve a contagem. A máscara encontra de 96 a 97% das edificações em cada bloco, mas uma fileira de casas ou um prédio de apartamentos divide paredes, então nenhum pixel de fundo separa duas casas, nem a 20 cm, nem a 2 cm. Em Lens e em Paris, uma edificação encontrada pela máscara está, na mediana, em uma mancha de cerca de 30.

Liévin mostra onde uma máscara semântica conta. As casas isoladas saem como uma mancha cada, e 344 das 926 edificações encontradas ali têm uma mancha só para si. Os pares de casas geminadas e as fileiras do antigo conjunto habitacional mineiro saem como uma mancha cada, e por isso a edificação mediana está em uma mancha de duas.

Para área, a máscara semântica chega perto. A máscara de IA fica de 7 a 17% acima da soma dos contornos, o que é esperado: ela enxerga telhados, que passam além das paredes traçadas pela BD TOPO, e pequenos anexos. A classe “área construída” de 10 m equivale a 1,8 a 3,8 vezes a área dos contornos, porque um pixel de 10 m com telhado, quintal e calçada é rotulado como área construída. Ela mede tecido urbano, não edificações.
As árvores também se fundem
No bloco de Paris, 1.296 das 1.583 árvores do inventário da cidade estão na cobertura de copas da máscara de IA (a até 2 m do tronco), e 89% delas dividem uma mancha de copas com outra árvore do inventário. A alameda arborizada ao longo do boulevard Richard-Lenoir é uma única mancha com 254 árvores do inventário. Contar copas a partir de uma máscara de copas funciona para árvores isoladas e falha em uma rua arborizada.
Como medimos
Os blocos são quadrados de 1 km em Lambert 93, centrados em Lens (50,432 N, 2,832 E), na Cité Pasteur em Liévin (50,433 N, 2,762 E) e no boulevard Richard-Lenoir (48,860 N, 2,370 E). Uma mancha é um grupo de pixels de máscara em contato com 20 m² ou mais, que é o que o Poligonizar do QGIS produz com as configurações padrão, e uma edificação conta como encontrada quando metade do seu contorno está sob a máscara. A CoSIA só é publicada como mapa estilizado, então a lemos a cerca de 0,4 m e associamos cada cor de volta à sua classe. Os poucos pixels de borda perdidos assim dividem manchas, de modo que as proporções acima são, se tanto, baixas. As fotos por trás da CoSIA são anteriores ao cadastro com o qual as comparamos. A BD TOPO às vezes desenha um par de casas geminadas como uma só edificação. O inventário de Paris deixa de fora as árvores particulares. Três blocos são três lugares, não um número nacional.
Da máscara aos polígonos no QGIS
Uma máscara semântica precisa de três ou quatro etapas de processamento para virar polígonos utilizáveis, e uma ferramenta de instância entrega os polígonos direto. Aqui está cada caminho, com as ferramentas do QGIS que o percorrem.
A partir de uma máscara semântica
- Remova o ruído. Execute
Raster > Análise > Crivo. Ele “remove polígonos raster menores que um tamanho limite informado (em pixels)” e os preenche com o valor do maior vizinho, conforme o manual do QGIS. O limite padrão é de 10 pixels. A 20 cm, 10 pixels são apenas 0,4 m², então aumente o valor para igualar o menor objeto que interessa. - Poligonize. Execute
Raster > Converter > Raster para vetor (poligonizar). Ele “cria polígonos vetoriais para todas as regiões conectadas de pixels do raster que compartilham o mesmo valor de pixel”, com o valor em um campo chamadoDNpor padrão, conforme o manual. Deixe “Usar conectividade de 8” desmarcado. Com ela ativada, dois pixels que se tocam só pelo canto se unem, e duas edificações que se encontram em um único canto viram um polígono. - Mantenha a classe. Os pixels de fundo também formam polígonos. Selecione
"DN" = 1(ou o valor da sua classe) e salve a seleção como uma nova camada. - Decida o que uma feição significa. Para a superfície de uma classe, execute
Vetor > Ferramentas de Geoprocessamento > Dissolversem campo: você obtém uma feição multiparte e um único valor de área. Para as manchas, marque “Manter feições disjuntas separadas” (QGIS 3.32 ou posterior), ou executeMultipartes para partes simplesna Caixa de Ferramentas de Processamento, e cada mancha vira uma linha própria. - Limpe as bordas. As bordas de pixel saem como degraus. O guia de raster para vetor cobre simplificar, suavizar e um filtro de área.
O que você tem depois da etapa 4 é um polígono por mancha, não por objeto. A tabela de Lens acima mostra essa diferença: 269 manchas para 3.006 edificações.
É também assim que se fazem os grandes conjuntos de contornos de edificações. Os contornos globais de edificações da Microsoft são construídos em duas fases: “Segmentação semântica”, que reconhece os pixels de edificação com redes neurais profundas, e depois “Poligonização”, que converte esses pixels em polígonos. Um pixel conta como edificação quando sua probabilidade é superior a 0,5. A etapa de polígonos é onde acontece a separação em edificações, e é trabalho extra que um modelo semântico deixa para você.
A partir de uma ferramenta de instância
- Execute a ferramenta em uma zona. Cada objeto chega como um polígono próprio, uma linha na tabela de atributos.
- Verifique as multipartes. Algumas ferramentas devolvem um objeto em várias peças.
Multipartes para partes simplesas divide; confira as que foram divididas antes de contar. - Meça cada um. Adicione um campo com
$areana Calculadora de Campo e filtre os fragmentos menores que o menor objeto real. - Associe o que você já sabe. Cada polígono pode receber uma altura, um endereço ou um ID de cadastro por meio de uma associação por localização, o que a superfície de uma classe não permite.
Com o AI Segmentation, as etapas 1 a 3 viram uma só: digite “edificação” ou “piscina”, escolha uma zona, e cada objeto encontrado volta como um polígono próprio em uma nova camada. Com o AI Agent, o caminho semântico acima roda a partir de uma frase em um painel de chat dentro do QGIS: você descreve a camada que quer, e ele executa as mesmas ferramentas do QGIS, Crivo, Poligonizar e Dissolver, e confere o mapa antes de responder.
Qual delas as ferramentas do QGIS produzem
A maioria dos plugins do QGIS construídos sobre modelos de cobertura do solo é semântica, e as ferramentas construídas sobre o Segment Anything são de instância.
- Semântica: o Deepness e a maior parte dos modelos do seu catálogo, o Semi-Automatic Classification Plugin, o modelo de cobertura do solo do Mapflow.
- Instância: a família Segment Anything, ou seja, o Geo-SAM, o samgeo e os plugins SAM para QGIS. Um objeto por clique.
- O AI Segmentation, o plugin que fazemos na TerraLab para o QGIS, é uma ferramenta de instância. Você nomeia o objeto, uma edificação, uma árvore, uma piscina, ou desenha um exemplo dele, e ele devolve um polígono por objeto encontrado na zona. O guia de contornos de edificações mostra como isso fica em um quarteirão denso. Onde as edificações já estão mapeadas, o baixador gratuito de contornos entrega esses polígonos de instância em GeoJSON, sem rodar nada.
Perguntas frequentes
As respostas curtas abaixo cobrem o que as pessoas pesquisam junto com esses dois termos.
Qual é a diferença entre segmentação semântica, de instância e panóptica?
A segmentação semântica dá uma classe a cada pixel. A segmentação de instância separa cada objeto de uma classe em uma máscara própria. A segmentação panóptica faz as duas coisas de uma vez: cada pixel recebe uma classe, e cada objeto contável, como uma edificação ou um carro, também recebe um ID próprio.
Qual devo usar em um projeto de SIG?
Use a semântica quando a resposta é uma área ou uma proporção: cobertura de copas, superfície impermeável, área alagada. Use a de instância quando a resposta é uma contagem ou um atributo por objeto: edificações, árvores, piscinas, painéis solares. Se você precisa das duas, rode uma de cada e empilhe as camadas.
Detecção de objetos é a mesma coisa que segmentação de instância?
Não. A detecção de objetos devolve um retângulo em volta de cada objeto. A segmentação de instância devolve o seu contorno, pixel a pixel. Para um mapa, quase sempre você quer o contorno.
Posso transformar uma máscara semântica em instâncias?
Às vezes. Poligonize a máscara e divida os polígonos nos pontos estreitos. Funciona em coisas separadas, como copas de árvores em um pomar. Falha em uma fileira de casas, onde não há ponto estreito para cortar.
A resolução da imagem muda a resposta?
Muda, mas menos do que se espera. A 10 m uma casa tem um ou dois pixels e não há nada para separar, então a cobertura do solo por satélite é semântica por necessidade. A 20 cm uma casa tem milhares de pixels e a segmentação de instância se torna possível, mas uma máscara semântica a 20 cm ainda funde toda casa que divide parede: no centro de Lens, 97,5% das edificações que ela encontra dividem uma mancha.
Por que minha máscara poligonizada dá um único polígono para um quarteirão inteiro?
Porque as casas desse quarteirão dividem paredes, então nenhum pixel de fundo as separa na máscara. O Poligonizar junta todos os pixels conectados de mesmo valor em um só polígono. Só um modelo de instância, que desenha cada objeto por conta própria, os separa.
O Segment Anything é segmentação de instância?
Sim, na saída: ele devolve uma máscara por objeto que você aponta, então dois telhados colados voltam como duas máscaras. O modelo original, porém, não dá um rótulo de classe. Ele separa os objetos sem nomeá-los, e as ferramentas do QGIS construídas sobre ele tiram a classe do seu clique ou do seu prompt.
A segmentação semântica e a de instância fazem parte da categoria mais ampla do GeoAI. O que é GeoAI explica o termo de que esses dois são exemplos. O mapeamento de copas de árvores mostra os dois lados em árvores: cobertura de copas a partir de uma máscara, ou um polígono por copa. O hub de IA no QGIS reúne o que a IA pode e não pode fazer dentro do QGIS.
, é uma ferramenta de instância. Você nomeia o objeto, uma edificação, uma árvore, uma piscina, ou desenha um exemplo dele, e ele devolve um polígono por objeto encontrado na zona. O 

