Saltar al contenido
AI Segmentation
GeoAI
Guía

Segmentación semántica vs segmentación de instancias

Publicado el Actualizado el

Huellas de edificios de Shivajinagar, Bengaluru, cada edificio como un polígono propio sobre una trama densa de calles.
Foto: planemad, CC BY-SA 4.0, Wikimedia Commons.

La segmentación semántica asigna una clase a cada píxel de una imagen: este píxel es edificio, aquel es carretera, el siguiente es árbol. La segmentación de instancias va un paso más allá y separa entre sí los objetos de una misma clase: este píxel es el edificio número 12, aquel es el número 13.

La diferencia en una línea

La semántica responde «cuánto». La de instancias responde «cuántos, y cuál». La panóptica, el tercer término, responde ambas cosas en el mismo mapa.

La misma imagen, etiquetada de dos maneras. La segmentación semántica pinta todos los edificios del mismo color. La de instancias da a cada uno su propio contorno y su propio número.

Tres paneles con los mismos siete edificios: en el semántico todos son verdes y dos casas contiguas forman una sola figura; en el de instancias cada edificio tiene un color distinto y un número del 1 al 7; en el panóptico los mismos edificios numerados sobre una clase de suelo gris.
Dos casas contiguas: una sola figura en la semántica, los objetos 1 y 2 en la de instancias y en la panóptica.
SemánticaInstanciasPanóptica
SalidaUna clase por píxelUna máscara por objetoUna clase por píxel, más un ID de objeto en lo contable
Dos casas contiguasUna máscaraDos objetosDos objetos
Qué cuenta como objetoNada: una clase es una superficieCada tejado, copa, piscina o vehículoCada elemento contable; las superficies siguen siendo superficies
¿Se puede contar?NoSíSí, en las clases contables
Uso SIG habitualCobertura del suelo, cubierta arbórea, superficie impermeable, cambiosInventarios de edificios, árboles, piscinas y panelesMapas de escena completa, parcelas agrícolas
Modelos habitualesU-Net, DeepLabMask R-CNN, la familia Segment AnythingDos cabezales, o un solo modelo entrenado con etiquetas panópticas
Pasar a vectorial en QGISPoligonizar y después limpiarYa es un polígono por objetoPoligonizar las clases y conservar los ID de objeto
La misma calle de casas adosadas en Lens mostrada dos veces: a la izquierda todos los edificios bajo una sola máscara verde, a la derecha cada casa como un polígono de color propio.
Lens, las mismas casas adosadas dos veces. A la izquierda, semántica: una sola máscara. A la derecha, instancias: un polígono por casa. Edificios: colaboradores de OpenStreetMap, ODbL. Ortofoto: IGN, BD ORTHO, licencia abierta.

Qué te da cada una en un mapa

Un modelo semántico te da superficies que medir, y un modelo de instancias te da objetos que contar.

La semántica es un mapa de cobertura del suelo con bordes nítidos: una máscara de edificios, una de carreteras, una de vegetación. Sirve para estadísticas de área, superficie impermeable, cubierta arbórea y cambios entre dos fechas. No sirve para nada que requiera un recuento.

La de instancias es un inventario. Cada tejado, copa de árbol o piscina llega como un polígono propio, con su propia fila en la tabla de atributos. Puedes contar, medir cada uno y unir una altura a cada uno. El precio es que el modelo debe decidir dónde termina un objeto, algo difícil en una hilera de casas adosadas, y los fallos se ven así: dos casas fusionadas, una copa partida en tres.

De dónde vienen los términos. Ambos son términos de visión por computadora. En 2014, Long, Shelhamer y Darrell demostraron que una red entrenada «de extremo a extremo, de píxeles a píxeles» podía hacer segmentación semántica. En 2017, Mask R-CNN añadió a un detector de objetos «una rama que predice una máscara de objeto», que es segmentación de instancias. En 2023, Segment Anything se entrenó con «más de 1000 millones de máscaras sobre 11 millones de imágenes con licencia y respetuosas con la privacidad», y es la familia en la que se basan hoy las herramientas de instancias de QGIS.

Segmentación panóptica, el tercer término

La segmentación panóptica asigna una clase a cada píxel, como la semántica, y además da un ID propio a cada objeto contable, como la de instancias. Kirillov y sus colegas bautizaron la tarea en 2018 y la definieron como una que «unifica las tareas habitualmente distintas de segmentación semántica (asignar una etiqueta de clase a cada píxel) y segmentación de instancias (detectar y segmentar cada instancia de objeto)».

El artículo divide las clases en dos tipos. Los objetos contables (en inglés, things) son edificios, vehículos, árboles. Las superficies (en inglés, stuff) son amorfas: césped, agua, pavimento. Un mapa panóptico cuenta los objetos y mide las superficies, en una sola capa sin huecos ni solapes. El mismo artículo propuso una única puntuación para ambos, la calidad panóptica (PQ), «para todas las clases (superficies y objetos)».

Dónde se usa en SIG. Las tierras de cultivo son el caso más claro. PASTIS, un conjunto de referencia francés, reúne 124 422 parcelas agrícolas en 2433 series temporales de Sentinel-2 a 10 m por píxel, que cubren unos 4000 km² de Francia. Cada píxel lleva a la vez un tipo de cultivo y un índice de parcela. Un modelo semántico entrenado con él dice «trigo aquí». Uno panóptico dice «trigo, parcela 57», así que puedes contar las parcelas y medir cada una. El artículo que lo respalda describe la segmentación panóptica de parcelas con precisión de píxel como una tarea con «importantes implicaciones económicas y medioambientales».

En la práctica, un equipo SIG rara vez necesita un modelo panóptico. Ejecuta una herramienta de instancias para los objetos contables, una semántica para las superficies, y apila las dos capas en QGIS. Obtienes el mismo mapa en dos pasos.

Lo que cuenta una máscara semántica: tres teselas francesas, medidas

Si poligonizas una máscara semántica de edificios, cuentas manzanas, no edificios: en 1 km² del centro de Lens, el mapa de cobertura del suelo con IA del IGN, hecho a partir de fotos aéreas de 20 cm, da 269 manchas de edificios, mientras que el registro nacional de edificios tiene 3006. Lo medimos el 23 de septiembre de 2026 en tres teselas de 1 km², cada una contrastada con los edificios de BD TOPO del IGN.

En una tesela de 1 km²Lens, centro urbanoLiévin, casas de ciudad mineraParís 11.º
Edificios en BD TOPO (20 m² o más)30069521759
Manchas en la máscara de IA a 20 cm (IGN CoSIA)26955895
Edificios hallados que comparten mancha97.5 %63 %99.5 %
Mediana de edificios en esa mancha30231
Manchas en la cobertura del suelo a 10 m (ESA WorldCover)1291
Área, máscara de IA / huellas / «superficie construida» a 10 m40.5 / 36.3 / 87.2 ha14.4 / 12.3 / 46.3 ha58.4 / 54.7 / 96.3 ha

Una máscara más fina no arregla el recuento. La máscara encuentra entre el 96 y el 97 % de los edificios de cada tesela, pero una hilera de casas o un bloque de viviendas comparten muros, así que ningún píxel de fondo separa dos casas, ni a 20 cm ni a 2 cm. En Lens y en París, un edificio hallado por la máscara está, en la mediana, en una mancha de unos 30.

Tres paneles de la misma ventana de 420 por 300 m en el centro de Lens: los edificios de BD TOPO, cada uno de un color; la máscara de edificios de CoSIA, casi toda en manchas de diez o más edificios; y la clase de superficie construida de WorldCover como una única mancha sólida.
Centro de Lens. A la izquierda, edificios de BD TOPO. En el centro y a la derecha, máscaras de edificios poligonizadas, con cada mancha coloreada según los edificios que contiene. IGN BD TOPO y CoSIA 2021-2023, ESA WorldCover 2021, medido el 23 de septiembre de 2026.

Liévin muestra dónde sí cuenta bien una máscara semántica. Las casas aisladas salen como una mancha cada una, y 344 de los 926 edificios hallados allí tienen una mancha para ellos solos. Las casas pareadas y las hileras del antiguo barrio minero salen como una mancha por conjunto, y por eso el edificio mediano está en una mancha de dos.

Tres paneles de una ventana en Liévin: casas aisladas como manchas verdes individuales, casas pareadas y hileras en manchas naranjas y rojas, y la cobertura del suelo a 10 m que fusiona todo el barrio.
Liévin, Cité Pasteur. Las casas aisladas se cuentan bien; las pareadas y las hileras, no. Mismas fuentes y fecha.

Para el área, la máscara semántica se acerca. La máscara de IA sale entre un 7 y un 17 % por encima de la suma de huellas, lo cual es esperable: ve tejados, que sobresalen de los muros que traza BD TOPO, y anexos pequeños. La clase «superficie construida» a 10 m equivale a entre 1.8 y 3.8 veces el área de las huellas, porque un píxel de 10 m que contiene un tejado, un patio y una acera se etiqueta como construido. Mide tejido urbano, no edificios.

Los árboles también se fusionan

En la tesela de París, 1296 de los 1583 árboles que inventaría la ciudad están dentro de la cubierta arbórea de la máscara de IA (a menos de 2 m del tronco), y el 89 % de ellos comparte mancha de copa con otro árbol inventariado. El paseo arbolado del bulevar Richard-Lenoir es una sola mancha que contiene 254 árboles inventariados. Contar copas a partir de una máscara de cubierta arbórea funciona con árboles aislados y falla a lo largo de una calle arbolada.

Cómo lo medimos

Las teselas son cuadrados de 1 km en Lambert 93 centrados en Lens (50.432 N, 2.832 E), Cité Pasteur en Liévin (50.433 N, 2.762 E) y el bulevar Richard-Lenoir (48.860 N, 2.370 E). Una mancha es un grupo de píxeles contiguos de la máscara de 20 m² o más, que es lo que genera Poligonizar en QGIS con su configuración por defecto, y un edificio cuenta como hallado cuando la mitad de su huella queda bajo la máscara. CoSIA solo se publica como mapa con estilo, así que lo leímos a unos 0.4 m y devolvimos cada color a su clase. Los pocos píxeles de borde que se pierden así parten manchas, de modo que los porcentajes anteriores son, en todo caso, bajos. Las fotos que sirven de base a CoSIA son anteriores al registro con el que las comparamos. BD TOPO a veces dibuja una casa pareada como un solo edificio. El inventario de París no incluye los árboles privados. Tres teselas son tres lugares, no una cifra nacional.

De la máscara a los polígonos en QGIS

Una máscara semántica necesita tres o cuatro pasos de procesamiento para convertirse en polígonos utilizables, mientras que una herramienta de instancias te entrega los polígonos directamente. Aquí tienes cada camino con las herramientas de QGIS que lo hacen.

Desde una máscara semántica

  1. Elimina el ruido. Ejecuta Ráster > Análisis > Sieve. «Elimina los polígonos ráster más pequeños que un umbral dado (en píxeles)» y los rellena con el valor del vecino más grande, según el manual de QGIS. El umbral por defecto es de 10 píxeles. A 20 cm, 10 píxeles son solo 0.4 m², así que súbelo hasta el tamaño del objeto más pequeño que te interese.
  2. Poligoniza. Ejecuta Ráster > Conversión > Poligonizar (ráster a vectorial). «Crea polígonos vectoriales para todas las regiones conectadas de píxeles del ráster que comparten un valor de píxel», con el valor en un campo llamado DN por defecto, según el manual. Deja desactivada la opción «Usa 8-conectividad». Si está activada, dos píxeles que solo se tocan por una esquina se unen, y dos edificios que coinciden en una esquina pasan a ser un solo polígono.
  3. Conserva la clase. Los píxeles de fondo también forman polígonos. Selecciona "DN" = 1 (o el valor de tu clase) y guarda la selección como una capa nueva.
  4. Decide qué es un objeto espacial. Para una superficie de clase, ejecuta el algoritmo Disolver sin indicar ningún campo: obtienes un solo objeto multiparte y una sola cifra de área. Para manchas, marca «Mantener objetos disjuntos separados» (QGIS 3.32 o posterior), o ejecuta Multiparte a monoparte desde la caja de herramientas de Procesos, y cada mancha se convierte en su propia fila.
  5. Limpia los bordes. Los bordes de los píxeles salen como escalones. La guía de ráster a vectorial explica cómo simplificar, suavizar y filtrar por área.

Lo que tienes tras el paso 4 es un polígono por mancha, no por objeto. La tabla de Lens de arriba muestra esa diferencia: 269 manchas para 3006 edificios.

Así se hacen también los grandes conjuntos de huellas. Las huellas de edificios globales de Microsoft se construyen en dos etapas: «Segmentación semántica», que reconoce los píxeles de edificio con redes neuronales profundas, y «Poligonización», que convierte esos píxeles en polígonos. Un píxel cuenta como edificio cuando su probabilidad supera 0.5. La etapa de polígonos es donde se separan los edificios, y es trabajo extra que un modelo semántico te deja a ti.

Desde una herramienta de instancias

  1. Ejecuta la herramienta en una zona. Cada objeto llega como un polígono propio, una fila en la tabla de atributos.
  2. Revisa los multipartes. Algunas herramientas devuelven un objeto en varias piezas. Multiparte a monoparte las separa; revisa las que se partieron antes de contar.
  3. Mide cada uno. Añade un campo con $area en la calculadora de campos y filtra las astillas menores que el objeto real más pequeño.
  4. Une lo que ya sabes. Cada polígono puede recibir una altura, una dirección o un ID de registro mediante una unión espacial, algo que una superficie de clase no permite.

Con AI Segmentation, los pasos 1 a 3 se reducen a uno: escribe building (edificio) o swimming pool (piscina), elige una zona, y cada objeto hallado vuelve como un polígono propio en una capa nueva. Con AI Agent, el camino semántico de arriba se ejecuta con una sola frase en un panel de chat dentro de QGIS: describes la capa que quieres y el agente ejecuta las mismas herramientas de QGIS, Sieve, Poligonizar y Disolver, y revisa el mapa antes de responder.

Qué produce cada herramienta de QGIS

La mayoría de los plugins de QGIS basados en modelos de cobertura del suelo son semánticos, y las herramientas basadas en Segment Anything son de instancias.

  • Semánticas: Deepness y la mayoría de los modelos de su zoo, el Semi-Automatic Classification Plugin, el modelo de cobertura del suelo de Mapflow.
  • De instancias: la familia Segment Anything, es decir, Geo-SAM, samgeo y los plugins SAM para QGIS. Un objeto por clic.
  • AI Segmentation, el plugin que hacemos en TerraLab para QGIS, es una herramienta de instancias. Nombras el objeto (un edificio, un árbol, una piscina) o dibujas un ejemplo, y devuelve un polígono por cada objeto hallado en la zona. La guía de huellas de edificios muestra el resultado en una manzana densa. Donde los edificios ya están cartografiados, el descargador gratuito de huellas te da esos polígonos de instancias como GeoJSON sin ejecutar nada.

Preguntas frecuentes

Las respuestas breves de abajo cubren lo que la gente busca junto a estos dos términos.

¿Cuál es la diferencia entre segmentación semántica, de instancias y panóptica?

La segmentación semántica da una clase a cada píxel. La de instancias separa cada objeto de una clase en su propia máscara. La panóptica hace ambas cosas a la vez: cada píxel recibe una clase, y cada objeto contable, como un edificio o un vehículo, recibe además su propio ID.

¿Cuál debo usar en un proyecto SIG?

Usa la semántica cuando la respuesta sea un área o una proporción: cubierta arbórea, superficie impermeable, terreno inundado. Usa la de instancias cuando la respuesta sea un recuento o un atributo por objeto: edificios, árboles, piscinas, paneles solares. Si necesitas ambas, ejecuta una de cada y apila las capas.

¿La detección de objetos es lo mismo que la segmentación de instancias?

No. La detección de objetos devuelve un rectángulo alrededor de cada objeto. La segmentación de instancias devuelve su contorno, píxel a píxel. Para un mapa casi siempre quieres el contorno.

¿Puedo convertir una máscara semántica en instancias?

A veces. Poligoniza la máscara y luego divide los polígonos por los estrechamientos. Funciona con objetos separados, como las copas de un huerto. Falla en una hilera de casas adosadas, donde no hay ningún estrechamiento por donde cortar.

¿La resolución de las imágenes cambia la respuesta?

Sí, pero menos de lo que se cree. A 10 m una casa ocupa uno o dos píxeles y no hay nada que separar, así que la cobertura del suelo por satélite es semántica por necesidad. A 20 cm una casa son miles de píxeles y la segmentación de instancias es posible, pero una máscara semántica a 20 cm sigue fusionando todas las casas que comparten un muro: en el centro de Lens, el 97.5 % de los edificios que halla comparten mancha.

¿Por qué mi máscara poligonizada da un solo polígono para toda una manzana?

Porque las casas de esa manzana comparten muros, así que ningún píxel de fondo las separa en la máscara. Poligonizar une todos los píxeles conectados del mismo valor en un solo polígono. Solo un modelo de instancias, que dibuja cada objeto por separado, las distingue.

¿Segment Anything es segmentación de instancias?

Sí, por su salida: devuelve una máscara por cada objeto que señalas, así que dos tejados contiguos vuelven como dos máscaras. El modelo original, eso sí, no da etiqueta de clase. Separa los objetos sin nombrarlos, y las herramientas de QGIS construidas sobre él toman la clase de tu clic o de tu prompt.

La segmentación semántica y la de instancias forman parte de la categoría más amplia de GeoAI. Qué es GeoAI explica el término del que estas dos son ejemplos. Mapear copas de árboles muestra ambos lados con árboles: cubierta arbórea a partir de una máscara, o un polígono por copa. El centro de IA para QGIS reúne lo que la IA puede y no puede hacer dentro de QGIS.