Segmentación semántica vs segmentación de instancias
Publicado el Actualizado el

La segmentación semántica asigna una clase a cada píxel de una imagen: este píxel es edificio, aquel es carretera, el siguiente es árbol. La segmentación de instancias va un paso más allá y separa entre sí los objetos de una misma clase: este píxel es el edificio número 12, aquel es el número 13.
La diferencia en una línea
La semántica responde «cuánto». La de instancias responde «cuántos, y cuál». La panóptica, el tercer término, responde ambas cosas en el mismo mapa.
La misma imagen, etiquetada de dos maneras. La segmentación semántica pinta todos los edificios del mismo color. La de instancias da a cada uno su propio contorno y su propio número.

| Semántica | Instancias | Panóptica | |
|---|---|---|---|
| Salida | Una clase por píxel | Una máscara por objeto | Una clase por píxel, más un ID de objeto en lo contable |
| Dos casas contiguas | Una máscara | Dos objetos | Dos objetos |
| Qué cuenta como objeto | Nada: una clase es una superficie | Cada tejado, copa, piscina o vehículo | Cada elemento contable; las superficies siguen siendo superficies |
| ¿Se puede contar? | No | Sí | Sí, en las clases contables |
| Uso SIG habitual | Cobertura del suelo, cubierta arbórea, superficie impermeable, cambios | Inventarios de edificios, árboles, piscinas y paneles | Mapas de escena completa, parcelas agrícolas |
| Modelos habituales | U-Net, DeepLab | Mask R-CNN, la familia Segment Anything | Dos cabezales, o un solo modelo entrenado con etiquetas panópticas |
| Pasar a vectorial en QGIS | Poligonizar y después limpiar | Ya es un polígono por objeto | Poligonizar las clases y conservar los ID de objeto |

Qué te da cada una en un mapa
Un modelo semántico te da superficies que medir, y un modelo de instancias te da objetos que contar.
La semántica es un mapa de cobertura del suelo con bordes nítidos: una máscara de edificios, una de carreteras, una de vegetación. Sirve para estadísticas de área, superficie impermeable, cubierta arbórea y cambios entre dos fechas. No sirve para nada que requiera un recuento.
La de instancias es un inventario. Cada tejado, copa de árbol o piscina llega como un polígono propio, con su propia fila en la tabla de atributos. Puedes contar, medir cada uno y unir una altura a cada uno. El precio es que el modelo debe decidir dónde termina un objeto, algo difícil en una hilera de casas adosadas, y los fallos se ven así: dos casas fusionadas, una copa partida en tres.
De dónde vienen los términos. Ambos son términos de visión por computadora. En 2014, Long, Shelhamer y Darrell demostraron que una red entrenada «de extremo a extremo, de píxeles a píxeles» podía hacer segmentación semántica. En 2017, Mask R-CNN añadió a un detector de objetos «una rama que predice una máscara de objeto», que es segmentación de instancias. En 2023, Segment Anything se entrenó con «más de 1000 millones de máscaras sobre 11 millones de imágenes con licencia y respetuosas con la privacidad», y es la familia en la que se basan hoy las herramientas de instancias de QGIS.
Segmentación panóptica, el tercer término
La segmentación panóptica asigna una clase a cada píxel, como la semántica, y además da un ID propio a cada objeto contable, como la de instancias. Kirillov y sus colegas bautizaron la tarea en 2018 y la definieron como una que «unifica las tareas habitualmente distintas de segmentación semántica (asignar una etiqueta de clase a cada píxel) y segmentación de instancias (detectar y segmentar cada instancia de objeto)».
El artículo divide las clases en dos tipos. Los objetos contables (en inglés, things) son edificios, vehículos, árboles. Las superficies (en inglés, stuff) son amorfas: césped, agua, pavimento. Un mapa panóptico cuenta los objetos y mide las superficies, en una sola capa sin huecos ni solapes. El mismo artículo propuso una única puntuación para ambos, la calidad panóptica (PQ), «para todas las clases (superficies y objetos)».
Dónde se usa en SIG. Las tierras de cultivo son el caso más claro. PASTIS, un conjunto de referencia francés, reúne 124 422 parcelas agrícolas en 2433 series temporales de Sentinel-2 a 10 m por píxel, que cubren unos 4000 km² de Francia. Cada píxel lleva a la vez un tipo de cultivo y un índice de parcela. Un modelo semántico entrenado con él dice «trigo aquí». Uno panóptico dice «trigo, parcela 57», así que puedes contar las parcelas y medir cada una. El artículo que lo respalda describe la segmentación panóptica de parcelas con precisión de píxel como una tarea con «importantes implicaciones económicas y medioambientales».
En la práctica, un equipo SIG rara vez necesita un modelo panóptico. Ejecuta una herramienta de instancias para los objetos contables, una semántica para las superficies, y apila las dos capas en QGIS. Obtienes el mismo mapa en dos pasos.
Lo que cuenta una máscara semántica: tres teselas francesas, medidas
Si poligonizas una máscara semántica de edificios, cuentas manzanas, no edificios: en 1 km² del centro de Lens, el mapa de cobertura del suelo con IA del IGN, hecho a partir de fotos aéreas de 20 cm, da 269 manchas de edificios, mientras que el registro nacional de edificios tiene 3006. Lo medimos el 23 de septiembre de 2026 en tres teselas de 1 km², cada una contrastada con los edificios de BD TOPO del IGN.
| En una tesela de 1 km² | Lens, centro urbano | Liévin, casas de ciudad minera | París 11.º |
|---|---|---|---|
| Edificios en BD TOPO (20 m² o más) | 3006 | 952 | 1759 |
| Manchas en la máscara de IA a 20 cm (IGN CoSIA) | 269 | 558 | 95 |
| Edificios hallados que comparten mancha | 97.5 % | 63 % | 99.5 % |
| Mediana de edificios en esa mancha | 30 | 2 | 31 |
| Manchas en la cobertura del suelo a 10 m (ESA WorldCover) | 1 | 29 | 1 |
| Área, máscara de IA / huellas / «superficie construida» a 10 m | 40.5 / 36.3 / 87.2 ha | 14.4 / 12.3 / 46.3 ha | 58.4 / 54.7 / 96.3 ha |
Una máscara más fina no arregla el recuento. La máscara encuentra entre el 96 y el 97 % de los edificios de cada tesela, pero una hilera de casas o un bloque de viviendas comparten muros, así que ningún píxel de fondo separa dos casas, ni a 20 cm ni a 2 cm. En Lens y en París, un edificio hallado por la máscara está, en la mediana, en una mancha de unos 30.

Liévin muestra dónde sí cuenta bien una máscara semántica. Las casas aisladas salen como una mancha cada una, y 344 de los 926 edificios hallados allí tienen una mancha para ellos solos. Las casas pareadas y las hileras del antiguo barrio minero salen como una mancha por conjunto, y por eso el edificio mediano está en una mancha de dos.

Para el área, la máscara semántica se acerca. La máscara de IA sale entre un 7 y un 17 % por encima de la suma de huellas, lo cual es esperable: ve tejados, que sobresalen de los muros que traza BD TOPO, y anexos pequeños. La clase «superficie construida» a 10 m equivale a entre 1.8 y 3.8 veces el área de las huellas, porque un píxel de 10 m que contiene un tejado, un patio y una acera se etiqueta como construido. Mide tejido urbano, no edificios.
Los árboles también se fusionan
En la tesela de París, 1296 de los 1583 árboles que inventaría la ciudad están dentro de la cubierta arbórea de la máscara de IA (a menos de 2 m del tronco), y el 89 % de ellos comparte mancha de copa con otro árbol inventariado. El paseo arbolado del bulevar Richard-Lenoir es una sola mancha que contiene 254 árboles inventariados. Contar copas a partir de una máscara de cubierta arbórea funciona con árboles aislados y falla a lo largo de una calle arbolada.
Cómo lo medimos
Las teselas son cuadrados de 1 km en Lambert 93 centrados en Lens (50.432 N, 2.832 E), Cité Pasteur en Liévin (50.433 N, 2.762 E) y el bulevar Richard-Lenoir (48.860 N, 2.370 E). Una mancha es un grupo de píxeles contiguos de la máscara de 20 m² o más, que es lo que genera Poligonizar en QGIS con su configuración por defecto, y un edificio cuenta como hallado cuando la mitad de su huella queda bajo la máscara. CoSIA solo se publica como mapa con estilo, así que lo leímos a unos 0.4 m y devolvimos cada color a su clase. Los pocos píxeles de borde que se pierden así parten manchas, de modo que los porcentajes anteriores son, en todo caso, bajos. Las fotos que sirven de base a CoSIA son anteriores al registro con el que las comparamos. BD TOPO a veces dibuja una casa pareada como un solo edificio. El inventario de París no incluye los árboles privados. Tres teselas son tres lugares, no una cifra nacional.
De la máscara a los polígonos en QGIS
Una máscara semántica necesita tres o cuatro pasos de procesamiento para convertirse en polígonos utilizables, mientras que una herramienta de instancias te entrega los polígonos directamente. Aquí tienes cada camino con las herramientas de QGIS que lo hacen.
Desde una máscara semántica
- Elimina el ruido. Ejecuta
Ráster > Análisis > Sieve. «Elimina los polígonos ráster más pequeños que un umbral dado (en píxeles)» y los rellena con el valor del vecino más grande, según el manual de QGIS. El umbral por defecto es de 10 píxeles. A 20 cm, 10 píxeles son solo 0.4 m², así que súbelo hasta el tamaño del objeto más pequeño que te interese. - Poligoniza. Ejecuta
Ráster > Conversión > Poligonizar (ráster a vectorial). «Crea polígonos vectoriales para todas las regiones conectadas de píxeles del ráster que comparten un valor de píxel», con el valor en un campo llamadoDNpor defecto, según el manual. Deja desactivada la opción «Usa 8-conectividad». Si está activada, dos píxeles que solo se tocan por una esquina se unen, y dos edificios que coinciden en una esquina pasan a ser un solo polígono. - Conserva la clase. Los píxeles de fondo también forman polígonos. Selecciona
"DN" = 1(o el valor de tu clase) y guarda la selección como una capa nueva. - Decide qué es un objeto espacial. Para una superficie de clase, ejecuta el algoritmo Disolver sin indicar ningún campo: obtienes un solo objeto multiparte y una sola cifra de área. Para manchas, marca «Mantener objetos disjuntos separados» (QGIS 3.32 o posterior), o ejecuta Multiparte a monoparte desde la caja de herramientas de Procesos, y cada mancha se convierte en su propia fila.
- Limpia los bordes. Los bordes de los píxeles salen como escalones. La guía de ráster a vectorial explica cómo simplificar, suavizar y filtrar por área.
Lo que tienes tras el paso 4 es un polígono por mancha, no por objeto. La tabla de Lens de arriba muestra esa diferencia: 269 manchas para 3006 edificios.
Así se hacen también los grandes conjuntos de huellas. Las huellas de edificios globales de Microsoft se construyen en dos etapas: «Segmentación semántica», que reconoce los píxeles de edificio con redes neuronales profundas, y «Poligonización», que convierte esos píxeles en polígonos. Un píxel cuenta como edificio cuando su probabilidad supera 0.5. La etapa de polígonos es donde se separan los edificios, y es trabajo extra que un modelo semántico te deja a ti.
Desde una herramienta de instancias
- Ejecuta la herramienta en una zona. Cada objeto llega como un polígono propio, una fila en la tabla de atributos.
- Revisa los multipartes. Algunas herramientas devuelven un objeto en varias piezas. Multiparte a monoparte las separa; revisa las que se partieron antes de contar.
- Mide cada uno. Añade un campo con
$areaen la calculadora de campos y filtra las astillas menores que el objeto real más pequeño. - Une lo que ya sabes. Cada polígono puede recibir una altura, una dirección o un ID de registro mediante una unión espacial, algo que una superficie de clase no permite.
Con AI Segmentation, los pasos 1 a 3 se reducen a uno: escribe building (edificio) o swimming pool (piscina), elige una zona, y cada objeto hallado vuelve como un polígono propio en una capa nueva. Con AI Agent, el camino semántico de arriba se ejecuta con una sola frase en un panel de chat dentro de QGIS: describes la capa que quieres y el agente ejecuta las mismas herramientas de QGIS, Sieve, Poligonizar y Disolver, y revisa el mapa antes de responder.
Qué produce cada herramienta de QGIS
La mayoría de los plugins de QGIS basados en modelos de cobertura del suelo son semánticos, y las herramientas basadas en Segment Anything son de instancias.
- Semánticas: Deepness y la mayoría de los modelos de su zoo, el Semi-Automatic Classification Plugin, el modelo de cobertura del suelo de Mapflow.
- De instancias: la familia Segment Anything, es decir, Geo-SAM, samgeo y los plugins SAM para QGIS. Un objeto por clic.
- AI Segmentation, el plugin que hacemos en TerraLab para QGIS, es una herramienta de instancias. Nombras el objeto (un edificio, un árbol, una piscina) o dibujas un ejemplo, y devuelve un polígono por cada objeto hallado en la zona. La guía de huellas de edificios muestra el resultado en una manzana densa. Donde los edificios ya están cartografiados, el descargador gratuito de huellas te da esos polígonos de instancias como GeoJSON sin ejecutar nada.
Preguntas frecuentes
Las respuestas breves de abajo cubren lo que la gente busca junto a estos dos términos.
¿Cuál es la diferencia entre segmentación semántica, de instancias y panóptica?
La segmentación semántica da una clase a cada píxel. La de instancias separa cada objeto de una clase en su propia máscara. La panóptica hace ambas cosas a la vez: cada píxel recibe una clase, y cada objeto contable, como un edificio o un vehículo, recibe además su propio ID.
¿Cuál debo usar en un proyecto SIG?
Usa la semántica cuando la respuesta sea un área o una proporción: cubierta arbórea, superficie impermeable, terreno inundado. Usa la de instancias cuando la respuesta sea un recuento o un atributo por objeto: edificios, árboles, piscinas, paneles solares. Si necesitas ambas, ejecuta una de cada y apila las capas.
¿La detección de objetos es lo mismo que la segmentación de instancias?
No. La detección de objetos devuelve un rectángulo alrededor de cada objeto. La segmentación de instancias devuelve su contorno, píxel a píxel. Para un mapa casi siempre quieres el contorno.
¿Puedo convertir una máscara semántica en instancias?
A veces. Poligoniza la máscara y luego divide los polígonos por los estrechamientos. Funciona con objetos separados, como las copas de un huerto. Falla en una hilera de casas adosadas, donde no hay ningún estrechamiento por donde cortar.
¿La resolución de las imágenes cambia la respuesta?
Sí, pero menos de lo que se cree. A 10 m una casa ocupa uno o dos píxeles y no hay nada que separar, así que la cobertura del suelo por satélite es semántica por necesidad. A 20 cm una casa son miles de píxeles y la segmentación de instancias es posible, pero una máscara semántica a 20 cm sigue fusionando todas las casas que comparten un muro: en el centro de Lens, el 97.5 % de los edificios que halla comparten mancha.
¿Por qué mi máscara poligonizada da un solo polígono para toda una manzana?
Porque las casas de esa manzana comparten muros, así que ningún píxel de fondo las separa en la máscara. Poligonizar une todos los píxeles conectados del mismo valor en un solo polígono. Solo un modelo de instancias, que dibuja cada objeto por separado, las distingue.
¿Segment Anything es segmentación de instancias?
Sí, por su salida: devuelve una máscara por cada objeto que señalas, así que dos tejados contiguos vuelven como dos máscaras. El modelo original, eso sí, no da etiqueta de clase. Separa los objetos sin nombrarlos, y las herramientas de QGIS construidas sobre él toman la clase de tu clic o de tu prompt.
La segmentación semántica y la de instancias forman parte de la categoría más amplia de GeoAI. Qué es GeoAI explica el término del que estas dos son ejemplos. Mapear copas de árboles muestra ambos lados con árboles: cubierta arbórea a partir de una máscara, o un polígono por copa. El centro de IA para QGIS reúne lo que la IA puede y no puede hacer dentro de QGIS.
, es una herramienta de instancias. Nombras el objeto (un edificio, un árbol, una piscina) o dibujas un ejemplo, y devuelve un polígono por cada objeto hallado en la zona. La 

