Accurately extracting building footprints from satellite or aerial imagery has long posed a challenge in the geospatial field, particularly when it comes to preserving geometric precision. Traditional methods often prioritise speed over detail, resulting in outputs that do not meet the accuracy requirements of urban planning, infrastructure development and environmental monitoring. This is where HiSup comes in – it is a promising new method aimed at closing the geometry gap in building footprint extraction.

Dans cet article, nous examinons pour la première fois HiSup, en explorant comment il améliore la précision des polygones et représente une avancée significative dans la création de jeux de données géospatiales de haute qualité.

Des masques raster aux vecteurs prêts pour l'entreprise

Dans l'un de nos articles précédents sur reconnaissance automatisée des bâtiments, nous avons démontré un pipeline de segmentation très performant. Cependant, dès que nous avons partagé les résultats avec des assureurs, des analystes en réponse d'urgence et des spécialistes du cadastre, une préoccupation a immédiatement émergé :

Les polygones ne s'alignent pas avec les murs.

These teams work with vector footprints every day that must snap to parcel boundaries, setback lines, or flood-risk buffers. Classical post-processing techniques such as Douglas–Peucker simplification, marching squares and hand-tuned regularisation could not bridge the gap between our smooth raster masks and the crisp geometry required. The root cause is the well-known mask-reversibility problem: convolutional networks learn region consistency first and boundary precision second. This means that information which would enable perfect back-conversion to polygons is lost during training.

Un changement radical était nécessaire.

HiSup : supervision hiérarchique pour l'apprentissage sensible à la forme

Le modèle HiSup (Hierarchical Supervision) a été introduit par Bowen Xu, Jiakun Xu, Nan Xue et Gui-Song Xia dans l'ISPRS Journal of Photogrammetry and Remote Sensing (2023).

Pourquoi la précision au niveau des polygones reste importante

Although high-resolution satellite imagery has made the semantic segmentation of buildings relatively routine, most geospatial workflows, from cadastral updates to insurance risk models, consume vector polygons rather than raster masks. Conventional pipelines therefore first segment and then vectorise, typically using Douglas–Peucker or marching squares heuristics. This approach has two drawbacks:

  • Écart de performance entre masque et polygone

Les masques haute performance atteignent un IoU élevé, mais une fois vectorisés, leur précision moyenne diminue considérablement, par exemple de 79 % → 67 % sur le benchmark AICrowd.

  • Masques irréversibles

Les détails fins des limites sont perdus dans les têtes sémantiques qui optimisent uniquement la cohérence des régions, rendant impossible une reconversion fidèle en polygones.

Présentation de HiSup pour une détection précise des empreintes

La Supervision Hiérarchique résout le goulot d'étranglement de la « réversibilité du masque » en entraînant simultanément trois niveaux géométriques :

HiSup

A lightweight, cross-level interaction module incorporates the mid-level attraction field into both the vertex and mask heads, reinforced by an efficient channel-attention mechanism. The result is masks that already ‘know’ where their precise boundaries lie, making the final polygonisation process trivial – boundary pixels are simply attracted to the nearest predicted vertex (MaV-Attr).

Gains quantifiables

Sur l'ensemble de validation du AICrowd Mapping Challenge :

  • AP (COCO 0,5-0,95) : 79,4 % – en hausse de +12,4 points par rapport à Frame-Field et de +5,6 points par rapport au meilleur modèle conjoint sommet-arête précédent.
  • APboundary : 66,5 % – une progression de +16,5 pp qui reflète une véritable fidélité de pointe.
  • Dissimilarité PoLiS : 0,726 – la plus faible parmi toutes les méthodes publiées, confirmant une redondance minimale des sommets.
  • Sur le benchmark inter-villes Inria Aerial Image Labeling, HiSup atteint 75,5 % d'IoU et 96,3 % de précision au niveau des pixels, dépassant toutes les approches polygonales antérieures sans ajustement spécifique à chaque ville.

Impact commercial pour les pipelines géospatiaux

HiSup offers a range of tangible benefits for geospatial data processing workflows. By producing cleaner vectors with fewer vertices, it significantly reduces file sizes, resulting in lower storage requirements and reduced network transfer costs. Its fast post-processing capabilities – achieving speeds under 5 milliseconds on a 300 × 300 tile – eliminate the need for global graph optimisation, thereby streamlining downstream operations. The model also preserves sharp boundary details, which are essential for tasks such as setback analysis, flood-risk mapping and property-tax assessments. HiSup is also highly flexible, being compatible with HRNet and U-ResNet, and having been trained end-to-end using standard BCE and L1 loss functions. This makes it easily adaptable to various deployment environments.

Notre benchmark interne : résultats de premier passage

Nous avons affiné HiSup à l'aide d'un ensemble de données restreint mais de haute qualité, composé de diverses empreintes européennes et nord-américaines. Les chiffres préliminaires ci-dessous sont déjà encourageants.

Masque de probabilité sémantique vs superposition de polygones HiSup

HiSup

Précision de la surface d'empreinte

HiSup

The MAE shows that the error distribution is heavy-tailed: over-prediction occurs on closely spaced terraced houses. The MSE metric amplifies the same outliers. Once we fine-tune for densely spaced footprints, we expect this to drop sharply. The RMSE metric, which is equivalent to misplacing a 10.85 m × 10.85 m square, is already workable for parcel-level screening tasks. When examining the mean average percentage error, the small sheds skew the percentage errors.

Métriques de segmentation classiques

HiSup

The Polygon IoU is much lower than indicated in the papers, suggesting a significant difference between our area of interest and the training dataset in terms of building appearance. Fine-tuning on regional data should help. Smaller and more irregular structures also contribute to lower scores. The F1-score often exceeds the 0.70 threshold frequently referenced in the context of semi-automated mapping workflows. Overall accuracy is inflated by the dominant background class – see the per-class figures for a more accurate picture. Average accuracy provides a balanced view of both classes, but there is still room for improvement.

Correspondance de polygones à plusieurs seuils de chevauchement Ground Truth

À l'aide de cette évaluation, nous souhaitons voir combien de bâtiments individuels nous détectons à différents seuils de chevauchement GT.

HiSup

Environ les trois quarts des empreintes coïncident avec la vérité terrain d'au moins 50%, qui est déjà au niveau des références publiques. La baisse progressive avec 75–80% seuils de chevauchement confirment que HiSup conserve mieux les détails des limites que ne le font les pipelines de vectorisation de masques. À 90% chevauchement, le chevauchement strict met en évidence la sensibilité aux annexes, aux toits en surplomb et aux toits masqués par les arbres. Les indices de hauteur sont les prochains sur notre feuille de route. Enfin, à 95% se chevauchent, près de six polygones sur dix sont presque parfaitement alignés au pixel près, offrant une base solide pour les mises à jour cadastrales automatisées.

An important caveat is that the model has not yet been fine-tuned for local architectural styles, roof-edge materials, or off-nadir distortions. We expect to see significant improvements once we adapt the final layers to the data distribution of each region.

Pourquoi cela compte pour votre entreprise

HiSUp

Vecteurs de construction précis et légers à travers le portefeuille Spyrosoft

Les sorties d'empreintes de bâtiments précises et compactes de HiSup créent de la valeur bien au-delà du domaine géospatial, générant un effet d'entraînement dans de multiples domaines d'expertise de Spyrosoft. Dans notre services géospatiaux et de geoAI, par exemple, les empreintes HiSup s'intègrent parfaitement dans les chaînes d'outils existantes, permettant des applications telles que des tableaux de bord de détection de changements et des modèles de taxation à l'échelle parcellaire. Dans notre intelligence artificielle et apprentissage automatique pratique, ces vecteurs sensibles à la forme facilitent le développement de systèmes complets de surveillance des actifs et de pipelines sophistiqués de notation des risques.

Du point de vue du déploiement, HiSup s'intègre naturellement dans notre offre de plateformes cloud et de données. It can be run efficiently on scalable Kubernetes clusters or serverless GPU infrastructure, with outputs streamed directly into cloud-native data and business intelligence ecosystems for real-time spatial analytics. HiSup delivers clean, ready-to-use building polygons that require no additional post-processing across various industry verticals, including insurers (within our domaine des services financiers), équipes d'intervention d'urgence (défense et aérospatiale), opérateurs de smart city (industrie 4.0et les fournisseurs de services publics, accélérant le retour sur investissement dans les flux de travail critiques.

Zoom sur les polygones prédits

HiSUp

En conclusion

HiSup integrates seamlessly into our Geospatial Services and AI practice, supporting everything from satellite-image tiling to vector-tile delivery within domain-specific data pipelines. Its mature model lifecycle management, which spans scalable data labelling, experiment tracking, on-device quantisation and MLOps, ensures reliability and performance, whether it is deployed in the cloud or on-premises.

By combining HiSup with our expertise in developing end-to-end GeoAI solutions, we help our clients to speed up innovation in geospatial intelligence. So, if your project requires custom integration, our cross-functional teams can take you from prototype to production while meeting industry-specific compliance standards. Fill in the form below and let’s connect!

FAQ : HiSup

Traditional segmentation models produce raster masks that often look visually correct but fail to align precisely with real building walls once converted to polygons. This “mask reversibility” problem results in geometry loss during training. HiSup addresses this by learning boundary-aware representations, enabling more accurate and business-ready polygon outputs.

Conventional workflows rely on post-processing techniques such as Douglas–Peucker simplification or marching squares. While these methods can simplify geometry, they cannot recover boundary details that were never learned by the model. As a result, vectorised polygons often show reduced precision compared to the original masks.

HiSup utilise une supervision hiérarchique pour entraîner simultanément trois niveaux géométriques :
– Prédiction de masque au niveau du pixel
– Champs d'attraction de niveau intermédiaire
– Détection de polygones au niveau des sommets
A cross-level interaction module ensures that mask predictions are aware of their precise boundaries. During polygonisation, boundary pixels are simply attracted to the nearest predicted vertex, making the conversion process both accurate and efficient.

Many professional workflows (including cadastral updates, flood-risk analysis, insurance modelling and property taxation) operate on vector polygons, not raster masks. Precise boundaries ensure alignment with parcel data, zoning rules and infrastructure layers, directly affecting decision-making quality and regulatory compliance.

Yes. HiSup is lightweight and flexible. It integrates with architectures such as HRNet and U-ResNet and can be trained end-to-end using standard BCE and L1 loss functions. This makes it suitable for various deployment scenarios, including cloud-native and on-premises environments.