Sciences de la vie• 3 min de lecture8 octobre 2026

HSCM-Lane : Utilisation de la modélisation de contexte à fenêtre décalée pour la segmentation de voies au niveau du pixel

HSCM-Lane améliore la détection du marquage au sol dans les véhicules autonomes en combinant un encodeur-décodeur ResNet avec une modélisation de contexte à fenêtre décalée à plusieurs niveaux. Sur l'ensemble de validation BDD100K, la petite version du modèle atteint 34,44 % d'intersection sur union des voies.

En bref: HSCM-Lane améliore la détection du marquage au sol dans les véhicules autonomes en combinant un encodeur-décodeur ResNet avec une modélisation de contexte à fenêtre décalée à plusieurs niveaux. Sur l'ensemble de validation BDD100K, la petite version du modèle atteint 34,44 % d'intersection sur union des voies.

Conduire en toute sécurité exige qu'une voiture autonome détecte de faibles lignes de route même lorsqu'elles sont cachées par des ombres, effacées ou aspergées de pluie. Une nouvelle approche de vision par ordinateur appelée HSCM-Lane vise à résoudre ce défi en aidant les systèmes à « voir » la vue d'ensemble de la route sans perdre les fins détails géométriques.

Ce qui s'est passé, en mots simples

Des chercheurs ont proposé HSCM-Lane, une architecture encodeur-décodeur conçue pour prédire des masques de voies binaires pour les systèmes avancés d'aide à la conduite et les véhicules autonomes. Le modèle utilise un réseau de base ResNet amélioré par un module de contexte Swin hiérarchique, qui applique une modélisation de contexte à fenêtre décalée aux niveaux de caractéristiques de l'encodeur 1/4, 1/8 et 1/16. En utilisant le jeu de données BDD100K pour l'entraînement et la validation, la petite configuration a atteint 34,44 % d'intersection sur union de la classe de voies, 65,00 % de rappel de voies et 82,12 % de précision équilibrée, contre 33,00 %, 62,48 % et 80,38 % pour son homologue sans le module de contexte. Le redimensionnement du réseau de base a donné 34,86 % d'intersection sur union des voies pour la version moyenne et 34,98 % pour la grande version. Lors d'une évaluation hors domaine sur TuSimple, les versions petite, moyenne et grande ont atteint 27,2 %, 27,6 % et 27,6 % d'intersection sur union des voies sans réglage fin sur le domaine cible.

Points clés

  • Modélisation du contexte à plusieurs niveaux: Le modèle intègre une modélisation de contexte à fenêtre décalée aux niveaux de caractéristiques 1/4, 1/8 et 1/16 d'un encodeur ResNet pour aider à maintenir la continuité à travers des régions de voies faibles ou discontinues.
  • Améliorations des performances: Sur l'ensemble de validation BDD100K, HSCM-Lane-S a surperformé son homologue sans HSCM de 1,44 point de pourcentage en intersection sur union des voies, 2,52 points en rappel de voies et 1,74 point en précision équilibrée.
  • Mise à l'échelle du réseau de base: Tester différentes capacités du réseau de base ResNet a montré un compromis progressif entre qualité et coût, les réseaux plus grands produisant des gains incrémentiels de l'intersection sur union des voies.
  • Tests inter-ensembles de données: Sans réglage fin sur le domaine cible, les modèles ont atteint de 27,2 % à 27,6 % d'intersection sur union des voies dans le cadre d'un protocole d'évaluation hors domaine dérivé au niveau du pixel sur le jeu de données TuSimple.

Termes expliqués

  • Segmentation de voies au niveau du pixel — Une tâche de vision par ordinateur où chaque pixel d'une image est classé soit comme appartenant à une voie de circulation, soit comme appartenant à l'arrière-plan. Exemple: Colorier en bleu chaque pixel qui compose la ligne de division peinte en blanc sur une autoroute, et tout le reste en noir.
  • Réseau de base ResNet — Une structure de réseau de neurones fondamentale utilisée pour traiter les images qui aide à prévenir la perte d'information lorsque les données traversent de nombreuses couches du réseau. Exemple: Une chaîne de montage de filtres qui décompose la photo d'une rue en caractéristiques plus simples comme des bords, des formes et des textures.
  • Intersection sur Union (IoU) — Métrique standard utilisée pour mesurer dans quelle mesure la forme prédite par un modèle informatique correspond à la forme cible réelle. Exemple: Comparer le contour dessiné d'une place de stationnement avec la vraie place de stationnement peinte pour voir dans quelle mesure les deux zones se superposent.
  • Architecture encodeur-décodeur — Une conception de réseau de neurones où la première partie compresse l'image d'entrée en caractéristiques compactes, et la seconde partie réassocie ces caractéristiques à la taille d'image d'origine pour générer une sortie détaillée. Exemple: Résumer un long livre en points clés, puis réécrire une nouvelle version basée uniquement sur ces notes.

Pourquoi c'est important

Une meilleure détection des voies aide les systèmes avancés d'aide à la conduite et les véhicules autonomes à maintenir les véhicules au centre de leur voie, même dans des conditions difficiles telles que de la peinture effacée, des ombres ou du mauvais temps. Cette recherche offre un moyen structuré d'améliorer la précision du masque de voies tout en gardant le système suffisamment léger pour une utilisation en temps réel.

Ce que l'on ne sait pas encore

La source note que des travaux futurs sont encore nécessaires pour aborder la cohérence temporelle, la détection au niveau de l'instance, les données multimodales, la planification des véhicules et la validation de la sécurité.


Source : PLOS ONE. L'original est sous licence CC BY 4.0. Ce texte est une adaptation réalisée avec l'aide d'une IA (résumée, simplifiée et traduite) et peut différer de l'original.