Biotecnología• 3 min de lectura8 de octubre de 2026

HSCM-Lane: Uso de Modelado de Contexto con Ventana Desplazada para la Segmentación de Carriles a Nivel de Píxel

HSCM-Lane mejora la detección de marcas viales en vehículos autónomos combinando un codificador-decodificador ResNet con un modelado de contexto de ventana desplazada multinivel. En el conjunto de validación BDD100K, la versión pequeña del modelo alcanza una intersección sobre unión de carriles del 34.44%.

En resumen: HSCM-Lane mejora la detección de marcas viales en vehículos autónomos combinando un codificador-decodificador ResNet con un modelado de contexto de ventana desplazada multinivel. En el conjunto de validación BDD100K, la versión pequeña del modelo alcanza una intersección sobre unión de carriles del 34.44%.

Conducir de forma segura requiere que un coche autónomo detecte líneas de carretera tenues incluso cuando están ocultas por sombras, desgastadas o salpicadas de lluvia. Un nuevo enfoque de visión por computadora llamado HSCM-Lane pretende resolver este desafío ayudando a los sistemas a "ver" el panorama general de la carretera sin perder finos detalles geométricos.

Qué ocurrió, en palabras sencillas

Los investigadores propusieron HSCM-Lane, una arquitectura codificadora-decodificadora diseñada para predecir máscaras de carriles binarias para sistemas avanzados de asistencia al conductor y vehículos autónomos. El modelo utiliza una columna vertebral ResNet mejorada por un Módulo de Contexto Swin Jerárquico, que aplica un modelado de contexto con ventana desplazada en los niveles de características del codificador 1/4, 1/8 y 1/16. Utilizando el conjunto de datos BDD100K para entrenamiento y validación, la configuración pequeña logró una intersección sobre unión de la clase de carril del 34.44%, una recuperación de carriles del 65.00% y una precisión equilibrada del 82.12%, en comparación con el 33.00%, 62.48% y 80.38% de su homólogo sin el módulo de contexto. Escalar la columna vertebral arrojó una intersección sobre unión de carriles del 34.86% para la versión mediana y del 34.98% para la versión grande. En una evaluación fuera de dominio en TuSimple, las versiones pequeña, mediana y grande alcanzaron una intersección sobre unión de carriles del 27.2%, 27.6% y 27.6% sin ajuste fino en el dominio de destino.

Puntos clave

  • Modelado de contexto multinivel: El modelo incorpora un modelado de contexto con ventana desplazada en los niveles de características 1/4, 1/8 y 1/16 de un codificador ResNet para ayudar a mantener la continuidad a través de regiones de carriles débiles o discontinuas.
  • Mejoras de rendimiento: En el conjunto de validación BDD100K, HSCM-Lane-S superó a su homólogo sin HSCM en 1.44 puntos porcentuales en intersección sobre unión de carriles, 2.52 puntos en recuperación de carriles y 1.74 puntos en precisión equilibrada.
  • Escalado de la columna vertebral: Probar diferentes capacidades de la columna vertebral ResNet mostró una compensación gradual entre calidad y costo, con columnas vertebrales más grandes que producen ganancias incrementales en la intersección sobre unión de carriles.
  • Pruebas entre conjuntos de datos: Sin ajuste fino en el dominio de destino, los modelos lograron del 27.2% al 27.6% de intersección sobre unión de carriles bajo un protocolo de evaluación derivado fuera de dominio a nivel de píxel en el conjunto de datos TuSimple.

Términos explicados

  • Segmentación de carriles a nivel de píxel — Una tarea de visión por computadora en la que cada píxel de una imagen se clasifica como perteneciente a un carril de carretera o al fondo. Ejemplo: Colorear de azul cada píxel que compone la línea divisoria pintada de blanco en una carretera, y todo lo demás de negro.
  • Columna vertebral ResNet — Una estructura de red neuronal fundamental utilizada para procesar imágenes que ayuda a prevenir la pérdida de información a medida que los datos fluyen a través de muchas capas de la red. Ejemplo: Una línea de montaje de filtros que desglosa la foto de una calle en características más simples como bordes, formas y texturas.
  • Intersección sobre Unión (IoU) — Métrica estándar utilizada para medir qué tan de cerca coincide la forma predicha por un modelo computacional con la forma objetivo real. Ejemplo: Comparar el contorno dibujado de un espacio de estacionamiento con el espacio de estacionamiento pintado real para ver cuánto se superponen ambas áreas.
  • Arquitectura codificadora-decodificadora — Un diseño de red neuronal donde la primera parte comprime la imagen de entrada en características compactas, y la segunda parte expande esas características de vuelta al tamaño original de la imagen para generar una salida detallada. Ejemplo: Resumir un libro largo en viñetas clave y luego reescribir una versión nueva basada únicamente en esas notas.

Por qué importa

Una mejor detección de carriles ayuda a los sistemas avanzados de asistencia al conductor y a los vehículos autónomos a mantener los vehículos centrados en sus carriles, incluso en condiciones difíciles como pintura descolorida, sombras o mal tiempo. Esta investigación ofrece una forma estructurada de mejorar la precisión de la máscara de carriles manteniendo el sistema lo suficientemente ligero para su uso en tiempo real.

Lo que aún no sabemos

La fuente señala que todavía se necesita trabajo futuro para abordar la consistencia temporal, la detección a nivel de instancia, los datos multimodales, la planificación de vehículos y la validación de seguridad.


Fuente: PLOS ONE. El original tiene licencia CC BY 4.0. Este texto es una adaptación hecha con ayuda de IA (resumida, simplificada y traducida) y puede diferir del original.