La clasificación precisa de los cultivos es fundamental para la agricultura de precisión moderna, ya que permite a los agricultores controlar la salud de los cultivos, predecir los rendimientos y asignar los recursos de manera eficiente. Sin embargo, los métodos tradicionales suelen tener dificultades con la complejidad de los entornos agrícolas, donde los cultivos varían ampliamente en tipo, etapas de crecimiento y características espectrales.
¿Qué son las imágenes hiperespectrales y el marco de trabajo CMTNet?
La imagen hiperespectral (HSI), una tecnología que captura datos en cientos de bandas de longitud de onda estrechas y contiguas, se ha convertido en un elemento revolucionario en este campo. A diferencia de las cámaras RGB estándar o los sensores multiespectrales, que recogen datos en unas pocas bandas anchas, la HSI proporciona una "huella espectral" detallada para cada píxel.
Por ejemplo, la vegetación sana refleja intensamente la luz infrarroja cercana debido a la actividad de la clorofila, mientras que los cultivos estresados muestran patrones de absorción distintos. Al registrar estas sutiles variaciones (de 400 a 1000 nanómetros) con alta resolución espacial (tan fina como 0,043 metros), la imagen hiperespectral permite diferenciar con precisión las especies de cultivos, detectar enfermedades y analizar el suelo.
A pesar de estas ventajas, las técnicas existentes presentan dificultades para equilibrar detalles locales, como la textura de las hojas o los patrones del suelo, con patrones globales, como la distribución de cultivos a gran escala. Esta limitación se hace especialmente evidente en conjuntos de datos ruidosos o desequilibrados, donde las sutiles diferencias espectrales entre cultivos pueden provocar clasificaciones erróneas.
Para abordar estos desafíos, los investigadores desarrollaron CMTNet (Convolutional Meets Transformer Network), un novedoso marco de aprendizaje profundo que combina las ventajas de las redes neuronales convolucionales (CNN) y los Transformers. Las CNN son una clase de redes neuronales diseñadas para procesar datos con estructura de cuadrícula, como imágenes, mediante capas de filtros que detectan jerarquías espaciales (por ejemplo, bordes, texturas).
Los Transformers, desarrollados originalmente para el procesamiento del lenguaje natural, utilizan mecanismos de autoatención para modelar dependencias de largo alcance en los datos, lo que les permite capturar patrones globales con eficacia. A diferencia de los modelos anteriores, que procesan características locales y globales de forma secuencial, CMTNet utiliza una arquitectura paralela para extraer ambos tipos de información simultáneamente.
Este enfoque ha demostrado ser altamente efectivo, logrando una precisión de vanguardia en tres conjuntos de datos HSI principales basados en UAV. Por ejemplo, en el conjunto de datos WHU-Hi-LongKou, CMTNet alcanzó una precisión general (OA) de 99,58%, superando al mejor modelo anterior en 0,19%.
Desafíos de la imagen hiperespectral tradicional en la clasificación agrícola
Los primeros métodos para analizar datos hiperespectrales solían centrarse en características espectrales o espaciales, lo que generaba resultados incompletos. Las técnicas espectrales, como el análisis de componentes principales (PCA), redujeron la complejidad de los datos al centrarse en la información de longitud de onda, pero ignoraron las relaciones espaciales entre los píxeles.
Por ejemplo, el análisis de componentes principales (PCA) transforma datos espectrales de alta dimensión en un menor número de componentes que explican la mayor parte de la varianza, simplificando así el análisis. Sin embargo, este enfoque descarta el contexto espacial, como la disposición de los cultivos en un campo. Por el contrario, los métodos espaciales, como los operadores de morfología matemática, resaltan patrones en la disposición física de los cultivos, pero pasan por alto detalles espectrales cruciales.
La morfología matemática utiliza operaciones como la dilatación y la erosión para extraer formas y estructuras de las imágenes, como los límites entre campos. Con el tiempo, las redes neuronales convolucionales (CNN) mejoraron la clasificación al procesar ambos tipos de datos.
Sin embargo, sus campos receptivos fijos —el área de una imagen que una red puede "ver" de una sola vez— limitaban su capacidad para capturar dependencias de largo alcance. Por ejemplo, una CNN 3D podría tener dificultades para distinguir entre dos variedades de soja con perfiles espectrales similares pero patrones de crecimiento diferentes en un campo extenso.
Los Transformers, un tipo de red neuronal diseñada originalmente para el procesamiento del lenguaje natural, ofrecieron una solución a este problema. Mediante mecanismos de autoatención, los Transformers destacan en el modelado de relaciones globales en los datos. La autoatención permite al modelo ponderar la importancia de las diferentes partes de una secuencia de entrada, lo que le permite centrarse en las regiones relevantes (por ejemplo, un grupo de plantas enfermas) e ignorar el ruido (por ejemplo, las sombras de las nubes).
Sin embargo, a menudo pasan por alto detalles locales sutiles, como los bordes de las hojas o las grietas del suelo. Los modelos híbridos como CTMixer intentaron combinar redes neuronales convolucionales (CNN) y transformadores (Transformers), pero lo hicieron de forma secuencial, procesando primero las características locales y luego las globales. Este enfoque resultó en una fusión ineficiente de la información y un rendimiento subóptimo en entornos agrícolas complejos.
Cómo funciona CMTNet: Conectando funciones locales y globales
CMTNet supera estas limitaciones mediante una arquitectura única de tres partes diseñada para extraer y fusionar eficazmente características espectrales-espaciales, locales y globales.
1. El primer componente, el módulo de extracción de características espectrales y espaciales, Procesa datos HSI sin procesar utilizando capas convolucionales 3D y 2D.
Las capas convolucionales 3D analizan simultáneamente las dimensiones espaciales (altura × anchura) y espectrales (longitud de onda), capturando patrones como la reflectancia de longitudes de onda específicas en el follaje de un cultivo. Por ejemplo, un núcleo 3D podría detectar que el maíz sano refleja más luz infrarroja cercana en sus hojas superiores que en las inferiores.
Las capas 2D refinan estas características, centrándose en detalles espaciales como la disposición de las plantas en un campo. Este proceso de dos pasos garantiza que se conserven tanto la diversidad espectral (por ejemplo, el contenido de clorofila) como el contexto espacial (por ejemplo, el espaciado entre filas).
2. El segundo componente, el Módulo de extracción de características locales y globales, opera en paralelo. Una rama utiliza redes neuronales convolucionales (CNN) para centrarse en detalles locales, como la textura de las hojas individuales o la forma de las zonas de suelo. Estas características son fundamentales para identificar especies con perfiles espectrales similares, como diferentes variedades de soja.
La otra rama emplea transformadores para modelar relaciones globales, como la distribución de los cultivos en grandes áreas o cómo las sombras de los árboles cercanos afectan las lecturas espectrales. Al procesar estas características simultáneamente en lugar de secuencialmente, CMTNet evita la pérdida de información que afectaba a los modelos híbridos anteriores.
Por ejemplo, mientras que la rama CNN identifica los bordes dentados de las hojas de algodón, la rama Transformer reconoce que estas hojas forman parte de un campo de algodón más grande bordeado por plantas de sésamo.
3. El tercer componente, el módulo de restricción de múltiples salidas, Garantiza un aprendizaje equilibrado entre características locales, globales y fusionadas. Durante el entrenamiento, se aplican funciones de pérdida independientes a cada tipo de característica, lo que obliga a la red a refinar todos los aspectos de su comprensión.
Una función de pérdida cuantifica la diferencia entre los valores predichos y los reales, guiando así los ajustes del modelo. Por ejemplo, la pérdida para características locales podría penalizar al modelo por clasificar erróneamente los bordes de las hojas, mientras que la pérdida global corrige errores en la distribución de cultivos a gran escala.
Estas pérdidas se combinan utilizando ponderaciones optimizadas mediante una búsqueda aleatoria, una técnica que prueba diversas combinaciones de ponderaciones para maximizar la precisión. Este proceso da como resultado un modelo robusto y adaptable, capaz de gestionar diversos escenarios agrícolas.
Evaluación del rendimiento de CMTNet en conjuntos de datos hiperespectrales de UAV
Para evaluar CMTNet, los investigadores lo probaron con tres conjuntos de datos hiperespectrales adquiridos mediante UAV de la Universidad de Wuhan. Estos conjuntos de datos son referencias ampliamente utilizadas en teledetección debido a su alta calidad y diversidad:
- WHU-Hola-LongKouEste conjunto de datos abarca 550 × 400 píxeles con 270 bandas espectrales y una resolución espacial de 0,463 metros. Una resolución espacial de 0,463 metros significa que cada píxel representa un área de 0,463 m × 0,463 m en el suelo, lo que permite la identificación de plantas individuales. Incluye nueve tipos de cultivos, como maíz, algodón y arroz, con 1019 muestras de entrenamiento y 203 523 muestras de prueba.
- WHU-Hi-HanChuanEste conjunto de datos, que captura 1217 × 303 píxeles con una resolución de 0,109 metros, incluye 16 tipos de cobertura terrestre, como fresas, soja y láminas de plástico. La mayor resolución (0,109 m) permite apreciar detalles más finos, como la distinción entre plantas de soja jóvenes y maduras. Las muestras de entrenamiento y prueba sumaron 1289 y 256 241, respectivamente.
- WHU-Hi-HongHuCon 940 × 475 píxeles y 270 bandas, este conjunto de datos de alta resolución (0,043 metros) incluye 22 clases, como algodón, colza y brotes de ajo. A esta resolución, se aprecian las hojas individuales y las grietas del suelo, lo que lo hace ideal para una clasificación precisa. Contiene 1925 muestras de entrenamiento y 384 678 muestras de prueba.
El modelo se entrenó en GPU NVIDIA TITAN Xp utilizando PyTorch, con una tasa de aprendizaje de 0,001 y un tamaño de lote de 100. La tasa de aprendizaje determina cuánto ajusta el modelo sus parámetros durante el entrenamiento: si es demasiado alta, puede sobrepasar los valores óptimos; si es demasiado baja, el entrenamiento se vuelve lento.
Cada experimento se repitió diez veces para garantizar la fiabilidad, y los parches de entrada (pequeños segmentos de la imagen completa) se optimizaron a 13 × 13 píxeles mediante una búsqueda en cuadrícula, un método que prueba diferentes tamaños de parche para encontrar el más eficaz.
CMTNet logra una precisión de vanguardia en la clasificación de cultivos.
CMTNet logró resultados notables en todos los conjuntos de datos, superando a los métodos existentes tanto en precisión general (OA) como en rendimiento específico por clase. La OA mide el porcentaje de píxeles clasificados correctamente en todas las clases, mientras que la precisión promedio (AA) calcula la precisión media por clase, corrigiendo los desequilibrios.
En el conjunto de datos WHU-Hi-LongKou, CMTNet alcanzó una precisión general (OA) de 99,58%, superando a CTMixer por 0,19%. Para clases complejas con datos de entrenamiento limitados, como el algodón (41 muestras), CMTNet aún alcanzó una precisión de 99,53%. De manera similar, en el conjunto de datos WHU-Hi-HanChuan, mejoró la precisión para la sandía (22 muestras) de 82,42% a 96,11%, demostrando su capacidad para manejar datos desequilibrados mediante una fusión de características eficaz.
Las comparaciones visuales de los mapas de clasificación revelaron menos zonas fragmentadas y límites más suaves entre los campos en comparación con modelos como 3D-CNN y Vision Transformer (ViT). Por ejemplo, en el conjunto de datos WHU-Hi-HanChuan, propenso a las sombras, CMTNet minimizó los errores causados por los bajos ángulos de incidencia del sol, mientras que ResNet clasificó erróneamente la soja como tejados grises.
Las sombras representan un desafío único porque alteran las firmas espectrales: una planta de soja en la sombra podría reflejar menos luz infrarroja cercana, asemejándose a la ausencia de vegetación. Aprovechando el contexto global, CMTNet reconoció que estas plantas en sombra formaban parte de un campo de soja más extenso, lo que redujo los errores.
En el conjunto de datos WHU-Hi-HongHu, el modelo sobresalió en la distinción de cultivos espectralmente similares, como diferentes variedades de brasicáceas, logrando una precisión de 96,54% para Brassica parachinensis.
Los estudios de ablación —experimentos que eliminan componentes para evaluar su impacto— confirmaron la importancia de cada módulo. La adición del módulo de restricción de salida múltiple por sí sola mejoró la precisión global en 1,52% en WHU-Hi-HongHu, lo que subraya su papel en el perfeccionamiento de la fusión de características. Sin este módulo, las características locales y globales se combinaban de forma aleatoria, lo que generaba clasificaciones inconsistentes.
Compromisos computacionales y consideraciones prácticas
Si bien la precisión de CMTNet es inigualable, su costo computacional es mayor que el de los métodos tradicionales. El entrenamiento con el conjunto de datos WHU-Hi-HongHu tardó 1885 segundos, en comparación con los 74 segundos de Random Forest (RF), un algoritmo de aprendizaje automático que construye árboles de decisión durante el entrenamiento.
Sin embargo, esta compensación se justifica en la agricultura de precisión, donde la exactitud influye directamente en las predicciones de rendimiento y la asignación de recursos. Por ejemplo, clasificar erróneamente un cultivo enfermo como sano podría provocar plagas incontroladas que devastarían campos enteros.
Para aplicaciones en tiempo real, en el futuro se podrían explorar técnicas de compresión de modelos, como la poda de neuronas redundantes o la cuantización de pesos (que reduce la precisión numérica), para disminuir el tiempo de ejecución sin sacrificar el rendimiento. La poda elimina las conexiones menos importantes de la red neuronal, de forma similar a recortar las ramas de un árbol para mejorar su forma, mientras que la cuantización simplifica los cálculos numéricos, acelerando el procesamiento.
El futuro de la clasificación hiperespectral de cultivos con CMTNet
A pesar de su éxito, CMTNet presenta limitaciones. Su rendimiento disminuye ligeramente en regiones con mucha sombra, como se observa en el conjunto de datos WHU-Hi-HanChuan (97,29% OA frente a 99,58% en LongKou, bien iluminado). Las sombras dificultan la clasificación, ya que reducen la intensidad de la luz reflejada, alterando los perfiles espectrales.
Además, las clases con muestras de entrenamiento extremadamente pequeñas, como la soja de hoja estrecha (20 muestras), se quedan atrás con respecto a aquellas con datos abundantes. El tamaño reducido de las muestras limita la capacidad del modelo para aprender variaciones diversas, como las diferencias en la forma de las hojas debidas a la calidad del suelo.
Futuras investigaciones podrían integrar datos multimodales, como mapas de elevación LiDAR o imágenes térmicas, para mejorar la resistencia a las sombras y las oclusiones. El LiDAR (detección y medición de luz) utiliza pulsos láser para crear modelos de terreno en 3D, lo que podría ayudar a distinguir los cultivos de las sombras mediante el análisis de las diferencias de altura.
Además, la termografía captura las señales térmicas, lo que proporciona información adicional sobre la salud de las plantas: los cultivos estresados suelen presentar temperaturas más elevadas en el dosel debido a la reducción de la transpiración. Las técnicas de aprendizaje semisupervisado, que aprovechan datos sin etiquetar (por ejemplo, imágenes de drones sin anotaciones manuales), también podrían mejorar el rendimiento para tipos de cultivos poco comunes.
Mediante la regularización de la consistencia —que consiste en entrenar el modelo para que produzca predicciones estables en versiones ligeramente modificadas de la misma imagen—, los investigadores pueden aprovechar los datos sin etiquetar para mejorar la generalización.
Finalmente, la implementación de CMTNet en dispositivos periféricos, como drones equipados con GPU integradas, podría permitir la monitorización en tiempo real en zonas remotas. Esta implementación reduce la dependencia de la computación en la nube, minimizando la latencia y los costes de transmisión de datos. Sin embargo, esto requiere optimizar el modelo para una memoria y capacidad de procesamiento limitadas, posiblemente mediante arquitecturas ligeras como MobileNet o la destilación del conocimiento, donde un modelo "estudiante" más pequeño imita a un modelo "maestro" más grande.
Conclusión
CMTNet representa un avance significativo en la clasificación hiperespectral de cultivos. Al armonizar las redes neuronales convolucionales (CNN) y los transformadores (Transformers), aborda desafíos de larga data en la extracción y fusión de características, ofreciendo a agricultores y agrónomos una poderosa herramienta para la agricultura de precisión.
Las aplicaciones abarcan desde la detección de enfermedades en tiempo real hasta la optimización de los programas de riego, aspectos fundamentales para una agricultura sostenible en el contexto del cambio climático y el crecimiento demográfico. A medida que la tecnología de los vehículos aéreos no tripulados (UAV) se vuelve más accesible, modelos como CMTNet desempeñarán un papel crucial en la seguridad alimentaria mundial.
Los avances futuros, como las arquitecturas más ligeras y la fusión de datos multimodales, podrían mejorar aún más su practicidad. Con la innovación continua, CMTNet podría convertirse en un pilar fundamental de los sistemas de agricultura inteligente en todo el mundo, garantizando un uso eficiente de la tierra y una producción de alimentos resiliente para las generaciones venideras.
Referencia: Guo, X., Feng, Q. y Guo, F. CMTNet: una red híbrida CNN-transformer para la clasificación hiperespectral de cultivos basada en UAV en agricultura de precisión. Sci Rep 15, 12383 (2025). https://doi.org/10.1038/s41598-025-97052-w
Agricultura de precisión







