Blog / Agricultură de precizie / CMTNet redefinește agricultura de precizie prin performanța superioară în clasificarea culturilor față de metodele tradiționale

CMTNet redefinește agricultura de precizie prin performanța superioară în clasificarea culturilor față de metodele tradiționale

1 min citit |
Share

Clasificarea precisă a culturilor este esențială pentru agricultura modernă de precizie, permițând fermierilor să monitorizeze sănătatea culturilor, să prezică recoltele și să aloce resursele eficient. Metodele tradiționale, însă, se confruntă adesea cu complexitatea mediilor agricole, unde culturile variază foarte mult în tip, stadii de creștere și semnături spectrale.

Ce este imagistica hiperspectrală și cadrul CMTNet?

Imagistica hiperspectrală (HSI), o tehnologie care captează date pe sute de benzi de lungimi de undă înguste și contigue, a apărut ca un factor de schimbare în acest domeniu. Spre deosebire de camerele RGB standard sau de senzorii multispectali, care colectează date pe câteva benzi largi, HSI oferă o “amprentă spectrală” detaliată pentru fiecare pixel.

De exemplu, vegetația sănătoasă reflectă puternic lumina din infraroșu apropiat datorită activității clorofilei, în timp ce culturile stresate prezintă modele distincte de absorbție. Prin înregistrarea acestor variații subtile (de la 400 la 1.000 nanometri) la rezoluții spațiale înalte (până la 0,043 metri), HSI permite diferențierea precisă a speciilor de culturi, detectarea bolilor și analiza solului.

În ciuda acestor avantaje, tehnicile existente se confruntă cu provocări în echilibrarea detaliilor locale, cum ar fi textura frunzelor sau modelele solului, cu modelele globale, cum ar fi distribuția culturilor la scară largă. Această limitare devine deosebit de evidentă în seturi de date zgomotoase sau dezechilibrate, unde diferențele spectrale subtile între culturi pot duce la clasificări greșite.

Pentru a aborda aceste provocări, cercetătorii au dezvoltat CMTNet (Rețea Convoluțională Întâlnește Transformer), un cadru nou de învățare profundă care combină punctele forte ale rețelelor neuronale convoluționale (CNN) și ale Transformerilor. CNN-urile sunt o clasă de rețele neuronale concepute pentru a procesa date de tip grilă, cum ar fi imaginile, folosind straturi de filtre care detectează ierarhii spațiale (de exemplu, margini, texturi).

Arhitectura și performanța CMTNet

Transformerele, dezvoltate inițial pentru procesarea limbajului natural, utilizează mecanisme de auto-atenție pentru a modela dependențele pe termen lung în date, făcându-le capabile să capteze modele globale. Spre deosebire de modelele anterioare care procesează caracteristicile locale și globale secvențial, CMTNet folosește o arhitectură paralelă pentru a extrage simultan ambele tipuri de informații.

Această abordare s-a dovedit deosebit de eficientă, obținând precizie de ultimă generație pe trei seturi majore de date HSI bazate pe UAV. De exemplu, pe setul de date WHU-Hi-LongKou, CMTNet a atins o acuratețe generală (OA) de 99,58%, depășind modelul anterior cel mai performant cu 0,19%.

Provocările imagisticii hiperspectrale tradiționale în clasificarea agricolă

Metodele timpurii de analiză a datelor hiperspectrale s-au concentrat adesea fie pe caracteristicile spectrale, fie pe cele spațiale, ducând la rezultate incomplete. Tehnicile spectrale, cum ar fi analiza componentelor principale (PCA), au redus complexitatea datelor concentrându-se pe informațiile despre lungimea de undă, dar au ignorat relațiile spațiale dintre pixeli.

PCA, de exemplu, transformă datele spectrale de înaltă dimensiune în mai puțini componenți care explică cea mai mare variație, simplificând analiza. Cu toate acestea, această abordare renunță la contextul spațial, cum ar fi aranjamentul culturilor pe un teren. În schimb, metodele spațiale, cum ar fi operatorii de morfoologie matematică, au evidențiat modele în dispunerea fizică a culturilor, dar au omis detalii spectrale critice.

Morfologia matematică folosește operații precum dilatarea și eroziunea pentru a extrage forme și structuri din imagini, cum ar fi granițele dintre parcele. De-a lungul timpului, rețelele neuronale convoluționale (CNN) au îmbunătățit clasificarea prin procesarea ambelor tipuri de date.

Cu toate acestea, câmpurile lor receptive fixe — regiunea dintr-o imagine pe care o rețea o poate “vedea” odată — le-au limitat capacitatea de a capta dependențe pe distanțe lungi. De exemplu, o rețea 3D-CNN ar putea avea dificultăți în a distinge între două soiuri de soia cu profiluri spectrale similare, dar cu modele de creștere diferite pe un câmp mare.

Transformerele, un tip de rețea neuronală concepută inițial pentru procesarea limbajului natural, au oferit o soluție la această problemă. Prin utilizarea mecanismelor de auto-atenție, Transformerele excelează la modelarea relațiilor globale din date. Auto-atenția permite modelului să pondereze importanța diferitelor părți ale unei secvențe de intrare, permițându-i să se concentreze pe regiuni relevante (de exemplu, un grup de plante bolnave) în timp ce ignoră zgomotul (de exemplu, umbrele norilor).

Înrudite:  Fuzionarea și divizarea zonelor pentru gestionare în agricultură

Cu toate acestea, le scapă adesea detalii locale fine, cum ar fi marginile frunzelor sau crăpăturile din sol. Modele hibride precum CTMixer au încercat să combine CNN-urile și Transformerele, dar au făcut acest lucru secvențial, procesând mai întâi caracteristicile locale și apoi pe cele globale. Această abordare a dus la o fuziune ineficientă a informațiilor și la o performanță suboptimală în medii agricole complexe.

Cum funcționează CMTNet: Conectarea caracteristicilor locale și globale

CMTNet depășește aceste limitări printr-o arhitectură unică în trei părți, concepută pentru a extrage și fuziona eficient caracteristicile spectrale-spațiale, locale și globale.

1. Prima componentă, modul de extragere a caracteristicilor spectral-spațiale, procesează date HSI brute folosind straturi convoluționale 3D și 2D.

Straturile convoluționale 3D analizează simultan dimensiunile spațiale (înălțime × lățime) și spectrale (lungimea de undă), captând modele precum reflectanța unor lungimi de undă specifice pe o coroană de cultură. De exemplu, un nucleu 3D ar putea detecta că porumbul sănătos reflectă mai multă lumină în infraroșu apropiat în frunzele superioare în comparație cu cele inferioare.

Straturile 2D rafinează apoi aceste caracteristici, concentrându-se pe detalii spațiale precum aranjamentul plantelor într-un câmp. Acest proces în doi pași asigură că atât diversitatea spectrală (de exemplu, conținutul de clorofilă), cât și contextul spațial (de exemplu, spațierea între rânduri) sunt păstrate.

2. A doua componentă, modul de extracție a caracteristicilor local-global, operează în paralel. O ramură utilizează rețele neuronale convoluționale (CNN) pentru a se concentra pe detalii locale, cum ar fi textura frunzelor individuale sau forma petelor de sol. Aceste caracteristici sunt critice pentru identificarea speciilor cu profiluri spectrale similare, cum ar fi diferite soiuri de soia.

Cealaltă ramură utilizează Transformers pentru a modela relații globale, cum ar fi modul în care culturile sunt distribuite pe suprafețe mari sau cum umbrele copacilor din apropiere afectează citirile spectrale. Prin procesarea acestor caracteristici simultan, mai degrabă decât secvențial, CMTNet evită pierderea de informații care afectează modelele hibride anterioare.

De exemplu, în timp ce ramura CNN identifică marginile neregulate ale frunzelor de bumbac, ramura Transformer recunoaște că aceste frunze fac parte dintr-un câmp mai mare de bumbac, mărginit de plante de susan.

3. A treia componentă, modul de constrângere multi-ieșire, asigură învățarea echilibrată între caracteristicile locale, globale și combinate. În timpul antrenamentului, funcții de pierdere separate sunt aplicate fiecărui tip de caracteristică, forțând rețeaua să-și rafineze toate aspectele înțelegerii sale.

O funcție de pierdere cuantifică diferența dintre valorile prezise și cele reale, ghidând ajustările modelului. De exemplu, pierderea pentru caracteristicile locale ar putea penaliza modelul pentru clasificarea greșită a marginilor frunzelor, în timp ce pierderea globală corectează erorile în distribuția culturilor la scară largă.

Aceste pierderi sunt combinate folosind ponderi optimizate printr-o căutare aleatorie – o tehnică ce testează diverse combinații de ponderi pentru a maximiza acuratețea. Acest proces rezultă într-un model robust și adaptabil, capabil să gestioneze scenarii agricole diverse.

Evaluarea Performanței CMTNet pe Seturi de Date Hiperspectrale de Drone

Pentru a evalua CMTNet, cercetătorii l-au testat pe trei seturi de date hiperspectrale achiziționate de drone (UAV) de la Universitatea Wuhan. Aceste seturi de date sunt reperelor larg utilizate în teledetecție datorită calității și diversității lor ridicate:

  1. WHU-Hi-LongKouAcest set de date acoperă 550 × 400 pixeli cu 270 de benzi spectrale și o rezoluție spațială de 0,463 metri. O rezoluție spațială de 0,463 metri înseamnă că fiecare pixel reprezintă o zonă de 0,463m × 0,463m pe sol, permițând identificarea plantelor individuale. Acesta include nouă tipuri de culturi, precum porumb, bumbac și orez, cu 1.019 eșantioane de antrenament și 203.523 eșantioane de test.
  2. WHU-Hi-HanChuan: Capturând 1.217 × 303 pixeli la o rezoluție de 0,109 metri, acest set de date prezintă 16 tipuri de acoperire a solului, inclusiv căpșuni, soia și folii de plastic. Rezoluția mai mare (0,109 m) permite detalii mai fine, cum ar fi distincția între plantele tinere și cele mature de soia. Eșantioanele de antrenament și de test au totalizat 1.289 și, respectiv, 256.241.
  3. WHU-Hi-HongHu: Cu 940 × 475 pixeli și 270 de benzi, acest set de date de înaltă rezoluție (0,043 metri) include 22 de clase, cum ar fi bumbac, rapiță și răsaduri de usturoi. La rezoluția de 0,043 m, sunt vizibile frunze individuale și crăpături în sol, ceea ce îl face ideal pentru clasificări detaliate. Acesta conține 1.925 de eșantioane de antrenament și 384.678 de eșantioane de test.
Înrudite:  Integrarea GeoPard cu UP42

Compararea seturilor de date de teledetecție de înaltă rezoluție

Modelul a fost antrenat pe GPU-uri NVIDIA TITAN Xp folosind PyTorch, cu o rată de învățare de 0,001 și o dimensiune a lotului de 100. O rată de învățare determină cât de mult își ajustează modelul parametrii în timpul antrenamentului—prea mare și ar putea depăși valorile optime; prea mică, iar antrenamentul devine lent.

Fiecare experiment a fost repetat de zece ori pentru a asigura fiabilitatea, iar "patch"-urile de intrare – segmente mici din imaginea completă – au fost optimizate la 13 × 13 pixeli prin căutare exhaustivă (grid search), o metodă care testează diferite dimensiuni de "patch"-uri pentru a le găsi pe cele mai eficiente.

CMTNet Atinge Precizie de Ultimă Generație în Clasificarea Culturilor

CMTNet a obținut rezultate remarcabile pe toate seturile de date, depășind metodele existente atât în acuratețea generală (OA), cât și în performanța specifică clasei. OA măsoară procentul de pixeli clasificați corect pe toate clasele, în timp ce acuratețea medie (AA) calculează media acurateței pe clasă, abordând dezechilibrele.

Pe setul de date WHU-Hi-LongKou, CMTNet a obținut un OA de 99,58%, depășind CTMixer cu 0,19%. Pentru clasele dificile cu date de antrenament limitate, cum ar fi bumbacul (41 de eșantioane), CMTNet a atins totuși o acuratețe de 99,53%. Similar, pe setul de date WHU-Hi-HanChuan, a îmbunătățit acuratețea pentru pepeni (22 de eșantioane) de la 82,42%la 96,11%, demonstrând capacitatea sa de a gestiona date dezechilibrate prin fuziune eficientă a caracteristicilor.

Comparațiile vizuale ale hărților de clasificare au relevat mai puține pete fragmentate și limite mai netede între parcele, în comparație cu modele precum 3D-CNN și Vision Transformer (ViT). De exemplu, în setul de date WHU-Hi-HanChuan, predispus la umbre, CMTNet a minimizat erorile cauzate de unghiurile solare joase, în timp ce ResNet a clasificat greșit soia ca acoperișuri gri.

Performanța CMTNet pe diverse seturi de date

Umbrele prezintă o provocare unică deoarece modifică semnăturile spectrale — o plantă de soia la umbră ar putea reflecta mai puțină lumină în infraroșu apropiat, asemănându-se cu non-vegetația. Folosind contextul global, CMTNet a recunoscut că aceste plante umbrite făceau parte dintr-un câmp de soia mai mare, reducând erorile.

Pe setul de date WHU-Hi-HongHu, modelul a excelat în distingerea culturilor spectral similare, cum ar fi diferite varietăți de brassica, obținând o precizie de 96,54% pentru Varză parchinensis.

Studiile de ablație — experimente care elimină componente pentru a evalua impactul acestora — au confirmat importanța fiecărui modul. Adăugarea singură a modulului de constrângere multi-ieșire a crescut OA cu 1,52% pe WHU-Hi-HongHu, subliniind rolul său în rafinarea fuziunii caracteristicilor. Fără acest modul, caracteristicile locale și globale erau combinate întâmplător, ducând la clasificări inconsistente.

Compromisuri computaționale și considerații practice

Deși acuratețea CMTNet este de neegalat, costul său computațional este mai mare decât al metodelor tradiționale. Antrenamentul pe setul de date WHU-Hi-HongHu a durat 1.885 de secunde, comparativ cu 74 de secunde pentru Random Forest (RF), un algoritm de învățare automată care construiește arbori de decizie în timpul antrenamentului.

Cu toate acestea, acest compromis este justificat în agricultura de precizie, unde acuratețea influențează direct predicțiile de recoltă și alocarea resurselor. De exemplu, clasificarea greșită a unei culturi bolnave ca fiind sănătoasă ar putea duce la focare necontrolate de dăunători, devastând câmpuri întregi.

Înrudite:  Rolul unui NAS cu funcție de implementare atentă pentru monitorizarea eficientă a culturilor bazată pe drone

Pentru aplicații în timp real, lucrările viitoare ar putea explora tehnici de compresie a modelelor, cum ar fi eliminarea neuronilor redundanți sau cuantificarea ponderilor (reducerea preciziei numerice), pentru a reduce timpul de rulare fără a sacrifica performanța. Eliminarea presupune îndepărtarea conexiunilor mai puțin importante din rețeaua neuronală, similar cu tăierea ramurilor unui copac pentru a-i îmbunătăți forma, în timp ce cuantificarea simplifică calculele numerice, accelerând procesarea.

Viitorul clasificării culturilor hiperspectrale cu CMTNet

În ciuda succesului său, CMTNet se confruntă cu limitări. Performanța scade ușor în regiunile puternic umbrite, așa cum se vede pe setul de date WHU-Hi-HanChuan (97,29% OA față de 99,58% în LongKou bine luminat). Umbrele complică clasificarea deoarece reduc intensitatea luminii reflectate, alterând profilurile spectrale.

În plus, clasele cu eșantioane de antrenament extrem de mici, cum ar fi soia cu frunze înguste (20 de eșantioane), rămân în urmă față de cele cu date abundente. Dimensiunile mici ale eșantioanelor limitează capacitatea modelului de a învăța variații diverse, cum ar fi diferențele în forma frunzelor datorită calității solului.

Cercetările viitoare ar putea integra date multimodale, cum ar fi hărțile de elevație LiDAR sau imaginile termice, pentru a îmbunătăți reziliența la umbre și ocluzii. LiDAR (Light Detection and Ranging) utilizează impulsuri laser pentru a crea modele 3D ale terenului, ceea ce ar putea ajuta la delimitarea culturilor de umbre prin analizarea diferențelor de înălțime.

Mai mult, termoviziunea captează semnăturile termice, oferind indicii suplimentare despre sănătatea plantelor – culturile stresate au adesea temperaturi mai ridicate ale coronamentului din cauza transpirației reduse. Tehnicile de învățare semi-supervizată, care valorifică datele neetichetate (de exemplu, imagini UAV fără adnotări manuale), ar putea, de asemenea, să îmbunătățească performanța pentru tipuri rare de culturi.

Prin utilizarea regularizării prin consistență—antrenarea modelului pentru a produce predicții stabile pe versiuni ușor modificate ale aceleiași imagini—cercetătorii pot exploata datele neetichetate pentru a îmbunătăți generalizarea.

În cele din urmă, implementarea CMTNet pe dispozitive edge, cum ar fi dronele echipate cu GPU-uri integrate, ar putea permite monitorizarea în timp real pe terenuri îndepărtate. Implementarea edge reduce dependența de cloud computing, minimizând latența și costurile de transmitere a datelor. Cu toate acestea, acest lucru necesită optimizarea modelului pentru memorie limitată și putere de procesare, potențial prin arhitecturi ușoare precum MobileNet sau prin distilarea cunoștințelor, unde un model mai mic “student” imită un model mai mare “profesor”.

Concluzie

CMTNet reprezintă un salt semnificativ înainte în clasificarea hiperspectrală a culturilor. Prin armonizarea CNN-urilor și a Transformerelor, abordează provocări de lungă durată în extragerea și fuzionarea caracteristicilor, oferind fermierilor și agronomilor un instrument puternic pentru agricultura de precizie.

Aplicațiile variază de la detectarea bolilor în timp real până la optimizarea programelor de irigare, toate acestea fiind critice pentru agricultura sustenabilă în contextul schimbărilor climatice și al creșterii populației. Pe măsură ce tehnologia UAV devine mai accesibilă, modele precum CMTNet vor juca un rol esențial în securitatea alimentară globală.

Progresele viitoare, precum arhitecturile mai ușoare și fuziunea multimodală a datelor, ar putea spori în continuare practicitatea acestora. Odată cu inovația continuă, CMTNet ar putea deveni o piatră de temelie a sistemelor de agricultură inteligentă la nivel mondial, asigurând o utilizare eficientă a terenurilor și o producție alimentară rezilientă pentru generațiile viitoare.

Referință: Guo, X., Feng, Q. & Guo, F. CMTNet: o rețea hibridă CNN-transformer pentru clasificarea culturilor hiperspectrale bazată pe drone în agricultura de precizie. Sci Rep 15, 12383 (2025). https://doi.org/10.1038/s41598-025-97052-w

Agricultură de precizie
Obțineți cele mai recente știri
de la GeoPard

Abonează-te la newsletter-ul nostru!

Abonare

GeoPard oferă produse digitale pentru a valorifica întregul potențial al câmpurilor dumneavoastră, pentru a îmbunătăți și automatiza realizările agronomice cu ajutorul practicilor Ag de precizie bazate pe date

Alăturați-vă nouă pe AppStore și Google Play

Magazin de aplicații Magazin Google
Telefoane
Obține ultimele știri de la GeoPard

Abonează-te la newsletter-ul nostru!

Abonare

Posturi conexe

wpChatIcon
wpChatIcon

Descoperă mai multe la GeoPard - Precision agriculture Mapping software

Abonează-te acum ca să citești în continuare și să ai acces la întreaga arhivă.

Continuă lectura

    Solicită Demo Gratuit GeoPard / Consultanță








    Prin apăsarea butonului accepți termenii noștri Politica de confidențialitate. Avem nevoie de asta pentru a răspunde solicitării dumneavoastră.

      Abonare


      Prin apăsarea butonului accepți termenii noștri Politica de confidențialitate

        Trimiteți-ne informații


        Prin apăsarea butonului accepți termenii noștri Politica de confidențialitate