Blog / Rolnictwo precyzyjne / CMTNet redefiniuje rolnictwo precyzyjne, przewyższając tradycyjną klasyfikację upraw

CMTNet redefiniuje rolnictwo precyzyjne, przewyższając tradycyjną klasyfikację upraw

1 minuta czytania |
Udział

Dokładna klasyfikacja upraw jest niezbędna dla nowoczesnego rolnictwa precyzyjnego, umożliwiając rolnikom monitorowanie stanu roślin, przewidywanie plonów i efektywną alokację zasobów. Tradycyjne metody często jednak nie radzą sobie ze złożonością środowisk rolniczych, w których uprawy są bardzo zróżnicowane pod względem rodzaju, faz wzrostu i charakterystyki spektralnej.

Czym jest obrazowanie hiperspektralne i framework CMTNet?

Obrazowanie hiperspektralne (HSI), technologia rejestrująca dane w setkach wąskich, przyległych pasm długości fal, stało się przełomem w tej dziedzinie. W przeciwieństwie do standardowych kamer RGB czy czujników multispektralnych, które gromadzą dane w kilku szerokich pasmach, HSI zapewnia szczegółowy “spektralny odcisk palca” dla każdego piksela.

Na przykład, zdrowa roślinność silnie odbija światło bliskiej podczerwieni ze względu na aktywność chlorofilu, podczas gdy rośliny poddane stresowi wykazują wyraźne wzorce absorpcji. Rejestrując te subtelne wahania (od 400 do 1000 nanometrów) z wysoką rozdzielczością przestrzenną (nawet 0,043 metra), HSI umożliwia precyzyjne rozróżnianie gatunków roślin uprawnych, wykrywanie chorób i analizę gleby.

Pomimo tych zalet, istniejące techniki napotykają trudności w równoważeniu lokalnych szczegółów, takich jak tekstura liści czy wzory gleby, z wzorcami globalnymi, takimi jak rozmieszczenie upraw na dużą skalę. To ograniczenie staje się szczególnie widoczne w przypadku zaszumionych lub niezrównoważonych zbiorów danych, gdzie subtelne różnice widmowe między uprawami mogą prowadzić do błędnych klasyfikacji.

Aby sprostać tym wyzwaniom, naukowcy opracowali Sieć CMT (Convolutional Meets Transformer Network) – nowatorski framework głębokiego uczenia, który łączy zalety splotowych sieci neuronowych (CNN) i transformatorów. CNN to klasa sieci neuronowych zaprojektowanych do przetwarzania danych siatkowych, takich jak obrazy, z wykorzystaniem warstw filtrów wykrywających hierarchie przestrzenne (np. krawędzie, tekstury).

Architektura i wydajność CMTNet

Transformatory, pierwotnie opracowane do przetwarzania języka naturalnego, wykorzystują mechanizmy samouwagi do modelowania dalekosiężnych zależności w danych, co czyni je biegłymi w wychwytywaniu wzorców globalnych. W przeciwieństwie do wcześniejszych modeli, które przetwarzały cechy lokalne i globalne sekwencyjnie, CMTNet wykorzystuje architekturę równoległą do jednoczesnej ekstrakcji obu typów informacji.

To podejście okazało się wysoce skuteczne, osiągając najwyższą dokładność w trzech głównych zbiorach danych HSI opartych na bezzałogowych statkach powietrznych. Na przykład, w zbiorze danych WHU-Hi-LongKou, CMTNet osiągnął ogólną dokładność (OA) na poziomie 99,58%, przewyższając poprzedni najlepszy model o 0,19%.

Wyzwania tradycyjnego obrazowania hiperspektralnego w klasyfikacji produktów rolnych

Wczesne metody analizy danych hiperspektralnych często koncentrowały się na cechach spektralnych lub przestrzennych, co prowadziło do niekompletnych wyników. Techniki spektralne, takie jak analiza głównych składowych (PCA), zmniejszały złożoność danych, koncentrując się na informacjach o długości fali, ale ignorując relacje przestrzenne między pikselami.

Na przykład PCA przekształca wielowymiarowe dane widmowe w mniejszą liczbę składowych, które wyjaśniają największą wariancję, upraszczając analizę. Jednak takie podejście pomija kontekst przestrzenny, taki jak rozmieszczenie upraw na polu. Z kolei metody przestrzenne, takie jak operatory morfologii matematycznej, uwypuklały wzorce w fizycznym rozmieszczeniu upraw, ale pomijały kluczowe szczegóły widmowe.

Morfologia matematyczna wykorzystuje operacje takie jak dylatacja i erozja do wyodrębniania kształtów i struktur z obrazów, na przykład granic między polami. Z czasem splotowe sieci neuronowe (CNN) udoskonaliły klasyfikację, przetwarzając oba rodzaje danych.

Jednak ich stałe pola recepcyjne – obszar obrazu, który sieć może “widzieć” jednocześnie – ograniczały ich zdolność do wychwytywania zależności dalekosiężnych. Na przykład, sieć 3D-CNN może mieć trudności z rozróżnieniem dwóch odmian soi o podobnych profilach widmowych, ale różnych wzorcach wzrostu na dużym polu.

Rozwiązaniem tego problemu okazały się transformatory, rodzaj sieci neuronowej pierwotnie zaprojektowanej do przetwarzania języka naturalnego. Wykorzystując mechanizmy samouwagi, transformatory doskonale modelują globalne relacje w danych. Samouwaga pozwala modelowi ocenić istotność poszczególnych części sekwencji wejściowej, umożliwiając mu skupienie się na istotnych obszarach (np. skupisku chorych roślin), ignorując jednocześnie szum (np. cienie chmur).

Powiązane:  Wprowadzenie Map Zysków GeoPard: Krok Naprzód w Rolnictwie Precyzyjnym

Często jednak pomijają one drobne, lokalne szczegóły, takie jak krawędzie liści czy pęknięcia gleby. Modele hybrydowe, takie jak CTMixer, próbowały łączyć sieci neuronowe (CNN) i transformatory, ale robiły to sekwencyjnie, najpierw przetwarzając cechy lokalne, a następnie globalne. Takie podejście prowadziło do nieefektywnego łączenia informacji i suboptymalnej wydajności w złożonych środowiskach rolniczych.

Jak działa CMTNet: łączenie funkcji lokalnych i globalnych

CMTNet przezwycięża te ograniczenia dzięki unikalnej, trzyczęściowej architekturze zaprojektowanej w celu efektywnego wyodrębniania i łączenia cech widmowo-przestrzennych, lokalnych i globalnych.

1. Pierwszy składnik, moduł ekstrakcji cech widmowo-przestrzennych, przetwarza surowe dane HSI przy użyciu warstw splotowych 3D i 2D.

Trójwymiarowe warstwy splotowe analizują jednocześnie wymiary przestrzenne (wysokość × szerokość) i widmowe (długość fali), rejestrując wzorce, takie jak odbicie określonych długości fal w koronie rośliny. Na przykład, trójwymiarowe ziarno kukurydzy może wykryć, że zdrowa kukurydza odbija więcej światła bliskiej podczerwieni w górnych liściach niż w dolnych.

Warstwy 2D następnie udoskonalają te cechy, koncentrując się na szczegółach przestrzennych, takich jak rozmieszczenie roślin na polu. Ten dwuetapowy proces zapewnia zachowanie zarówno różnorodności widmowej (np. zawartości chlorofilu), jak i kontekstu przestrzennego (np. odstępów między rzędami).

2. Drugim składnikiem jest moduł ekstrakcji cech lokalno-globalnych, działa równolegle. Jedna z gałęzi wykorzystuje sieci neuronowe CNN do analizy lokalnych szczegółów, takich jak tekstura poszczególnych liści czy kształt fragmentów gleby. Cechy te są kluczowe dla identyfikacji gatunków o podobnych profilach widmowych, takich jak różne odmiany soi.

Druga gałąź wykorzystuje Transformery do modelowania relacji globalnych, takich jak rozkład upraw na dużych obszarach lub wpływ cieni rzucanych przez pobliskie drzewa na odczyty widmowe. Przetwarzając te cechy jednocześnie, a nie sekwencyjnie, sieć CMTNet unika utraty informacji, która jest plagą wcześniejszych modeli hybrydowych.

Na przykład, podczas gdy dział CNN identyfikuje poszarpane krawędzie liści bawełny, dział Transformer rozpoznaje, że liście te są częścią większego pola bawełny otoczonego roślinami sezamu.

3. Trzeci składnik, moduł ograniczeń wielowyjściowych, zapewnia zrównoważone uczenie się cech lokalnych, globalnych i połączonych. Podczas uczenia do każdego typu cechy stosowane są oddzielne funkcje strat, co zmusza sieć do udoskonalenia wszystkich aspektów jej zrozumienia.

Funkcja straty określa różnicę między wartościami przewidywanymi a rzeczywistymi, kierując korektami modelu. Na przykład, strata cech lokalnych może karać model za błędną klasyfikację krawędzi liści, podczas gdy strata globalna koryguje błędy w rozmieszczeniu upraw na dużą skalę.

Straty te są łączone za pomocą wag zoptymalizowanych metodą losowego wyszukiwania – techniki, która testuje różne kombinacje wag w celu maksymalizacji dokładności. Proces ten prowadzi do powstania solidnego i elastycznego modelu, który może obsługiwać różne scenariusze rolnicze.

Ocena wydajności sieci CMTNet w hiperspektralnych zbiorach danych bezzałogowych statków powietrznych (UAV)

Aby ocenić sieć CMTNet, naukowcy przetestowali ją na trzech hiperspektralnych zbiorach danych pozyskanych przez bezzałogowe statki powietrzne z Uniwersytetu w Wuhan. Ze względu na wysoką jakość i różnorodność, zbiory te są powszechnie stosowanymi punktami odniesienia w teledetekcji:

  1. WHU-Cześć-LongKouTen zbiór danych obejmuje obraz o wymiarach 550 × 400 pikseli, 270 pasm widmowych i rozdzielczości przestrzennej 0,463 metra. Rozdzielczość przestrzenna 0,463 metra oznacza, że każdy piksel reprezentuje obszar o wymiarach 0,463 m × 0,463 m na ziemi, co umożliwia identyfikację poszczególnych roślin. Zestaw obejmuje dziewięć rodzajów upraw, takich jak kukurydza, bawełna i ryż, z 1019 próbkami szkoleniowymi i 203 523 próbkami testowymi.
  2. WHU-Hi-HanChuan: Ten zbiór danych, rejestrujący dane o rozdzielczości 1217 × 303 pikseli i rozdzielczości 0,109 metra, obejmuje 16 rodzajów pokrycia terenu, w tym truskawki, soję i folie plastikowe. Wyższa rozdzielczość (0,109 m) umożliwia uzyskanie większej szczegółowości, na przykład rozróżnienie młodych i dojrzałych roślin soi. Liczba próbek szkoleniowych i testowych wyniosła odpowiednio 1289 i 256 241.
  3. WHU-Cześć-HongHu: Ten zbiór danych o wysokiej rozdzielczości (0,043 m) i rozdzielczości 940 × 475 pikseli oraz 270 pasmach obejmuje 22 klasy, takie jak bawełna, rzepak i kiełki czosnku. Przy rozdzielczości 0,043 m widoczne są pojedyncze liście i pęknięcia w glebie, co czyni go idealnym do klasyfikacji drobnoziarnistej. Zawiera 1925 próbek szkoleniowych i 384 678 próbek testowych.
Powiązane:  Wykresy rozwoju upraw GeoPard dla rolnictwa precyzyjnego

Porównanie zestawów danych teledetekcyjnych o wysokiej rozdzielczości

Model trenowano na procesorach graficznych NVIDIA TITAN Xp przy użyciu PyTorch, ze współczynnikiem uczenia się wynoszącym 0,001 i rozmiarem partii wynoszącym 100. Współczynnik uczenia się określa, jak bardzo model dostosowuje swoje parametry podczas treningu — zbyt wysoki współczynnik może spowodować przekroczenie optymalnych wartości; zbyt niski współczynnik sprawia, że trening staje się powolny.

Każdy eksperyment powtórzono dziesięć razy, aby zapewnić niezawodność, a wejściowe fragmenty — niewielkie segmenty pełnego obrazu — zoptymalizowano do rozmiaru 13 × 13 pikseli poprzez przeszukiwanie siatki — metodę polegającą na testowaniu różnych rozmiarów fragmentów w celu znalezienia najbardziej efektywnego.

CMTNet osiąga najnowocześniejszą dokładność w klasyfikacji upraw

CMTNet osiągnął znakomite wyniki we wszystkich zbiorach danych, przewyższając istniejące metody zarówno pod względem ogólnej dokładności (OA), jak i wydajności w poszczególnych klasach. OA mierzy odsetek poprawnie sklasyfikowanych pikseli we wszystkich klasach, podczas gdy średnia dokładność (AA) oblicza średnią dokładność dla każdej klasy, eliminując brak równowagi.

W zbiorze danych WHU-Hi-LongKou, CMTNet osiągnął OA na poziomie 99,58%, przewyższając CTMixer o 0,19%. W przypadku klas o ograniczonych danych treningowych, takich jak bawełna (41 próbek), CMTNet nadal osiągał dokładność 99,53%. Podobnie, w zbiorze danych WHU-Hi-HanChuan, poprawił dokładność dla arbuza (22 próbki) z 82,42% do 96,11%, co dowodzi jego zdolności do radzenia sobie z niezrównoważonymi danymi poprzez efektywne łączenie cech.

Wizualne porównania map klasyfikacji ujawniły mniej fragmentarycznych fragmentów i gładsze granice między polami w porównaniu z modelami takimi jak 3D-CNN i Vision Transformer (ViT). Na przykład, w podatnym na zacienienie zbiorze danych WHU-Hi-HanChuan, sieć CMTNet zminimalizowała błędy spowodowane niskimi kątami padania promieni słonecznych, podczas gdy ResNet błędnie klasyfikował soję jako szare dachy.

Wydajność sieci CMTNet w różnych zestawach danych

Cienie stanowią wyjątkowe wyzwanie, ponieważ zmieniają sygnatury widmowe – soja w cieniu może odbijać mniej światła bliskiej podczerwieni, przypominając roślinność. Wykorzystując globalny kontekst, sieć CMTNet rozpoznała, że te zacienione rośliny stanowią część większego pola soi, co pozwoliło ograniczyć liczbę błędów.

W zbiorze danych WHU-Hi-HongHu model wykazał się doskonałą zdolnością rozróżniania podobnych pod względem widmowym upraw, takich jak różne odmiany kapusty, osiągając dokładność 96,54% dla Brassica parachinensis.

Badania ablacyjne – eksperymenty polegające na usuwaniu komponentów w celu oceny ich wpływu – potwierdziły znaczenie każdego modułu. Dodanie samego modułu ograniczeń wielowyjściowych zwiększyło OA o 1,52% na WHU-Hi-HongHu, co podkreśla jego rolę w udoskonalaniu fuzji cech. Bez tego modułu cechy lokalne i globalne były łączone chaotycznie, co prowadziło do niespójnych klasyfikacji.

Kompromisy obliczeniowe i rozważania praktyczne

Chociaż dokładność CMTNet jest niezrównana, jej koszt obliczeniowy jest wyższy niż w przypadku tradycyjnych metod. Uczenie zbioru danych WHU-Hi-HongHu zajęło 1885 sekund, w porównaniu z 74 sekundami w przypadku algorytmu uczenia maszynowego Random Forest (RF), który buduje drzewa decyzyjne podczas treningu.

Jednak ten kompromis jest uzasadniony w rolnictwie precyzyjnym, gdzie dokładność bezpośrednio wpływa na prognozy plonów i alokację zasobów. Na przykład, błędne zaklasyfikowanie chorej uprawy jako zdrowej może prowadzić do niekontrolowanych plag szkodników, niszczących całe pola.

Powiązane:  Zrównoważone rolnictwo, biopaliwa i rola rolnictwa precyzyjnego: perspektywa GeoPard

W przypadku aplikacji czasu rzeczywistego, przyszłe prace mogłyby eksplorować techniki kompresji modelu, takie jak przycinanie zbędnych neuronów lub kwantyzacja wag (zmniejszanie precyzji numerycznej), aby skrócić czas wykonania bez utraty wydajności. Przycinanie usuwa mniej istotne połączenia z sieci neuronowej, podobnie jak przycinanie gałęzi drzewa w celu poprawienia jego kształtu, podczas gdy kwantyzacja upraszcza obliczenia numeryczne, przyspieszając przetwarzanie.

Przyszłość hiperspektralnej klasyfikacji upraw z CMTNet

Pomimo sukcesu, sieć CMTNet napotyka na ograniczenia. Wydajność nieznacznie spada w silnie zacienionych regionach, co widać w zbiorze danych WHU-Hi-HanChuan (97,29% OA w porównaniu z 99,58% w dobrze oświetlonym LongKou). Cienie komplikują klasyfikację, ponieważ zmniejszają intensywność odbitego światła, zmieniając profile widmowe.

Ponadto klasy z wyjątkowo małymi próbkami szkoleniowymi, takie jak soja wąskolistna (20 próbek), pozostają w tyle za klasami z dużą ilością danych. Małe rozmiary próby ograniczają zdolność modelu do uczenia się różnorodnych wariantów, takich jak różnice w kształcie liści wynikające z jakości gleby.

Przyszłe badania mogłyby zintegrować dane multimodalne, takie jak mapy wysokościowe LiDAR czy obrazowanie termiczne, aby poprawić odporność na cienie i przesłonięcia. LiDAR (Light Detection and Ranging) wykorzystuje impulsy laserowe do tworzenia trójwymiarowych modeli terenu, które mogłyby pomóc w odróżnianiu upraw od cieni poprzez analizę różnic wysokości.

Co więcej, obrazowanie termiczne rejestruje sygnatury cieplne, dostarczając dodatkowych wskazówek dotyczących stanu zdrowia roślin – uprawy poddane stresowi często charakteryzują się wyższą temperaturą korony z powodu zmniejszonej transpiracji. Techniki uczenia półnadzorowanego, wykorzystujące nieoznakowane dane (np. obrazy z bezzałogowych statków powietrznych bez ręcznych adnotacji), mogą również poprawić wydajność w przypadku rzadkich gatunków upraw.

Wykorzystując regularyzację spójności — czyli uczenie modelu w celu generowania stabilnych prognoz na podstawie nieznacznie zmienionych wersji tego samego obrazu — naukowcy mogą wykorzystać nieoznakowane dane w celu udoskonalenia generalizacji.

Wreszcie, wdrożenie CMTNet na urządzeniach brzegowych, takich jak drony wyposażone w pokładowe procesory graficzne (GPU), mogłoby umożliwić monitorowanie w czasie rzeczywistym w odległych obszarach. Wdrożenie brzegowe zmniejsza zależność od przetwarzania w chmurze, minimalizując opóźnienia i koszty transmisji danych. Wymaga to jednak optymalizacji modelu pod kątem ograniczonej pamięci i mocy obliczeniowej, potencjalnie poprzez lekkie architektury, takie jak MobileNet lub destylację wiedzy, gdzie mniejszy model “ucznia” naśladuje większy model “nauczyciela”.

Wniosek

Sieć CMTNet stanowi znaczący krok naprzód w hiperspektralnej klasyfikacji upraw. Harmonizując sieci CNN i transformatory, rozwiązuje ona długotrwałe problemy związane z ekstrakcją i fuzją cech, oferując rolnikom i agronomom potężne narzędzie do precyzyjnego rolnictwa.

Zastosowania obejmują wykrywanie chorób w czasie rzeczywistym, optymalizację harmonogramów nawadniania – wszystkie te elementy są kluczowe dla zrównoważonego rolnictwa w obliczu zmian klimatu i wzrostu populacji. Wraz ze wzrostem dostępności technologii bezzałogowych statków powietrznych (UAV), modele takie jak CMTNet odegrają kluczową rolę w globalnym bezpieczeństwie żywnościowym.

Przyszłe postępy, takie jak lżejsze architektury i multimodalna fuzja danych, mogą jeszcze bardziej zwiększyć ich praktyczność. Dzięki ciągłym innowacjom, CMTNet może stać się kamieniem węgielnym inteligentnych systemów rolniczych na całym świecie, zapewniając efektywne użytkowanie gruntów i odporną produkcję żywności dla przyszłych pokoleń.

Odniesienie: Guo, X., Feng, Q. i Guo, F. CMTNet: hybrydowa sieć CNN-transformator do hiperspektralnej klasyfikacji upraw w rolnictwie precyzyjnym z wykorzystaniem bezzałogowych statków powietrznych. Sci Rep 15, 12383 (2025). https://doi.org/10.1038/s41598-025-97052-w

Rolnictwo precyzyjne
Otrzymaj najnowsze wiadomości
od GeoPard

Zapisz się do naszego newslettera!

Subskrybuj

GeoPard dostarcza cyfrowe produkty, aby uwolnić pełny potencjał Twoich pól, usprawnić i zautomatyzować Twoje osiągnięcia agronomiczne dzięki praktykom rolnictwa precyzyjnego opartym na danych.

Dołącz do nas w AppStore i Google Play

Sklep z aplikacjami Sklep Google
Telefony
Najnowsze wiadomości od GeoPard

Zapisz się do naszego newslettera!

Subskrybuj

Powiązane posty

wpIkonaCzat
wpIkonaCzat

Odkryj więcej z GeoPard - Precision agriculture Mapping software

Zasubskrybuj już teraz, aby czytać dalej i uzyskać dostęp do pełnego archiwum.

Czytaj dalej

    Poproś o bezpłatną prezentację / konsultację GeoPard








    Klikając przycisk, zgadzasz się na nasze Polityka prywatności. Potrzebujemy tego, aby odpowiedzieć na Twoją prośbę.

      Subskrybuj


      Klikając przycisk, zgadzasz się na nasze Polityka prywatności

        Prosimy o przesłanie informacji


        Klikając przycisk, zgadzasz się na nasze Polityka prywatności