Pengecaman Tanda Lalu Lintas Berdasarkan Algoritma YOLOv3 Bahagian 2
Jan 19, 2024
2. Asas Algoritma
2.1. Algoritma YOLOv3
YOLOv3 [14] ialah algoritma pengesanan sasaran satu peringkat Redmon yang dipertingkatkan berdasarkan YOLOv2, yang telah meningkatkan ketepatan pengesanan dan prestasi masa nyata serta mengatasi algoritma lain dari segi kelajuan dan ketepatan.
Dalam beberapa tahun kebelakangan ini, perkembangan pesat teknologi kecerdasan buatan telah membolehkan pelbagai sistem pengesanan pintar diaplikasikan dalam pelbagai bidang. Ketepatan pengesanan ialah penunjuk penting untuk menilai kualiti sistem pintar, dan ingatan ialah salah satu keupayaan teras yang menyokong operasi sistem pintar. Jadi, apakah hubungan antara keduanya?
Pertama sekali, kita perlu menjelaskan dengan jelas bahawa ketepatan pengesanan dan ingatan bukanlah "korelasi positif" atau "korelasi negatif" yang mudah. Terdapat tahap interaksi dan koordinasi yang tinggi antara mereka. Dalam kebanyakan kes, ketepatan pengesanan sistem pintar bergantung pada ingatannya, iaitu keupayaannya untuk memahami dan mempelajari data sampel.
Sebagai contoh, dalam bidang pengecaman muka, sistem pengecaman muka yang baik perlu dapat mengenal pasti wajah yang berbeza dengan tepat dan memadankannya dengan maklumat orang tersebut dalam pangkalan data wajah yang diketahui. Ini memerlukan sistem pintar mempunyai ingatan yang kuat, dapat menyimpan maklumat wajah yang dikenali dalam pangkalan data, dan menggunakannya secara fleksibel dalam tugas pengecaman seterusnya.
Begitu juga, dalam bidang perubatan, sistem pintar perlu memahami dan mengingati sejumlah besar pengetahuan perubatan untuk membantu doktor dalam diagnosis penyakit dan reka bentuk pelan rawatan. Ini juga memerlukan sistem pintar untuk mempunyai keupayaan ingatan dan pembelajaran yang kuat, untuk terus menyerap pengetahuan perubatan baharu, dan untuk mengesahkan silang dan menaik taraf dengan pangkalan pengetahuan sedia ada.
Sudah tentu, hubungan antara ketepatan pengesanan dan ingatan bukan sehala. Sebaliknya, ketepatan pengesanan yang baik juga boleh menggalakkan peningkatan memori sistem pintar. Contohnya, dalam beberapa tugas pengelasan dan pengecaman, sistem pintar perlu terus menyediakan maklum balas dan pengoptimuman untuk terus meningkatkan ketepatan dan ketepatannya, dengan itu mengukuhkan lagi keupayaan untuk memahami dan mengingati data sampel.
Secara umum, ketepatan pengesanan dan ingatan adalah dua elemen yang sangat diperlukan untuk pengendalian sistem pintar. Mereka mempunyai interaksi dan hubungan yang kompleks yang perlu dipertimbangkan dan diselaraskan sepenuhnya. Hanya dengan terus meningkatkan ketepatan pengesanan dan terus mengukuhkan ingatan dan keupayaan pembelajaran sistem pintar boleh pembangunan komprehensif dan aplikasi sistem pintar benar-benar direalisasikan. Ia boleh dilihat bahawa kita perlu meningkatkan ingatan, dan Cistanche deserticola boleh meningkatkan memori dengan ketara, kerana Cistanche deserticola juga boleh mengawal keseimbangan neurotransmitter, seperti meningkatkan tahap asetilkolin dan faktor pertumbuhan. Bahan-bahan ini sangat penting untuk ingatan dan pembelajaran. Selain itu, Daging juga boleh meningkatkan aliran darah dan menggalakkan penghantaran oksigen, yang dapat memastikan otak menerima nutrien dan tenaga yang mencukupi, seterusnya meningkatkan daya hidup dan daya tahan otak.

Klik tahu suplemen untuk meningkatkan ingatan
YOLOv3 kini merupakan algoritma yang paling popular dalam keluarga YOLO dan digunakan secara meluas dalam senario pengesanan sebenar [15]; struktur rangkaian YOLOv3 ditunjukkan dalam Rajah 1.

Struktur konvolusi lengkap yang digunakan oleh YOLOv3 tidak dikekang oleh saiz input imej.
Lapisan pengumpulan dan bersambung sepenuhnya dialih keluar daripada keseluruhan struktur rangkaian, dan lapisan konvolusi dengan saiz langkah 2 digunakan sebagai ganti lapisan pengumpulan untuk operasi pensampelan bawah, yang menghalang kehilangan maklumat sasaran semasa pengumpulan dan memudahkan pengesanan sasaran kecil [ 16].
Selain itu,YOLOv3 menggantikan struktur rangkaian DarkNet-19 YOLOv2 dengan lapisan pengekstrakan ciri DarkNet-53.
Rangkaian DarkNet-53, yang berjaya menyelesaikan masalah kecerunan rangkaian dalam dan kehilangan maklumat asal semasa proses konvolusi berbilang lapisan untuk mengekstrak ciri dengan lebih baik dan meningkatkan pengesanan dan pengelasan [17], meminjam struktur rangkaian sisa ResNet [ 18] dan menggunakan output asal lapisan sebelumnya sebagai sebahagian daripada input dalam lapisan terakhir rangkaian.
Seperti yang ditunjukkan dalam Rajah 2, modul theresidual dalam YOLOv3 terdiri daripada dua lapisan konvolusi dan lapisan pintasan.

Tambahan pula, YOLOv3 menggunakan tanggapan rangkaian piramid ciri (FPN) (19] dan memperkenalkan rangkaian piramid ciri untuk meramalkan peta ciri pada tiga skala, dengan skala pengesanan 13 x 13, 26 x 26 dan 52 x 52.
Kaedah pengekstrakan ciri oleh rangkaian saraf konvolusi adalah dari bawah ke atas dalam rangkaian FPN, dan proses pensampelan atas peta ciri lapisan konvolusi adalah atas ke bawah, seperti ditunjukkan dalam Rajah 3.
2.2. Struktur Pengumpulan Piramidal Ruang
Struktur pengumpulan piramid spatial (SPP) (20] menyelesaikan masalah pengekstrakan berulang ciri imej oleh rangkaian saraf konvolusi dan meningkatkan kecekapan pengesanan dengan ketara; struktur rangkaian SPPNet ditunjukkan dalam Rajah 4.

Untuk memastikan bahawa resolusi imej input sepadan dengan dimensi ciri lapisan bersambung sepenuhnya dalam rangkaian saraf dengan lapisan bersambung sepenuhnya, operasi pemangkasan wilayah dan penskalaan pada imej input diperlukan.
Proses penskalaan dan pemangkasan akan mengakibatkan kehilangan maklumat ciri gambar, menurunkan ketepatan pengesanan dan menjejaskan hasil pengesanan: walau bagaimanapun, proses penskalaan dan pemangkasan akan mengakibatkan kehilangan ketepatan pengesanan maklumat ciri gambar dan menjejaskan keputusan pengesanan, manakala SPPNet boleh mengatasi batasan saiz tetap imej input, menjimatkan kos pengiraan 21.

3. YOLOv3 yang dipertingkatkan
3.1. Struktur Rangkaian YOLOv3 yang dipertingkatkan
Rangkaian pengekstrakan ciri asas lazimnya diturunkan sampel sebanyak lima kali, dengan kadar pensampelan turun sebanyak 2, dan kepelbagaian lima kali pensampelan turun ialah 32 kepada kuasa kelima daripada dua, menurut penerangan set data COCO.
Jika pensampelan rendah diteruskan, peta ciri yang diperolehi akan menjadi satu, dan maklumat sasaran akan hilang. Sasaran kecil adalah kurang daripada 32 × 32 piksel, sasaran sederhana ialah 32 × 32–96 × 96 piksel, dan sasaran gergasi lebih besar daripada 96 × 96 piksel [22].
Seperti yang digambarkan dalam Rajah 5, set data tanda trafik TT100K yang digunakan dalam kerja ini kebanyakannya terdiri daripada sasaran kecil dan sederhana, dengan sasaran besar hanya menyumbang 7.4% daripada jumlah set data dan sasaran kecil menyumbang 42.5% [23].

Set data TT100K mempunyai peleraian tinggi, dengan setiap imej mempunyai resolusi 2048 × 2048 piksel dan tanda trafik terbesar di kalangan sasaran kecil menyumbang kurang daripada 0.1% daripada keseluruhan imej, menimbulkan cabaran yang ketara kepada sasaran goritma pengesanan.
Sasaran kecil mempunyai ciri terhad dan memerlukan ketepatan penyetempatan yang hebat.
Walaupun pengenalan struktur FPN dalam YOLOv3 untuk memanfaatkan gabungan ciri berbilang skala untuk menghasilkan ramalan dengan menggabungkan penemuan lapisan ciri yang berbeza, yang penting untuk pengenalpastian sasaran kecil, hasilnya masih tidak memuaskan.
Dalam rangkaian YOLOv3, lapisan cetek mengandungi kurang maklumat semantik ciri tetapi lokasi sasaran yang tepat, manakala lapisan dalam mempunyai lebih banyak tetapi lokasi sasaran yang kasar.
Akibatnya, lapisan konvolusi cetek digunakan untuk meramal sasaran kecil dan lapisan konvolusi dalam digunakan untuk meramal sasaran besar. Skala ramalan ciri keempat bersaiz 152 × 152 telah ditambahkan pada tiga skala ramalan ciri struktur rangkaian YOLOv3 untuk menggunakan sepenuhnya ciri cetek dalam rangkaian untuk menjangkakan sasaran kecil.
Dengan saiz imej input 608 × 608, saiz ciri imej output ialah 152 × 152 selepas konvolusi dan pensampelan naik dua kali ganda imej input, dan lapisan ciri diinduksi melalui lapisan penghalaan; pengekstrakan ciri ini digabungkan dengan ciri lapisan ke-11 untuk meningkatkan skala ramalan ciri keempat.
Di samping itu, modul SPP telah ditambah untuk merealisasikan penggabungan ciri tempatan dan global dengan meminjam tanggapan SPPNet dan menggabungkannya dengan YOLOv3.
Sebelum lapisan pengesanan YOLO, modul SPP telah disepadukan antara lapisan konvolusi kelima dan keenam, dan peta ciri modul SPP dan peta ciri disatukan telah disambungkan semula dan dihantar ke lapisan rangkaian pengesanan seterusnya.

Untuk mencapai gabungan tahap peta ciri ciri tempatan dan global, kernel pengumpulan maksimum modul SPP hendaklah sehampir mungkin dengan saiz peta ciri untuk dikumpulkan.
Untuk meminimumkan usaha pengiraan yang disebabkan oleh modul SPP, memperkayakan keupayaan ekspresi peta ciri, dan meningkatkan kesan pengesanan, modul SPP dalam penyelidikan ini terdiri daripada dua cawangan selari, setiap satunya terdiri daripada lapisan pengumpulan maksimum 19 × 19 dan ajump sambungan. Rajah 6 menggambarkan struktur rangkaian YOLOv3 yang dipertingkatkan.

3.2. Fungsi Kehilangan yang Diperbaiki
Fungsi kehilangan YOLOv3 terdiri daripada kehilangan koordinat pusat (rugi), kehilangan koordinat lebar-tinggi (kerugian), kehilangan keyakinan (lossconf), dan kehilangan klasifikasi (kerugian). Kehilangan koordinat pusat diwakili oleh:

di mana λcoord menandakan berat kehilangan koordinat; λnoobj menandakan berat kehilangan keyakinan tanpa objek; Iobjij menandakan sama ada kotak sauh jth sel ke-i bertanggungjawab untuk objek (1 atau 0); Inobbyij menandakan kotak sauh ke-j bagi grid ke-i yang tidak bertanggungjawab ke atas objek; (xi,yi,wji,hjI, CjI, Pji) menandakan koordinat kotak sasaran yang diramalkan, keyakinan dan kategori; dan (xˆji,yˆji,wˆji,ˆhjI, CˆjI, Pˆji) menandakan koordinat kotak sasaran sebenar, keyakinan dan kategori
Fungsi kehilangan YOLOv3 diwakili oleh Persamaan (5), di mana fungsi kerugian min squareerror (MSE) digunakan untuk regresi kotak sempadan dan entropi silang digunakan sebagai fungsi kerugian dalam lossconf dan tempatan.
kerugian=lossxy + losswh − losscon f − losscls (5)
Walau bagaimanapun, menggunakan MSE sebagai fungsi kehilangan regresi kotak sempadan adalah tidak sesuai untuk pengesanan sasaran kecil, sensitif kepada skala objek dan memfokuskan pada sasaran berskala besar sambil tidak mesra kepada objek berskala kecil.
Untuk mengimbangi kehilangan sasaran besar dan kecil dan memaksimumkan hasil pengesanan dengan melemahkan pengaruh saiz kotak sempadan pada fungsi kehilangan lebar dan ketinggian, fungsi kehilangan jenis IoU digunakan dalam kertas ini, dan kerugian metrik yang dihasilkan oleh IoU digunakan sebagai Persamaan prestasi (6).
IoU =|A ∩ B||A ∪ B|(6)
Apabila kotak sempadan dan kotak sasaran tidak bertindih, IoU=0 tidak mencerminkan jurang jarak antara dua kotak; apabila kotak ramalan dan kotak berlabel bertindih sepenuhnya, IoU=1, titik tengah kotak sempadan tidak dapat ditentukan dan jurang saiz dengan kotak sasaran tidak boleh dioptimumkan lagi.
Kehilangan DIoU [24] adalah bebas daripada saiz; oleh itu, saiz yang besar tidak akan mengakibatkan kerugian yang besar. Oleh kerana saiz yang kecil menghasilkan sedikit kerugian, yang boleh menangani masalah, kerja ini menggunakan kehilangan DIoU, yang formula pengiraannya dibentangkan dalam Persamaan (7).
D Kehilangan IoU=1 − IoU +ρ2 b, bgt c2(7)
di mana b dan bgt menandakan titik pusat, ρ ialah jarak Euclidean, dan c ialah panjang pepenjuru bagi kotak tertutup terkecil yang meliputi dua kotak.
Kehilangan DIoU meminimumkan jarak antara dua bingkai sasaran secara langsung, menumpu dengan cepat dan lebih selaras dengan mekanisme regresi rangka sasaran, yang mengambil kira jarak antara sasaran dan penambat, kadar pertindihan dan skala, menjadikan regresi bingkai sasaran lebih stabil, sambil masih memberikan arah kecerunan untuk kotak sempadan apabila ia tidak bertindih dengan bingkai sasaran.

For more information:1950477648nn@gmail.com






