Penyelidikan Mengenai Pengecaman Audio Berdasarkan Rangkaian Neural Dalam dalam Pengajaran Muzik
Oct 10, 2023
Solfeggio ialah kursus asas yang penting untuk jurusan muzik, dan latihan pengecaman audio merupakan salah satu pautan penting. Dengan peningkatan prestasi komputer, pengecaman audio telah digunakan secara meluas dalam peranti boleh pakai pintar. Dalam beberapa tahun kebelakangan ini, pembangunan pembelajaran mendalam telah mempercepatkan proses penyelidikan pengecaman audio. Walau bagaimanapun, terdapat banyak gangguan bunyi dalam persekitaran pengajaran muzik, yang membawa kepada prestasi kelas audio…er, yang tidak dapat memenuhi permintaan sebenar. Untuk menyelesaikan masalah ini, sistem pengecaman audio yang dipertingkatkan berdasarkan YOLO-v4 dicadangkan, yang terutamanya meningkatkan struktur rangkaian.
Nyanyian penglihatan dan latihan telinga tidak dapat dipisahkan dari ingatan. Dalam proses pembelajaran muzik, nyanyian penglihatan dan latihan telinga adalah kemahiran yang sangat penting. Tujuan latihan telinga nyanyian penglihatan adalah untuk membolehkan pelajar mempraktikkan kemahiran muzik dan ingatan mereka dengan mendengar dan menyanyikan not tertentu.
Kandungan utama latihan telinga nyanyian penglihatan termasuk pic, irama, suara, melodi, harmoni, dsb. Melalui latihan telinga nyanyian penglihatan, kita boleh terus melatih telinga, membolehkan kita mengenal pasti pelbagai nota dan irama dengan lebih tepat, serta menukar dengan cepat nota yang kita dengar menjadi simbol dalam peta muzik, dengan itu meningkatkan keupayaan Kita untuk mengingat.
Nyanyian penglihatan dan latihan telinga juga boleh membantu kita lebih memahami dan menguasai undang-undang muzik. Apabila kita menggunakan telinga untuk merasa dan memahami muzik secara langsung, kita dapat memahami irama dan melodi muzik dengan lebih mendalam, sekali gus meningkatkan keupayaan ingatan kita dengan lebih cepat.
Di samping itu, nyanyian penglihatan dan latihan telinga juga boleh membantu kita mengembangkan deria muzik yang baik dan emosi muzik yang kuat. Melalui latihan, pemahaman dan perasaan muzik kita akan menjadi lebih dan lebih mendalam, sekali gus meningkatkan cinta dan penghayatan kita terhadap muzik.
Ingatan adalah faktor yang sangat penting dalam proses pembelajaran muzik. Kemahiran ingatan yang baik adalah salah satu syarat yang diperlukan untuk mempelajari sebarang instrumen dan mengarang muzik. Melalui nyanyian penglihatan dan latihan telinga, kita boleh meningkatkan ingatan dan menguasai teknik dan kemahiran muzik dengan lebih baik. Apabila berhadapan dengan himpunan yang kompleks, kita boleh mengingati nota dan irama dengan lebih pantas, membantu kita mempersembahkan karya muzik dengan lebih baik.
Ringkasnya, latihan telinga dan ingatan nyanyian penglihatan tidak dapat dipisahkan, dan kedua-duanya saling melengkapi. Melalui latihan nyanyian penglihatan dan latihan telinga yang berterusan, kami boleh meningkatkan kemahiran muzik dan kebolehan ingatan kami untuk menguasai muzik dengan lebih baik. Ia dapat dilihat bahawa kita perlu meningkatkan daya ingatan, dan Cistanche deserticola boleh meningkatkan daya ingatan dengan ketara kerana Cistanche deserticola adalah bahan perubatan tradisional Cina yang mempunyai banyak kesan unik, salah satunya adalah untuk meningkatkan daya ingatan. Keberkesanan daging cincang berasal dari pelbagai bahan aktif yang terkandung di dalamnya, termasuk asid, polisakarida, flavonoid, dll. Bahan-bahan ini boleh menggalakkan kesihatan otak dalam pelbagai cara.

Klik tahu cara untuk meningkatkan fungsi otak
Pertama, nombor cepstrum frekuensi Mel digunakan untuk memproses audio asal dan mengekstrak ciri yang sepadan. my, cuba gunakan model YOLO-v4 dalam …bidang pembelajaran mendalam kepada …bidang pengecaman audio dan perbaikinya dengan menggabungkannya dengan modul kumpulan piramid spatial untuk mengukuhkan keupayaan generalisasi data dalam format audio yang berbeza. Kedua, kaedah susun dalam pembelajaran ensemble digunakan untuk menggabungkan submodel bebas dua saluran yang berbeza. Keputusan eksperimen menunjukkan bahawa berbanding dengan teknologi pembelajaran mendalam yang lain, model YOLO-v4 yang dipertingkatkan boleh meningkatkan prestasi pengecaman audio, dan ia mempunyai prestasi yang lebih baik dalam memproses data format audio yang berbeza, yang menunjukkan keupayaan generalisasi yang lebih baik.
1. Pengenalan
Muzik adalah bentuk seni abstrak dengan bunyi sebagai alat ekspresinya. Dalam proses pengajaran muzik, solfeggio boleh mengukuhkan keupayaan ingatan muzik pelajar, membolehkan pelajar mengenal pasti karya muzik dengan tepat, dan dengan itu memperoleh "persepsi muzik" yang lebih baik. Sebagai pautan penting dalam solfeggio, latihan pengecaman audio sangat sukar untuk pelajar junior. adalah kerana pelajar perlu menguasai semua jenis klef, membezakan panjang dan tempoh yang diwakili oleh not yang berbeza, dan perbezaan pic antara not yang berbeza.
Analisis isyarat audio berdasarkan peranti pintar terbenam telah menarik perhatian lebih ramai penyelidik [1–7]. Peranti boleh pakai pintar dengan fungsi pengecaman audio boleh membantu pelajar menyelesaikan masalah di atas dan merealisasikan bantuan pengajaran muzik. Tugas pengecaman audio perlu mempraproses isyarat audio yang dikumpul … berehat, mengekstrak ciri berharga untuk membezakan skor muzik daripadanya dan … mengelaskannya mengikut ciri ini. Klasifikasi adalah kaedah perlombongan data yang sangat penting [8–10]. Klasifikasi…kation merujuk kepada penjanaan fungsi klasik- …kation mengikut peraturan tertentu berdasarkan data set latihan. is function boleh memetakan data set ujian kepada salah satu kategori yang diberikan, sekali gus merealisasikan ramalan kategori data yang tidak diketahui. Pada masa ini, ... klasik biasa termasuk pepohon keputusan, regresi logistik, mesin vektor sokongan (SVM), Naive Bayes, algoritma jiran terdekat (KNN), rangkaian saraf BP dan pembelajaran mendalam [11–13].
Kaedah pembelajaran mesin sebelumnya selalunya perlu mengekstrak secara manual ciri yang boleh mewakili data asal sebagai input kelas…er. Walau bagaimanapun, pembelajaran mendalam secara automatik boleh mengekstrak ciri berdimensi tinggi bagi sampel (tanpa pengekstrakan ciri manual), selagi data input meliputi maklumat data asal sebanyak mungkin, yang sesuai untuk data berskala besar. *kaedah pembelajaran mendalam boleh merealisasikan tugas pengecaman audio tertentu dengan bantuan sejumlah besar data audio yang dikumpul oleh peranti pintar. *e convolutional neural network (CNN), sebagai sejenis seni bina pembelajaran mendalam, digunakan secara meluas dalam klasifikasi imej, pengecaman pertuturan, pemprosesan bahasa semula jadi dan bidang lain kerana prestasi unggulnya dalam pembelajaran ciri tempatan [14]. Berbeza daripada model rangkaian saraf lain (seperti mesin Boltzmann dan rangkaian saraf berulang), CNN dicirikan dalam operasi teras itu ialah operasi lilitan. *e Rangkaian YOLO mengambil pengajaran daripada struktur rangkaian klasifikasi CNN dan menunjukkan kelebihan yang baik dalam bidang pengecaman imej, yang telah menarik perhatian ramai penyelidik.
*Oleh itu, kajian ini cuba mengaplikasikan model YOLO-v4 kepada bidang pengecaman audio dan menambah baik struktur rangkaiannya. Di samping itu, kaedah susun dalam pembelajaran ensembel digunakan untuk menggabungkan dua submodel bebas saluran yang berbeza, dan prestasi klasifikasi sistem bersatu dipertingkatkan lagi berbanding dengan submodel tunggal.
2. Karya Berkaitan
Pada masa kini, dengan kemunculan sejumlah besar peranti pintar, prestasi komputer yang cemerlang dan pembangunan teknologi pembelajaran mendalam telah bersama-sama mempromosikan proses penyelidikan dalam bidang audio. Digabungkan dengan kandungan penyelidikan utama kajian ini, status penyelidikan semasa akan diperkenalkan dari dua aspek: rangkaian saraf konvolusi dan pengecaman audio.
*Struktur rangkaian neural convolutional berasal daripada kajian oleh Yann LeCun pada tahun 1998 yang dipanggil Le Net-5 rangkaian saraf tiruan. *e rangkaian neural convolutional, seperti rangkaian neural lain, boleh dilatih oleh algoritma perambatan balik [15]. Pada tahun 2012, Alex Krizhevsky dan yang lain menggunakan teknologi CNN buat kali pertama dalam tugas penglihatan komputer yang kompleks. Dengan menggunakan 3 lapisan bersambung sepenuhnya, 5 lapisan konvolusi dan pengelas Softmax, rangkaian saraf konvolusi dengan 8 lapisan dibina, yang dinamakan AlexNet. AlexNet menggunakan fungsi pengaktifan ReLU, dan pada masa yang sama, ia juga menggunakan regularisasi (keciciran) untuk mengelakkan overfitting. Pada tahun 2014, pasukan penglihatan komputer Google mengemukakan rangkaian GoogLeNet [16], dengan kedalaman rangkaian 22 lapisan, yang mengandungi struktur baharu, insiden. Ia menyepadukan ciri kedalaman yang berbeza dan skala yang sama, dan ketepatan pengesanan dipertingkatkan. Berdasarkan rangkaian GoogLeNet, algoritma YOLO dan SSD muncul. Kedua-dua kaedah adalah berdasarkan rangkaian hujung ke hujung tunggal, yang boleh melengkapkan input daripada imej asal kepada output kedudukan dan kategori objek.
Dalam aspek pengecaman audio, Yang dan Zhao [17] mencadangkan kaedah pengelasan pemandangan akustik berdasarkan mesin vektor sokongan (SVM), yang meningkatkan tekstur bunyi untuk meningkatkan ketepatan pengelasan. Greco et al. [18] mencadangkan sistem pengecaman suara berdasarkan kaedah pembelajaran mendalam heuristik. Demir et al. [19] mencadangkan kaedah CNN lata piramid baharu untuk pengelasan bunyi alam sekitar. Zhu et al. [20] mencadangkan algoritma YOLO-v4 yang dipertingkatkan untuk instrumen pengimejan bunyi, yang secara berkesan meningkatkan ketepatan pengesanan imej awan fasa akustik. *Kaedah di atas semuanya menunjukkan prestasi yang sangat baik dalam menangani tugas pengecaman audio dalam satu adegan akustik, tetapi terdapat banyak gangguan bunyi dalam persekitaran pengajaran muzik, dan adalah perlu untuk menangani pelbagai data format audio yang berbeza.
*Oleh itu, kajian ini mencadangkan sistem pengecaman audio berdasarkan model rangkaian YOLO-v4 yang dipertingkatkan. *inovasi dan sumbangan utama termasuk yang berikut: (1) cuba gunakan seni bina rangkaian YOLO-v4, yang sangat baik dalam bidang pembelajaran mendalam, kepada bidang pengecaman audio, dan perbaikinya dengan menggabungkan modul kolam piramid spatial. *e seni bina rangkaian YOLO-v4 yang dipertingkatkan dengan berkesan menggunakan maklumat spatial dalam fail audio, sekali gus mengukuhkan keupayaan generalisasi data dalam format audio yang berbeza. (2) *Kaedah susun dalam pembelajaran ensembel digunakan untuk menggabungkan dua submodel bebas saluran yang berbeza, dan prestasi klasifikasi sistem bersatu dipertingkatkan.
3. Pengekstrakan dan Pemprosesan Ciri Audio
Mengekstrak perwakilan parameter terbaik bagi isyarat audio adalah salah satu tugas penting untuk menghasilkan prestasi pengecaman yang lebih baik. *e Pengekstrakan ciri dalam peringkat ini adalah sangat penting untuk pengelasan pengelas pada peringkat seterusnya kerana ia akan menjejaskan kecekapan pengelasan secara langsung.
Dalam tugas pengelasan, terutamanya tugas pengelasan audio, pekali sepstrum frekuensi Mel (MFCC) yang menggambarkan bentuk spektrum mempunyai sejarah yang panjang. Walaupun proses pengekstrakan MFCC akan menyebabkan pemampatan data yang hilang, pengelasan dan kesan pengecamannya agak tersedia walaupun ketika kadar data sangat rendah. Di samping itu, berbanding dengan ciri pengelasan lain, MFCC digunakan secara meluas kerana ia lebih selaras dengan keluk tindak balas frekuensi pendengaran telinga manusia.

*Sebab mengapa manusia boleh menilai persekitaran yang berbeza dalam persekitaran bunyi yang kompleks terletak pada kredit koklea. *koklea boleh dilihat sebagai bank penapis untuk membantu orang menapis 20-20 audio kHz. *Masalahnya ialah sensitiviti koklea kepada frekuensi dalam julat pendengaran adalah tidak linear, tetapi terdapat hubungan pemetaan. MFCC boleh mensimulasikan tindak balas frekuensi telinga manusia. Pengekstrakan ciri MFCC terdiri daripada tujuh langkah, dan keseluruhan proses ditunjukkan dalam Rajah 1.
Isyarat audio biasa mempunyai fenomena bahawa tenaga frekuensi rendah adalah besar, tetapi tenaga frekuensi tinggi adalah kecil. Jika ia dihantar secara terus, ia akan membawa kepada nisbah isyarat kepada hingar yang tinggi pada frekuensi rendah dan nisbah isyarat kepada hingar yang tidak mencukupi pada frekuensi tinggi. Untuk mengimbangi kehilangan isyarat audio semasa penghantaran, prapenekanan diperkenalkan untuk mengimbangi isyarat input supaya ciri frekuensi tinggi isyarat audio boleh diserlahkan. Prapenekanan biasanya dicapai menggunakan penapis laluan tinggi [21–23].

Pembingkaian membahagikan sampel audio yang diperoleh daripada penukaran analog-ke-digital (ADC) kepada bingkai kecil dengan panjang dalam julat 20–40 milisaat. Selepas prapenekanan dan pembingkaian selesai, adalah perlu untuk menambah tetingkap Hamming pada setiap bingkai. Windowing adalah untuk mengawal jumlah pemprosesan data, dan hanya data dalam tetingkap diproses pada satu masa. *e julat frekuensi dalam spektrum transformasi Fourier pantas adalah sangat luas, yang membawa kepada isyarat pertuturan tidak mengikut skala linear [24–26]. *oleh itu, adalah perlu untuk melepasi bank penapis skala Mel seperti yang ditunjukkan dalam Rajah 2.
Rajah 2 menunjukkan satu set penapis segi tiga, yang digunakan untuk mengira jumlah wajaran komponen spektrum penapis supaya output yang diproses menghampiri skala Mel. *e tindak balas frekuensi amplitud bagi setiap penapis adalah segi tiga. *e Spektrum Mel bagi frekuensi tertentu f dikira seperti berikut:

13 ciri pembezaan tertib pertama mewakili perubahan antara bingkai sepstrum dalam ciri MFCC, manakala 39 ciri pembezaan tertib kedua mewakili perubahan antara bingkai dalam ciri pembezaan tertib pertama. *e perbezaan pesanan pertama dikira seperti berikut:

4. Struktur Rangkaian SPP-YOLO-v4
4.1. Modul Kolam Piramid Ruang (SPP). SPP boleh mengelakkan herotan maklumat yang disebabkan oleh penskalaan, regangan, keratan, dan operasi lain dan menyediakan output yang tidak terjejas oleh saiz input, yang tidak boleh dicapai dengan teknologi penyatuan tingkap gelongsor [27]. Kedua, SPP boleh mengumpulkan dengan berbilang skala, manakala penggabungan tingkap gelongsor hanya menggunakan satu skala tetingkap. *Struktur asas modul SPP ditunjukkan dalam Rajah 3. Dapat dilihat bahawa kerana saiz input adalah fleksibel, SPP boleh menggabungkan ciri-ciri data dalam format audio yang berbeza. *e dimensi vektor ciri yang diubah adalah sama dengan lapisan bersambung sepenuhnya sambil mengurangkan masalah generalisasi.
4.2. SPP-YOLO-v4. YOLO-v4 ialah algoritma pengesanan satu peringkat masa nyata berketepatan tinggi yang menyepadukan YOLO-v1, YOLO-v2 dan YOLO-v3. YOLO-v4 membina rangkaian separa rentas peringkat (CSPNet) CSP dalam modul baki, di mana lapisan ciri ialah input dan maklumat ciri lapisan yang lebih tinggi ialah output. *menunjukkan bahawa objektif pembelajaran YOLO-v4 dalam modul ResNet adalah berbeza antara output dan input. *Oleh itu, pembelajaran sisa direalisasikan, dan parameter model dikurangkan, jadi keupayaan pembelajaran ciri dipertingkatkan. Memandangkan persekitaran aplikasi pengajaran muzik, beberapa perubahan dibuat berdasarkan rangkaian asal, dan struktur rangkaian akhir ditunjukkan dalam Rajah 4.
Mula-mula, lapisan ciri dililit tiga kali, dan kemudian, lapisan ciri input dikumpulkan secara maksimum dengan menggunakan teras terkumpul maksimum dengan saiz yang berbeza. Selepas konvolusi dan pensampelan, lapisan ciri yang berbeza disambungkan secara bersiri untuk merealisasikan gabungan ciri. *ms, lakukan pensampelan turun, mampatkan ketinggian dan lebar, dan akhirnya tindanan dengan lapisan ciri sebelumnya untuk merealisasikan lebih gabungan ciri (5 kali). *Modul klasifikasi menggunakan ciri yang diekstrak daripada rangkaian untuk membuat pertimbangan klasifikasi. Ambil grid 13 ×13 sebagai contoh, yang sama dengan membahagikan spektrogram Mel input kepada 13 ×13 petak; kemudian, setiap segi empat sama akan dipratetap dengan tiga bingkai sebelumnya. *e keputusan pengelasan rangkaian akan melaraskan kedudukan tiga kotak terdahulu ini dan akhirnya ditapis oleh algoritma penindasan bukan maksimum (NMS) [28], untuk mendapatkan keputusan pengelasan akhir.

5. Sistem Pengecaman Audio Berdasarkan SPPYOLO-v4
5.1. Seni Bina Sistem. Seperti yang ditunjukkan dalam Rajah 5, selepas input audio, sistem pengecaman audio yang dicadangkan mula-mula membahagikan data jujukan audio kepada dua bahagian. *Bahagian pertama datang daripada saluran stereo, manakala bahagian kedua dimampatkan menjadi mono. *e isyarat audio kedua-dua saluran diekstrak oleh spektrogram MFCC dan dimasukkan ke dalam model SPP-YOLO-v4 sebagai ciri. *ms, dua kumpulan model SPP-YOLO-v4 disepadukan, dan kaedah tindanan diguna pakai dalam penyepaduan. Selepas pembelajaran bersepadu kedua-dua model, keputusan klasifikasi audio akhirnya dikeluarkan. *perincian model SPP-YOLO-v4 ditunjukkan dalam Rajah 4.
5.2. Menyusun Pembelajaran Bersepadu. Seperti yang ditunjukkan dalam Rajah 5, sistem menggunakan teknologi pembelajaran ensemble untuk mendapatkan hasil pengelasan akhir. *Idea asas pembelajaran ensemble ialah membentuk pengelas yang kuat melalui gabungan beberapa pengelas yang lemah. Walaupun beberapa pengelas lemah membuat ramalan yang salah, ia boleh diperbetulkan oleh pengelas lemah lain dengan ramalan yang betul, sekali gus mencapai kesan meningkatkan prestasi sistem.
Dengan mengandaikan bahawa x ialah input, mi (i � 1, 2, . . . , k) ialah kumpulan pengelas dan output pengelas ialah taburan kebarangkalian mi (x, cj) bagi setiap kelas cj (i � 1, 2, . . . , k), keluaran akhir y(x) pengelas bersepadu boleh dinyatakan sebagai


sasaran klasifikasi. Pada masa ini, algoritma pembelajaran ensembel yang popular termasuk menyusun, membungkus, meningkatkan, pemilihan ensembel, dan sebagainya. *Algoritma pembelajaran ensemble yang dipilih dalam kajian ini ialah kaedah susun.
Penimbunan ialah proses pembelajaran peringkat kedua dengan output proses pembelajaran peringkat pertama sebagai input, juga dikenali sebagai "pembelajaran meta." *Kaedah tindanan telah menjadi kaedah pembelajaran ensemble yang popular, bukan sahaja kerana pelaksanaannya agak mudah tetapi juga kerana ia dapat meningkatkan keupayaan generalisasi sistem dengan ketara, yang sangat konsisten dengan tujuan kajian ini. *Prinsip asas kaedah menyusun ditunjukkan dalam Rajah 6.
6. Eksperimen dan Analisis Keputusan
6.1. Persekitaran Eksperimen dan Set Data. *Platform perkakasan kajian ini ialah Intel Core i3-M350 CPU@ Dualcore 2.20 GHz, 8 GB memori DDR2, Nvidia RTX2080Ti GPU dan 11 GB memori video. *e Alat pembangunan bersepadu PyCharm dibangunkan dalam bahasa Python 3.5.0. *e Rangka kerja anotasi YOLO yang ditulis dalam Python digunakan untuk menukar format berangka supaya ia boleh dibaca oleh YOLO. *kaedah perbandingan ialah model campuran Gaussian (GMM), CNN dan R-CNN.

*e set data eksperimen direkodkan fail audio dalam persekitaran pengajaran sebenar. *e set data terdiri daripada jenis audio empat label berbeza (D1, D2, D3 dan D4). Semua fail audio dipotong menjadi 30-klip kedua. *Terdapat 12 format fail audio termasuk MPEG, MP3 dan WMA. Setiap rakaman dilakukan di lokasi yang berbeza, dan purata tempoh rakaman ialah 3–5 minit. *Peralatan rakaman termasuk mikrofon dalam telinga Soundman OKM II Classic/studio A3 dua saluran dan perakam bentuk gelombang Roland Edirol R09 dengan kadar pensampelan 44.1 kHz dan resolusi 24-bit.
*Data data yang digunakan mengandungi 1404 fail audio dan bilangan fail audio bagi setiap jenis ialah 351. Kira-kira 70% daripada data digunakan untuk melatih model pengecaman audio dan baki 30% digunakan untuk ujian. *tetapan sistem diberikan dalam Jadual 1.


6.3. Pengesahan Prestasi SPP-YOLO-v4. Untuk mengesahkan kesan promosi cadangan YOLO-v4 (SPP-YOLO-v4) yang dipertingkatkan pada keupayaan generalisasi, ia dibandingkan dengan model YOLO-v4 tradisional. Dalam percubaan, 3 daripada 12 format fail audio telah dipilih: MPEG, MP3 dan WMA. *Keupayaan generalisasi SPP-YOLOv4 diberikan dalam Jadual 2.
Daripada Jadual 2, boleh didapati bahawa ketepatan keseluruhan SPP-YOLO-v4 adalah lebih tinggi daripada YOLO-v4 tradisional, yang mengesahkan keupayaan generalisasinya untuk data dalam format audio yang berbeza. *adalah kerana berbanding dengan kaedah asal, SPP SPP-YOLO-v4 mengandungi lebih banyak lapisan, tetapi ia juga meningkatkan masa pemprosesan.
6.4. Perbandingan Keputusan Ujian. Jadual 3 menyediakan keputusan kehilangan latihan, mAP dan seterusnya untuk semua kategori selepas 8000 pusingan latihan. Dapat dilihat bahawa model latihan kaedah yang dicadangkan dapat mengenal pasti jenis audio dengan berkesan. Ia mempunyai kelebihan tertentu dalam ketepatan, kadar ingatan semula, dan skor F1, dan nilai kerugiannya juga merupakan yang paling rendah daripada semua kaedah, hanya 0.0122. *Oleh itu, kestabilan dan ketepatan kaedah yang dicadangkan adalah lebih baik. *terutamanya disebabkan oleh resolusi tinggi dan medan penerimaan (RF) SPP-YOLO-v4, dan penambahan modul SPP dalam lapisan sambungan mengekalkan kelebihan yang dibawa oleh SPP. Dari segi masa latihan, SPP-YOLO-v4 hanya lebih sedikit daripada GMM. *e CNN perlu melatih banyak operasi konvolusi, jadi masa latihannya lebih lama.

Akhir sekali, percubaan menggunakan data daripada 12 format audio yang berbeza untuk menguji dan membandingkan empat kaedah. Jadual 4 memberikan nilai ketepatan ujian dan masa ujian. Dapat dilihat bahawa purata ketepatan kaedah yang dicadangkan dalam kajian ini ialah 99.0%, dan purata masa pengesanan ialah 0.449ss. *Oleh itu, kaedah yang dicadangkan mencapai prestasi yang lebih baik antara empat kaedah berbanding. Dapat disimpulkan bahawa pensampelan dan pengumpulan maksimum SPP-YOLO-v4 membawa faedah yang ketara. Pengumpulan maksimum memilih nilai maksimum dari kawasan bersebelahan untuk memadamkan sedikit bunyi frekuensi maksimum dalam jujukan audio. *Oleh itu, subsampling konvolusi boleh dikendalikan dengan lebih baik dalam lapisan pensampelan seterusnya. *kasar kelebihan ini, SPP boleh meningkatkan prestasi rangkaian tulang belakang.

7. Kesimpulan
*adalah kajian membentangkan sistem pengecaman audio yang sesuai untuk persekitaran pengajaran muzik. Gunakan SPP untuk meningkatkan seni bina rangkaian YOLO-v4, iaitu, gunakan SPP untuk memilih kawasan setempat pada skala yang berbeza pada lapisan lilitan yang sama untuk mempelajari ciri sistem berbilang skala. Di samping itu, kaedah susun dalam pembelajaran ensemble digunakan untuk menggabungkan submodel bebas dua saluran yang berbeza. *e keputusan percubaan menunjukkan bahawa kaedah yang dicadangkan boleh meningkatkan ketepatan pengecaman jenis audio dan mempunyai prestasi yang lebih baik untuk format fail audio yang berbeza. Disebabkan oleh pengehadan keadaan rakaman audio, terdapat beberapa jenis audio dalam set data percubaan dan prestasi pengelasan fail audio yang dirakam oleh peranti berbeza masih belum disahkan. Lebih banyak ujian akan dijalankan ke atas kedua-dua isu ini pada masa hadapan.
Ketersediaan Data
*e data yang digunakan untuk menyokong penemuan kajian ini boleh didapati daripada pengarang yang berkaitan atas permintaan.
Konflik Kepentingan
*Pengarang mengisytiharkan bahawa mereka tidak mempunyai konflik kepentingan.
Rujukan
[1] S. Wu, D. Zhang, Z. Zhang, N. Yang, M. Li, dan M. Zhou, "Terjemahan mesin saraf Ketergantungan-kepada-Pergantungan," Transaksi IEEE/ACM pada Audio, Pertuturan dan Bahasa Pemprosesan, jld. 26, tidak. 11, hlm. 2132–2141, 2018.
[2] J. Zou, W. Li, C. Chen, dan Q. Du, "Klasifikasi adegan menggunakan ciri tempatan dan global dengan gabungan perwakilan kolaboratif," Sains Maklumat, vol. 348, no. 2, hlm. 209–226, 2016.
[3] H. Phan, L. Hertel, M. Maass, P. Koch, R. Mazur, dan A. Mertins, "Klasifikasi adegan audio yang lebih baik berdasarkan pembenaman pokok label dan rangkaian neural konvolusi," Transaksi IEEE/ACM pada Pemprosesan Audio, Pertuturan dan Bahasa, jld. 25, tidak. 6, hlm. 1278–1290, 2017.
[4] S. Bayatli, "Penimbangan peraturan pemindahan tanpa pengawasan dalam terjemahan mesin berasaskan peraturan menggunakan pendekatan entropi maksimum," Jurnal Sains dan Kejuruteraan Maklumat, vol. 36, tidak. 2, ms. 309–322, 2020.
[5] A. Rakotomamonjy, "Pembelajaran perwakilan diselia untuk klasifikasi pemandangan audio," Transaksi IEEE/ACM pada Pemprosesan Audio, Pertuturan dan Bahasa, vol. 25, tidak. 6, hlm. 1253–1265, 2017.
[6] W. Yang dan S. Krishnan, "Menggabungkan ciri temporal mengikut corak binari tempatan untuk klasifikasi pemandangan akustik," Transaksi IEEE/ ACM pada Pemprosesan Audio, Pertuturan dan Bahasa, vol. 25, tidak. 6, hlm. 1315–1321, 2017.
[7] AS Dhanjal dan W. Singh, "Sistem terjemahan mesin automatik untuk pertuturan pelbagai bahasa kepada bahasa isyarat India," Alat dan Aplikasi Multimedia, vol. 81, tidak. 3, hlm. 4283–4321, 2021.
[8] MA . Alamir, "Model klasifikasi adegan akustik novel menggunakan gabungan lewat rangkaian saraf konvolusi dan pengelas ensembel yang berbeza," Applied Acoustics, vol. 172, no. 3, ms. 112–122, 2020.
[9] JG Makin, DA Moses, dan EF Chang, "Terjemahan mesin aktiviti kortikal kepada teks dengan rangka kerja penyahkod-pengekod," Nature Neuroscience, vol. 23, tidak. 4, hlm. 575–582, 2020.
[10] S. Waldekar dan G. Saha, "Klasifikasi adegan akustik berasaskan gabungan dua peringkat," Applied Acoustics, vol. 170, tidak. 5, ID Artikel 107502, 2020.
For more information:1950477648nn@gmail.com






