Pengekstrakan Parameter Ciri Yang Diperbaiki Daripada Isyarat Pertuturan Menggunakan Algoritma Pembelajaran Mesin(2)
May 30, 2023
3.7. Proses pengumpulan dan penjanaan set data telah dilakukan seperti berikut. Dalam kajian ini, set data dengan 120 jam audio digunakan untuk latihan model. Set data termasuk rakaman audio pertuturan yang terdiri daripada ayat dengan maksimum 15 perkataan dengan jumlah panjang kira-kira 120 jam.

ginseng padang pasir
Selain itu, set data termasuk sejumlah besar teks berbeza untuk digunakan dalam membangunkan model bahasa. Lebih 90,650 ujaran, 415,780 perkataan dan 65,810 perkataan unik yang disertakan dalam korpus teks telah dikumpulkan, menghasilkan sekitar 120 jam data pertuturan yang ditranskripsikan. Kami membahagikan set data kepada set latihan, pengesahan dan ujian. Statistik set data
dilaporkan dalam Jadual 3.
Jadual 3. Spesifikasi set data.

Kami membahagikan set data kepada tiga folder yang sepadan dengan set latihan, pengesahan dan ujian. Setiap folder mengandungi rakaman audio dan transkrip. Audio dan nama fail transkripsi yang sepadan adalah sama, kecuali rakaman audio disimpan sebagai fail WAV, manakala transkripsi disimpan sebagai fail TXT menggunakan pengekodan UTF-8. Semua transkripsi diwakili menggunakan abjad Latin yang terdiri daripada 29 huruf dan simbol apostrof. Untuk mengelakkan pemasangan berlebihan, kami menggunakan teknik penambahan data berdasarkan gangguan halaju dan peningkatan spektrum.

Cistanche deserticola
4. Kaedah Cadangan
Tugas penting untuk pengaturcara apabila membangunkan sistem pengecaman pertuturan ialah penciptaan kaedah optimum untuk ekspresi parametrik isyarat pertuturan [45]. Kaedah ini membolehkan pemisahan bunyi dan perkataan yang dituturkan dengan sangat baik sambil memastikan bahawa pembesar suara tidak sensitif terhadap pola sebutan dan perubahan dalam persekitaran akustik. Kebanyakan kesilapan dalam pengecaman perkataan disebabkan oleh perubahan dalam nada isyarat disebabkan oleh peralihan dalam mikrofon atau perbezaan dalam nada sebutan [46]. Satu lagi punca biasa kesilapan ialah ubah bentuk rawak tak linear bentuk spektrum, yang sentiasa ada dalam isyarat pertuturan pembesar suara [47,48]. Oleh itu, salah satu tugas terpenting dalam mencipta sistem pengecaman pertuturan yang berkesan ialah pemilihan perwakilan yang mencukupi untuk kandungan isyarat yang dianalisis serta tidak sensitif kepada suara pembesar suara dan pelbagai persekitaran akustik.

Suplemen cistanche berhampiran saya-Meningkatkan Ingatan
Sistem yang digunakan untuk mengekstrak parameter ciri biasanya mempunyai keperluan berikut. Kandungan maklumat, iaitu set parameter ciri, mesti memastikan pengenalpastian yang boleh dipercayai bagi unsur pertuturan yang boleh dikenali. Tambahan pula, kenyaringan, iaitu, mampatan maksimum isyarat audio, dan korelasi bukan statistik parameter mesti diminimumkan. Kebebasan daripada penutur juga mesti dicapai, iaitu penyingkiran maksimum maklumat yang berkaitan dengan ciri penutur daripada vektor aksara. Akhirnya, homogeniti, yang merujuk kepada parameter yang mempunyai varians purata yang sama dan keupayaan untuk menggunakan metrik mudah untuk menentukan pertalian antara set aksara, mesti disediakan [49]. Walau bagaimanapun, tidak selalu mungkin untuk memenuhi semua keperluan secara serentak kerana keperluan tersebut adalah bercanggah. Perihalan parametrik bagi unsur-unsur pertuturan hendaklah cukup terperinci untuk membezakannya dengan pasti dan hendaklah selaconik yang mungkin.

Superman herba cistanche
Dalam amalan, isyarat pertuturan yang diterima daripada mikrofon didigitalkan pada kadar pensampelan 8 hingga 22 kHz. Nilai berangka bersiri dibahagikan kepada serpihan pertuturan (bingkai) dengan tempoh 10 hingga 30 ms, yang sepadan dengan bahagian pertuturan separa pegun. Vektor ciri dikira daripada setiap bingkai, yang kemudiannya digunakan pada tahap akustik pengecaman pertuturan. Pada masa ini, pelbagai kaedah tersedia untuk perwakilan parametrik isyarat berdasarkan analisis autokorelasi, penapisan linear perkakasan, analisis spektrum dan LPC. Pendekatan yang paling biasa untuk parameterisasi pertuturan ialah analisis spektrum serpihan isyarat dan pengiraan pekali cepstralnya.
MFCC telah digunakan sebagai ciri bermaklumat untuk isyarat pertuturan [41]. Ciri-ciri ini digunakan secara meluas dalam pengecaman pertuturan dan berdasarkan dua konsep utama: skala cepstral dan Mel. Kelebihan utama algoritma adalah tahap kebiasaan yang tinggi dan kemudahan pertuturan. Ciri MFCC diasingkan daripada isyarat pertuturan yang dirakam. Algoritma MFCC menggunakan hasil daripada algoritma pensuisan fonogram dan spektrum. Algoritma klasik yang digunakan untuk mengira MFCCs digambarkan dalam Rajah 5.

Rajah 5. Skim klasik untuk mengira MFCC.
Kajian ini membentangkan kaedah pantas untuk mengekstrak parameter fungsi daripada isyarat pertuturan. Algoritma yang dicadangkan untuk pengiraan pantas MFCC ditunjukkan dalam Rajah 6.

Rajah 6. Rangka kerja yang dicadangkan untuk mengira MFCC.
Kami mempertimbangkan urutan pelaksanaan algoritma yang dicadangkan untuk pengekstrakan pantas parameter fungsi daripada isyarat pertuturan
4.1. Pembahagian kepada Bingkai
Selepas penapisan awal, isyarat pertuturan dibahagikan kepada bingkai 16 ms. Setiap bingkai (kecuali yang pertama) mengandungi 10 ms akhir bingkai sebelumnya. Proses ini berterusan sehingga akhir isyarat. Dalam kajian ini, kerana kadar pensampelan isyarat pertuturan ialah 16 kHz, panjang bingkai ialah N=256, dan panjang mengimbangi ialah M=160. Pertindihan ialah 62.5 peratus daripada panjang bingkai. Liputan 50 peratus hingga 75 peratus daripada panjang bingkai biasanya disyorkan.
4.2. Tetingkap Hanning dan Nilai Menurun
Saiz tetingkap Hanning 1D telah digunakan. Tingkap Hanning juga dipanggil tetingkap kosinus yang dinaikkan. Tetingkap Hanning boleh dianggap sebagai jumlah spektrum frekuensi tiga tetingkap masa segi empat tepat. Ia boleh menggunakan lobus sisi untuk membatalkan satu sama lain, menghapuskan gangguan frekuensi tinggi dan kebocoran tenaga. Tetingkap Hanning adalah fungsi tetingkap yang sangat berguna.

Suplemen cistanche berhampiran saya-Meningkatkan Ingatan
Klik di sini untuk melihat produk Cistanche Meningkatkan Memori dan Mencegah Penyakit Alzheimer
【Minta lebih lanjut】 E-mel:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692
Kotak berat digunakan untuk mengurangkan herotan dan melicinkan bingkai individu. Isyarat terapung yang diteliti dalam kajian ini terdiri daripada nada padat. Magnitud nada rata ditentukan oleh magnitud nada tulen pada frekuensi f, yang ditapis melalui tetingkap Hanning.
Aspek kritikal tetingkap ini ialah ia menetapkan sempadan bingkai kepada sifar. Dalam kes ini, tenaga pendek boleh dikira semasa melalui tingkap, dan ia boleh dipindahkan daripada jujukan yang digunakan untuk mengira tenaga amplitud terendah. Matlamatnya adalah untuk mengeluarkan isyarat tenaga rendah daripada isyarat dengan mengira tenaga isyarat sambil melicinkan isyarat dari tetingkap ini. Proses ini memerlukan persamaan tenaga isyarat berikut:

di mana En ialah tenaga bagi serpihan isyarat input, dan xi ialah nilai isyarat.
Sebagai tambahan kepada proses tetingkap menggunakan (11), isyarat diproses dalam langkah seterusnya, yang secara signifikan mengurangkan bilangan nilai yang memasuki pemproses. Rajah 7 membentangkan algoritma pemprosesan selari.
Saiz tetingkap mewakili beberapa sampel dan tempoh. Ia adalah parameter utama analisis. Saiz tetingkap bergantung pada frekuensi asas, keamatan dan perubahan dalam isyarat.

Rajah 7. Algoritma tetingkap Hanning untuk mengeluarkan bahagian senyap. 4.3. Suis Transformasi Fourier Masa Pendek (STFT) Pemahaman intuitif wujud tentang maksud ketinggian tinggi atau rendah. STFT ialah transformasi Fourier yang digunakan untuk menentukan frekuensi sinusoidal dan kandungan fasa bahagian tempatan isyarat apabila ia berubah dari semasa ke semasa. Dalam amalan, pengiraan STFT melibatkan pembahagian isyarat masa yang lebih panjang kepada segmen yang lebih pendek dengan panjang yang sama, diikuti dengan pengiraan berasingan bagi transformasi Fourier pada setiap segmen yang lebih pendek. Ini mendedahkan spektrum Fourier bagi setiap segmen yang lebih pendek. Isyarat masa diskret adalah digunakan dalam amalan. Penukaran frekuensi masa yang sepadan ialah penukaran Fourier diskret, yang menerangkan panjang isyarat Xn sebagai mewakili domain frekuensi nilai kompleks bagi pekali N. STFT, yang menerangkan evolusi komponen frekuensi dari masa ke masa, adalah salah satu alat yang paling banyak digunakan untuk analisis dan pemprosesan pertuturan [50]. Sama seperti spektrum itu sendiri, satu kelebihan STFT ialah parameternya mempunyai tafsiran fizikal dan intuitif. STFT biasanya divisualisasikan menggunakan spektrum log 20log10 (X(h, k)). Spektrum log 2D tersebut kemudiannya boleh dilihat menggunakan peta terma yang dikenali sebagai spektrogram. Dalam peringkat ketiga algoritma, prosedur pensuisan spektrum STFT digunakan pada bingkai yang dilalui melalui tetingkap berat. STFT isyarat diperoleh dengan membuka tingkap dan menentukan DFT setiap tetingkap. Khususnya, transformasi untuk tetingkap Xn dan Wn bagi isyarat input ditentukan seperti berikut:

di mana indeks-k sepadan dengan nilai kekerapan, dan wn ialah fungsi tetingkap, yang biasanya merupakan tetingkap Hanning atau tetingkap Gaussian yang berpusat di sekitar sifar.
4.4. Mel Transform
Pada peringkat keempat, isyarat yang dipindahkan ke jalur frekuensi dibahagikan kepada julat menggunakan fifilter segi tiga. Sempadan fifilter dikira menggunakan kekerapan kapur. Peralihan kepada medan frekuensi kapur adalah berdasarkan persamaan berikut:

di mana f ialah julat frekuensi.
Suis terbalik ditentukan seperti berikut:

Pertimbangkan NN sebagai bilangan fifilter (26 fifilter biasanya digunakan) dan flflow, setinggi julat frekuensi yang dikaji. Julat ini dipindahkan ke skala Mel dan dibahagikan kepada julat bersilang teragih sama rata NN. Sempadan yang sesuai dengan frekuensi linear ditentukan dalam fifield, manakala pekali pemberat yang diperolehi berdasarkan penurasan dilambangkan dengan H. Selepas itu, fifilter digunakan pada modulus segi empat sama pekali yang diperoleh daripada transformasi Fourier. Nilai yang diperoleh adalah logaritma kerana ungkapan berikut:

Algoritma penguraian nilai tunggal dilaksanakan dalam peringkat akhir pengiraan MFCC.
5. Keputusan Eksperimen
Kami melaksanakan dan menguji kaedah yang dicadangkan dalam Visual Studio 2019 C plus plus pada PC dengan CPU 4.90 GHz, 32 GB RAM dan dua GPU Nvidia GeForce 2080Ti, seperti yang ditunjukkan dalam Jadual 4. Sistem telah diuji dalam persekitaran peranti yang berbeza untuk menilai prestasi kaedah pengekstrakan ciri isyarat. Dalam eksperimen, semasa operasi algoritma (Rajah 8), apabila jujukan permukaan isyarat ialah n=15, bilangan nilai dikurangkan sebanyak 40–50 peratus, dan masa pemprosesan meningkat 1. 2-lipat. Akibatnya, algoritma ini menunjukkan kecekapan yang lebih tinggi. Selain itu, algoritma ini membolehkan pengasingan dan penghapusan kawasan senyap semasa melalui tetingkap Hanning.
Beberapa cara yang mungkin tersedia untuk mengelakkan pembaziran lebar jalur memori. Kami mencadangkan penyelesaian baharu yang meningkatkan prestasi pengkomputeran dengan memadankan saiz bingkai isyarat kepada saiz blok memori cache. Jenis pengoptimuman ini boleh menjejaskan prestasi pemprosesan selari keseluruhan dengan ketara. Walau bagaimanapun, ia boleh digunakan dalam pemprosesan isyarat digital dengan membahagikan isyarat kepada bingkai melalui pelaksanaan pada pemproses berbilang teras. Walau bagaimanapun, dalam amalan, pemilihan biasanya dilakukan pada skala kecil, sepadan dengan lebar bas data yang menghubungkan memori cache ke memori utama dan saiz bloknya. Kaedah kami melaksanakan penggunaan optimum kenangan ini dalam pengkomputeran selari. Organisasi memori cache memainkan peranan penting dalam algoritma pemprosesan selari apabila membahagikan data kepada aliran. Khususnya, kehadiran kesan vektor-matriks dalam pemprosesan isyarat digital dan saiz alirannya harus dilaraskan mengikut saiz blok cache. Ini boleh dicapai menggunakan kaedah yang dicadangkan, seperti yang digambarkan dalam Rajah 9.
Jadual 4. Spesifikasi terperinci bagi persediaan eksperimen.


rajah 8. (a) Isyarat masuk awal dan (b) rupa isyarat selepas menggunakan algoritma yang dicadangkan.

Rajah 9. Struktur pengkomputeran selari menggunakan pemproses RK3288.
Dalam bahagian ini, kita membincangkan analisis kuantitatif untuk membandingkan prestasi sistem yang berbeza. Kami membandingkan kaedah kami dengan ritma algo pengecaman pertuturan yang terkenal berdasarkan pendekatan pembelajaran mendalam. Metrik penilaian adalah penting untuk mengira pelbagai strategi untuk pengecaman pertuturan dan menilai prestasi pendekatan yang berbeza. Walaupun kami menggunakan hasil kajian lain sebagai perbandingan, kami tidak pasti sama ada ia benar kerana kod sumber dan set data kaedah ini tidak tersedia secara terbuka untuk mengesahkan prestasi sebenar. Rajah 10 menggambarkan hasil pergerakan semula bahagian senyap semasa laluan serpihan isyarat pertuturan melalui tetingkap Han ning berdasarkan algoritma pantas yang dicadangkan. Keputusan kelajuan yang diperoleh daripada analisis dibentangkan dalam Jadual 5.

Rajah 10. nilai k algoritma KNN (dengan pemilihan ciri).
Jadual 5. Keputusan eksperimen kaedah yang dicadangkan.

Julat telah ditentukan untuk mengetahui tahap kejiranan yang memberikan nilai ketepatan terbaik dalam algoritma KNN. Julat yang ditentukan meliputi 1–25. Dalam Rajah 10, graf algoritma KNN dengan pemilihan ciri telah digunakan. Apabila graf diperiksa, apabila nilai kejiranan ialah 1 pada mulanya, ketepatan latihan adalah jauh lebih tinggi daripada ketepatan ujian. Dalam algoritma KNN yang dibuat menggunakan ciri yang dipilih melalui korelasi, ketepatan model ditentukan sebagai 99.15 peratus dalam set data latihan dan 97.35 peratus dalam set data ujian.
Kadar ralat perkataan (WER) atau kadar ralat aksara biasanya digunakan untuk menilai ketepatan pengekstrakan ciri daripada isyarat pertuturan. Ini adalah matriks objektif yang membantu untuk perbandingan yang saksama bagi teknik pengecaman. Dalam kajian terdahulu kami [51-56], kami mengira metrik seperti ukuran-F (FM), ketepatan dan ingat semula. FM ialah purata wajaran yang mengimbangi ukuran antara ketepatan dan kadar ingat semula. Ketepatan ialah nisbah bilangan pemerhatian positif yang diramalkan dengan betul kepada jumlah bilangan pemerhatian positif yang diramalkan. Pengingatan semula ialah nisbah bilangan pemerhatian positif yang diramalkan dengan betul kepada jumlah bilangan pemerhatian dalam kelas sebenar, seperti yang ditunjukkan dalam (9). Persamaan berikut boleh digunakan untuk mengira purata ketepatan dan kadar ingat semula kaedah pengekstrakan ciri:

di mana TP menandakan bilangan positif benar, FP menandakan bilangan positif palsu, dan FN menandakan bilangan negatif palsu.
FM dikira menggunakan (10), mempertimbangkan kedua-dua ketepatan dan ingat semula.

Purata FM, ingat semula dan ketepatan kaedah yang dicadangkan ialah 98.4 peratus . Pengesanan palsu berlaku dalam 1.6 peratus kes disebabkan oleh bunyi yang tidak diingini isyarat pada mikrofon. Julat ketepatan model adalah antara 0 dan 1, dan skor anggaran metrik mencapai nilai terbaiknya pada 1. Penilaian kaedah kami dan kaedah pengekstrakan ciri pertuturan lain yang diterbitkan baru-baru ini dibentangkan dalam Jadual 6. Nombor yang sama ciri telah digunakan untuk perbandingan yang adil. Sebanyak 325 sampel pertuturan daripada setiap kumpulan telah dianalisis daripada subjek yang mempunyai latar belakang ciri yang serupa. Kesan panjang bingkai yang berbeza mengikut bilangan bank fifilter dalam MFCC dan panjang bingkai yang berbeza dalam susunan LPC juga telah diperiksa untuk ketepatan yang lebih baik.
Jadual 6. Keputusan ketepatan kuantitatif pengekstrakan ciri pertuturan.

Seperti yang dinyatakan sebelum ini, WER ialah ukuran yang paling biasa untuk prestasi pengecaman pertuturan. Ia dikira dengan membandingkan transkripsi rujukan dengan output pengecam pertuturan. Berdasarkan perbandingan ini, adalah mungkin untuk mengira bilangan ralat, yang biasanya tergolong dalam tiga kategori: (1) sisipan apabila perkataan tidak terdapat dalam rujukan dalam output pengecaman pertuturan automatik (ASR), (2) pemadaman apabila perkataan terlepas dalam output ASR, dan (3) penggantian apabila perkataan dikelirukan dengan perkataan lain. WER boleh dikira seperti berikut.

di mana S ialah bilangan penggantian perkataan yang tidak dikenali dengan betul, D ialah bilangan pemadaman, I ialah bilangan sisipan, dan N ialah bilangan perkataan dalam transkripsi rujukan. Isu utama dalam pengiraan skor ini ialah penjajaran antara urutan dua perkataan. Ini boleh ditentukan melalui pengaturcaraan dinamik menggunakan jarak Levenshtein [67].
Berdasarkan Jadual 6, kami melakukan analisis statistik untuk menunjukkan ketepatan purata kaedah yang dibandingkan menggunakan metrik penilaian WER, seperti yang digambarkan dalam Rajah 11. Pengekstrak ciri yang dipertingkatkan menghasilkan ketepatan kira-kira 98.4 peratus, manakala pendekatan lain menghasilkan ketepatan antara 78 peratus dan 96 peratus . Kami menggunakan keputusan yang disediakan dalam kertas yang berkaitan untuk perbandingan; namun, ketepatan nilai ini tidak mudah disahkan kerana kod sumber dan set data kaedah ini tidak tersedia secara umum untuk mengesahkan prestasi sebenar mereka. Namun begitu, dalam kes adegan standard, kaedah yang dicadangkan telah ditunjukkan secara eksperimen untuk memberikan ketepatan pengekstrakan ciri pertuturan yang sangat baik dengan mengurangkan masa pengiraan, walaupun apabila data pertuturan bising atau berkualiti rendah.

Rajah 11. Keputusan kuantitatif pendekatan pengekstrakan ciri isyarat pertuturan menggunakan graf menegak.
Selain itu, kami menilai keputusan positif palsu kaedah yang dipilih. Seperti yang boleh diperhatikan daripada Rajah 12, pendekatan yang dicadangkan mempunyai ralat yang paling sedikit. Tambahan pula, kaedah pengiraan selari yang sangat cekap telah mengurangkan dengan ketara pemilihan ciri isyarat bunyi dan ralat pengekstrakan. Overfifitting adalah salah satu isu utama semasa latihan, dan hampir semua model pembelajaran mesin mengalaminya. Kami cuba mengurangkan risiko overfifitting menggunakan teknik pemilihan ciri yang sebaliknya bertujuan untuk menilai kepentingan ciri sedia ada dalam set data dan membuang ciri yang kurang penting (tiada ciri baharu dicipta).

Rajah 12. Keputusan yang boleh dilihat bagi eksperimen pengekstrakan ciri isyarat pertuturan positif palsu.
Jadual 7 memaparkan keputusan prestasi kaedah yang digunakan dalam persekitaran pengecaman pertuturan berdasarkan sifat yang berbeza. Pendekatan kami yang dicadangkan tidak mengalami bunyi latar belakang yang tidak diingini dan tidak perlu serta tidak dipengaruhi oleh suara manusia yang berkualiti rendah seperti suara serak, suara yang dihasilkan dengan sakit tekak, atau bahkan bunyi daripada manusia yang kehilangan suara sepenuhnya. Kaedah kami bertujuan untuk mengatasi masalah peralatan rakaman yang tidak mencukupi, bunyi latar belakang, loghat dan dialek yang sukar, dan pelbagai nada dalam suara. Dalam persekitaran biasa, hasil terbaik untuk mengesan dan mengekstrak cabaran ciri pertuturan dengan tepat diperoleh menggunakan kaedah yang dicadangkan dengan masa pemprosesan yang lebih singkat.
Jadual 7. Semakan pengesanan ciri pertuturan dan prestasi pengekstrakan menggunakan pelbagai ciri.

Keputusan kaedah pengecaman pertuturan diklasifikasikan sebagai kuat, normal atau lemah untuk tujuh kategori. Kriteria yang berkuasa menunjukkan bahawa algoritma boleh mengatasi semua jenis cabaran. Sebaliknya, kriteria biasa menunjukkan bahawa algoritma mungkin gagal dalam keadaan tertentu kerana sempadan perkataan tidak ditentukan terlebih dahulu. Akhirnya, kriteria yang lemah menunjukkan bahawa algoritma tidak boleh dipercayai di bawah bunyi latar belakang atau getaran.
6. Had
Sukar untuk membuat kesimpulan bahawa kaedah yang dicadangkan setakat ini tidak menunjukkan sebarang kekurangan. Kaedah yang dicadangkan kami juga boleh mengakibatkan ralat disebabkan oleh pelbagai persekitaran bunyi. Untuk mengatasi masalah ini, kami bertujuan untuk mengurangkan bilangan ciri dalam set data dengan mencipta ciri baharu daripada ciri sedia ada [69]. Memandangkan overfifitting adalah salah satu isu utama untuk melatih model yang berbeza semasa pertandingan, memperkayakan data latihan dengan menambahkan sampel data daripada sumber yang berbeza boleh menjadi penyelesaian yang mungkin untuk meningkatkan keputusan. Tanpa mengambil kira masalah yang dinyatakan di atas, keputusan eksperimen mendedahkan bahawa kaedah kami adalah sangat teguh dan berkesan untuk tugasan pengekstrakan ciri pertuturan, dengan ketepatan purata 98.4 peratus dan FM sebanyak 99.5 peratus .
7. Kesimpulan
Pendekatan pengkomputeran selari berprestasi tinggi baru menggunakan kaedah pembelajaran mesin telah dicadangkan untuk sistem pengecaman pertuturan. Masalah pecutan dalam mesin dengan sumber pengkomputeran terhad boleh diselesaikan menggunakan sistem teragih. Kelajuan pengiraan dalam sistem pengecaman isyarat boleh ditingkatkan, dan prestasi platform berbilang teras boleh dipertingkatkan dengan mencipta dan menggunakan ritma algo yang cekap dan pantas. Keputusan menunjukkan bahawa model yang dicadangkan mengurangkan masa pemprosesan dan meningkatkan ketepatan pengekstrakan ciri sebanyak 98.4 peratus dengan menggunakan MFCC secara berkesan. Telah diperhatikan bahawa ciri-ciri dengan nilai korelasi rendah yang diekstrak oleh pemilihan ciri juga berkesan dalam kejayaan model. Analisis statistik dilakukan ke atas data pra-diproses, dan maklumat bermakna dihasilkan daripada data menggunakan algoritma pembelajaran mesin K-nerest neighbors (KNN).
Kajian masa depan akan menumpukan pada meningkatkan ketepatan kaedah kami dengan menggunakan pendekatan pembelajaran mendalam dan mengoptimumkan memori cache pemproses berbilang teras untuk mengesan dan mengekstrak isyarat pertuturan tanpa kehilangan kualiti yang ketara. Tambahan pula, kami merancang untuk membina model analisis spektrum berdasarkan pemprosesan selari dengan prestasi analisis yang mantap yang akan membolehkan penubuhan peranti terbenam dengan sumber pengiraan rendah menggunakan set data pertuturan Taris [70] dalam 3D CNN dan 3D U-Net Environment [71– 75]
Rujukan
1. Meng, YJ; Liu, WJ; Zhang, RZ; Du, Pengekstrakan dan Pengecaman Parameter Ciri Ucapan HS Berdasarkan Interpolasi. Appl. Mech. Mater. 2014, 602–605, 2118–2123. [CrossRef] 2. Musaev, M.; Rakhimov, M. Latihan Dipercepat untuk Rangkaian Neural Konvolusi. Dalam Prosiding Persidangan Antarabangsa 2020 mengenai Sains Maklumat dan Teknologi Komunikasi (ICISCT), Tashkent, Uzbekistan, 4–6 November 2020; ms 1–5. [CrossRef] 3. Ye, F.; Yang, J. Model Rangkaian Neural Dalam untuk Pengecaman Pembesar Suara. Appl. Sci. 2021, 11, 3603. [CrossRef] 4. Musaev, M.; Rakhimov, M. Kaedah Memetakan Blok Memori Utama kepada Cache dalam Pemprosesan Selari Isyarat Pertuturan. Dalam Prosiding Persidangan Antarabangsa 2019 mengenai Sains Maklumat dan Teknologi Komunikasi (ICISCT), Karachi, Pakistan, 9–10 Mac 2019; ms 1–4. [CrossRef] 5. Jiang, N.; Liu, T. Algoritma pembahagian pertuturan dan pengelompokan yang lebih baik berdasarkan SOM dan k-means. Matematik. Masalah En. 2020, 2020, 3608286. [Rujuk Silang] 6. Hu, W.; Yang, Z.; Chen, C.; Matahari, B.; Xie, Q. Pendekatan pembahagian getaran untuk sistem berbilang tindakan turet kawalan berangka. Proses Video Imej Isyarat. 2021, 16, 489–496. [CrossRef]
7. Popescu, TD; Aiordachioaie, D. Pengesanan kerosakan galas elemen gelek menggunakan pembahagian optimum isyarat bergetar. Mech. Syst. Proses Isyarat. 2019, 116, 370–391. [CrossRef] 8. Shihab, MSH; Aditya, S.; Setu, JH; Imtiaz-Ud-Din, KM; Efat, MIA Teknik Pengekstrakan Ciri GRU-CNN Hibrid untuk Pengecaman Pembesar Suara. Dalam Prosiding 2020 23Persidangan Antarabangsa Komputer dan Teknologi Maklumat (ICCIT), Dhaka, Bangladesh, 19–21 Disember 2020; ms 1–6. [CrossRef] 9. Korkmaz, O.; Atasoy, A. Pengiktirafan emosi daripada isyarat pertuturan menggunakan pekali cepstral frekuensi mel. Dalam Prosiding Persidangan Antarabangsa Kejuruteraan Elektrik dan Elektronik (ELECO) Ke-9, Bursa, Turki, 26–28 November 2015; ms 1254–1257. 10. Ayvaz, U.; Gürüler, H.; Khan, F.; Ahmed, N.; Whangbo, T.; Abdusalomov, A. Pengecaman Pembesar Suara Automatik Menggunakan Pekali Cepstral Frekuensi Mel Melalui Pembelajaran Mesin. CMC-Comput. Mater. Teruskan. 2022, 71, 5511–5521. 11. Al-Qaderi, M.; Lahamer, E.; Rad, A. Sistem Pengecaman Pembesar Suara Dua Tahap melalui Gabungan Pengelas Heterogen dan Kerjasama Ciri Pelengkap. Penderia 2021, 21, 5097. [CrossRef] 12. Batur Dinler, Ö.; Aydin, N. Set Parameter Ciri Optimum Berdasarkan Rangkaian Neural Berulang Unit Berulang Berpagar untuk Pengesanan Segmen Pertuturan. Appl. Sci. 2020, 10, 1273. [CrossRef] 13. Kim, H.; Shin, Peningkatan Pertuturan Dwi-Mic JW Berdasarkan TF-GSC dengan Penindasan Kebocoran dan Pemulihan Isyarat. Appl. Sci. 2021, 11, 2816. [CrossRef] 14. Lee, S.-J.; Kwon, H.-Y. Strategi Prapemprosesan untuk Menolak Data Pertuturan Berdasarkan Pengesanan Segmen Pertuturan. Appl. Sci. 2020, 10, 7385. [CrossRef] 15. Rusnac, A.-L.; Grigore, O. CNN Architectures and Feature Extraction Methods for EEG Imaginary Speech Recognition. Penderia 2022, 22, 4679. [CrossRef] [PubMed] 16. Wafa, R.; Khan, MQ; Malik, F.; Abdusalomov, AB; Cho, YI; Odarchenko, R. Kesan Metodologi Tangkas terhadap Kejayaan Projek, dengan Peranan Penyederhanaan Kesesuaian Pekerjaan Seseorang dalam Industri IT Pakistan. Appl. Sci. 2022, 12, 10698. [CrossRef] 17. Aggarwal, A.; Srivastava, A.; Agarwal, A.; Chahal, N.; Singh, D.; Alnuaim, AA; Alhadlaq, A.; Lee, H.-N. Pengekstrakan Ciri Dua Hala untuk Pengecaman Emosi Pertuturan Menggunakan Pembelajaran Mendalam. Penderia 2022, 22, 2378. [CrossRef] [PubMed] 18. Marini, M.; Vanello, N.; Fanucci, L. Mengoptimumkan Parameter Pengekstrakan Ciri Bergantung kepada Pembesar Suara untuk Meningkatkan Prestasi Pengecaman Pertuturan Automatik untuk Penghidap Dysarthria. Sensor 2021, 21, 6460. [CrossRef] 19. Tiwari, S.; Jain, A.; Sharma, AK; Almustafa, Sistem Sokongan Keputusan Diagnostik Jantung Berbilang Kelas Berasaskan Isyarat Phonocardiogram KM. Akses IEEE 2021, 9, 110710–110722. [CrossRef] 20. Mohtaj, S.; Schmitt, V.; Möller, S. Model berasaskan Pengekstrakan Ciri untuk Pengecaman Ucapan Kebencian. arXiv 2022, arXiv: 2201.04227. 21. Kuldoshbay, A.; Abdusalomov, A.; Mukhiddinov, M.; Baratov, N.; Makhmudov, F.; Cho, YI Penambahbaikan untuk kaedah pengelasan automatik untuk imej ultrasound yang digunakan di CNN. Int. J. Gelombang Pelbagai Resolusi Inf. Proses. 2022, 20, 2150054. 22. Passricha, V.; Aggarwal, RK Hibrid CNN dalam dan LSTM dua arah untuk pengecaman pertuturan automatik. J. Intell. Syst. 2020, 29, 1261–1274. [CrossRef] 23. Mukhamadiyev, A.; Khujayarov, I.; Djuraev, O.; Cho, J. Kaedah Pengecaman Pertuturan Automatik Berdasarkan Pendekatan Pembelajaran Mendalam untuk Bahasa Uzbekistan. Penderia 2022, 22, 3683. [CrossRef] [PubMed] 24. Li, F.; Liu, M.; Zhao, Y.; Kong, L.; Dong, L.; Liu, X.; Hui, M. Pengekstrakan ciri dan pengelasan bunyi jantung menggunakan rangkaian neural convolutional 1D. EURASIP J. Adv. Proses Isyarat. 2019, 2019, 59. [CrossRef] 25. Chang, L.-C.; Hung, J.-W. Kajian Awal Pengekstrakan Ciri Pertuturan Teguh Berdasarkan Memaksimumkan Kebarangkalian Keadaan dalam Model Akustik Dalam. Appl. Syst. Innov. 2022, 5, 71. [CrossRef] 26. Ramírez, J.; Górriz, JM; Segura, Pengesanan Aktiviti Suara JC. Asas dan Kemantapan Sistem Pengecaman Pertuturan. Dalam Pengiktirafan dan Pemahaman Pertuturan Teguh; Grimm, M., Kroschel, K., Eds.; Pendidikan dan Penerbitan I-TECH: London, UK, 2007; ms 1–22. 27. Oh, S. Kaedah Pengekstrakan Ciri Pertuturan Teguh Berasaskan DNN dan Bunyi Isyarat Menggunakan Penapis LMS Ramalan Purata yang Diperbaiki untuk Pengecaman Pertuturan. J. Converg. Inf. Technol. 2021, 11, 1–6. [CrossRef] 28. Abbaschian, BJ; Sierra-Sosa, D.; Elmaghraby, A. Teknik Pembelajaran Mendalam untuk Pengecaman Emosi Pertuturan, daripada Pangkalan Data kepada Model. Penderia 2021, 21, 1249. [CrossRef] 29. Rakhimov, M.; Mamadjanov, D.; Mukhiddinov, A. Pendekatan Selari Berprestasi Tinggi untuk Pemprosesan Imej dalam Pengkomputeran Teragih. Dalam Prosiding Persidangan Antarabangsa Ke-14 IEEE 2020 mengenai Aplikasi Teknologi Maklumat dan Komunikasi (AICT), Uzbekistan, Tashkent, 7–9 Oktober 2020; ms 1–5. [CrossRef] 30. Abdusalomov, A.; Mukhiddinov, M.; Djuraev, O.; Khamdamov, U.; Whangbo, TK Pengekstrakan Objek Saling Automatik Berdasarkan Ambang Penyesuaian Setempat untuk Menjana Grafik Taktil. Appl. Sci. 2020, 10, 3350. [CrossRef] 31. Abdusalomov, A.; Whangbo, TK Penambahbaikan untuk kaedah pengecaman latar depan menggunakan teknik penyingkiran bayang-bayang untuk persekitaran dalaman. Int. J. Gelombang Pelbagai Resolusi Inf. Proses. 2017, 15, 1750039. [CrossRef] 32. Abdusalomov, A.; Whangbo, TK Pengesanan dan Penyingkiran Bayang Objek Bergerak Menggunakan Maklumat Geometri dan Warna untuk Strim Video Dalaman. Appl. Sci. 2019, 9, 5165. [CrossRef] 33. Mery, D. Penglihatan Komputer untuk Ujian X-ray; Penerbitan Antarabangsa Springer: Cham, Switzerland, 2015; hlm. 271, ISBN 978-3319207469. 34. Mark, S. Imej pertuturan menentukur semula sempadan persepsi pertuturan. Atten. Persepsi. Psikofi. 2016, 78, 1496–1511. [CrossRef] 35. Mudgal, E.; Mukuntharaj, S.; Modak, MU; Rao, Pengecaman Pertuturan Masa Nyata Berdasarkan Templat YS Menggunakan Penapis Digital pada DSP-TMS320F28335. Dalam Prosiding Persidangan Antarabangsa Keempat 2018 mengenai Kawalan dan Automasi Komunikasi Pengkomputeran (ICCUBEA), Pune, India, 16–18 Ogos 2018; ms 1–6. [CrossRef]






