Pengekstrakan Parameter Ciri Yang Diperbaiki Daripada Isyarat Pertuturan Menggunakan Algoritma Pembelajaran Mesin(1)

May 30, 2023

Abstrak: Pengecaman pertuturan merujuk kepada keupayaan perisian atau perkakasan untuk menerima isyarat pertuturan, mengenal pasti ciri pembesar suara dalam isyarat pertuturan dan mengecam pembesar suara selepas itu. Secara umumnya, proses pengecaman pertuturan melibatkan tiga langkah utama: pemprosesan akustik, pengekstrakan ciri, dan pengelasan/pengiktirafan. Tujuan pengekstrakan ciri adalah untuk menggambarkan isyarat pertuturan menggunakan bilangan komponen isyarat yang telah ditetapkan. Ini kerana semua maklumat dalam isyarat akustik adalah terlalu menyusahkan untuk dikendalikan, dan sesetengah maklumat tidak relevan dalam tugas pengenalpastian. Kajian ini mencadangkan pendekatan berasaskan pembelajaran mesin yang melakukan pengekstrakan parameter ciri daripada isyarat pertuturan untuk meningkatkan prestasi aplikasi pengecaman pertuturan dalam persekitaran bandar pintar masa nyata. Selain itu, prinsip memetakan blok memori utama ke cache digunakan dengan cekap untuk mengurangkan masa pengkomputeran. Saiz blok memori cache ialah parameter yang sangat mempengaruhi prestasi cache. Khususnya, pelaksanaan proses sedemikian dalam sistem masa nyata memerlukan kelajuan pengiraan yang tinggi. Kelajuan pemprosesan memainkan peranan penting dalam pengecaman pertuturan dalam sistem masa nyata. Ia memerlukan penggunaan teknologi moden dan algoritma pantas yang meningkatkan pecutan dalam mengekstrak parameter ciri daripada isyarat pertuturan. Masalah dengan overclocking semasa pemprosesan digital isyarat pertuturan masih belum dapat diselesaikan sepenuhnya. Keputusan eksperimen menunjukkan bahawa kaedah yang dicadangkan berjaya mengekstrak ciri isyarat dan mencapai prestasi pengelasan yang lancar berbanding dengan algoritma pengecaman pertuturan konvensional yang lain.

Cistanche deserticola slice (11)

Cistanche deserticola

Kata kunci: pengenalan suara; pengkomputeran selari; pengkomputeran teragih; pemproses berbilang teras; pengekstrakan ciri; analisis spektrum

1. Pengenalan

Penubuhan pendekatan komunikasi antara manusia dan teknologi komputer adalah tugas kritikal dalam kecerdasan buatan moden. Salah satu kaedah yang paling mudah untuk pengguna memasukkan maklumat adalah melalui isyarat pertuturan. Oleh itu, teknologi pemprosesan isyarat pertuturan dan alatnya telah menjadi bahagian penting dalam masyarakat maklumat. Pengecaman pertuturan ialah aspek penyelidikan penting dalam pemprosesan isyarat pertuturan dan teknik interaksi manusia-komputer yang penting. Isyarat pertuturan mengandungi maklumat semantik, peribadi dan persekitaran [1]. Pendekatan umum untuk pemprosesan isyarat pertuturan adalah menggunakan analisis jangka pendek, di mana isyarat dibahagikan kepada tetingkap masa dengan saiz tetap, dengan mengandaikan bahawa parameter isyarat tidak berubah. Satu pertindihan diletakkan di antara tingkap untuk mendapatkan perwakilan isyarat yang lebih tepat. Algoritma pengekstrakan ciri seperti analisis spektrum dan ramalan linear digunakan pada setiap tetingkap. Walau bagaimanapun, proses ini juga harus mempertimbangkan kelajuan dan masa.

Desert living cistanche

ginseng padang pasir

Masa adalah kebimbangan penting dalam beberapa bidang pemprosesan isyarat masa nyata. Nisbah kelajuan pemprosesan boleh ditingkatkan dengan menggunakan sumber pemproses secara cekap dan membangunkan algoritma baharu dan pantas untuk mengurangkan masa pemprosesan digital. Walau bagaimanapun, masalah pengkomputeran berprestasi tinggi masih belum dapat diselesaikan sepenuhnya [2]. Selain itu, kemajuan besar telah dicapai dalam pengecaman pertuturan automatik dengan pembangunan perkakasan dan perisian pemprosesan isyarat digital. Walau bagaimanapun, di sebalik kemajuan ini, mesin tidak dapat menandingi prestasi rakan manusia mereka dari segi ketepatan dan pengecaman kelajuan, terutamanya dalam pengecaman pertuturan bebas pembesar suara. Oleh itu, sejumlah besar penyelidikan yang telah dijalankan mengenai pengecaman pertuturan telah memberi tumpuan kepada masalah pengecaman pertuturan yang bebas daripada penutur, disebabkan oleh pelbagai aplikasi dan batasan teknik pengecaman pertuturan yang ada [3].

Secara ringkasnya, sumbangan utama kajian adalah seperti berikut:

cistanche tea

teh cistanche

Klik di sini untuk melihat produk teh Cistanche deserticola

【Minta lebih lanjut】 E-mel:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692

Proses mengenal pasti seseorang melalui isyarat pertuturan terdiri daripada beberapa peringkat. Antaranya, beberapa langkah memerlukan lebih masa pengiraan. Ini adalah analisis spektrum. Salah satu parameter yang sangat penting dalam algoritma pembelajaran mesin ialah masa latihan. Dalam kerja ini, kami mendapati bahawa proses mengekstrak ciri adalah penting untuk mengenal pasti isyarat pertuturan. Selain itu, ia memerlukan banyak masa dalam pembelajaran mesin. Telah ditetapkan bahawa proses analisis spektrum terdiri daripada operasi bebas, dan penyejajaran adalah mungkin.

Eksperimen telah menunjukkan bahawa transformasi spektrum FFT dan DCT memberikan hasil yang baik dalam analisis spektrum. Proses analisis spektrum adalah sah untuk setiap segmen isyarat pertuturan. Ini membolehkan kita membezakan dengan jelas ciri-ciri ini daripada isyarat pertuturan. Dengan bantuan alat OpenMP dan TBB, algoritma pengkomputeran selari telah dibangunkan yang memungkinkan untuk mempercepatkan pengiraan.

Saiz segmen adalah penting apabila membahagikan isyarat pertuturan kepada segmen. Semasa eksperimen, didapati bahawa saiz segmen isyarat pertuturan bergantung pada memori cache pemproses pusat. Khususnya, pemadanan segmen dengan saiz cache dalam pemproses berbilang teras didapati mempunyai kesan positif ke atas kelajuan pengiraan dalam pembelajaran mesin.

Kaedah pelaksanaan selari baharu dicadangkan untuk transformasi spektrum isyarat bagi pengekstrakan parameter ciri daripada isyarat pertuturan menggunakan algoritma pembelajaran mesin pada pemproses berbilang teras menggunakan TBB dan OpenMP.

Didapati juga bahawa penggunaan prinsip pemetaan blok memori utama ke cache dan saiz blok memori cache secara berkesan dapat meningkatkan kelajuan pemprosesan.

Cistanche supplement near me—Improve memory2

Suplemen cistanche berhampiran saya-Meningkatkan Ingatan

Baki kertas ini disusun seperti berikut. Bahagian 2 menyemak kajian sedia ada untuk mengekstrak sifat isyarat pertuturan tertentu. Bahagian 3 menerangkan langkah pengekstrakan ciri dengan eksperimen. Bahagian 4 membentangkan algoritma pengiraan berprestasi tinggi yang dicadangkan untuk mengekstrak parameter ciri daripada isyarat pertuturan secara terperinci. Keputusan eksperimen berdasarkan pelaksanaan kami dibincangkan dalam Bahagian 5. Bahagian 6 menyerlahkan batasan kaedah yang dicadangkan. Akhir sekali, Bahagian 7 menyimpulkan kajian dengan meringkaskan penemuan dan mencatat hala tuju penyelidikan masa hadapan.

2. Karya Berkaitan

Kaedah baru, algoritma dan aplikasi yang lebih moden sedang dibangunkan dan dipertingkatkan untuk pembahagian isyarat pertuturan dan pengiraan penunjuk parametrik serpihan terpilih, dengan itu mencipta spektrogram isyarat pertuturan menggunakan analisis spektrum [4-7]. Pengenalpastian pembesar suara dengan klip suara terpelbagai di seluruh dunia adalah tugas yang penting dan mencabar, terutamanya dalam mengekstrak ciri yang kuat dan diskriminatif [8]. Sistem pengekstrakan ciri Mel Frequency Cepstral Coefficients (MFCC) novel yang lebih cepat dan lebih cekap tenaga daripada realisasi MFCC tradisional telah dicadangkan oleh Korkmaz et al. [9]. Daripada menggunakan penapis pra-menekankan laluan tinggi, mereka menggunakan penapis laluan rendah. Mereka melaksanakan penapis laluan jalur dengan penapis laluan tinggi kerana pra-penekanan diperlukan untuk meningkatkan tenaga isyarat dalam frekuensi tinggi. Dalam kerja kami sebelum ini [10], kami membentangkan kaedah berasaskan MFCC novel untuk pengenalan pembesar suara. Daripada menggunakan MFCC konvensional, kami menggunakan piksel daripada spektrogram Mel sebagai set ciri kami. Spektrogram telah diubah menjadi 2-tatasusunan D untuk mencipta set data baharu. Untuk mengenal pasti pembesar suara, beberapa algoritma pembelajaran telah diamalkan dengan 10-teknik pengesahan silang lipatan. Dengan bantuan perceptron berbilang lapisan (MLP) dengan fungsi pengaktifan tanh, ketepatan terbaik sebanyak 90.2 peratus telah dicapai.

Pengekstrakan ciri dicapai dengan menukar bentuk gelombang pertuturan kepada bentuk perwakilan parametrik pada kadar data yang agak rendah untuk pemprosesan dan analisis seterusnya [11–14]. Pendekatan pengekstrakan ciri biasanya menghasilkan vektor ciri berbilang dimensi untuk setiap isyarat pertuturan. Pengekstrakan ciri ialah bahagian pengecaman pembesar suara yang paling relevan. Ciri pertuturan mempunyai bahagian penting dalam pengasingan penutur daripada orang lain. Pengekstrakan ciri mengurangkan magnitud isyarat pertuturan, tanpa menyebabkan sebarang kerosakan pada kuasa isyarat pertuturan [15–17]. Dalam [18], pengarang memperkenalkan pendekatan baharu yang mengeksploitasi penalaan halus bagi saiz dan parameter anjakan tetingkap analisis spektrum yang digunakan untuk mengira transformasi Fourier masa pendek awal untuk meningkatkan prestasi pengecaman pertuturan automatik yang bergantung kepada pembesar suara. sistem (ASR). Dengan ketiadaan doktor, orang awam boleh menggunakan sistem bantuan keputusan yang dicipta menggunakan pendekatan kecerdasan buatan. Pengesanan status jantung awal dan tidak invasif boleh dicapai menggunakan isyarat phonocardiogram (PCG) [19-21].

Rangkaian saraf konvolusi (CNN) telah ditunjukkan untuk mensimulasikan lokaliti struktur dalam ruang ciri serta menggunakan pengumpulan dalam kawasan frekuensi berat sebelah untuk mengurangkan variasi translasi dan menyesuaikan untuk gangguan dan perubahan kecil dalam ruang ciri [22]. Mukhamadiyev et al. mencadangkan model pengecaman pertuturan model Markov yang disembunyikan rangkaian saraf dalam hujung ke hujung dan rangkaian perhatian pengkelasan temporal (CTC) sambungan hibrid untuk bahasa Uzbekistan dan dialeknya. Pendekatan yang dicadangkan mengurangkan masa latihan dan meningkatkan ketepatan pengecaman pertuturan dengan berkesan menggunakan fungsi objektif CTC dalam latihan model perhatian [23]. Pengekstrakan dan pengelasan ciri menggunakan model rangkaian neural convolutional satu dimensi (CNN), yang membahagikan isyarat bunyi jantung kepada normal dan tidak normal secara langsung bebas daripada elektrokardiogram (ECG), telah dicadangkan dalam [24]. Mereka mendakwa bahawa ketepatan klasifikasi lebih tinggi dalam CNN 1D berbanding dalam CNN 2D untuk isyarat bunyi jantung yang digunakan dalam kajian ini apabila kernel konvolusi kurang daripada 52 kerana kernel konvolusi yang besar boleh membawa kepada kerumitan pengiraan dan semakin memakan masa. . Dalam [25], rangkaian saraf dalam telah dilatih untuk memaksimumkan ketepatan posterior bagi urutan keadaan model akustik berkenaan dengan jujukan ciri pertuturan menggunakan pangkalan data TIMIT (TIMIT Acoustic-Phonetic Continuous Speech Corpus).

3. Pra-Pemprosesan: Gambaran Keseluruhan Bahan

cistanche—Improve memory4

Suplemen cistanche berhampiran saya-Meningkatkan Ingatan

Untuk tujuan ini, pembangunan algoritma pantas untuk mengekstrak parameter ciri daripada isyarat pertuturan dan perwakilan parametrik, pengekstrakan sampel yang berguna dan bermaklumat untuk pemprosesan, dan pembangunan program untuk pelaksanaan spektrogram segmen akustik terpilih adalah amat diperlukan.

Sistem pengecaman pertuturan terdiri daripada dua subsistem utama:

Pemprosesan utama isyarat pertuturan (fonogram);

Pengelasan simbol akustik menggunakan algoritma pintar (spektrogram).

Subsistem pertama menjana simbol akustik sebagai satu set sifat akustik bermaklumat bagi isyarat dan ciri isyarat. Subsistem kedua menukar isyarat pertuturan ke dalam bentuk parametrik berdasarkan ciri akustik yang diperolehi. Pemprosesan isyarat pertuturan terdiri daripada peringkat berikut:

Pemisahan sempadan isyarat pertuturan;

Penapisan digital;

Pembahagian;

Penggunaan tingkap melicinkan;

Transformasi spektrum, dan normalisasi frekuensi spektrum.

Langkah-langkah ini digunakan secara meluas untuk mengekstrak parameter ciri daripada isyarat pertuturan, dan ciri utamanya dipertimbangkan dalam perkara berikut.

3.1. Pengasingan Sempadan

Pengekstrakan bahagian pertuturan sahaja daripada isyarat masuk atau penentuan detik permulaan dan akhir ayat dalam persekitaran yang bising adalah tugas penting dalam pemprosesan pertuturan. Sifat isyarat pertuturan berikut digunakan untuk menyelesaikan masalah ini: tenaga jangka pendek isyarat pertuturan, bilangan titik bersilang pada sifar, ketumpatan taburan nilai medan senyap dalam isyarat, dan entropi spektrum. Sistem pengecaman pertuturan tradisional menggunakan teknik yang berdasarkan tenaga sementara dan spektrum isyarat (cth, pengesanan aktiviti suara) untuk menentukan sempadan pertuturan daripada isyarat pertuturan yang masuk [26–28].

Parameter utama isyarat pertuturan ialah tenaga jangka pendek isyarat pertuturan dan bilangan titik yang melalui sifar. Sebagai peraturan, parameter isyarat pertuturan berubah dengan cepat dari semasa ke semasa; oleh itu, adalah kebiasaan untuk memproses isyarat pertuturan menjadi serpihan sepanjang 10 hingga 30 ms yang tidak bertindih. Isyarat pertuturan adalah pegun dalam julat ini, dan kawasan senyap dalam isyarat pertuturan dikeluarkan dengan mengira tenaga sementara. Algoritma untuk menyelesaikan masalah ini dibahagikan kepada N jujukan 256 nilai tenaga jangka pendek isyarat pertuturan seterusnya.

Pengiraan tenaga setiap serpihan dengan membahagikan isyarat pertuturan adalah sesuai untuk pengkomputeran selari dan teragih. Setiap serpihan diproses secara bebas. Jika pemprosesan digunakan dalam multipemproses n-teras, adalah mungkin untuk mengira tenaga n serpihan secara serentak. Oleh itu, adalah mungkin untuk meningkatkan kecekapan pemprosesan selari semasa peringkat ini [29-32].

3.2. Bilangan Sifar-Crossing

Persilangan sifar ialah titik di mana tanda fungsi matematik berubah (cth, daripada positif kepada negatif), yang diwakili oleh pintasan paksi (nilai sifar) dalam graf fungsi [33]. Frekuensi silangan sifar dalam isyarat mungkin penunjuk paling mudah bagi sifat spektrumnya. Sebagai contoh, bilangan titik yang melalui sifar dalam isyarat pertuturan boleh ditentukan menggunakan persamaan berikut:

Figure 1. Method of speech separation based on spectral entropy analysis.


Rajah 1. Kaedah pemisahan pertuturan berdasarkan analisis entropi spektrum.

3.3. Penapisan Digital

Selain isyarat biasa yang berguna, terdapat pelbagai jenis bunyi. Memandangkan bunyi bising menjejaskan kualiti sistem pengecaman pertuturan secara negatif, menangani bunyi bising adalah isu yang mendesak. Dua jenis penapis digital digunakan untuk mengurangkan tahap hingar dalam sistem: penapis garisan dan penapis awal. Penapis linear boleh dianggap sebagai gabungan penapis frekuensi rendah dan tinggi kerana ia menangkap semua frekuensi rendah dan tinggi. Penapisan awal digunakan untuk meminimumkan kesan gangguan setempat pada tanda ciri yang digunakan untuk pengecaman seterusnya. Isyarat pertuturan mesti disalurkan melalui penapis laluan rendah untuk penjajaran spektrum [35].

3.4. Segmentasi

Segmentasi ialah proses membahagikan isyarat pertuturan kepada serpihan yang diskret dan tidak bertindih. Isyarat biasanya dibahagikan kepada unit pertuturan seperti ayat, perkataan, suku kata, fonem, atau unit fonetik yang lebih kecil. Pembahagian rakaman yang mengandungi ujaran banyak penutur mungkin terdiri daripada mengaitkan potongan ujaran kepada penutur tertentu. Istilah "stesen segmen" kadangkala digunakan untuk merujuk kepada pembahagian isyarat pertuturan ke dalam bingkai sebelum parameterisasinya [36,37].

3.5. Transformasi Spektrum

Adalah perlu untuk membezakan ciri utama isyarat pertuturan yang digunakan pada peringkat akhir proses pengecaman pertuturan. Ciri-ciri awal ditentukan dengan menganalisis sifat spektrum isyarat pertuturan. Algoritma transformasi Fourier pantas biasanya digunakan untuk mendapatkan frekuensi spektrum isyarat pertuturan [38,39].

3.6. Normalisasi Frekuensi Spektrum

Keseluruhan proses pengiraan dalam algoritma pintar adalah berdasarkan nombor perpuluhan yang bergerak. Oleh itu, parameter objek yang dikelaskan menggunakan rangkaian saraf adalah terhad kepada julat [{{0}}.0, 1.0]. Spektrum yang terhasil dinormalisasi antara 0 dan 1 untuk menggunakan pemprosesan spektrum menggunakan rangkaian saraf. Untuk mencapai matlamat ini, setiap komponen vektor dibahagikan kepada komponen maksimumnya.

Kaedah pemprosesan spektrum membolehkan penggunaan semua sampel data yang diperoleh daripada isyarat pertuturan. Banyak isyarat pertuturan mempunyai struktur frekuensi dan sifat spektrum tertentu. Kaedah spektrum menyediakan pemprosesan isyarat pertuturan berketepatan tinggi. Kelemahan pemprosesan spektrum termasuk fleksibiliti rendah dalam ciri tempatan isyarat, kekurangan dimensi spektrum, dan kos pengiraan yang agak tinggi.

Transformasi Fourier, analisis wavelet, dan banyak algoritma lain digunakan secara meluas dalam pemprosesan spektrum isyarat pertuturan. Transformasi Fourier digunakan dalam banyak bidang sains, termasuk pemprosesan pertuturan. Dalam pemprosesan isyarat pertuturan, transformasi Fourier menukar isyarat daripada medan masa kepada medan spektrum sebagai komponen frekuensi [40].

Dalam kajian terdahulu, transformasi Fourier diskret (DFT), transformasi kosinus diskret (DCT), transformasi Fourier jangka pendek, dan transformasi wavelet digunakan untuk analisis spektrum. Kaedah ini digunakan untuk mengubah serpihan isyarat pertuturan ke dalam domain frekuensi dan mengira spektrum. Pakej TBB dan OpenMP digunakan untuk mencipta algoritma selari untuk transformasi spektrum. Dalam kaedah ini, arahan membahagikan isyarat ke dalam bingkai; contohnya, N=16, 32, …, atau 4096 untuk setiap bingkai [4]. Saiz setiap bingkai yang dicipta adalah sama dengan saiz blok memori cache kerana memori cache adalah faktor yang mempengaruhi kecekapan pemprosesan selari. Keputusan pecutan digambarkan dalam Rajah 2.

Figure 2. Acceleration results for (a) four- and (b) eight-core processors.


Rajah 2. Keputusan pecutan untuk (a) pemproses empat dan (b) lapan teras.

Untuk pelaksanaan perisian bagi algoritma pemprosesan selari, pemprosesan bersiri dan selari telah dilakukan pada pemproses empat dan lapan teras, yang digunakan menggunakan komputer peribadi dan pelayan, seperti yang disenaraikan dalam Jadual 1.

Jadual 1. Ciri-ciri pemproses Intel.

Table 1. Characteristics of Intel processors.

Ciri utama algoritma DCT ialah berkala. Kelebihan DCT ialah ia cenderung untuk menumpukan kebanyakan tenaga isyarat pada sebilangan kecil faktor. Persamaan berikut menyediakan unsur-unsur matriks pekali:

imageimage


dengan L(k) ialah nilai DCT, k ialah indeks pekali, x(n) mewakili item data, dan N ialah saiz bingkai.

Parameter analisis Fourier adalah asas kepada kaedah yang digunakan untuk menjana vektor ciri dalam kebanyakan sistem pengecaman pertuturan dalam pemprosesan digital isyarat pertuturan dalam domain spektrum. Pekali cepstral frekuensi Mel (MFCCs) [41] dan teknik pengekodan ramalan linear (LPC) [42,43] digunakan dalam analisis Fourier untuk menjana imej spektrogram daripada isyarat pertuturan. Spektrum yang diperoleh menggunakan analisis Fourier memberikan maklumat yang ringkas dan tepat mengenai isyarat pertuturan, seperti yang digambarkan dalam Rajah 3.

Figure 3. DFT: (a) change in frequency range within time domain and (b) spectrogram.


Rajah 3. DFT: (a) perubahan dalam julat frekuensi dalam domain masa dan (b) spektrogram.

Isyarat dua dimensi (2D) digunakan untuk analisis spektrum dalam eksperimen. Ciri-ciri analisis spektrum 2D yang digunakan dalam algoritma pemprosesan imej selari adalah sesuai untuk pemprosesan selari dalam pemproses berbilang teras [38]. Khususnya, vektor dan matriks transformasi ke hadapan dan songsang mempunyai dimensi binari, dan keserasian seni bina pemproses berbilang teras ini boleh meningkatkan kelajuan pengiraan dengan berkesan. Oleh itu, kami menggunakan pemprosesan berurutan dan selari pada komputer dengan ciri pemproses yang berbeza untuk pelaksanaan perkakasan algoritma yang digunakan untuk memproses isyarat 2D (Jadual 2)

Jadual 2. Ciri-ciri menggunakan pemproses Intel.

Table 2. Characteristics of applying Intel processors.


Keseluruhan isyarat 2D dibahagikan kepada serpihan yang sama dengan saiz yang berbeza pada setiap peringkat [44]. Nilai serpihan yang dipilih adalah antara resolusi piksel 16 × 16 dan 1024 × 1024. Kelajuan algoritma DCT selari menggunakan pakej OpenMP berbanding dengan algoritma berjujukan ditunjukkan dalam Rajah 4 Penggunaan analisis spektrum 2D selari algoritma pada pemproses berbilang teras menghasilkan hasil overclocking yang hampir dengan bilangan teras.

Figure 4. Acceleration results for 2D parallel spectral analysis.

Rajah 4. Keputusan pecutan untuk analisis spektrum selari 2D.

Anda mungkin juga berminat