Pengecaman Bahasa Isyarat Berterusan Novel Spatio-Temporal Menggunakan Rangkaian Pelbagai Ciri yang Penuh perhatian(2)
Jun 01, 2023
3.5. Pembelajaran Urutan
Pembelajaran Urutan Selepas mendapat hasil daripada pengekstrak ciri spatial dan temporal dalam bentuk ciri gloss, kita perlu menyusunnya menjadi ayat yang lengkap. Oleh itu, kita perlu menggunakan pembelajaran berurutan untuk memastikan gloss itu diuruskan untuk membentuk ayat yang baik. Kaedah yang paling lazim dalam penyelidikan semasa merujuk kepada Memori Jangka Pendek Dwi Arah (Bi-LSTM) dan klasifikasi temporal Connectionist (CTC) [17,23] untuk masalah yang boleh diselesaikan menggunakan CTC dan beberapa karya terbaru [17,23] mencadangkan CTC sebagai proses latihan hujung ke hujung untuk CSLR.

Serbuk ekstrak cistanche
Klik di sini untuk melihat produk Cistanche
【Minta lebih lanjut】 E-mel:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692
Memori jangka pendek panjang (LSTM) [44] ialah varian rangkaian neural berulang (RNN), dan ia digunakan secara meluas dalam pemodelan jujukan. LSTM memodelkan kebergantungan jangka panjang dengan cemerlang; ia boleh memproses keseluruhan jujukan input dan menggunakan keadaan dalaman mereka untuk memodelkan peralihan keadaan. Walau bagaimanapun, kelemahan RNN hadapan ini ialah keadaan tersembunyi hanya dipelajari dari arah sehala. RNN menghasilkan keadaan tersembunyi seperti yang diterangkan oleh persamaan di bawah selepas menerima jujukan ciri sebagai input.
ht=RNN(ht−1,ot),
dengan ht mewakili keadaan tersembunyi, dengan keadaan awal h0 ialah vektor sifar tetap dan t ialah langkah masa. RNN digunakan untuk meramalkan kilauan tanda mengikut input jujukan ciri spatial.
Lebih-lebih lagi, tugas SL agak kompleks. Oleh itu, ia bukan sahaja memerlukan ciri yang diterima daripada konteks sehala tetapi juga memerlukan bantuan penggunaan maklumat dua hala untuk mempelajari kejadian perkataan yang datang sebelum dan selepas perkataan lain dalam ayat. Akibatnya, kami menggunakan Bi-LSTM [45] untuk mempelajari kebergantungan dinamik kompleks jujukan imej dengan mengubahnya menggunakan perwakilan spatial dan temporal kepada jujukan ciri gloss. Menurut penjelasan yang dinyatakan sebelum ini, kaedah Bi-LSTM boleh melakukan kerja dua hala dengan kaedah LSTM. Ini bermakna kaedah Bi-LSTM boleh mengklasifikasikan data berjujukan dengan lebih baik. Pengiraan Bi-LSTM yang menggunakan keadaan tersembunyi dua hala juga boleh dilihat sebagai pengiraan berulang LSTM yang diproses dari hadapan ke belakang dan kemudian dari belakang ke hadapan. Selepas itu, keadaan tersembunyi setiap langkah masa dilalui melalui lapisan yang disambungkan sepenuhnya dan lapisan softmax [17].

Serbuk cistanche
pada=W(ht tambah b),
yt,j=e at,j ∑ke at,j ,
di mana b ialah vektor pincang dan y(t,j) mewakili kebarangkalian label j pada langkah masa t. Dalam tugasan TSL kami, label j ialah kosa kata yang diperoleh daripada ayat tersebut. Dalam amalan, Bi-LSTM meningkatkan dengan ketara jumlah maklumat yang boleh diakses oleh rangkaian, yang seterusnya menambah baik konteks maklumat yang tersedia dalam algoritma. Maklumat tersebut mengandungi pengetahuan tentang perkataan yang datang selepas atau sebelum bingkai semasa dalam input urutan ciri ayat.
Bi-LSTM menghantar keadaan tersembunyi sebagai output ke lapisan CTC untuk setiap langkah masa. Oleh kerana hasil Bi-LSTM ini tidak memberi perhatian kepada susunan gloss, kami menggunakan CTC untuk mengendalikan pemetaan jujukan video o={ot} T 0 t=1 untuk menghasilkan tanda jujukan kilauan `={` i} IL =1 (L Kurang daripada atau sama dengan T) dengan susunan yang lebih baik. CTC digunakan dalam banyak bidang, termasuk pengecaman tulisan tangan [46], pengecaman pertuturan [47], dan pengecaman bahasa isyarat [17,23]. Dalam domain ini, ia digunakan sebagai fungsi pemarkahan tanpa menjajarkan urutan input dan output. Dalam CSLR, CTC dikenali sebagai modul yang dibangunkan untuk tugas hujung ke hujung yang melibatkan klasifikasi data temporal tanpa pembahagian. Melalui pengaturcaraan dinamik, CSLR boleh menyelesaikan isu penjajaran dengan mencipta label kosong (-) yang membenarkan sistem menghasilkan hasil yang optimum untuk perwakilan data yang tidak mempunyai label (seperti data epentesis dan segmen data bukan isyarat). Khususnya, CTC menjana label kosong "-" untuk melanjutkan perbendaharaan kata V, dengan V=Vorigin ∪ {-}. Tujuan label kosong ini adalah untuk mewakili peralihan dan untuk memaklumkan kewujudan gloss kosong yang tidak memberikan maklumat untuk proses pembelajaran, sebagai π={πt} T 0 t{{20 }}, dengan πt ∈ V. Akibatnya, CTC boleh menguruskan parameter output daripada pengekstrak ciri spatial dan temporal dan juga Bi-LSTM sebagai modul penjajaran dengan meringkaskan kebarangkalian semua laluan yang mungkin. Semua laluan penjajaran π mempunyai kebarangkalian yang diberikan urutan input seperti berikut [17]:

Percubaan Cistanche deserticola
p(π| o) {{0}} T 0 ∏ t=1 p(πt|o)=T 0 ∏ t=1 yt, πt
Dalam langkah seterusnya, kami mentakrifkan operasi pemetaan banyak-ke-satu B, yang mengalih keluar sebarang ruang kosong dan menduplikasi perkataan daripada laluan penjajaran. Contohnya, B (II-am- -seorang- -doktor)=Saya, saya, seorang, doktor. Akibatnya, kita boleh mengira kebarangkalian bersyarat bagi jujukan gloss tanda l sebagai jumlah kebarangkalian semua laluan yang boleh dipetakan ke l dari B, dengan cara yang diterangkan di bawah [17]:
p(π|o) = ∑ π∈B−1 p(π|o)
dengan B −1 (l)={π|B(π)=l} ialah operasi songsang bagi B. Akhir sekali, kehilangan CTC bagi jujukan ciri ditakrifkan seperti berikut [17]:
Lctc=− ln p(` |o)
Kebarangkalian bersyarat p(π|X) boleh dikira mengikut andaian kebebasan bersyarat.
4. Keputusan dan Perbincangan Eksperimen

Suplemen cistanche berhampiran saya-Tingkatkan Ingatan
Dalam bahagian ini, kami akan menerangkan butiran percubaan kami dengan konfigurasi yang dicadangkan seperti yang dijelaskan dalam bahagian awal.
4.1. Set data
Dalam bahagian ini, kami menerangkan set data yang kami gunakan semasa percubaan ini. Kami menggunakan dua set data, pertama ialah set data CSL [8,40,41] dan yang kedua ialah set data RWTH-PHOENIX [33,39]. Kedua-dua set data ini ialah set data bahasa isyarat berterusan, yang digunakan untuk menterjemah beberapa siri gerak isyarat ke dalam ayat penuh.
4.1.1. Set Data CSL
Dataset CSL telah digunakan oleh beberapa karya [8,40,41]. Terdapat sejumlah 100 ayat dan 178 perkataan yang terdapat dalam set data ini, yang biasa digunakan dalam komunikasi harian. Set data ini mengandungi 5 perkataan secara purata bagi setiap ayat. Setiap ayat dilakukan oleh 50 orang penandatangan sebanyak 5 kali. Oleh itu, jumlah bilangan video ialah 25,000, menjadikan ini salah satu set data terbesar. Untuk melatih model CSL kami, kami membahagikan set data kepada data untuk latihan dengan 20,000 video dan untuk ujian dengan 5000 video ayat yang sama tetapi dengan penandatangan yang berbeza.
4.1.2. Set Data RWTH-PHOENIX
Set data RWTH-PHOENIX [33,39] ialah set data bahasa isyarat Jerman, yang merupakan rakaman siaran cuaca awam dari stesen televisyen di Jerman. Video ini diproses supaya bersaiz 210 × 260. Terdapat 6841 ayat berbeza yang ditandatangani oleh 9 penanda tangan berbeza. Semua penandatangan memakai pakaian berwarna gelap pada latar belakang berwarna terang. Secara keseluruhan, terdapat 1232 perkataan dengan kira-kira 80,000 glosses. Set data ini dibahagikan mengikut format yang telah ditetapkan, yang terdiri daripada 5672 sampel latihan, 540 sampel pengesahan/pembangunan dan 629 sampel ujian.
4.2. Prapemprosesan Data
Perkara pertama yang perlu kami lakukan ialah praproses set data kami agar sesuai dengan model cadangan kami. Kami melakukan ubah saiz dan pemangkasan, seperti yang digambarkan oleh Rajah 3; di sebelah kiri, kita dapat melihat bahawa data asal bersaiz pada resolusi HD penuh atau 1920 × 1080. Kami perlu memangkas dan mengubah saiznya kepada resolusi 224 × 224 kerana modul spatial kami menerima input yang bersaiz sama dengan input ResNet50. Selepas itu, kami memasukkan data ke dalam model spatial kami, yang akan menghasilkan tensor 7 × 7 daripada satu imej.
Imej bingkai penuh yang dipraproses kemudiannya digunakan untuk menjana ciri titik utama. Kami menggunakan model HRNet untuk meramalkan 133 perkara utama daripada imej RGB ini. Walau bagaimanapun, kami hanya menggunakan 27 titik utama bahagian atas badan dalam model cadangan kami. Saiz input untuk ciri titik utama ialah 27 × 3 kerana kami mempunyai 3-data koordinat paksi (x, y dan z) bagi setiap titik. Dimensi input model ialah N × 224 × 224 × 3 untuk ciri bingkai penuh dan N × 1 × 27 × 3 untuk input titik utama, dengan N ialah bilangan bingkai. Untuk meningkatkan variasi set data, kami mengikuti penambahan daripada [12], termasuk pemangkasan rawak, flip mendatar dan penskalaan temporal rawak. Pemotongan rawak juga digunakan sebagai sebahagian daripada langkah prapemprosesan untuk memangkas imej asal.

Suplemen cistanche berhampiran saya-Tingkatkan Ingatan
4.3. Metrik Penilaian
Untuk menilai prestasi pengiktirafan model cadangan kami, kami menggunakan metrik kadar ralat perkataan (WER), yang merupakan metrik yang biasa digunakan dalam CSLR untuk menganggarkan ketepatan pengecaman ayat yang diramalkan, seperti yang ditunjukkan oleh persamaan di bawah [17]:
WER=S tambah I tambah DT=S tambah I tambah DS tambah C tambah D
di mana S ialah bilangan penggantian perkataan asal, I ialah bilangan sisipan yang tiada dalam ayat asal, D ialah bilangan pemadaman yang sepatutnya ada dalam ayat asal, C ialah bilangan perkataan betul yang sepadan. ayat asal, dan T ialah jumlah perkataan dalam ayat atau yang boleh diperoleh daripada jumlah penggantian, pemadaman, dan perkataan yang betul. Untuk CSL, setiap aksara digunakan untuk mewakili perkataan.
4.4. Eksperimen pada Strim Input
Percubaan ini tertumpu terutamanya pada membandingkan input satu aliran dan berbilang aliran pada model kami. Matlamatnya adalah untuk mencari konfigurasi terbaik aliran input. Kami hanya menggunakan set data RWTH-PHOENIX dalam percubaan ini. Model kami akan menerima dua input berasingan, input bingkai penuh dan titik kunci. Input aliran tunggal hanya menggunakan ciri RGB daripada imej bingkai penuh. Terdapat dua percubaan input satu aliran. Yang pertama hanya menggunakan ciri bingkai penuh daripada imej RGB, dan yang kedua menggunakan ciri titik kunci daripada input titik kunci. Input berbilang aliran yang kami cadangkan terdiri daripada ciri RGB dan titik kekunci. Hasil perbandingan menggunakan satu aliran dan berbilang aliran ditunjukkan dalam Jadual 1. Di sini, kita dapat melihat bahawa dengan menggunakan ciri berbilang aliran kita boleh memperoleh hasil yang lebih baik daripada menggunakan satu aliran. Aliran perdana diperoleh daripada ciri RGB bingkai penuh dan strim tambahan menggunakan ciri titik utama. Aliran titik kunci tambahan membantu model untuk belajar dengan lebih baik, terutamanya untuk menangkap butiran bentuk tangan.
Jadual 1. Perbandingan prestasi WER menggunakan input aliran tunggal dan berbilang aliran.

4.5. Eksperimen pada Modul Perhatian
Matlamat eksperimen ini adalah untuk memilih konfigurasi terbaik bagi modul perhatian. Dalam percubaan ini, kami menggunakan konfigurasi hasil terbaik daripada hasil percubaan sebelumnya dan set data yang sama. Kami menandakan perhatian spatial sebagai model dengan lapisan perhatian kendiri pada penghujung modul spatial untuk setiap ciri. Perhatian temporal awal ialah lapisan perhatian diri selepas pengumpulan temporal pertama, dan perhatian temporal lewat ialah lapisan perhatian diri selepas pengumpulan temporal kedua. Di sini, kami akan membandingkan semua konfigurasi di atas dan gabungan perhatian spatial dan temporal. Hasilnya ditunjukkan dalam Jadual 2. Keputusan perhatian spatial adalah lebih teruk daripada perhatian temporal. Tahap spatial mengandungi urutan ciri untuk setiap bingkai. Seperti yang dinyatakan dalam [20], lapisan perhatian diri lebih mudah untuk mempelajari laluan yang lebih pendek antara kebergantungan yang panjang. Oleh itu, perhatian spatial gagal untuk mengurangkan WER disebabkan oleh jujukan yang panjang. Sebaliknya, kami dapat memperoleh hasil yang lebih baik menggunakan perhatian sementara dengan meletakkannya selepas pengumpulan supaya ia akan mendapat panjang jujukan yang lebih pendek. Perhatian lewat yang mempunyai panjang jujukan terpendek memperoleh hasil terbaik. Selain itu, gabungan modul perhatian dalam spatial dan temporal adalah lebih teruk daripada hanya menggunakan perhatian tunggal. Berdasarkan keputusan ini, kami menggunakan konfigurasi terbaik untuk percubaan seterusnya.
Jadual 2. Perbandingan prestasi WER menggunakan konfigurasi perhatian yang berbeza

4.6. Eksperimen Ablasi pada Rangkaian STAMF
Tambahan pula, kami melakukan percubaan ablasi menggunakan set data yang sama dan konfigurasi terbaik aliran input dan modul perhatian. Jadual 3 pada eksperimen menggunakan perhatian temporal lewat tanpa pengumpulan membuktikan bahawa panjang jujukan mempengaruhi prestasi perhatian. Percubaan yang menggunakan lapisan pengumpulan dengan panjang jujukan yang lebih pendek memperoleh hasil yang lebih baik. Kami juga melakukan eksperimen ablasi untuk mengetahui prestasi menggunakan model yang berbeza untuk pembelajaran urutan. Keputusan dalam Jadual 4 menunjukkan bahawa menggunakan LSTM, yang hanya mempunyai maklumat sehala, mempunyai prestasi yang lebih rendah daripada menggunakan Bi-LSTM, yang mempunyai maklumat dua hala.
Jadual 3. Perbandingan prestasi WER menggunakan konfigurasi perhatian temporal lewat yang berbeza.

Jadual 4. Perbandingan prestasi WER menggunakan konfigurasi pembelajaran jujukan yang berbeza.

4.7. Eksperimen pada Rangkaian STAMF
Dalam bahagian ini, kami menerangkan proses latihan penuh untuk model cadangan kami yang dipanggil spatiotemporal attentive multi-ciri (STAMF). Ini akan merangkumi cara kami menyesuaikan data input kami ke dalam modul spatial, modul temporal dan modul pembelajaran jujukan langkah demi langkah. Dalam bahagian ini, kami menggunakan input berbilang aliran dan konfigurasi perhatian temporal lewat.
4.7.1. Butiran Pelaksanaan
Kami melakukan latihan dan ujian hujung ke hujung menggunakan bingkai input dengan saiz 224 × 224. Untuk pengoptimum, kami menggunakan pengoptimum Adam dengan 10−4 sebagai kadar pembelajaran dan membahagikannya dengan 2 pada zaman 10 dan 15 untuk CSL dan zaman 30, 40 dan 60 untuk RWTH PHOENIX. Kami menetapkan saiz kelompok kepada 4 dan melakukan 80 zaman untuk RWTH-PHOENIX dan 20 zaman untuk CSL. Latihan dan ujian dijalankan pada NVIDIA Tesla V100 dan 128G RAM.
Pada mulanya, kami mengekstrak ciri daripada aliran RGB menggunakan ResNet50 dan menggunakan HRNet untuk mendapatkan titik utama dan kemudian mengekstrak ciri titik kunci menggunakan ResNet50. Ambil perhatian bahawa kami sedang berurusan dengan data berurutan atau video. Oleh itu, kami perlu mengkonfigurasi saiz input kami bergantung pada panjang video. Atas sebab teknikal, saiz input untuk semua data perlu sama antara satu sama lain. Oleh itu, kami mesti mengetahui video terpanjang dalam set data kami, kemudian kami mengalas panjang bingkai input kami untuk memadankan nombor bingkai terbesar
Ciri yang diekstrak secara berurutan ini digunakan oleh modul temporal. Setiap aliran berurutan melalui dua pengumpulan temporal bertindan. Setiap himpunan temporal terdiri daripada 1-rangkaian konvolusi dimensi dan lapisan pengumpulan maksimum, yang mengurangkan panjang jujukan sebanyak separuh. Output pengumpulan temporal dari kedua-dua aliran kemudiannya disambungkan ke lapisan perhatian dan untuk pengumpulan temporal terakhir, selepas lapisan perhatian, ia digabungkan pada akhir sebagai output modul temporal.
Output temporal diproses oleh modul pembelajaran urutan. Proses ini menggunakan lapisan Bi-LSTM yang disambungkan dengan CTC untuk mendapatkan penjajaran akhir dan menyusun gloss menjadi ayat akhir.
4.7.2. Keputusan Kuantitatif
Ayat akhir dibandingkan dengan kebenaran asas untuk mengira skor WER sebagai hasil kuantitatif. Untuk CSL kami membahagikan set data kepada 80 peratus untuk data latihan dan 20 peratus untuk data ujian. Seperti yang ditunjukkan dalam Jadual 5, model berbilang ciri (STMF) kami yang dicadangkan menggunakan bingkai penuh dan ciri titik utama boleh mencapai hasil yang lebih baik dan mengurangkan WER kepada 0.8 berbanding model yang hanya menggunakan ciri bingkai penuh [23]. Keputusan terbaik kami diperolehi oleh model berbilang ciri yang dicadangkan menggunakan mekanisme perhatian (STAMF), yang mencapai 0.7 untuk WER. Lapisan perhatian masih menambah baik sedikit hasil walaupun set data CSL tidak mempunyai bingkai yang rosak. Ini membuktikan bahawa lapisan perhatian mempunyai kesan ke atas model. Model berbilang ciri yang dicadangkan itu sendiri adalah lebih baik daripada kaedah terkini dan lapisan perhatian menyumbang kepada penurunan skor WER pada set data CSL. Perkara utama pada CSL memberikan impak yang ketara kerana ia boleh memberikan maklumat yang berkesan berbanding kaedah berbilang ciri lain [17] yang menggunakan pose tangan, muka dan badan.
Untuk set data RWTH-PHOENIX, kami menggunakan konfigurasi buatan untuk memisahkan data latihan dan ujian. Set data dibahagikan kepada 5672 sampel video untuk latihan, 540 sampel video untuk pengesahan kendiri dan 629 sampel video untuk ujian. Seperti yang ditunjukkan dalam Jadual 6, hasil model berbilang ciri (STMF) kami yang dicadangkan menggunakan bingkai penuh dan ciri titik utama mempunyai 24 peratus WER, dan hasil terbaik kami ialah 20.5 peratus , diperoleh oleh model yang dicadangkan menggunakan modul perhatian (STAMF) dalam hasil latihan. Keputusan ujian adalah kedua terbaik berbanding [17] kerana mereka menggunakan lebih banyak ciri sebagai input. Walau bagaimanapun, modul perhatian telah terbukti memberi sumbangan yang besar untuk mengurangkan skor WER untuk set data RWTHPHOENIX. Berbeza daripada keputusan kami untuk set data CSL, model cadangan kami dengan berbilang strim tidak mencapai hasil yang optimum. Ini kerana set data RWTH-PHOENIX mempunyai banyak bingkai yang rosak; mereka mempunyai bahagian yang kabur, terutamanya di kawasan tangan. Bingkai ini memberikan maklumat titik kunci yang tidak konsisten kerana kedudukan titik kunci yang hilang atau salah dan menjadikan model kurang optimum. Masalah ini dikendalikan dengan menambahkan lapisan perhatian pada model berbilang ciri kami yang dicadangkan, yang membantu memilih maklumat yang betul dan menghasilkan peningkatan yang ketara berbanding model berbilang ciri yang dicadangkan tanpa perhatian.
Jadual 5. Perbandingan prestasi WER pada set data CSL.

Jadual 6. Perbandingan prestasi WER pada dataset RWTH-PHOENIX.

4.7.3. Keputusan Kualitatif
Kami juga melakukan penilaian kualitatif model kami, menggunakan visualisasi hasil pengecaman. Rajah 8 menunjukkan butiran penilaian kualitatif kami menggunakan tiga sampel ayat. Ayat pertama mengandungi 10 patah perkataan dan jumlah bingkai ialah 220. Ayat kedua mengandungi 12 patah perkataan dan jumlah keseluruhan bingkai ialah 168. Ayat ketiga mengandungi 9 patah perkataan dan jumlah keseluruhan bingkai ialah 135.
Keputusan sampel menunjukkan bahawa beberapa gloss tidak diramalkan dengan betul oleh model, dan kami menandakannya dengan tanda merah. Walau bagaimanapun, ia masih boleh meramalkan majoriti perkataan yang betul. Bilangan ralat terbanyak adalah dalam ayat pertama, yang mempunyai nombor bingkai terpanjang. Dalam ayat ini, permulaan ayat lebih banyak kesalahan, disebabkan beberapa gerak isyarat untuk perkataan awal hanya berbeza sedikit sehingga sukar untuk membezakan sempadannya. Walau bagaimanapun, model yang dicadangkan dengan pelbagai ciri dan perhatian (STAMF) boleh mengenal pasti lebih banyak perkataan, tetapi ia telah disalah label. Selain itu, konfigurasi model dengan perhatian mencapai hasil pengiktirafan yang lebih baik untuk dua sampel lagi, berbanding model yang dicadangkan tanpa perhatian.

Rajah 8. Penilaian kualitatif hasil pengecaman menggunakan konfigurasi berbeza bagi dataset RWTH-PHOENIX [33,39]. Glos ramalan yang salah ditandakan dengan warna merah.
5. Kesimpulan
Dalam kertas kerja ini, kami membentangkan spatiotemporal attentive multi-feature (STAMF) novel untuk CSLR, yang bertujuan untuk mempelajari korelasi spatial-temporal dan maklumat penting daripada jujukan ciri visual dan ciri titik utama dalam pendekatan hujung ke hujung. Dalam rangka kerja kami, modul spatial telah dibangunkan dengan ciri bingkai penuh daripada data RGB dan mata utama daripada titik utama badan, termasuk tangan sebagai berbilang ciri. Gabungan ini digunakan sebagai input ciri berbilang aliran memberikan prestasi unggul berbanding pendekatan terkini yang hanya menggunakan bingkai penuh atau dibandingkan dengan kaedah Rajah 8. Penilaian kualitatif hasil pengiktirafan menggunakan konfigurasi RWTH yang berbeza - set data PHOENIX [33,39]. Glos ramalan yang salah ditandakan dengan warna merah. 5. Kesimpulan Dalam kertas kerja ini, kami membentangkan ciri berbilang perhatian spatiotemporal (STAMF) novel untuk CSLR, yang bertujuan untuk mempelajari korelasi spatial-temporal dan maklumat penting daripada jujukan ciri visual dan ciri titik utama dalam hujung ke- pendekatan akhir. Dalam rangka kerja kami, modul spatial telah dibangunkan dengan ciri bingkai penuh daripada data RGB dan mata utama daripada titik utama badan, termasuk tangan sebagai berbilang ciri. Gabungan ini digunakan sebagai input ciri berbilang strim memberikan prestasi unggul berbanding pendekatan terkini yang hanya menggunakan bingkai penuh atau dibandingkan dengan kaedah yang menggunakan gabungan berbilang ciri lain, terutamanya untuk set data CSL. Kemudian, kami mencadangkan modul temporal yang terdiri daripada pengumpulan temporal dan perhatian temporal untuk menangkap maklumat penting dalam domain temporal. Penambahan perhatian temporal lewat mampu mendapatkan ciri penting daripada jujukan yang mempunyai maklumat yang salah dan memberikan peningkatan yang ketara berbanding model berbilang ciri yang dicadangkan kami. Ia juga membantu pembelajaran urutan untuk belajar dengan lebih baik dan meningkatkan prestasi seperti dalam percubaan set data CSL. Percubaan meluas pada set data yang biasa digunakan menunjukkan keunggulan model cadangan kami berbanding model tercanggih dengan skor WER menurun lebih daripada 50 peratus untuk set data CSL dan menurun sebanyak 5 peratus untuk set data RWTH-PHOENIX. Pada masa hadapan, kami merancang untuk melaksanakan teknik pembelajaran pemindahan dengan model semasa kami serta menggunakan kerja berterusan kami dalam industri sebenar.
Rujukan
1. Dreuw, P.; Rybach, D.; Deselaers, T.; Zahedi, M.; Ney, H. Teknik Pengecaman Pertuturan untuk Sistem Pengecaman Bahasa Isyarat. Dalam Prosiding INTERSPEECH 2007, Persidangan Tahunan ke-8 Persatuan Komunikasi Ucapan Antarabangsa, Antwerp, Belgium, 27–31 Ogos 2007; ms 2513–2516.
2. Ong, SCW; Ranganath, S. Analisis bahasa isyarat automatik: Tinjauan dan Masa Depan Melangkaui Makna Leksikal. IEEE Trans. Corak Dubur. Mach. Intell. 2005, 27, 873–891. [CrossRef] [PubMed]
3. Vogler, C.; Metaxas, D. Rangka Kerja untuk Mengenali Aspek Serentak Bahasa Isyarat Amerika. Pengiraan. Vis. Imej Underst. 2001, 81, 358–384. [CrossRef]
4. Bowden, R.; Windridge, D.; Kadir, T.; Zisserman, A.; Brady, M. Vektor Ciri Linguistik untuk Tafsiran Visual Bahasa Isyarat. Dalam Prosiding Persidangan Eropah mengenai Visi Komputer (ECCV), Prague, Republik Czech, 11–14 Mei 2004; ms 390–401.
5. Kasukurthi, N.; Rokad, B.; Bidani, S.; Dennisan, DA American Sign Language Alphabet Recognition menggunakan Deep Learning. arXiv 2019, arXiv:1905.05487.
6. Koller, O.; Zargaran, S.; Ney, H.; Bowden, R. Deep Sign: Mendayakan Pengecaman Bahasa Isyarat Berterusan Statistik Teguh melalui CNN-HMM Hibrid. Int. J. Pengiraan. Vis. 2018, 126, 1311–1325. [CrossRef]
7. Pu, J.; Zhou, W.; Li, H. Rangkaian Konvolusi Diluaskan dengan Pengoptimuman Berulang untuk Pengecaman Bahasa Isyarat Berterusan. Dalam Prosiding Persidangan Bersama Antarabangsa Kedua Puluh Tujuh mengenai Kepintaran Buatan, Stockholm, Sweden, 13–19 Julai 2018; ms 885–891.
8. Pu, J.; Zhou, W.; Li, H. Rangkaian Penjajaran Berulang untuk Pengecaman Bahasa Isyarat Berterusan. Dalam Prosiding Persidangan Masyarakat Komputer IEEE mengenai Penglihatan Komputer dan Pengecaman Corak, Long Beach, CA, Amerika Syarikat, 15–20 Jun 2019; ms 4160–4169.
9. Kumar, N. Penjejakan Muka dan Tangan Manusia Berdasarkan Trajektori Gerakan untuk Pengecaman Bahasa Isyarat. Dalam Prosiding 2017 4th IEEE Uttar Pradesh Section International Conference on Electrical, Computer and Electronics, Mathura, India, 26–28 Oktober 2017; ms 211–216.
10. Bhuyan, MK; Ghoah, D.; Bora, PK Rangka Kerja untuk Pengecaman Isyarat Tangan dengan Aplikasi untuk Bahasa Isyarat. Dalam Prosiding Persidangan Tahunan India 2006, INDICON, New Delhi, India, 15–17 September 2006; ms 1–6.
11. Das, SP; Talukdar, AK; Sarma, KK Pengecaman Bahasa Isyarat Menggunakan Ekspresi Wajah. Dalam Prosiding Sains Komputer Procedia, Kerala, India, 10–13 Ogos 2015; ms 210–216.
12. Rastgoo, R.; Kiani, K.; Escalera, S.; Sabokrou, M. Pengeluaran Bahasa Isyarat: Satu Tinjauan. Dalam Prosiding Persidangan IEEE/CVF 2021 tentang Bengkel Penglihatan Komputer dan Pengecaman Corak (CVPRW), Nashville, TN, Amerika Syarikat, 19–25 Jun 2021; ms 3446–3456.
13. Dong, S.; Wang, P.; Abbas, K. Tinjauan tentang Pembelajaran Mendalam dan Aplikasinya. Pengiraan. Sci. Wahyu 2021, 40, 100379. [CrossRef]
14. Athitsos, V.; Neidle, C.; Sclaroff, S.; Nash, J.; Stefan, A.; Yuan, Q.; Thangali, A. Set Data Video Leksikon Bahasa Isyarat Amerika. Dalam Prosiding Persidangan Masyarakat Komputer IEEE 2008 mengenai Bengkel Penglihatan Komputer dan Pengecaman Corak, Bengkel CVPR, Anchorage, Alaska, 23–28 Jun 2008; ms 1–8.
15. Bungeroth, J.; Stein, D.; Dreuw, P.; Ney, H.; Morrissey, S.; Way, A.; Zijl, LV Korpus Bahasa Isyarat ATIS. Dalam Prosiding Persidangan Antarabangsa ke-6 mengenai Sumber dan Penilaian Bahasa, LREC 2008, Marrakech, Maghribi, 28–30 Mei 2008; ms 2943–2946.
16. Papastratis, I.; Chatzikonstantinou, C.; Konstantinidis, D.; Dimitropoulos, K.; Daras, P. Teknologi Kecerdasan Buatan untuk Bahasa Isyarat. Penderia 2021, 21, 5843. [CrossRef] [PubMed]
17. Zhou, H.; Zhou, W.; Zhou, Y.; Li, H. Rangkaian Berbilang Kiu Spatial-Temporal untuk Pengecaman Bahasa Isyarat Berterusan. Dalam Prosiding AAAI 2020—Persidangan AAAI Ketiga Puluh Empat tentang Kepintaran Buatan, New York, NY, Amerika Syarikat, 7–12 Februari 2020; ms 13009–13016.
18. Gündüz, C.; Polat, H. Pengecaman bahasa isyarat Turki berdasarkan gabungan data berbilang aliran. Turki J. Electr. En. Pengiraan. Sci. 2021, 29, 1171–1186. [CrossRef]
19. Bohacek, M.; Hruz, M. Sign Pose-based Transformer untuk Pengecaman Bahasa Isyarat peringkat Perkataan. Dalam Prosiding Persidangan Musim Sejuk IEEE/CVF 2022 mengenai Aplikasi Bengkel Penglihatan Komputer, WACVW, Waikoloa, HI, Amerika Syarikat, 4–8 Januari 2022; ms 182–191.
20. Vaswani, A. Perhatian Adalah Semua yang Anda Perlukan. Dalam Prosiding Persidangan mengenai Sistem Pemprosesan Maklumat Neural, Long Beach, CA, Amerika Syarikat, 4–9 Disember 2017; ms 1–11.
21. Zhou, M.; Ng, M.; Cai, Z.; Cheung, KC Rangkaian Permulaan Sepenuhnya Berdasarkan Perhatian Kendiri untuk Pengecaman Bahasa Isyarat Berterusan. Depan. Artif. Intell. Appl. 2020, 325, 2832–2839.
22. Camgöz, NC; Koller, O.; Hadfifield, S.; Bowden, R. Transformers Bahasa Isyarat: Pengiktirafan dan Terjemahan Bahasa Isyarat hujung-ke-hujung bersama. Dalam Prosiding Persidangan Persatuan Komputer IEEE mengenai Visi Komputer dan Pengecaman Corak, Seattle, WA, Amerika Syarikat, 14–19 Jun 2020; ms 10020–10030.
23. Min, Y.; Hao, A.; Chai, X.; Chen, X. Kekangan Penjajaran Visual untuk Pengecaman Bahasa Isyarat Berterusan. Dalam Prosiding Persidangan Antarabangsa IEEE mengenai Penglihatan Komputer (ICCV), Montreal, BC, Kanada, 10–17 Oktober 2021; ms 11542–11551.
24. Guo, D.; Zhou, W.; Wang, M.; Li, H. Pengecaman Bahasa Isyarat Berdasarkan HMM Adaptif dengan Pembesaran Data. Dalam Prosiding Persidangan Antarabangsa IEEE mengenai Pemprosesan Imej (ICIP), Phoenix, AZ, Amerika Syarikat, 25–28 September 2016; ms 2876–2880.
25. Huang, J.; Zhou, W.; Li, H.; Li, W. Pengecaman Bahasa Isyarat Menggunakan Rangkaian Neural Konvolusi 3D. Dalam Prosiding Persidangan Antarabangsa IEEE mengenai Multimedia dan Ekspo (ICME), Turin, Itali, 29 Jun–3 Julai 2015; ms 1–6.
26. Guo, D.; Zhou, W.; Li, H.; Wang, M. Gabungan awal lewat dalam talian berdasarkan HMM adaptif untuk pengecaman bahasa isyarat. ACM Trans. Multimed. Pengiraan. Commun. Appl. 2017, 14, 1–18. [CrossRef]
27. Al-hammadi, M.; Muhammad, G.; Ahli, S. Pengecaman Isyarat Tangan untuk Bahasa Isyarat Menggunakan 3DCNN. Akses IEEE 2020, 8, 79491–79509. [CrossRef]
28. Reza, H.; Joze, V. MS-ASL: Set Data Berskala Besar dan Penanda Aras untuk Memahami Bahasa Isyarat Amerika. arXiv 2019, arXiv:1812.01053.
29. Li, D.; Opazo, CR; Yu, X.; Li, H. Pengecaman Bahasa Isyarat Dalam peringkat perkataan daripada Video: Perbandingan Set Data dan Kaedah Berskala Besar Baharu. Dalam Prosiding Persidangan Musim Sejuk IEEE 2020 mengenai Aplikasi Penglihatan Komputer, WACV, Snowmass Village, CO, Amerika Syarikat, 1–5 Mac 2020; hlm 1448–1458.
30. Pu, J.; Zhou, W.; Li, H. Pengecaman Bahasa Isyarat dengan Ciri Berbilang Modal. Dalam Prosiding Persidangan Lingkaran Pasifik mengenai Multimedia, Xi'an, China, 15–16 September 2016; ms 252–261.
31. Jiang, S.; Matahari, B.; Wang, L.; Bai, Y.; Li, K.; Fu, Y. Pengecaman Bahasa Isyarat Berbilang Modal Skeleton Aware. Dalam Prosiding Persidangan Persatuan Komputer IEEE mengenai Bengkel Penglihatan Komputer dan Pengecaman Corak, Nashville, TN, Amerika Syarikat, 19–25 Jun 2021; ms 3408–3418.
32. Sidig, AAI; Luqman, H.; Mahmoud, S.; Mohandes, M. KArSL: Pangkalan Data Bahasa Isyarat Arab. ACM Trans. Sumber Rendah Asia. Lang. Inf. Pemprosesan 2021, 20, 1–19. [CrossRef]
33. Koller, O.; Forster, J.; Ney, H. Pengecaman bahasa isyarat berterusan: Ke arah sistem pengecaman statistik perbendaharaan kata yang besar yang mengendalikan berbilang penandatangan. Pengiraan. Vis. Imej Underst. 2015, 141, 108–125. [CrossRef]
34. Koller, O.; Camgoz, NC; Ney, H. Pembelajaran Diselia Dengan Lemah dengan CNN-LSTM-HMM Berbilang Strim untuk Menemui Keselarian Berjujukan dalam Video Bahasa Isyarat. IEEE Trans. Corak Dubur. Mach. Intell. 2020, 42, 2306–2320. [CrossRef] [PubMed]
35. Camgoz, NC; Hadfifield, S.; Koller, O.; Bowden, R. SubUNets: Bentuk Tangan Hujung-ke-Hujung dan Pengecaman Bahasa Isyarat Berterusan. Dalam Prosiding Persidangan Antarabangsa IEEE 2017 mengenai Penglihatan Komputer (ICCV), Venice, Itali, 22–29 Oktober 2017; ms 3075–3084.
36. Dong, C.; Loy, CC; Beliau, K.; Tang, X. Resolusi Super Imej Menggunakan Rangkaian Konvolusi Dalam. IEEE Trans. Corak Dubur. Mach. Intell. 2014, 38, 295–307. [CrossRef] [PubMed]
37. Bressem, KK; Adams, LC; Erxleben, C.; Hamm, B.; Niehues, SM; Vahldiek, JL Membandingkan seni bina pembelajaran mendalam yang berbeza untuk klasifikasi radiograf dada. Sci. Rep. 2020, 10, 13590. [CrossRef]
38. Sun, K.; Xiao, B.; Liu, D.; Wang, J. Pembelajaran Perwakilan Resolusi Tinggi Mendalam untuk Anggaran Pose Manusia. Dalam Prosiding Persidangan Masyarakat Komputer IEEE mengenai Penglihatan Komputer dan Pengecaman Corak, Long Beach, CA, Amerika Syarikat, 15–20 Jun 2019; ms 5686–5696.
39. Koller, O.; Zargaran, S.; Ney, H. Tandatangan Semula: Penjajaran Semula Pemodelan Jujukan Hujung ke Hujung dengan CNN-HMM Berulang Dalam. Dalam prosiding Persidangan IEEE 2017 mengenai Visi Komputer dan Pengecaman Corak (CVPR), Honululu, HI, Amerika Syarikat, 21–26 Julai 2017; ms 3416–3424.
40. Zhou, H.; Zhou, W.; Li, H. Penyahkodan label pseudo dinamik untuk pengecaman bahasa isyarat berterusan. Dalam Prosiding Persidangan Antarabangsa IEEE mengenai Multimedia dan Ekspo (ICME) 2019, Shanghai, China, 18–21 Julai 2019; ms 1282–1287.
41. Xiao, Q.; Chang, X.; Zhang, X.; Liu, X. Pengecaman Bahasa Isyarat Berasaskan Video tanpa Segmentasi Temporal. Dalam Prosiding Persidangan Thirty-Second AAAI on Artifificial Intelligence, New Orleans, LA, Amerika Syarikat, 2–7 Februari 2018; ms 2257–2264.
42. Graves, A.; Fernández, S.; Gomez, F.; Schmidhuber, J. Pengelasan Temporal Connectionist: Melabelkan Data Urutan Tidak Bersegmen dengan Rangkaian Neural Berulang. Dalam Prosiding ICML '06: Prosiding persidangan antarabangsa ke-23 mengenai Pembelajaran Mesin, Pittsburgh, PA, Amerika Syarikat, 25–29 Jun 2006; ms 369–376.
43. Graves, A.; Liwicki, M.; Fernández, S.; Bertolami, R.; Bunke, H.; Schmidhuber, J. A Novel Connectionist System for Unconstrained Handwriting Recognition. IEEE Trans. Corak Dubur. Mach. Intell. 2009, 31, 855–868. [CrossRef]
44. Guo, D.; Zhou, W.; Li, H.; Wang, M. Hierarki LSTM untuk Terjemahan Bahasa Isyarat. Dalam Prosiding Persidangan AAAI mengenai Kepintaran Buatan, New Orleans, LA, Amerika Syarikat, 2–7 Februari 2018; ms 6845–6852.
45. Rahman, MM; Watanobe, Y.; Nakamura, K. Model Bahasa LSTM Dua Arah untuk Penilaian dan Pembaikan Kod. Simetri 2021, 13, 247. [CrossRef]
46. Hu, W.; Cai, M.; Chen, K.; Ding, H.; Matahari, L.; Liang, S.; Mo, X.; Huo, Q. Latihan Diskriminasi Urutan untuk Pengecaman Tulisan Luar Talian oleh Fungsi Objektif MMI CTC Terinterpolasi dan Tanpa Kisi. Dalam Prosiding Persidangan Antarabangsa mengenai Analisis dan Pengiktirafan Dokumen, ICDAR, Kyoto, Jepun, 9–15 November 2017; Jilid 1, ms 61–66.
47. Yoshimura, T.; Hayashi, T.; Takeda, K.; Watanabe, S. Pengecaman Pertuturan Automatik Hujung ke Hujung Disepadukan dengan Pengesanan Aktiviti Suara Berasaskan CTC. Dalam Prosiding ICASSP, Persidangan Antarabangsa IEEE mengenai Akustik, Pertuturan dan Pemprosesan Isyarat, Barcelona, Sepanyol, 4–8 Mei 2020; ms 6999–7003.
48. Guo, D.; Wang, S.; Tian, Q.; Wang, M. Rangkaian Konvolusi Temporal Padat untuk Terjemahan Bahasa Isyarat. Dalam Prosiding Persidangan Bersama Antarabangsa Kedua Puluh Lapan mengenai Kepintaran Buatan (IJCAI-19), Macao, China, 10–16 Ogos 2017; ms 744–750.
49. Wang, S.; Guo, D.; Zhou, W.; Zha, Z.; Wang, M. Connectionist Temporal Fusion untuk Terjemahan Bahasa Isyarat. Dalam Prosiding Persidangan Antarabangsa ACM ke-26 mengenai Multimedia, Seoul, Korea, 22–26 Oktober 2018; hlm 1483–1491.
50. Yang, Z.; Shi, Z. SF-Net: Rangkaian Ciri Berstruktur untuk Pengecaman Bahasa Isyarat Berterusan. arXiv 2019, arXiv:1908.01341.
51. Cheng, KL; Yang, Z.; Chen, Q.; Tai, Y. Rangkaian Konvolusi Sepenuhnya Untuk Pengecaman Bahasa Isyarat Berterusan. Dalam Prosiding Persidangan Eropah mengenai Visi Komputer, Glasgow, UK, 23–28 Ogos 2020; ms 697–714.
52. Koller, O.; Ney, H.; Bowden, R. Deep Hand: Cara Melatih CNN pada Imej 1 Juta Tangan Apabila Data Anda Berterusan dan Dilabel Lemah. Dalam Prosiding Persidangan IEEE 2016 mengenai Penglihatan Komputer dan Pengecaman Corak (CVPR), Las Vegas, NV, Amerika Syarikat, 27–30 Jun 2016; ms 3793–3802.
53. Slimane, Perkara Konteks FB: Perhatian Diri untuk Pengecaman Bahasa Isyarat. arXiv 2021, arXiv:2101.04632.
54. Niu, Z.; Mak, B. Pelabelan Butiran Halus Stochastic bagi Glosses Isyarat Berbilang keadaan untuk Pengecaman Bahasa Isyarat Berterusan. Dalam Prosiding Persidangan Eropah mengenai Visi Komputer, Glasgow, UK, 23–28 Ogos 2020; ms 1–16.
55. Cui, R.; Liu, H.; Zhang, C. Rangka Kerja Neural Dalam untuk Pengecaman Bahasa Isyarat Berterusan oleh Latihan Berulang. IEEE Trans. Multimed. 2019, 21, 1880–1891. [CrossRef]
56. Pu, J.; Zhou, W.; Hu, H.; Li, H. Meningkatkan Pengecaman Bahasa Isyarat Berterusan melalui Peningkatan Modaliti Silang. Dalam Prosiding Persidangan Antarabangsa ACM ke-28 mengenai Multimedia, Seattle, WA, Amerika Syarikat, 12–16 Oktober 2020; ms 1497–1505.






