Pengecaman Bahasa Isyarat Berterusan Novel Spatio-Temporal Menggunakan Rangkaian Pelbagai Ciri yang Berhati-hati(1)
Jun 01, 2023
Abstrak: Memandangkan strim video, kami menyasarkan untuk mengesan tanda tidak bersegmen yang berkaitan dengan pengecaman bahasa isyarat berterusan (CSLR) dengan betul. Walaupun terdapat peningkatan dalam kaedah pembelajaran mendalam yang dicadangkan dalam bidang ini, kebanyakannya tertumpu pada penggunaan hanya ciri RGB, sama ada imej bingkai penuh atau butiran tangan dan muka. Kekurangan maklumat untuk proses latihan CSLR sangat mengekang keupayaan untuk mempelajari pelbagai ciri menggunakan bingkai input video. Selain itu, mengeksploitasi semua bingkai dalam video untuk tugas CSLR boleh membawa kepada prestasi suboptimum kerana setiap bingkai mengandungi tahap maklumat yang berbeza, termasuk ciri utama dalam inferensi bunyi. Oleh itu, kami mencadangkan pengecaman bahasa isyarat berterusan spatiotemporal menggunakan rangkaian pelbagai ciri yang penuh perhatian untuk meningkatkan CSLR dengan menyediakan ciri titik kunci tambahan. Di samping itu, kami mengeksploitasi lapisan perhatian dalam modul spatial dan temporal untuk menekankan berbilang ciri penting secara serentak. Keputusan percubaan daripada kedua-dua set data CSLR menunjukkan bahawa kaedah yang dicadangkan mencapai prestasi unggul berbanding dengan kaedah terkini sebanyak 0.76 dan 20.56 untuk skor WER pada set data CSL dan PHOENIX, masing-masing.

Superman herba cistanche
Kata kunci: bahasa isyarat berterusan; spatial; temporal; pelbagai ciri; perkara utama; perhatian diri
1. Pengenalan
Bahasa Isyarat mengutamakan komunikasi manual menggunakan isyarat tangan, bahasa badan, dan pergerakan bibir berbanding bunyi untuk berkomunikasi [1,2]. Biasanya, bahasa isyarat digunakan oleh orang yang pekak atau kurang pendengaran, tetapi ia juga boleh digunakan dalam situasi yang mustahil atau sukar untuk mendengar bunyi. Oleh itu, sistem pengecaman bahasa isyarat (SLR) diperlukan kerana ia membantu menghubungkan orang yang kurang pendengaran dan mereka yang tidak.
Dalam tahun-tahun kebelakangan ini, penyelidik telah menumpukan banyak perhatian pada SLR kerana maklumat visual yang kaya yang diberikannya. Kajian SLR terkini biasanya dikelompokkan ke dalam pengecaman bahasa isyarat terpencil (ISLR) atau pengecaman bahasa isyarat berterusan (CSLR). Beberapa kerja hanya menangani ISLR [3,4], manakala yang lain hanya menganalisis tugas yang lebih mudah, seperti gerak isyarat statik untuk pengecaman abjad [5]. Sementara itu, kaedah terkini biasanya lebih rumit kerana ia menyelesaikan tugasan CSLR [6–8]. Berbanding dengan ISLR, CSLR adalah masalah yang lebih mencabar kerana ia melibatkan pembinaan semula ayat.

teh cistanche
Klik di sini untuk melihat produk teh Cistanche deserticola
【Minta lebih lanjut】 E-mel:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692
Penyelidikan CSLR masih mendapat permintaan yang tinggi kerana pelaksanaannya berkait rapat dengan keadaan seharian di dunia nyata. Pendekatan ini bertujuan untuk mengenali siri gloss yang berlaku dalam siri video tanpa pembahagian yang jelas atau bahkan tiada langsung. Tambahan pula, ia menggabungkan banyak penyelidikan pembelajaran mesin dan pemahaman menyeluruh tentang tingkah laku manusia. Sebagai contoh, ia melibatkan pengesanan pergerakan manusia [9], pengecaman gerak isyarat [10], dan pengecaman muka [11]. Namun begitu, terdapat beberapa cabaran untuk melaksanakan tugasan CSLR.
Pertama, pengumpulan data dan anotasi adalah mahal untuk CSLR [12]. Ini mungkin salah satu cabaran yang dihadapi dalam pembangunannya kerana CSLR terlibat dalam rangkaian yang besar dan jumlah data sangat mempengaruhi prestasi [13]. Selain itu, beberapa set data yang tersedia untuk bahasa isyarat dianotasi dengan lemah [12,14,15]. Untuk menyelesaikan isu ini, banyak kajian telah menggunakan pendekatan yang diselia dengan lemah, di samping penerapan penjajaran dan modul pengekstrak ciri kepada seni bina rangkaian [12].
Kedua, berbanding ISLR, CSLR lebih rumit. Maklumat yang mencukupi diperoleh dengan menggunakan beberapa ciri; ini telah terbukti mencapai prestasi yang lebih baik daripada menggunakan satu ciri seperti yang dilaporkan dalam karya sebelumnya [16–18]. Ciri berbilang ini terdiri daripada ciri utama iaitu imej badan yang mencapai ketepatan tertinggi dan ciri tambahan, seperti pose, kepala, tangan kiri, dan tangan kanan, yang mempunyai ketepatan yang lebih rendah untuk prestasi individu [17,18]. Melatih rangkaian yang besar dengan jumlah data yang besar memakan masa [13]. Menambah aliran input juga meningkatkan masa latihan, manakala menggunakan ciri berasaskan imej tambahan meningkatkan kos [19]. Oleh itu, kita perlu memilih ciri penting supaya kita boleh berlatih dengan cekap.

cistanche herba cina
Ketiga, input video mempunyai sejumlah besar imej dalam urutan. Sesetengah imej mempunyai bentuk tangan yang tidak jelas kerana pergerakan pantas, mungkin membawa kepada maklumat yang salah. Oleh itu, model cadangan kami menggunakan perhatian kendiri berdasarkan [20] untuk membantu memilih maklumat penting. Selain itu, perhatian diri yang dibuktikan oleh [21,22] mempunyai kesan ke atas peningkatan prestasi.
Oleh itu, kami mencadangkan model novel yang dipanggil novel spatiotemporal attentive multi-feature (STAMF) untuk menangani semua masalah. Kami mengikuti karya sebelumnya [17,23], yang telah terbukti berfungsi untuk CSLR dengan masalah anotasi yang lemah. Mereka membina model menggunakan tiga komponen utama: yang pertama ialah modul spatial, yang kedua ialah modul temporal, dan yang ketiga ialah modul pembelajaran urutan. Kami mencadangkan input berbilang ciri yang cekap dan berkesan menggunakan ciri bingkai penuh bersama dengan ciri titik kunci untuk melaksanakan tugas CSLR. Ciri bingkai penuh mewakili imej badan sebagai ciri utama, dan ciri titik kunci sebagai ciri tambahan. Ciri titik utama ialah pose badan, termasuk perincian pose tangan. Pose badan ini adalah ciri tambahan yang paling berkesan kerana dalam beberapa karya ia telah terbukti mencapai ketepatan tertinggi selepas ciri bingkai penuh [17,18]. Kami juga menggunakan modul perhatian yang menggunakan perhatian kendiri berdasarkan [20] untuk menangkap ciri penting dan untuk membantu pembelajaran urutan untuk meningkatkan prestasi.
Sumbangan manuskrip ini diringkaskan seperti berikut: • Kami memperkenalkan perhatian temporal baru ke dalam modul urutan untuk menangkap titik masa penting yang menyumbang kepada output akhir; • Kami memperkenalkan berbilang ciri yang terdiri daripada ciri bingkai penuh daripada nilai RGB bingkai sebagai ciri utama dan ciri titik kekunci yang merangkumi pose badan dengan perincian bentuk tangan sebagai ciri tambahan untuk meningkatkan prestasi pengecaman model; • Kami menggunakan metrik WER untuk menunjukkan bahawa model STAMF yang dicadangkan kami mengatasi model terkini pada kedua-dua set data penanda aras CSLR melalui eksperimen.

Suplemen cistanche berhampiran saya-Tingkatkan Ingatan
2. Karya Berkaitan
Terdapat beberapa kemajuan dalam teknologi, dan banyak penyelidikan telah dilakukan pada SLR. Kajian terdahulu [24–27] meneroka kemungkinan menggunakan ISLR yang mempunyai pembahagian bagi setiap perkataan. Dalam beberapa tahun kebelakangan ini, kaedah berasaskan pembelajaran mendalam telah digunakan untuk mengekstrak ciri menggunakan rangkaian konvolusi, sama ada 2D [28,29] atau 3D [30,31], untuk perwakilan visualnya yang kukuh. Majoriti penyelidikan awal tentang pengecaman bahasa isyarat tertumpu pada ISLR dengan ciri multimodal [30–32], seperti RGB, peta kedalaman dan rangka, yang memberikan prestasi yang lebih baik.
Pada masa kini, CSLR telah menjadi lebih popular, walaupun ia tidak dibahagikan dengan jelas antara setiap perkataan. Kerja-kerja awal menggunakan pengekstrak ciri CNN [6,33] dan HMM [34] untuk membina sasaran jujukan. Beberapa penyelidikan terkini untuk sistem CSLR [17,23] telah memasukkan tiga langkah utama dalam melaksanakan tugas pengecaman masalah. Pertama, mereka menjalankan pengekstrakan ciri spatial, kemudian segmentasi temporal, dan akhirnya sintesis ayat dengan model bahasa [35], atau mereka menggunakan pembelajaran urutan [17,23]. Pembelajaran jujukan ini menggunakan Bi-LSTM dan CTC untuk melombong hubungan antara kilauan tanda dalam jujukan video. Walaupun ia menggunakan anotasi lemah yang mempunyai jujukan video yang tidak dibahagikan untuk mentakrifkan kilauan tanda, pendekatan ini telah menunjukkan hasil yang menjanjikan.
Walau bagaimanapun, kajian CLSR berkaitan terkini yang melaksanakan pendekatan pelbagai ciri [17] menggunakan lima ciri secara serentak. Pendekatan pelbagai ciri adalah lebih berat berbanding dengan menggunakan ciri yang lebih sedikit [19]. Pendekatan ini juga tidak dapat mengendalikan bingkai bising daripada jujukan video yang mempunyai maklumat yang tidak jelas, seperti bentuk tangan yang kabur akibat pergerakan pantas. Selain itu, bergantung pada pembelajaran urutan berasaskan RNN mungkin menghadapi masalah dengan urutan yang panjang dan mungkin kehilangan konteks global [20].

Suplemen cistanche berhampiran saya-Tingkatkan Ingatan
Penyelidikan semasa bertujuan untuk meningkatkan prestasi dengan menambah mekanisme perhatian kendiri [21,22] yang boleh mengendalikan urutan yang lebih panjang untuk mempelajari konteks global. Perhatian kendiri adalah berdasarkan kajian awal [20] yang menunjukkan bahawa perhatian diri mempunyai kelebihan kerana mampu mengendalikan kebergantungan yang lama. Walau bagaimanapun, perhatian diri ini lebih mudah untuk mempelajari laluan yang lebih pendek berbanding dengan laluan yang lebih panjang dengan kebergantungan yang panjang. Dalam kerja-kerja CLSR sebelumnya [21,22] perhatian kendiri boleh membantu rangkaian mempelajari ciri dengan lebih berkesan.
Oleh itu, dalam makalah ini, kami memperkenalkan model pelbagai ciri penuh perhatian spatiotemporal novel. Model yang dicadangkan ini secara berkesan mengekstrak ciri penting dan mempelajari urutan dengan lebih baik dengan memberikan maklumat penting menggunakan mekanisme perhatian kendiri daripada pelbagai ciri. Semua proses dilaksanakan dalam pendekatan hujung ke hujung.
3. Kaedah Cadangan
Bahagian ini memperincikan teknik teras model cadangan kami untuk CSLR. Oleh itu, kami memulakan bahagian ini dengan menerangkan gambaran keseluruhan model yang dicadangkan kami. Selain itu, kami menyediakan lebih banyak butiran tentang setiap komponen utama, termasuk modul spatial, modul temporal dan modul pembelajaran urutan. Selain itu, kami juga menerangkan cadangan modul perhatian kami untuk membantu model belajar dengan lebih baik. Akhir sekali, kami boleh menyepadukan rangka kerja untuk latihan dan inferens ke dalam model cadangan kami.
3.1. Gambaran Keseluruhan Rangka Kerja
Memandangkan input video, model cadangan kami bertujuan untuk meramalkan tanda yang sepadan menjadi ayat berkilat yang betul. Modul pertama menjana berbilang ciri spatial, seperti ciri bingkai penuh dan titik kunci untuk setiap bingkai T video. Kemudian, modul temporal membolehkan kami mengekstrak korelasi temporal bagi ciri spatial antara bingkai untuk kedua-dua aliran. Sebagai langkah terakhir, rangkaian spatial dan temporal telah dikaitkan dengan memori jangka pendek dua arah (Bi-LSTM) dan CTC untuk pembelajaran jujukan dan inferens. Seterusnya, kami menerangkan komponen utama kami dengan lebih terperinci dan berturut-turut. Gambaran keseluruhan seni bina yang dicadangkan kami ditunjukkan dalam Rajah 1.

Rajah 1. Seni bina keseluruhan kaedah yang dicadangkan terdiri daripada tiga komponen: modul spatial, modul temporal, dan modul pembelajaran urutan. Modul spatial mula-mula mengambil jujukan imej untuk mengekstrak ciri mengikut bingkai dan kemudian menggunakan modul temporal untuk mengekstrak ciri temporal. Kemudian, ciri temporal dihantar ke modul pembelajaran urutan untuk melaksanakan ramalan perkataan dan membinanya menjadi ayat
3.2. Modul Spatial
Modul spatial mengeksploitasi ciri bingkai penuh dan ciri titik utama, seperti yang ditunjukkan dalam Rajah 2. Modul ini menggunakan seni bina rangkaian 2D-CNN sebagai tulang belakang, dan ResNet50 dipilih untuk menangkap berbilang ciri. ResNet50 adalah lebih berkesan untuk digunakan berbanding dengan seni bina ResNet terkini dari segi masa sambil mempunyai hasil yang setanding [36,37]. RGB menggunakan ResNet50 secara langsung, manakala titik kunci diperolehi oleh HRNet [38] daripada bingkai video dan diekstrak menggunakan ResNet50 untuk mendapatkan ciri titik kunci.

Rajah 2. Seni bina modul spatial menggunakan input berbilang aliran. Strim RGB sebagai ciri bingkai penuh dan strim titik kunci sebagai ciri titik kunci.
3.2.1. Ciri Bingkai Penuh
Kami menggunakan langkah prapemprosesan kami pada data RGB dan kemudian memasukkan data kami ke dalam model. Kami kemudian meletakkannya sebagai input bingkai penuh ke dalam seni bina kami. Rajah 3 menunjukkan ilustrasi imej RGB asal di sebelah kiri dan imej terpotong di sebelah kanan. Imej yang dipangkas digunakan sebagai input oleh model. Ini menggambarkan langkah prapemprosesan yang mengurangkan bahagian imej yang kurang penting dan memberi lebih tumpuan kepada penandatangan. Pemotongan ini menggunakan kaedah pemangkasan rawak dari [12] untuk menambah set data. Ciri bingkai penuh diekstrak daripada imej yang dipangkas untuk setiap bingkai dalam jujukan menggunakan ResNet50.

Rajah 3. Ciri bingkai penuh menggunakan imej RGB, (imej kiri) ialah imej asal, dan (imej kanan) ialah imej yang dipangkas untuk disesuaikan dengan model yang dicadangkan
3.2.2. Ciri Titik Utama
Kami mengekstrak ciri titik utama dalam modul spatial daripada RGB data untuk setiap bingkai dalam input video. Kualiti ciri titik kunci mempunyai peranan penting dalam model cadangan kami, jadi kami perlu menggunakan pendekatan yang mantap, seperti HRNet [38]. Kami menggunakan HRNet terlatih [38] untuk menganggarkan kesemua 133 mata utama badan, dan kami menggunakan 27 daripada 133 mata utama daripada keputusannya. Seperti yang ditunjukkan dalam Rajah 4, bahagian kiri ialah titik kekunci bahagian atas badan asal, dan bahagian kanan ialah 27 titik kekunci bahagian atas badan yang dipilih. 27 perkara utama ini termasuk pergelangan tangan, siku, bahu, leher, tangan dan jari.

Rajah 4. Ciri-ciri titik kunci bagi dataset PHOENIX-RWTH [33,39], (imej kiri) pengekstrakan daripada imej RGB dan (imej kanan) ialah titik kekunci terpilih yang digunakan oleh model yang dicadangkan.
3.3. Modul Temporal
Modul temporal bertujuan untuk mempelajari maklumat spatiotemporal daripada modul spatial. Modul temporal dibina oleh Pengumpulan Temporal bertindan untuk setiap aliran. Seperti yang ditunjukkan dalam Rajah 5, modul pengumpulan Temporal terdiri daripada lapisan konvolusi temporal dan lapisan pengumpulan untuk mengekstrak ciri daripada input berjujukan.

Rajah 5. Seni bina modul temporal terdiri daripada 1D-CNN bertindan dan lapisan pengumpulan yang dibenamkan dengan modul perhatian. Bekerja secara selari untuk kedua-dua strim ciri yang disatukan pada penghujung lapisan bertindan, dan menghasilkan satu ciri temporal dengan panjang jujukan empat kali lebih kecil.
Input ialah senarai pelbagai ciri spatial dari peringkat sebelumnya. Ciri temporal diperoleh menggunakan lapisan lilitan temporal yang merupakan lapisan lilitan 1D tunggal dengan panjang input dan output yang sama, diikuti dengan lapisan pengumpulan tunggal yang mengecilkan saiz kepada separuh. Menggunakan dua lapisan pengumpulan temporal bertindan ini adalah konfigurasi terbaik, mengikut kerja-kerja sebelumnya [12]. Selepas setiap pengumpulan sementara, kami membenamkan modul perhatian yang akan diterangkan secara terperinci dalam Bahagian 3.4. Pada akhirnya, kami menggabungkan output pengumpulan temporal dari kedua-dua aliran.
3.4. Modul Perhatian
Video ini mempunyai berbilang bingkai di mana sesetengah bahagian imej kadangkala kabur. Set data RTWH-PHOENIX [33,39] mempunyai lebih banyak bingkai yang rosak daripada set data CSL [8,40,41]. Ini berlaku apabila pergerakan terlalu pantas, mencipta imej kabur dan mengakibatkan lokasi titik kunci yang salah. Bingkai ini dianggap rosak dan berpotensi membawa kepada salah tafsiran bagi kedua-dua ciri RGB dan titik kekunci. Rajah 6 menunjukkan ilustrasi bingkai yang rosak dalam dataset RTWH-PHOENIX [33]. Untuk menangani masalah ini, kami menambah lapisan perhatian.

Rajah 6. Ilustrasi bingkai kecacatan pada dataset RWTH-PHOENIX [33,39]. Beberapa titik penting dalam kawasan tangan berada dalam kedudukan yang salah kerana imej kabur.
Menggunakan algoritma CTC, penjajaran laluan bersama-sama dengan pelabelannya dilakukan dengan menggunakan label kosong dan mengalih keluar label ulangan. CTC lebih suka meramalkan label kosong daripada sempadan gloss apabila ia tidak dapat membezakan sempadan gloss, tetapi tiada keputusan yang meyakinkan. Ini menyebabkan rangkaian menggunakan CTC untuk menghasilkan lonjakan dalam keputusan apabila menganalisis, mempelajari dan meramalkan [42,43]. Secara amnya, kehilangan CTC mencari bingkai utama, dan keputusan terakhir ialah ramalan rangka kunci tertentu yang mempunyai kebarangkalian tinggi untuk menjadi label kosong atau label bukan kosong. Jika gloss meramalkan label yang sama atau label kosong secara berturut-turut, ia menghasilkan output yang sama. Walau bagaimanapun, jika terdapat label sisipan di antara label yang sama, walaupun terdapat hanya satu kesilapan, ia mengakibatkan kerugian yang lebih besar. Di sini penambahan lapisan perhatian membantu memilih urutan temporal yang penting sebelum digunakan untuk pembelajaran berurutan.
Modul perhatian menggunakan mekanisme perhatian diri berbilang kepala [20]. Modul berbilang kepala digunakan untuk menjalankan beberapa mekanisme perhatian selari pada masa yang sama. Perhatian berbilang kepala dijalankan secara bebas untuk memfokuskan pada kebergantungan jangka pendek atau kebergantungan jangka panjang dalam kepala yang berasingan. Setiap keluaran kemudiannya digabungkan secara linear dan diubah menjadi bentuk yang diingini.
Pada masa yang sama, mekanisme perhatian diri berbilang kepala menjaga maklumat daripada subruang perwakilan berbilang, bergantung pada sejarah pemerhatian. Untuk kesederhanaan, kami menandakan urutan input sebagai X. Secara matematik, untuk model perhatian kepala tunggal, diberikan input X t − T tambah 1:t=[X t − T tambah 1, · · ·, X t ] ∈ RT × N × P, tiga ruang kecil diperolehi, iaitu subruang pertanyaan Q ∈ RN ×dq, subruang utama K ∈ RN × dk, dan subruang nilai V ∈ RN × dv. Proses pembelajaran subruang terpendam boleh dirumuskan sebagai [20]:
Q=XWQ, K=XWK , V=XWV ,
Kemudian, perhatian produk titik berskala digunakan untuk mengira output perhatian sebagai [20]:
Perhatian(Q, K, V)=jadi f tmaxQKT/ p dkV,
Tambahan pula, jika kita mempunyai berbilang kepala yang mengikut serentak berbilang perwakilan input, kita boleh memperoleh hasil yang lebih relevan pada masa yang sama. Langkah terakhir adalah untuk menggabungkan semua kepala dan menayangkannya semula untuk mengira skor akhir [20]:
MultiHead(Q,K,V)=Concat(head1,... , heads )WO,
kepala=Perhatian(Qi,Ki,Vi),
dengan Qi=XWQ i , Ki=XWVi , dan WO ∈ R hd × dmodel. Akhirnya, ia boleh memilih bahagian penting daripada urutan ciri kerana tidak semua maklumat dalam urutan itu penting.
Seperti yang ditunjukkan dalam Rajah 7, kami menggunakan modul perhatian dalam beberapa konfigurasi. Modul perhatian pertama diletakkan pada penghujung modul spatial, manakala modul perhatian kedua dan ketiga diletakkan dalam modul temporal. Modul perhatian kedua yang dipanggil modul temporal awal, diletakkan selepas blok pertama pengumpulan temporal sebagai input, manakala modul perhatian temporal ketiga, dipanggil modul perhatian temporal lewat, diletakkan selepas blok kedua pengumpulan temporal.

Rajah 7. Modul perhatian dibenamkan dalam modul spatial dan temporal dalam konfigurasi yang berbeza.






