Pengiktirafan Automatik yang Boleh Diterangkan Terhadap Keadaan Emosi Daripada Ekspresi Wajah Anjing: Kes Jangkaan dan Kekecewaan Positif

Aug 11, 2023

Menggunakan pengoptimum Adam dengan kadar pembelajaran {{0}}.0001. Model yang mencapai ketepatan maksimum pada set data pengesahan telah dipilih sebagai model terbaik. Semasa 10 zaman pertama, berat semua lapisan telah diperhalusi. Semasa 10 zaman pertama, berat semua lapisan telah diperhalusi. Semasa tempoh yang tinggal, pemberat ResNet50 dibekukan dan hanya pemberat lapisan atas baharu dikemas kini. Untuk pembolehubah tidak berkaitan orientasi ('Perata Telinga', 'Bahagian Bibir', 'Penambah Telinga', 'Telinga Ke Hadapan' dan 'Jilat Hidung') kami menggunakan teknik pembesaran berdasarkan fip mendatar imej rawak dan putaran sehingga 20 darjah. Sebagai input untuk pengekod, kami menggunakan jadual input, di mana setiap baris mewakili kehadiran (1)/ketiadaan (0) setiap satu daripada 11 pembolehubah DogFACS pada setiap video. Sasaran pengekod ialah jadual yang mengandungi keadaan (negatif(0)/positif(1)) bagi setiap video.

ResNet50 ialah seni bina rangkaian neural dalam yang telah menjadi salah satu rangkaian klasik dalam bidang penglihatan komputer. Rangkaian ResNet50 dicirikan oleh ingatan yang sangat kuat dan keupayaan untuk mengingati pengetahuan yang dipelajari sebelum ini semasa latihan, yang menjadikannya berfungsi dengan baik dalam tugas pengecaman imej yang kompleks.

Bagaimanakah ResNet50 mencapai memori? Ia menggunakan kaedah sambungan baki dan menambah sambungan pintasan merentas lapisan dalam setiap lapisan konvolusi, yang boleh menjadikan aliran maklumat lebih baik dalam rangkaian. Semasa proses latihan, disebabkan kewujudan sambungan pintasan ini, rangkaian boleh mempelajari baki pemetaan dengan lebih mudah dan tidak perlu menghabiskan terlalu banyak masa mencari pemetaan yang tinggal ini.

Prestasi memori jenis ini menjadikan ResNet50 berfungsi dengan baik dalam tugas pengecaman imej berskala besar. Untuk masalah seperti klasifikasi imej, pengesanan sasaran dan pengecaman muka, ResNet50 telah mencapai hasil yang sangat baik. Prestasi ingatan ini serupa dengan otak kita, yang juga menghubungkan neuron untuk meningkatkan ingatan. Jadi kita boleh katakan bahawa ResNet50 ialah model rangkaian saraf dalam yang sangat baik, yang mempunyai ingatan yang kuat dan boleh mengendalikan tugas pengecaman imej yang kompleks dengan baik. Pada masa yang sama, ia juga memberi kita sedikit inspirasi. Kita boleh belajar daripada idea ResNet50 untuk mereka bentuk model rangkaian saraf dalam yang lebih berkesan, untuk memenuhi keperluan manusia dengan lebih baik. Dapat dilihat bahawa kita perlu meningkatkan daya ingatan. Cistanche boleh meningkatkan daya ingatan kerana Cistanche adalah bahan perubatan tradisional Cina yang mempunyai banyak kesan unik, salah satunya adalah untuk meningkatkan daya ingatan. Keberkesanan daging cincang berasal dari pelbagai bahan aktif yang terkandung di dalamnya, termasuk asid karboksilik, polisakarida, flavonoid, dll. Bahan-bahan ini boleh menggalakkan kesihatan otak melalui pelbagai saluran.

increase memory

Klik cara untuk meningkatkan fungsi otak

Dalam penyelidikan haiwan, automasi pengiktirafan keadaan afektif setakat ini terutamanya menangani kesakitan dalam beberapa spesies. Keadaan emosi kekal sebagai wilayah yang belum dipetakan, terutamanya pada anjing, disebabkan oleh kerumitan morfologi dan ekspresi wajah mereka. Kajian ini menyumbang kepada memenuhi jurang dalam dua aspek. Pertama, ia adalah yang pertama menangani keadaan emosi anjing menggunakan set data yang diperoleh dalam tetapan percubaan terkawal, termasuk video daripada (n=29) Labrador Retrievers yang diandaikan berada dalam dua keadaan emosi yang disebabkan oleh eksperimen: negatif (kekecewaan) dan positif (jangkaan). Ekspresi muka anjing diukur menggunakan Sistem Pengekodan Tindakan Muka Anjing (DogFACS).

Dua pendekatan berbeza dibandingkan matlamat abator: (1) pendekatan berasaskan DogFACS dengan saluran paip dua langkah yang terdiri daripada (i) pengesan pembolehubah DogFACS dan (ii) pengelas Pohon Keputusan keadaan positif/negatif; (2) Pendekatan menggunakan teknik pembelajaran mendalam tanpa perwakilan perantaraan. Pendekatan tersebut mencapai ketepatan melebihi 71% dan 89%, masing-masing, dengan pendekatan pembelajaran mendalam menunjukkan prestasi yang lebih baik. Kedua, kajian ini juga merupakan yang pertama mengkaji kebolehjelasan model AI dalam konteks emosi dalam haiwan. Pendekatan berasaskan DogFACS menyediakan pepohon keputusan, yang merupakan perwakilan matematik yang mencerminkan penemuan terdahulu oleh pakar manusia tentang ekspresi muka tertentu (pembolehubah DogFACS) yang dikaitkan dengan keadaan emosi tertentu. Pendekatan pembelajaran mendalam menawarkan bentuk kebolehjelasan visual yang berbeza dalam bentuk peta haba yang mencerminkan kawasan tumpuan perhatian rangkaian, yang dalam beberapa kes menunjukkan fokus yang berkaitan dengan sifat pembolehubah DogFACS tertentu. Peta haba ini mungkin memegang kunci kepada cerapan baharu tentang kepekaan rangkaian kepada corak piksel bernuansa yang mencerminkan maklumat yang tidak dapat dilihat oleh mata manusia.

Charles Darwin terkenal menyifatkan penggunaan ekspresi muka sebagai paparan keadaan emosi pada manusia dan pelbagai spesies bukan manusia (selepas ini dirujuk sebagai haiwan) dalam karya maninya 'Ekspresi Emosi dalam Manusia dan Haiwan'1. Pada masa kini diakui secara meluas bahawa ekspresi muka adalah sumber maklumat penting untuk mengenali keadaan emosi. Pada manusia, ekspresi muka berfungsi sebagai cara bukan lisan utama yang mengawal interaksi2 dan perkaitan antara ekspresi muka dan keadaan emosi telah lama ditubuhkan oleh kajian sistematik dalam psikologi3,4. Dalam haiwan, ekspresi muka dihasilkan oleh kebanyakan spesies mamalia5, dan, seperti pada manusia, mereka diandaikan menyampaikan maklumat tentang keadaan emosi6,7. Oleh itu, ekspresi muka semakin dikaji sebagai penunjuk potensi keadaan subjektif dalam emosi haiwan dan penyelidikan kebajikan.

Piawaian emas untuk menilai secara objektif perubahan dalam ekspresi muka dalam penyelidikan emosi manusia ialah Sistem Pengekodan Tindakan Muka—FACS8,9. FACS baru-baru ini telah disesuaikan untuk spesies bukan manusia yang berbeza, termasuk beberapa primata bukan manusia (cth orang utan10, cimpanzi11, kera12,13), marmoset14, anjing15 dan kucing16. Sistem ini yang dirujuk sebagai AnimalFACS, seperti pada manusia, semakin digunakan untuk mengkaji keadaan emosi haiwan (cth17–19).

Cabaran utama dalam mengenal pasti ekspresi muka piawai dalam anjing melibatkan kepelbagaian morfologi kepala mereka20,21 dan struktur dermis di atasnya, seperti kemasukan kedutan kekal dalam beberapa baka. Untuk mengenal pasti ekspresi emosi muka dalam anjing, Caeiro et al.18 menggunakan DogFACS untuk menilai tindak balas spontan individu pelbagai baka dan campuran dalam tetapan emosi naturalistik menggunakan video dalam talian. Emosi kedua-dua valensi positif dan negatif telah disiasat, termasuk jangkaan ganjaran (emosi bervalensi positif) dan kekecewaan (emosi bervalensi negatif), kedua-duanya dicirikan oleh jangkaan rangsangan yang diingini16. Jangkaan positif ditakrifkan sebagai diinduksi dalam situasi yang melibatkan "[v]isualisasi makanan atau mendengar makanan/perkataan berkaitan makanan; [v]isualisasi tali, mendengar perkataan berkaitan berjalan" dan kekecewaan ditakrifkan sebagai didorong oleh "[v]isualisasi sumber yang diingini (mainan, makanan, ruang) yang atau menjadi tidak boleh diakses"18. Walaupun Caeiro et al.18 mendapati bahawa anjing menunjukkan ekspresi muka yang berbeza secara ketara dalam membezakan keadaan emosi tertentu, tiada ciri tersendiri yang dikenal pasti dalam konteks kekecewaan. Sehubungan itu, Bremhorst et al.22 menyiasat ekspresi muka anjing tentang jangkaan positif dan kekecewaan dalam persekitaran eksperimen terkawal, tidak seperti Caeiro et al.18, menyeragamkan juga baka anjing (Labrador Retriever). Selain itu, pengarang menggunakan konteks bukan sosial untuk menghapuskan risiko gangguan daripada respons yang mendapat perhatian yang dipelajari sebelum ini. Untuk secara eksperimen menimbulkan kedua-dua keadaan emosi yang dikaji, ganjaran makanan bernilai tinggi digunakan sebagai rangsangan pencetus dalam dua keadaan: keadaan positif diramalkan untuk mendorong jangkaan positif (melalui jangkaan makanan terkondisi), dan keadaan negatif harus mendorong kekecewaan (iaitu melalui pencegahan akses kepada ganjaran makanan yang dijangkakan). Ekspresi muka anjing di kedua-dua negeri ini diukur menggunakan DogFACS. Penulis mendapati bahawa pembolehubah "Ears Adductor" adalah lebih biasa dalam keadaan positif, manakala "Blink", "Lips Part", "Jaw Drop", "Nose Jick", dan "Ears Flattener" adalah lebih biasa dalam negatif. syarat22. Dalam kajian susulan, Bremhorst et al.19 menguji kumpulan anjing baharu menggunakan persediaan yang serupa. Walau bagaimanapun, dalam kajian ini, dua jenis ganjaran yang berbeza telah digunakan (makanan dan mainan) untuk menguji kebolehgeneralisasian penemuan terdahulu mereka kepada julat konteks yang lebih luas19.

Keputusan sebelumnya telah direplikasi19, dengan empat lagi pembolehubah lebih biasa dalam keadaan negatif: "Telinga Ke Bawah", "Penarik Sudut Bibir", "Pertunjukan Lidah" ​​dan "Penaik Bibir Atas". Semua mimik muka yang dikenal pasti kecuali "Penaik Bibir Atas" adalah bebas daripada jenis ganjaran yang dijangka diterima oleh anjing19. Tambahan pula, ukuran asas ketepatan diagnostik dinilai untuk ekspresi muka yang dikenal pasti sebagai penunjuk emosi yang berpotensi, termasuk sensitiviti, kekhususan, dan nilai ramalan positif dan negatifnya19. Keputusan menunjukkan bahawa tiada satu pun daripada ekspresi muka ini akan memberikan klasifikasi betul yang konsisten bagi emosi yang berkaitan jika digunakan sendiri sebagai penunjuk emosi individu19. Ini tidak menolak nilai potensi mereka sebagai isyarat tetapi mungkin menekankan pemprosesan holistik biasa bagi konfigurasi muka23, dan bukannya fokus pada elemen tunggal di dalamnya.

Kehadiran penonton dalam konteks emosi adalah elemen penting yang perlu dipertimbangkan semasa menyiasat ekspresi muka (emosi) pada anjing, seperti yang ditunjukkan oleh kajian terbaru oleh Pedretti et al.24. Begitu juga dengan 19,22, penulis juga mendedahkan anjing kepada jangkaan positif, dan kekecewaan bukan sosial dan bukan sosial, membangkitkan sesi ujian. Mereka juga menggunakan DogFACS untuk menganalisis ekspresi muka anjing dalam situasi ini, selain daripada tingkah laku lain seperti mengibas ekor, dan mengukur kepekatan kortisol air liur pra dan pasca ujian. Mereka mendapati bahawa "Telinga Ke Hadapan" berlaku lebih banyak dalam keadaan positif berbanding dengan keadaan negatif. Tambahan pula, pembolehubah ini dipengaruhi secara positif oleh kehadiran penonton, dan berkorelasi negatif dengan kepekatan kortisol pra-ujian, mencadangkan ia mungkin penunjuk tahap perhatian anjing yang baik. "Ears Flattener", "Blink", "Nose Jick", "Tail Wagging" dan "Whining" (dua yang terakhir tidak termasuk dalam pembolehubah DogFACS) juga dikaitkan dengan kehadiran penonton tetapi tidak dikaitkan dengan kepekatan kortisol, mencadangkan komponen komunikatif tingkah laku ini.

improve your memory

Ini menunjukkan bahawa DogFACS juga boleh berfungsi untuk menyiasat ekspresi muka anjing bukan sahaja sebagai isyarat (iaitu, menghasilkan perubahan tingkah laku yang mengiringi keadaan emosi) tetapi juga sebagai isyarat (iaitu, tingkah laku yang dihasilkan khusus untuk menyampaikan emosi kepada rakan komunikasi), lihat juga 25. Oleh itu, sistem AnimalFACS menyediakan cara penting untuk menggalakkan pemahaman tentang ekspresi muka haiwan. Walau bagaimanapun, penggunaan sistem ini untuk analisis ekspresi muka mempunyai cabarannya, termasuk pergantungannya pada anotasi manual yang memerlukan latihan dan pensijilan manusia yang meluas, ini boleh memakan masa untuk dilakukan dan mungkin terdedah kepada kesilapan manusia atau berat sebelah26.

Automasi mempunyai potensi untuk menyediakan kemajuan pelengkap yang penting kepada proses ini. Khususnya, ia dikatakan bahawa alat automatik mempunyai objektiviti dan kebolehpercayaan yang lebih besar daripada pengekodan manual, menghapuskan subjektiviti dan bias27,28, tetapi mereka juga tidak bergantung pada pengesanan ciri tunggal untuk kejayaan mereka. Oleh itu, tidak menghairankan bahawa pengekodan ekspresi muka automatik ialah bidang yang bertenaga dalam penyelidikan emosi manusia, dengan pelbagai alatan perisian komersial tersedia, seperti FaceReader oleh Noldus29, Afdex30, EmoVu31, serta pangkalan data yang luas seperti CAS(ME)332.

Dalam haiwan, sebaliknya, automasi analisis ekspresi muka kurang diteliti. Ini disebabkan oleh beberapa cabaran (seperti yang dibincangkan oleh 33,34), termasuk pertama kali pertumbuhan atau minat relatif dalam penyelidikan emosi haiwan, yang bermaksud lebih sedikit data tersedia berbanding dengan jumlah data yang besar dalam domain manusia. Kedua, terutamanya dalam spesies yang dijinakkan, variasi besar dalam morfologi muka memberikan cabaran teknikal35. Akhir sekali, kekurangan laporan diri lisan menjadikannya mencabar untuk mewujudkan kebenaran asas untuk keadaan emosi yang dialami pada haiwan, manakala, pada manusia, pelaporan diri adalah pendekatan standard untuk tujuan ini. Oleh itu, protokol pengumpulan data untuk haiwan memerlukan kawalan dan kawal selia yang meluas, definisi operasi keadaan emosi yang dikaji (lihat cth18), atau mungkin penilaian oleh pakar manusia—walaupun ini berpotensi menimbulkan pertimbangan berat sebelah dan subjektif.

Broomé et al.36 menyediakan tinjauan komprehensif terhadap dua puluh kajian yang membentangkan pendekatan terkini untuk pengecaman automatik emosi dan kesakitan pada haiwan. Majoriti kerja-kerja ini memberi tumpuan kepada kejadian kesakitan. Spesies yang telah ditangani dalam konteks ini termasuk tikus37–39, biri-biri40, kuda33,41,42 dan kucing43. Semua kerja ini menyediakan pengelas binari untuk kesakitan/tiada kesakitan, menggunakan teknik pembelajaran mesin.

Bekerja pada lebih meluas mengautomasikan pengecaman emosi haiwan adalah lebih terhad. Dua kajian dalam primat bukan manusia menumpukan pada Unit Tindakan / pengecaman ekspresi muka yang berkaitan, tanpa menangani keadaan emosi secara eksplisit44,45. Blumrosen et al.44 pengecaman automatik empat ekspresi muka primata bukan manusia: neutral, mengetap bibir, mengunyah dan membuka mulut rawak dengan usaha anotasi yang minimum, manakala Morozov et al.45 melaksanakan sistem prototaip untuk pengekodan MaqFACS automatik untuk kera Rhesus , dilatih untuk mengklasifikasikan enam pembolehubah MacFACS.

Hanya tiga karya yang menyediakan klasifikasi hujung ke hujung untuk keadaan emosi yang berbeza telah ditinjau dalam Broomé et al.36. Corujo et al.46 mentakrifkan empat keadaan emosi untuk kuda: "biar", "jengkel", "ingin tahu", dan "santai", mentakrifkan setiap daripadanya dari segi tingkah laku mata, telinga, hidung dan leher. Sebagai contoh, "santai" ditakrifkan sebagai mata: sebahagian besarnya ditutup, telinga: santai, bukaan menghala ke sisi, hidung: mulut dan leher santai: lebih kurang selari. Model rangkaian neural convolutional (CNN) telah dilatih untuk meramalkan empat "kelas" emosi ini. Ferres et al.47 menggunakan anggaran pose automatik menggunakan DeepLabCut48 untuk klasifikasi empat kelas emosi "kemarahan", "takut", "kegembiraan" dan "kelonggaran" untuk anjing. Franzoni et al.49 juga menggunakan model CNN untuk mengklasifikasikan atribut terhad yang berkaitan dengan keadaan emosi: "senyum" (berkaitan dengan "kegembiraan"), "geram" (berkaitan dengan "kemarahan" ), dan "tidur" (berkaitan dengan neutral negeri).

Daripada tiga karya yang berkaitan dengan anjing47,49,50 dua tertumpu pada badan untuk mengenali keadaan emosi47 dan kesakitan50, dan satu pada ekspresi muka emosi49. Walau bagaimanapun, set data yang digunakan dalam kajian Ferres et al.47 dan Franzoni et al.49 kedua-duanya mengandungi imej yang dikumpul daripada internet dan diberi penjelasan oleh bukan pakar dan dengan itu berpotensi mempunyai kebolehpercayaan dan kesahihan yang rendah. Kerja Zhu50 mengkaji pengecaman kesakitan berdasarkan bahasa badan, dan bukan ekspresi muka.

Kajian yang dibentangkan di sini ialah yang pertama meneroka pengecaman automatik emosi anjing daripada ekspresi muka, menggunakan set data yang dikumpul daripada protokol percubaan yang direka dengan teliti di mana konteksnya mempertahankan keadaan emosi22. Dalam protokol ini, keadaan emosi jangkaan positif (emosi positif) dan kekecewaan (emosi negatif) ditakrifkan secara operasi (mengikut 18 dan diinduksi secara eksperimen dalam sampel 29 subjek Labrador Retriever, meminimumkan kebolehubahan perbezaan morfologi antara anjing. ekspresi muka yang dihasilkan oleh anjing telah dikodkan secara objektif menggunakan sistem DogFACS piawai oleh pengekod DogFACS yang diperakui. Set data ini mewujudkan persekitaran eksperimen yang unik untuk meneroka pendekatan yang berbeza untuk automasi pengecaman emosi dengan berat sebelah minimum dalam definisi emosi. Data ini selanjutnya mendapat manfaat daripada mengurangkan variasi morfologi muka peserta disebabkan oleh penyeragaman baka.

Menurut 36, terdapat dua laluan standard untuk mengklasifikasikan keadaan emosi atau kesakitan: menggunakan ciri buatan tangan, atau menggunakan paradigma pembelajaran mendalam berdasarkan ciri yang dipelajari51. Ciri buatan tangan boleh dibahagikan secara kasar kepada ciri peringkat rendah, yang berdasarkan statistik imej (seperti histogram kecerunan berorientasikan) yang biasa digunakan dalam literatur penglihatan komputer51, dan ciri peringkat tinggi, yang berasaskan semantik, dalam spesies- struktur muka dan/atau badan anatomi tertentu, sisik meringis, unit tindakan, dsb. Contoh yang terakhir ialah mercu tanda muka kucing52, mata kunci badan anjing47 atau unit tindakan kesakitan biri-biri40. Ciri ini menggalakkan kebolehjelasan algoritma pembelajaran mesin dengan mengasaskan keputusan model dalam konsep tingkah laku. Pendekatan pembelajaran mendalam, sebaliknya, adalah lebih fleksibel dan dijangka berprestasi lebih baik (terutama apabila set data yang besar tersedia), namun memerlukan sumber pengiraan yang mahal dan 'kotak hitam' dalam erti kata ia tidak memberi penjelasan. dalam istilah yang boleh difahami oleh manusia mengapa keputusan pengelasan tertentu dibuat.

Dalam kajian ini, kami menyiasat kedua-dua laluan alternatif ini kepada pengelasan automatik keadaan emosi dalam anjing. Laluan pertama menggunakan pembolehubah DogFACS sebagai ciri peringkat tinggi yang boleh dijelaskan. Saluran paip klasifikasi mempunyai dua peringkat dalam kes ini: pertama, pengecaman automatik kod DogFACS dan kedua, menggunakan anotasi untuk mengklasifikasikan emosi yang dikaji. Kami menunjukkan kegunaan perwakilan yang boleh dijelaskan sedemikian untuk memahami cara pembolehubah DogFACS digunakan dalam membuat keputusan mesin. Laluan kedua mengambil pendekatan pembelajaran mendalam (lebih mudah, satu peringkat), membolehkan mesin belajar terus daripada ciri data yang tidak semestinya difahami manusia. Kami selanjutnya membandingkan aspek kebolehjelasan antara kedua-dua pendekatan dan menggunakan teknik visualisasi peta haba untuk menyerlahkan hubungan ciri yang dipelajari dengan objek semantik yang berkaitan dengan bahagian muka anjing.

Keputusan

Set data.

Kami menggunakan set data dan anotasi DogFACS yang dijana sebagai sebahagian daripada kajian terdahulu oleh Bremhorst et al.22. Untuk mengurangkan kesan variasi morfologi, 29 subjek satu baka tanpa ciri muka ekstrem (Labrador Retriever) telah diuji (19 betina–13 dikebiri, 10 jantan–9 dikebiri; julat umur: 2–9.5 tahun, min umur {{9} }.22 tahun). Rajah 1 menunjukkan taburan umur dan jantina subjek.

Set data termasuk keseluruhan 248 sampel video sepanjang 3s yang dirakam pada kadar bingkai 25.25 bingkai/s, dengan setiap resolusi bingkai ialah 1920 × 1080 piksel. Kamera yang digunakan untuk merakam ialah HIKVision, IR Mini Bullet Network Camera; perakam: Siri HIKVision, DS-7600. Subjek terletak di belakang tetingkap lutsinar menggunakan protokol yang diterangkan sepenuhnya dalam Bremhorst et al.22. Setiap subjek diuji 3 kali dalam keadaan positif, dan 6 kali dalam keadaan negatif. Secara keseluruhannya dua pertiga daripada video telah dianotasi sebagai negatif dan satu pertiga sebagai positif. Diandaikan sepanjang kajian ini bahawa keadaan negatif mendorong kekecewaan, dan keadaan positif mendorong jangkaan positif, oleh itu kita menggunakan valens positif/negatif untuk merujuk kepada dua keadaan emosi. Rajah 2 menunjukkan tanaman muka anjing yang diekstrak daripada set data.

boost memory

Set data diseimbangkan menggunakan pensampelan terkurang rawak, meninggalkan 82 video keadaan positif dan 82 video keadaan negatif daripada (n = 29) individu, keseluruhan 164 video. Pengimbangan dilakukan dengan mengekalkan bilangan sampel positif dan negatif yang sama bagi setiap individu.

Semua sampel video telah dikodkan menggunakan 39 pembolehubah DogFACS berdasarkan manual DogFACS53 oleh pengekod DogFACS yang diperakui, dengan menganotasi satu bingkai setiap 200 ms menggunakan Solomon Coder (versi 15.03.15, Andràs Péter). Daripada 39 pembolehubah ini, sebelas pembolehubah yang dibentangkan dalam Jadual 1 digunakan dalam kajian Bremhorst22, berdasarkan kelaziman sekurang-kurangnya 10% merentasi semua sampel sama ada keadaan positif atau negatif dan sekurang-kurangnya kekuatan besar perjanjian interkoder (lihat22 untuk butiran lanjut).

10 ways to improve memory

Gambaran keseluruhan kedua-dua pendekatan.

Kami membentangkan di sini perbandingan dua pendekatan berbeza untuk pengelasan automatik bagi keadaan positif dan negatif: berasaskan DogFACS vs. tulen (pendekatan DogFACS juga mempunyai modul pembelajaran mendalam untuk pengesanan pembolehubah DogFACS) pendekatan pembelajaran mendalam. Rajah 3 membentangkan gambaran keseluruhan peringkat tinggi bagi kedua-dua pendekatan.

Ketersediaan data video membolehkan kami bekerja dengan dua jenis input: bingkai tunggal atau jujukan bingkai. Yang pertama membayangkan lebih banyak kehilangan maklumat, tetapi lebih mudah dan lebih terkawal; manakala yang kedua termasuk dimensi temporal, yang telah ditunjukkan mempunyai kepentingan untuk tugas-tugas tersebut, contohnya, dalam konteks pengesanan kesakitan pada kuda42,54. Pendekatan lazim dalam konteks pengiktirafan automatik keadaan afektif dan kesakitan pada haiwan, bagaimanapun, adalah asas rangka tunggal (cth, 33,39,41,55). Oleh kerana sifat penerokaan kajian ini, kami memutuskan pilihan ini.

Kedua-dua pendekatan itu berfungsi pada asas bingkai tunggal, iaitu, pengelasan dilakukan pada bingkai tunggal yang diekstrak daripada video. Walau bagaimanapun, pengagregatan maklumat bingkai tunggal dilakukan secara berbeza dalam kedua-dua kes. Selepas langkah pra-pemprosesan untuk mengekstrak muka anjing yang dipotong daripada bingkai (lihat Rajah 2 untuk contoh), dalam pendekatan mendalam muka dipotong mentah diambil sebagai input oleh rangkaian saraf. Kami bereksperimen di sini dengan seni bina rangkaian saraf dua jenis: rangkaian saraf konvolusi (Resnet5056) dan rangkaian pengubah penglihatan57 (ViT) yang diperkenalkan baru-baru ini. Keputusan rangkaian yang dipilih kemudiannya diagregatkan menggunakan undian majoriti, dan keputusan klasifikasi setiap video dicapai.

Pendekatan berasaskan DogFACS, sebaliknya, menggunakan saluran paip dengan dua langkah berturut-turut. Yang pertama ialah pengesan Pembolehubah DogFACS automatik, yang mengesan satu set pembolehubah DogFACS dalam setiap bingkai. Pembolehubah DogFACS kemudiannya diagregatkan untuk keseluruhan video. Langkah kedua ialah pepohon keputusan, yang inputnya ialah set pembolehubah DogFACS yang dikesan dalam video yang digunakan untuk mencapai keputusan pengelasan akhir.

Oleh itu, pendekatan berasaskan DogFACS membuat keputusan klasifikasi berdasarkan set pembolehubah DogFACS yang dikenal pasti dalam video; pendekatan pembelajaran mendalam, sebaliknya, memutuskan setiap bingkai secara berasingan, mengekstrak ciri yang dipelajari daripada imej mentah, dan kemudian mengagregatkan keputusan untuk semua bingkai untuk video. Oleh itu, apabila meneroka kebolehjelasan kedua-dua pendekatan, dalam pendekatan pertama kita dijangka mempunyai 'penjelasan' di sepanjang baris Bremhorst et al.22 (mengenal pasti pembolehubah lazim dalam setiap keadaan, atau beberapa gabungan daripadanya). Pendekatan terakhir, bagaimanapun, dijangka akan menghasilkan lebih banyak penjelasan visual tentang ciri imej yang difokuskan oleh model, seperti yang dihuraikan di bawah.

Untuk menilai prestasi model kami, kami menggunakan metrik standard ketepatan, ketepatan dan ingat semula, yang merupakan kaedah standard dalam konteks pembelajaran mesin. Sebagai kaedah pengesahan, kami menggunakan pengesahan silang satu subjek keluar tanpa pertindihan subjek, yang bermaksud menggunakan setiap subjek anjing sebagai set ujian yang berasingan. Kaedah ini disyorkan untuk set data di mana seorang individu mempunyai lebih daripada satu sampel yang berkaitan36. Lihat Broomé et al.36 untuk perbincangan tentang kepentingan memilih kaedah pengesahan yang sesuai.

short term memory how to improve

Pendekatan berasaskan DogFACS.

Set pembolehubah DogFACS. Kami bereksperimen dengan dua set berbeza pembolehubah DogFACS:

1. Set daripada sebelas pembolehubah yang dibentangkan dalam Jadual 1 yang digunakan dalam kajian Bremhorst et al.22, adalah pembolehubah yang paling menjanjikan atau berpotensi paling penting (berdasarkan kelaziman sekurang-kurangnya 10% merentasi semua sampel sama ada keadaan positif atau negatif) dan ia boleh dikodkan dengan pasti (dengan sekurang-kurangnya kekuatan perjanjian interkoder yang besar, lihat22).

2. Keseluruhan set 39 pembolehubah DogFACS yang dikodkan dalam kajian Bremhorst et al.22.

Classification results. To explore optimal performance, we used the manual DogFACS annotations from Bremhorst et al.22 to experiment with different machine learning techniques, including Decision Tree, XGBoost, and Random Forest. Table 2 presents a comparison of their performance, with Random Forest performing slightly better for the full set of DogFACS variables (39 variables), reaching accuracy > 71%. In the limited set (11 DogFACS variables), the three models converged to one tree, and thus are presented together, reaching a slightly lower accuracy of > 66%.

Meminimumkan pokok keputusan. Seterusnya, kami melakukan carian sistematik untuk set minimum pembolehubah DogFACS yang akan menghasilkan prestasi pengelasan yang sama yang ditunjukkan dalam Jadual 2. Jadual 3 menunjukkan bahawa menggunakan hanya satu pembolehubah DogFACS sebagai ciri menjamin prestasi yang sama seperti yang ditunjukkan dalam Jadual 2. Pembolehubah 'Ears Flattener' adalah yang paling penting untuk pengelasan menggunakan set terhad 11 pembolehubah DogFACS, kehadirannya meramalkan keadaan negatif. Rajah 4 menunjukkan pepohon keputusan yang dipermudahkan dengan hanya satu ciri yang meramalkan keadaan positif—ketiadaan 'Perata Telinga', dan keadaan negatif—kehadirannya (dengan ketepatan > 66%).

Terutama, apabila mempertimbangkan semua 39 pembolehubah DogFACS, 'Eyes Up' ialah pembolehubah yang paling penting untuk pengelasan menggunakan kesemua 39 pembolehubah, kehadirannya meramalkan keadaan positif dengan ketepatan tinggi > 71%.

Pengesanan automatik pembolehubah DogFACS. Berdasarkan penemuan kami, melatih pengesan untuk pembolehubah 'Ears Flattener' dan 'Eyes Up' DogFACS cukup untuk saluran paip pengelasan automatik sepenuhnya. Kami juga meneroka pengesanan pembolehubah lain, menggunakan rangkaian saraf konvolusional ResNet50 yang telah terlatih pada set data seimbang (pada bilangan imej yang berbeza-beza disebabkan oleh kebolehubahan dalam kekerapan pembolehubah DogFACS). Prestasi pengesan yang diperolehi dibentangkan dalam Jadual 4.

ways to improve memory

Pendekatan yang mendalam.

Dalam pendekatan ini kami menggunakan persediaan "pembelajaran pemindahan" biasa, melatih probe linear di atas tulang belakang yang telah dilatih tetap menggunakan anotasi manusia. Kami meneroka kesesuaian tulang belakang yang berbeza untuk tugasan ini dengan mengulangi percubaan dengan empat tulang belakang yang telah dilatih: ResNet dan ViT yang dilatih sama ada dalam cara yang diselia untuk pengelasan imej57 atau dengan cara yang diselia sendiri menggunakan DINO58.

Kami melatih empat model berbeza (pada keseluruhan set data) dan menguji prestasinya menggunakan bingkai daripada set data seimbang yang sama yang diterangkan di atas (82 video keadaan negatif, 82 video keadaan positif daripada (n = 29) individu, menjadikan 164 video secara keseluruhan).

Jadual 5 membentangkan keputusan pengelasan yang dianalisis setiap video, iaitu, kami mengatakan bahawa video dikelaskan dengan betul jika majoriti bingkainya dikelaskan dengan betul. Dapat dilihat bahawa model yang dilatih dengan tulang belakang DINO-ViT menunjukkan prestasi terbaik dengan ketepatan melebihi 89%. Jadual 6 membentangkan keputusan pengelasan yang dianalisis oleh bingkai. Seperti yang dijangkakan, dalam kes ini, langkah-langkah agak berkurangan berbanding analisis yang dilakukan pada pengagregatan bingkai yang menghasilkan ketepatan 85% untuk model yang dilatih dengan tulang belakang DINO-ViT.

memory enhancement

Perbincangan

The present study is the first to explore automated recognition of canine emotional states focusing on diverse facial expressions, whilst using a carefully designed controlled experimental setup for dataset creation and annotation. We present classifiers of two different types: deep learning-based and DogFACS-based, both having a performance that is comparable to and in some cases outperforms those presented in previous studies addressing recognition of pain or emotional state from facial expressions, including mice38,39 (> 89% and 93% respectively), cats43 (> 72%), horses42,46 (> 75% and 65% respectively) and sheep55 (> 64%).

The DogFACS-based approach described here reached an accuracy of > 71% using the full set (n =  39) of DogFACS variables, but a lower accuracy of > 66% when using only the eleven DogFACS variables which were utilized in the study of Bremhorst et al.22 ( this accuracy was achieved based on manual DogFACS annotations and is expected to drop even lower in an end-to-end pipeline). Of the full set of 39 DogFACS variables, 'Eyes Up' were of considerable importance for classification, and including them in the Decision Tree leads to higher accuracy (>71%). Walau bagaimanapun, apabila mentafsir pembolehubah arah seperti pergerakan mata dan kepentingannya sebagai penunjuk emosi yang berpotensi, set-up eksperimen kajian di mana data dikumpul mesti sentiasa dipertimbangkan. Dalam Bremhorst et al.22, penguji menyampaikan ganjaran makanan dengan gerakan sedikit di atas celak anjing. Ini mungkin telah menggalakkan anjing untuk melihat ke atas (mendorong pembolehubah 'Eyes Up') untuk menjangkakan makanan. Oleh itu, kita mesti menyedari bahawa pembolehubah DogFACS ini boleh menjadi artifak prosedur percubaan. Apabila memilih pembolehubah sebagai sebahagian daripada pembangunan penunjuk emosi, adalah penting untuk menimbang risiko ralat jenis I (positif palsu) berbanding ralat jenis II (negatif palsu) hampir tidak dapat dielakkan. Dalam bekerja dengan set sebelas pembolehubah DogFACS yang dikurangkan, kami mengutamakan mengelakkan negatif palsu daripada positif palsu agar tidak mengecualikan pembolehubah daripada penyiasatan lanjut secara pra-matang. Kita boleh menjangkakan bahawa pembolehubah yang diterima secara salah akan dikecualikan dalam kajian seterusnya jika kekurangan kesahan ramalannya dikenal pasti (seperti yang dibincangkan dalam19).

As a byproduct of these results, we obtained automated detectors for nine DogFACS variables, of which five performed with an accuracy >70%, menunjukkan kebolehlaksanaan pengecaman automatik yang tepat bagi pembolehubah DogFACS. Cabaran utama untuk pengesan latihan bagi setiap pembolehubah ialah ketersediaan data, iaitu kekerapan rendah kemunculan beberapa pembolehubah DogFACS, memerlukan usaha tertumpu untuk mengumpul set data bagi pembolehubah tertentu. Selain itu, sesetengah pembolehubah mempunyai dimensi temporal dan tidak boleh dikendalikan pada asas bingkai tunggal (cth, mata berkedip atau tercungap-cungap). Membangunkan pengesan untuk mereka memerlukan model yang juga menggunakan dinamik temporal, seperti pendekatan Broomé et al.42.

Perlu diingatkan lagi bahawa memandangkan set data kami terhad kepada satu baka, keperluan penyelidikan masa depan segera ialah penilaian kebolehgeneralisasian model kepada baka lain. Jika prestasi menurun dengan ketara apabila memindahkan keputusan kepada baka lain, pendekatan alternatif kepada pendekatan mendalam yang digunakan di sini ditunjukkan, contohnya, dalam Feighelstein et al.43.

improve your memory

Meneroka kebolehgeneralisasian model yang dibentangkan di sini adalah penting bukan sahaja dalam konteks pengesanan pembolehubah DogFACS tetapi juga untuk klasifikasi emosi. Set data yang digunakan di sini dikawal bukan sahaja untuk baka tetapi juga direkodkan dalam keadaan persekitaran yang dikawal ketat. Mengitlak daripada persekitaran terkawal kepada tetapan naturalistik merupakan cabaran yang amat sukar juga dalam pengkomputeran afektif manusia60. Feng et al.61 menyediakan kajian semula domain manusia tentang cara teknik pembelajaran pemindahan boleh mengatasi cabaran yang berkaitan dengan jumlah sampel data yang terhad, label yang terhad dan kebolehubahan persekitaran, mempromosikan sistem automatik yang teguh dan boleh digeneralisasikan untuk pengecaman emosi. Cara yang sama boleh diterokai dalam pengkomputeran afektif anjing; keputusan yang dibentangkan di sini menyediakan garis dasar untuk penerokaan selanjutnya arah ini.

Soalan seperti 'Bolehkah mesin mengenali keadaan emosi haiwan?' menarik dalam hak mereka sendiri dan mempunyai aplikasi praktikal yang meluas untuk kebajikan haiwan. Hasil kajian kami memberikan beberapa petunjuk untuk jawapan yang positif, sekurang-kurangnya dalam kes kekecewaan positif dan jangkaan pada anjing. Walau bagaimanapun, membina model AI yang mengiktiraf emosi anjing mempunyai nilai tambah yang ketara dalam membantu kita memahami cara mesin mengklasifikasikan emosi, sama ada ia sensitif terhadap nuansa yang tidak dapat dilihat oleh pakar manusia, dan apakah implikasinya terhadap pemahaman kita tentang emosi haiwan dan berterusan. perbahasan tentang perasaan haiwan. Atas sebab ini, adalah penting dan menjanjikan untuk meneroka kebolehjelasan (apakah rasional di sebalik keputusan mesin?), dan kebolehtafsiran (bagaimana struktur model berkaitan dengan membuat keputusan sedemikian?)62. Topik ini adalah asas dalam AI dan ditangani oleh badan penyelidikan yang besar63–65, dengan majoriti usaha memfokuskan pada pendekatan pembelajaran mendalam, yang kebolehtafsirannya dihadkan oleh struktur kompleksnya66. Kaedah kebolehjelasan adalah mengikut sifat domain khusus mereka: memberikan penjelasan untuk pengiktirafan ciri personaliti automatik dalam temu duga kerja adalah berbeza, contohnya, daripada menyediakan justifikasi klinikal untuk keputusan perubatan62.

increase brain power

Kajian kami adalah yang pertama menangani aspek kebolehjelasan model AI untuk pengecaman emosi haiwan. Semasa kami membandingkan dua pendekatan berbeza untuk klasifikasi emosi, terdapat nilai tambah daripada keupayaan untuk membandingkan juga perbezaan dalam aspek kebolehjelasan yang mereka hadapi. Pendekatan berasaskan DogFACS membawa kepada model dalam bentuk Pohon Keputusan mudah, yang memodelkan penaakulan logik manusia dalam bentuk gabungan keadaan Boolean mengenai kehadiran/ketiadaan pembolehubah DogFACS tertentu. Sifat penjelasan Pohon Keputusan terutama ditunjukkan dalam versi ringkasnya dengan hanya satu nod, seperti yang dikaji di sini (dengan 'Penyerap Telinga'). Pokok sedemikian berkait rapat dengan konsep yang berguna untuk pakar manusia, khususnya untuk penunjuk emosi yang dikaji oleh Bremhorst et al.19. Penunjuk emosi yang sah bertujuan untuk mengenal pasti dengan tepat keadaan emosi tertentu, hadir apabila emosi itu hadir, dan tidak hadir sebaliknya.

Ciri-ciri ini diterangkan oleh kepekaan dan kekhususan, metrik yang biasa digunakan untuk menilai ketepatan ujian diagnostik. Bremhorst et al.19 mendapati bahawa tiada pembolehubah DogFACS yang dipertimbangkan dalam kajian boleh dianggap sebagai penunjuk individu khusus untuk jangkaan positif atau kekecewaan pada anjing. Khususnya, 'Penyerap Telinga' ditunjukkan mempunyai kepekaan yang agak tinggi tetapi kekhususan yang rendah. Oleh itu, tidak menghairankan bahawa model yang diterangkan dalam kajian kami, yang merupakan Pokok Keputusan dengan 'Penata Telinga' sebagai satu ciri, tidak mencapai prestasi tinggi. Walau bagaimanapun, hubungan antara metrik penunjuk emosi seperti yang digunakan oleh Bremhorst et al.19, dan metrik yang digunakan di sini untuk menilai prestasi model kami adalah tidak mudah. Walaupun yang pertama mengira sensitiviti, kekhususan, dan nilai ramalan positif dan negatif untuk keseluruhan, data tidak seimbang, yang terakhir menilai prestasi dalam tugas ramalan. Ini bermakna data dibahagikan kepada dua bahagian: latihan, yang digunakan untuk melatih model dan ujian untuk penilaian prestasinya. Berbeza dengan Bremhorst et al.19, kami juga mengimbangi data menggunakan pensampelan terkurang. Walau bagaimanapun, hubungan intuitif antara kedua-duanya ialah jika penunjuk emosi yang sangat baik ditemui menggunakan pendekatan terdahulu, kita boleh menjangkakan bahawa Pokok Keputusan menggunakannya sebagai ciri juga akan mencapai prestasi yang cemerlang.

Selain kebolehjelasan, pendekatan pembelajaran mesin yang dibentangkan di sini untuk mencari model Pokok Keputusan yang optimum untuk meramalkan emosi anjing berpotensi membawa kepada cerapan baharu tentang penunjuk emosi. Seperti yang dibincangkan di atas, penemuan penunjuk emosi yang tepat dari segi Bremhorst et al.19 berkait rapat dengan masalah mencari pengelas Decision Tree dengan pembolehubah DogFACS tunggal untuk ramalan emosi. Walaupun pengelas sedemikian tidak ditunjukkan mempunyai ketepatan yang tinggi dalam kajian kami (dan sememangnya, tiada penunjuk emosi yang tepat ditemui dalam19), prestasi pengelasan boleh dipertingkatkan dengan mempertimbangkan bentuk Pohon Keputusan yang lebih canggih, contohnya dengan mengumpulkan pembolehubah DogFACS kepada pasangan. , tiga kali ganda, dsb. Eksperimen awal kami menggunakan pasangan pembolehubah DogFACS sebagai nod, ditunjukkan dalam Rajah 5, menunjukkan bahawa ini meningkatkan prestasi model dari segi penarikan balik. Yang penting, penyiasatan tentang gabungan pembolehubah DogFACS yang boleh meningkatkan klasifikasi boleh dibuat secara automatik, menyeluruh dan sistematik, yang berpotensi membawa kepada tanggapan yang lebih terperinci tentang penunjuk emosi. Ini menyediakan laluan yang menjanjikan untuk penyelidikan masa depan.

Pendekatan pembelajaran mendalam, sebaliknya, mencapai prestasi yang lebih tinggi dengan ketara melebihi 89%, menunjukkan potensi pendekatan sedemikian untuk klasifikasi emosi. Selain itu, tulang belakang DINO-ViT nampaknya paling sesuai untuk tugas pengelasan emosi daripada kesemua empat pilihan yang disiasat. Kami membuat hipotesis bahawa ini disebabkan oleh ciri DINO-ViT yang sensitif kepada bahagian objek, seperti yang ditunjukkan dalam67; dan disebabkan sifat tugas pengelasan emosi, memerlukan pemahaman pada peringkat bahagian objek (bahagian muka seperti mata, telinga, dsb.). Menariknya, tulang belakang yang telah dilatih dengan DINO menghasilkan hasil yang lebih baik daripada tulang belakang yang diselia.

Perlu diingat bahawa pengelas pembelajaran mendalam berfungsi berdasarkan imej, kemudian mengagregatkan hasil setiap video. Ini menunjukkan bahawa walaupun banyak bingkai tidak menunjukkan kehadiran pembolehubah DogFACS, model itu masih berjaya dalam pengelasan yang betul. Ini mungkin menunjukkan sensitiviti model kepada butiran halus pada tahap piksel yang mungkin melangkaui kemampuan mata manusia. Walau bagaimanapun, ia juga mungkin berkaitan dengan kemungkinan perangkap dalam bentuk beberapa kecenderungan yang wujud. Juga, pembolehubah 'Eyes Up', yang dibincangkan di atas, mungkin memainkan peranan penting untuk rangkaian, dan kesannya terhadap pembuatan keputusan tidak mudah dinetralkan dalam rangkaian pembelajaran mendalam. Menyiasat isu ini memerlukan pengumpulan data selanjutnya dalam keadaan eksperimen dan persekitaran yang berbeza untuk menolak perangkap tersebut.

Kebolehjelasan pendekatan pembelajaran mendalam yang dipertimbangkan di sini adalah, sebaliknya, mempunyai sifat visual yang berbeza sama sekali berbanding dengan yang berdasarkan DogFACS. Tidak seperti model Decision Tree, adalah amat mencabar untuk menerangkan pembuatan keputusan rangkaian saraf dalam istilah yang boleh difahami manusia, kerana sifat 'kotak hitam'nya yang sangat kompleks68. Menggunakan kaedah EigenCAM59 menyerlahkan perbezaan antara model berbeza yang kami uji (ResNet/ViT, diselia/DINO). Seperti yang ditunjukkan dalam Rajah 6, terdapat beberapa perbezaan antara model. Model Te ViT nampaknya mempamerkan penyetempatan yang lebih baik daripada model ResNet, kerana kawasan yang sangat diaktifkan (ditandakan dengan merah) adalah lebih kecil dan terletak pada kawasan yang lebih menonjol (contohnya mata, telinga, hidung dan bukannya kulit). Selain itu, model DINO-ViT nampaknya diaktifkan pada berbilang kawasan yang menonjol dan bukannya satu (cth mengaktifkan pada telinga, mata dan hidung dan bukannya telinga pada contoh kanan atas). Kami mengaitkan kejayaan model berasaskan ViT kepada keupayaan ViT untuk memberikan isyarat yang lebih setempat daripada model ResNet. Ini berpunca daripada seni bina mereka—peleraian ciri ViT kekal malar di seluruh lapisan, manakala resolusi ciri CNN berkurangan apabila lapisan menjadi lebih dalam.

Walaupun mencapai kesimpulan muktamad memerlukan penyelidikan lanjut, kami bereksperimen dengan kaedah EigenCAM yang memfokuskan perhatian kami pada bingkai yang memenuhi syarat berikut: (i) dikodkan secara manual dengan pembolehubah 'Ears Flattener', dan (ii) tergolong dalam kelas sampel video bagi keadaan negatif, dan (iii) diklasifikasikan dengan betul oleh rangkaian DINO-ViT sebagai keadaan negatif. Dalam analisis kami, kami membahagikan contoh kepada tiga kategori, seperti yang ditunjukkan dalam Rajah 7. Contoh kategori A ialah peta haba dengan fokus yang jelas pada telinga sahaja. Ini boleh dilihat sebagai konsisten dengan penjelasan 'Penata Telinga' yang berkaitan dengan DogFACS, iaitu, mungkin model tersebut mempelajari corak yang berkaitan dengan pergerakan telinga. Kategori B juga selaras dengan ini, menunjukkan peta haba memfokuskan pada kedua-dua telinga dan kawasan lain, seperti mata, dahi, hidung dan mulut. Yang terakhir ini juga mungkin secara tidak langsung berkaitan dengan pergerakan 'Penipis Telinga', serta pembolehubah DogFACS lain atau beberapa ciri postur lain yang mungkin terdapat dalam bingkai. Walau bagaimanapun, kategori yang paling menarik ialah kategori C: di sini model mengambil isyarat daripada bahagian muka selain telinga, masih membuat klasifikasi yang betul. Kes-kes ini mungkin memegang kunci untuk memahami sensitiviti rangkaian kepada nuansa yang tidak dapat dilihat oleh mata manusia. Walau apa pun, perlu diingatkan bahawa anotasi DogFACS tidak boleh meliputi semua kemungkinan perubahan dalam tingkah laku muka, yang mungkin ditunjukkan dalam corak piksel yang sensitif kepada rangkaian. Kami kemudian juga mengekstrak peta haba daripada video yang tidak mempunyai pembolehubah DogFACS beranotasi. Terdapat sembilan video tanpa pembolehubah, lapan daripadanya 'positif' dan satu—'negatif'. Secara mengejutkan, majoriti video ini (77%) masih diklasifikasikan dengan betul oleh model. Ini mungkin satu lagi petunjuk model yang melihat tingkah laku muka halus yang tidak ditangkap oleh DogFACS. Apabila memeriksa peta haba yang dihasilkan untuk bingkai video ini, kami mendapati bahawa kawasan hidung-mulut adalah tumpuan utama untuk model. Beberapa bingkai lain menunjukkan fokus pada bahagian muka yang lain, manakala terdapat kes bingkai yang dikelaskan dengan betul tetapi peta haba kabur dan tidak jelas. Contoh daripada ketiga-tiga kategori ini ditunjukkan dalam Rajah 8. Menariknya, peta haba ini kurang fokus pada bahagian muka tertentu, menunjukkan bahawa sememangnya dalam kes ini isyarat visual kurang jelas untuk model.

increase memory power

improve short term memory

Satu lagi isu penting yang berkaitan dengan kedua-dua pendekatan berkenaan prestasi ialah panjang pendek video (3 s) dalam set data semasa. Menggunakan video yang lebih panjang membawa kepada cabaran untuk mengenal pasti tetingkap masa optimum semasa keadaan dalaman boleh dianggap sebagai malar. Masalah ini telah dipertimbangkan dalam69 dalam konteks kesakitan ortopedik gred rendah pada kuda dan merupakan hala tuju penting untuk penyelidikan masa depan juga untuk keadaan emosi anjing.

Untuk meringkaskan, kajian ini menunjukkan nilai dua pendekatan pengelasan automatik yang berbeza untuk dua keadaan emosi dalam anjing berdasarkan ekspresi muka mereka: keadaan positif vs negatif. Kedua-duanya mencapai ketepatan yang baik setanding dengan kaedah tercanggih lain dalam pengiktirafan automatik kesan haiwan. Keputusan ini bukan sahaja memberikan buat pertama kalinya jawapan afirmatif kepada soalan 'Bolehkah mesin mengenali emosi anjing positif/negatif?', tetapi juga membuka laluan penyelidikan baharu untuk meneroka cara mesin mengenalinya, dan cara membuat pengiktirafan ini dapat dijelaskan kepada manusia. . Percubaan lanjut dengan set data yang lebih besar dengan ciri peserta yang lebih luas juga akan menggalakkan pemahaman kita tentang cara membangunkan penunjuk emosi haiwan yang baik. Satu hala tuju khusus yang kelihatan sangat menjanjikan ialah meneroka potensi pendekatan yang berkaitan dengan pengesanan mercu tanda muka, seperti OpenFace70 dan Google MediaPipe71. Pendekatan yang sama baru mula diterokai untuk haiwan bukan manusia, lihat, contohnya kajian Feighelstein et al.43 pada muka kucing. Seperti dalam domain manusia, pembangunan mereka akan memerlukan usaha pelbagai disiplin yang luas untuk pengumpulan set data yang besar untuk pelbagai spesies.

Kaedah

Set data.

Dataset yang berkaitan dengan anjing yang digunakan untuk kajian ini telah dikumpul sebelum ini di bawah kelulusan etika Universiti Lincoln berikut, (UID: CoSREC252) seperti di Bremhorst et al.22 dengan pindaan kepada penyelidikan ini diperoleh daripada Universiti Lincoln untuk menggunakan set data asal dalam kajian ini. Protokol semasa yang menggunakan data ini telah disemak oleh Jawatankuasa Etika Universiti Haifa dan tiada kelulusan lanjut diperlukan.

Pemotongan dan prapemprosesan.

Langkah ini adalah relevan untuk kedua-dua DogFACS dan pendekatan mendalam. Bingkai video asal mengandungi kekacauan latar belakang termasuk bilik sekeliling, manusia, badan anjing, dsb. Kami menyasarkan untuk menumpukan pada ekspresi muka anjing dan mengelakkan mempelajari peramal keadaan emosi yang lain (cth postur badan anjing). Oleh itu, kami melatih Mask-RCNN72 untuk mengenal pasti wajah taring dan menggunakannya untuk memangkas kotak sempadan muka daripada setiap imej. Kami melatih Mask-RCNN pada kira-kira 200 imej beranotasi daripada set data ini, menjadikannya paling sesuai untuk persediaan percubaan khusus ini. Contoh tanaman muka yang diperoleh menggunakan peringkat pra-pemprosesan boleh dilihat dalam Rajah 2.

Pendekatan berasaskan DogFacs.

Daripada video kepada pembolehubah DogFACS. Saluran paip penuh diterangkan dalam rajah berikut lihat Rajah 9. Ia termasuk langkah-langkah berikut:

• Memotong muka anjing keluar dari bingkai menggunakan kaedah yang diterangkan di atas.

• Membina set data pembolehubah DogFACS Menggunakan pengekodan DogFACS manual Bremhorst et al.22, untuk setiap pembolehubah DogFACS, kami mencipta dua folder dengan contoh positif dan negatif (muka anjing sama ada menyatakan atau tidak menyatakan pembolehubah DogFACS ini). Untuk sampel positif (pembolehubah hadir), kami memilih imej semua bingkai yang dikodkan secara manual dengan pembolehubah ini. Untuk sampel negatif, kami memilih bingkai dalam video yang tidak mempunyai pembolehubah ditandakan pada pengekodannya sehingga penampilan pertama pembolehubah itu (atau sehingga penghujung video jika tidak hadir). Set data kemudiannya seimbang, meninggalkan bilangan imej yang sama untuk contoh positif dan negatif bagi setiap pembolehubah. Jadual 4 menunjukkan saiz set data untuk semua pembolehubah DogFACS yang pengesannya diperolehi.

Daripada pembolehubah DogFACS kepada klasifikasi keadaan emosi. Kami menggunakan pembelajaran pemindahan berdasarkan seni bina rangkaian ResNet50 pra-latihan yang dimulakan dengan pemberat Imagenet. Kami menggantikan lapisan atasnya dengan lapisan kumpulan purata, lapisan keciciran 2{15}} peratus dan lapisan pengelas dua kelas. Model ini dilatih selama 2{17}} zaman menggunakan pengoptimum Adam dengan kadar pembelajaran 0.0001. Model yang mencapai ketepatan maksimum pada set data pengesahan telah dipilih sebagai model terbaik. Semasa 10 zaman pertama, berat semua lapisan telah diperhalusi. Semasa 10 zaman pertama, berat semua lapisan telah diperhalusi. Semasa tempoh yang tinggal, pemberat ResNet50 dibekukan dan hanya pemberat lapisan atas baharu dikemas kini. Untuk pembolehubah tidak berkaitan orientasi ('Perata Telinga', 'Bahagian Bibir', 'Penambah Telinga', 'Telinga Ke Hadapan' dan 'Jilat Hidung') kami menggunakan teknik pembesaran berdasarkan fip mendatar imej rawak dan putaran sehingga 20 darjah. Sebagai input untuk pengekod, kami menggunakan jadual input, di mana setiap baris mewakili kehadiran (1)/ketiadaan (0) setiap satu daripada 11 pembolehubah DogFACS pada setiap video. Sasaran pengekod ialah jadual yang mengandungi keadaan (negatif(0)/positif(1)) bagi setiap video.

supplements to boost memory

Pendekatan yang mendalam.

Sehingga baru-baru ini rangkaian neural convolutional (CNN) dianggap canggih dalam tugas penglihatan komputer. Baru-baru ini seni bina Vision Transformer (ViT)57 muncul sebagai alternatif73. Kaedah DINO untuk latihan hanya diperkenalkan pada tahun 2021 sebagai rangka pembelajaran penyulingan kendiri. Melatih beberapa tulang belakang DNN (ResNet50, visit-small, vit-base, dll) dalam konfigurasi ini menunjukkan bahawa tulang belakang ViT yang dilatih dengan pendekatan DINO mengatasi prestasi klasifikasi sebelumnya pada dataset standard ImageNet74.

Kami menggunakan seni bina ResNet50 untuk tulang belakang yang diselia dan dilatih DINO; ViT-S/16 dilatih dengan cara yang diawasi dan ViT-S/8 dilatih dengan DINO. Kami menggunakan pemberat ViT yang telah dilatih daripada Perpustakaan Timm75. Kami melatih keempat-empat model untuk 30 zaman menggunakan Adam optimizer76 dengan beta=(0, 0.999) dan kadar pembelajaran: 10−4 untuk tulang belakang ResNet dan 5 · 10−6 untuk tulang belakang ViT. Keluk kehilangan model terlatih ditunjukkan dalam Rajah 10.

Visualisasi peta.

Kami memilih kaedah Eigen-CAM59 untuk menggambarkan komponen utama pengaktifan akhir bagi setiap model. Telah ditunjukkan bahawa Eigen-CAM memberikan hasil yang lebih mudah ditafsirkan dengan kurang pengiraan berbanding kaedah CAM lain seperti Grad-CAM77 yang popular. Selain itu, tidak seperti kaedah visualisasi lain seperti Grad-CAM59 dan Grad-CAM++78, Eigen-CAM ialah alat bebas kelas. Sifat ini membolehkan Eigen-CAM memvisualisasikan corak yang dipelajari walaupun ramalan model adalah salah, berbanding kaedah CAM lama yang menghasilkan peta yang tidak berkaitan apabila ramalannya tidak betul. Sifat EigenCAM ini membolehkan mentafsir sebab kegagalan ramalan. Ia lebih konsisten dan diskriminatif kelas berbanding kaedah visualisasi terkini yang lain. Selain itu, EigenCAM bukan model khusus—ia boleh digunakan untuk kedua-dua ViT dan CNN tanpa menukar lapisan.

Ketersediaan data

Set data yang digunakan dalam kertas ini tersedia atas permintaan daripada pengarang yang berkaitan.


Rujukan

Darwin, C. Te Expression of Emotions in Animals and Man Vol. 11, 1872 (Murray, 1872).

2. Ekman, P. & Friesen, WV Mengukur pergerakan muka. alam sekitar. Psikol. Tingkah laku bukan lisan. 1, 56–75 (1976).

3. Ekman, P. & Keltner, D. Ekspresi muka universal emosi. Dalam Komunikasi Bukan Lisan: Di mana alam bertemu dengan budaya (eds Segerstrale UP & Molnar, P.) vol. 27, 46 (1997).

4. Russell, JA, Bachorowski, J.-A. & Fernández-Dols, J.-M. Ekspresi muka dan vokal emosi. Ann. Psikol Rev. 54, 329–349 (2003).

5. Diogo, R., Abdala, V., Lonergan, N. & Wood, B. Dari fsh kepada manusia moden-anatomi perbandingan, homologi, dan evolusi otot kepala dan leher. J. Anat. 213, 391–424 (2008).

6. Descovich, KA et al. Ekspresi Wajah: Alat yang Kurang Digunakan untuk Penilaian Kebajikan dalam Mamalia (Altex, 2017).

7. Mota-Rojas, D. et al. Kemajuan semasa dalam penilaian emosi anjing, ekspresi muka, dan penggunaannya untuk pengiktirafan klinikal kesakitan. Haiwan 11, 3334 (2021).

8. Ekman, P. & Friesen, Sistem Pengekodan Tindakan Muka WV: Manual (Consulting Psychologists Press, 1978).

9. Ekman, P. & Friesen, W. Sistem pengekodan tindakan muka: satu teknik untuk pengukuran pergerakan muka (1978).


For more information:1950477648nn@gmail.com




Anda mungkin juga berminat