Tự động nhận biết các trạng thái cảm xúc từ nét mặt của chó có thể giải thích được: Trường hợp dự đoán tích cực và thất vọng

Aug 11, 2023

Sử dụng trình tối ưu hóa Adam với tốc độ học tập là {{0}}.0001. Mô hình đạt được độ chính xác tối đa trên tập dữ liệu xác thực được chọn là mô hình tốt nhất. Trong 10 kỷ nguyên đầu tiên, trọng số của tất cả các lớp đã được tinh chỉnh. Trong 10 kỷ nguyên đầu tiên, trọng lượng của tất cả các lớp đã được tinh chỉnh. Trong các thời kỳ còn lại, trọng số ResNet50 bị cố định và chỉ có trọng số của các lớp trên cùng mới được cập nhật. Đối với các biến không liên quan đến định hướng ('Ears Flattener', 'Lips Part', 'Ears Adductor', 'Ears Forward' và 'Nose Lick'), chúng tôi đã áp dụng kỹ thuật tăng cường dựa trên fip ngang hình ảnh ngẫu nhiên và xoay lên đến 20 độ. Để làm đầu vào cho bộ mã hóa, chúng tôi đã sử dụng một bảng đầu vào, trong đó mỗi hàng biểu thị sự hiện diện (1)/vắng mặt (0) của từng biến trong số 11 biến DogFACS trên mỗi video. Mục tiêu của bộ mã hóa là một bảng chứa điều kiện (âm (0)/dương (1)) của mỗi video.

ResNet50 là kiến ​​trúc mạng thần kinh sâu đã trở thành một trong những mạng cổ điển trong lĩnh vực thị giác máy tính. Mạng ResNet50 được đặc trưng bởi bộ nhớ rất mạnh và khả năng ghi nhớ kiến ​​thức đã học trước đó trong quá trình đào tạo, giúp mạng thực hiện tốt các tác vụ nhận dạng hình ảnh phức tạp.

ResNet50 đạt được bộ nhớ như thế nào? Nó áp dụng phương pháp kết nối dư và thêm kết nối phím tắt giữa các lớp trong mỗi lớp tích chập, điều này có thể giúp luồng thông tin trong mạng tốt hơn. Trong quá trình huấn luyện, do có sự tồn tại của các kết nối phím tắt này nên mạng có thể học các ánh xạ còn lại dễ dàng hơn và không cần mất quá nhiều thời gian để tìm các ánh xạ còn lại này.

Loại hiệu suất bộ nhớ này giúp ResNet50 hoạt động tốt trong các tác vụ nhận dạng hình ảnh quy mô lớn. Đối với các vấn đề như phân loại hình ảnh, phát hiện mục tiêu, nhận dạng khuôn mặt, ResNet50 đã đạt được kết quả rất tốt. Hiệu suất bộ nhớ này tương tự như bộ não của chúng ta, nó cũng kết nối các tế bào thần kinh để tăng cường trí nhớ. Vì vậy có thể nói ResNet50 là một mô hình mạng nơ-ron sâu rất tốt, có bộ nhớ mạnh và có thể xử lý tốt các tác vụ nhận dạng hình ảnh phức tạp. Đồng thời, nó cũng mang đến cho chúng ta nguồn cảm hứng nào đó. Chúng ta có thể học hỏi từ những ý tưởng của ResNet50 để thiết kế một mô hình mạng lưới thần kinh sâu hiệu quả hơn, nhằm phục vụ tốt hơn nhu cầu của con người. Có thể thấy rằng chúng ta cần phải cải thiện trí nhớ của mình. Cistanche có thể cải thiện trí nhớ vì Cistanche là dược liệu cổ truyền của Trung Quốc với nhiều tác dụng độc đáo, một trong số đó là cải thiện trí nhớ. Hiệu quả của thịt băm đến từ nhiều hoạt chất có trong nó, bao gồm axit cacboxylic, polysacarit, flavonoid, v.v. Những thành phần này có thể tăng cường sức khỏe não bộ thông qua nhiều kênh khác nhau.

increase memory

Bấm vào các cách để cải thiện chức năng não

Trong nghiên cứu động vật, việc tự động hóa nhận dạng trạng thái cảm xúc cho đến nay chủ yếu giải quyết được cơn đau ở một số loài. Các trạng thái cảm xúc vẫn chưa được khám phá, đặc biệt là ở chó, do sự phức tạp của hình thái và biểu cảm khuôn mặt của chúng. Nghiên cứu này góp phần lấp đầy khoảng trống ở hai khía cạnh. Đầu tiên, đây là lần đầu tiên giải quyết các trạng thái cảm xúc của chó bằng cách sử dụng tập dữ liệu thu được trong bối cảnh thử nghiệm được kiểm soát, bao gồm các video từ (n=29) Labrador Retrievers được cho là ở hai trạng thái cảm xúc do thử nghiệm gây ra: tiêu cực (thất vọng) và tích cực (dự đoán). Biểu cảm khuôn mặt của những chú chó được đo bằng Hệ thống mã hóa hành động trên khuôn mặt của chó (DogFACS).

Hai cách tiếp cận khác nhau được so sánh nhằm mục đích loại bỏ: (1) cách tiếp cận dựa trên DogFACS với quy trình hai bước bao gồm (i) trình phát hiện biến DogFACS và (ii) trình phân loại Cây quyết định trạng thái dương/âm; (2) Một cách tiếp cận sử dụng các kỹ thuật học sâu không có biểu diễn trung gian. Các phương pháp tiếp cận này đạt độ chính xác lần lượt trên 71% và 89%, trong đó phương pháp học sâu hoạt động tốt hơn. Thứ hai, nghiên cứu này cũng là nghiên cứu đầu tiên nghiên cứu khả năng giải thích của các mô hình AI trong bối cảnh cảm xúc ở động vật. Cách tiếp cận dựa trên DogFACS cung cấp cây quyết định, là một biểu diễn toán học phản ánh những phát hiện trước đây của các chuyên gia về con người về các biểu hiện khuôn mặt nhất định (các biến DogFACS) có tương quan với các trạng thái cảm xúc cụ thể. Phương pháp học sâu cung cấp một dạng giải thích trực quan, khác biệt dưới dạng bản đồ nhiệt phản ánh các vùng trọng tâm chú ý của mạng, trong một số trường hợp cho thấy trọng tâm liên quan đến bản chất của các biến DogFACS cụ thể. Những bản đồ nhiệt này có thể nắm giữ chìa khóa cho những hiểu biết mới về độ nhạy của mạng đối với các mẫu pixel có sắc thái phản ánh thông tin mà mắt người không nhìn thấy được.

Charles Darwin đã mô tả một cách nổi tiếng việc sử dụng nét mặt để thể hiện trạng thái cảm xúc ở con người và các loài không phải con người khác nhau (sau đây gọi là động vật) trong tác phẩm nổi tiếng 'Biểu hiện cảm xúc ở con người và động vật'1. Ngày nay người ta thừa nhận rộng rãi rằng nét mặt là nguồn thông tin quan trọng để nhận biết trạng thái cảm xúc. Ở người, nét mặt đóng vai trò như một phương tiện phi ngôn ngữ chính điều chỉnh các tương tác2 và mối liên hệ giữa nét mặt và trạng thái cảm xúc đã được thiết lập từ lâu bởi các nghiên cứu có hệ thống về tâm lý học3,4. Ở động vật, hầu hết các loài động vật có vú đều tạo ra nét mặt5, và cũng như ở người, chúng được cho là truyền tải thông tin về trạng thái cảm xúc6,7. Do đó, nét mặt ngày càng được nghiên cứu như những chỉ số tiềm năng về trạng thái chủ quan trong nghiên cứu về cảm xúc và phúc lợi động vật.

Tiêu chuẩn vàng để đánh giá khách quan những thay đổi trong nét mặt trong nghiên cứu cảm xúc của con người là Hệ thống mã hóa hành động trên khuôn mặt—FACS8,9. FACS gần đây đã được điều chỉnh cho phù hợp với các loài không phải con người khác nhau, bao gồm một số loài linh trưởng không phải con người (ví dụ đười ươi10, tinh tinh11, khỉ đuôi dài12,13), marmosets14, chó15 và mèo16. Những hệ thống này được gọi là AnimalFACS, cũng như ở người, ngày càng được sử dụng nhiều để nghiên cứu các trạng thái cảm xúc của động vật (ví dụ17–19).

Một thách thức lớn trong việc xác định các biểu hiện khuôn mặt tiêu chuẩn ở chó liên quan đến sự đa dạng về hình thái của đầu20,21 và các cấu trúc da bên trên, chẳng hạn như sự xuất hiện các nếp nhăn vĩnh viễn ở một số giống. Để xác định các biểu hiện cảm xúc trên khuôn mặt ở chó, Caeiro và cộng sự18 đã áp dụng DogFACS để đánh giá phản ứng tự phát của các cá thể thuộc các giống khác nhau và hòa trộn trong môi trường cảm xúc tự nhiên bằng cách sử dụng video trực tuyến. Cảm xúc có giá trị tích cực và tiêu cực đã được nghiên cứu, bao gồm dự đoán về phần thưởng (cảm xúc có giá trị tích cực) và sự thất vọng (cảm xúc có giá trị tiêu cực), cả hai đều được đặc trưng bởi sự mong đợi về một kích thích mong muốn16. Dự đoán tích cực được định nghĩa là được tạo ra trong các tình huống liên quan đến "[v]hình ảnh hóa thức ăn hoặc nghe thấy (các) từ liên quan đến bữa ăn/thức ăn; [v]hình dung ra dây xích, nghe (các) từ liên quan đến bước đi" và sự thất vọng được định nghĩa là được gây ra bởi "[v]việc hiện thực hóa một nguồn tài nguyên mong muốn (đồ chơi, thực phẩm, không gian) hiện không thể tiếp cận được"18. Trong khi Caeiro và cộng sự18 phát hiện ra rằng chó thể hiện những biểu cảm khuôn mặt khác nhau đáng kể trong việc phân biệt các trạng thái cảm xúc nhất định, không có đặc điểm phân biệt nào được xác định trong bối cảnh thất vọng. Theo đó, Bremhorst và cộng sự22 đã nghiên cứu những biểu hiện trên khuôn mặt của những con chó với sự mong đợi tích cực và thất vọng trong môi trường thử nghiệm có kiểm soát, không giống như của Caeiro và cộng sự18, tiêu chuẩn hóa cả giống chó (Labrador Retriever). Hơn nữa, các tác giả đã sử dụng bối cảnh phi xã hội để loại bỏ nguy cơ bị can thiệp từ các phản ứng thu hút sự chú ý đã học trước đó. Để gợi ra bằng thực nghiệm cả hai trạng thái cảm xúc đã được nghiên cứu, phần thưởng thực phẩm có giá trị cao được sử dụng làm tác nhân kích thích trong hai điều kiện: điều kiện tích cực được dự đoán sẽ gây ra dự đoán tích cực (thông qua kỳ vọng về thực phẩm có điều kiện) và điều kiện tiêu cực sẽ gây ra sự thất vọng (tức là thông qua ngăn cản việc tiếp cận phần thưởng thực phẩm dự kiến). Biểu cảm khuôn mặt của chó ở hai trạng thái này được đo bằng DogFACS. Các tác giả nhận thấy rằng biến "Ears Adductor" phổ biến hơn ở điều kiện tích cực, trong khi các biến "Chớp mắt", "Phần môi", "Hài lòng", "Liếm mũi" và "Ears Flattener" phổ biến hơn ở điều kiện tiêu cực. điều kiện22. Trong một nghiên cứu tiếp theo, Bremhorst và cộng sự19 đã thử nghiệm một nhóm chó mới bằng cách sử dụng một thiết lập tương tự. Tuy nhiên, trong nghiên cứu này, hai loại phần thưởng khác nhau đã được sử dụng (thức ăn và đồ chơi) để kiểm tra tính khái quát của những phát hiện trước đó của họ đối với nhiều bối cảnh hơn19.

Các kết quả trước đó đã được lặp lại19, với bốn biến số khác phổ biến hơn trong điều kiện tiêu cực: "Tai hướng xuống", "Kéo góc môi", "Thở lưỡi" và "Nâng môi trên". Tất cả các biểu hiện trên khuôn mặt được xác định ngoại trừ "Kẻ nâng môi trên" đều độc lập với loại phần thưởng mà những chú chó mong đợi nhận được19. Hơn nữa, các biện pháp cơ bản về độ chính xác của chẩn đoán đã được đánh giá đối với các biểu hiện trên khuôn mặt được xác định là các chỉ số cảm xúc tiềm ẩn, bao gồm độ nhạy, độ đặc hiệu và giá trị tiên đoán dương và âm19. Kết quả chỉ ra rằng không có biểu cảm khuôn mặt nào trong số này có thể cung cấp sự phân loại chính xác nhất quán về cảm xúc liên quan nếu được sử dụng riêng lẻ làm chỉ báo cảm xúc riêng lẻ19. Điều này không làm giảm giá trị tiềm năng của chúng dưới dạng tín hiệu nhưng có lẽ nhấn mạnh đến quá trình xử lý tổng thể thông thường của các cấu hình khuôn mặt23, thay vì tập trung vào các yếu tố đơn lẻ bên trong nó.

Sự hiện diện của khán giả trong bối cảnh cảm xúc là một yếu tố quan trọng cần được xem xét khi nghiên cứu các biểu hiện trên khuôn mặt (cảm xúc) ở chó, như được chỉ ra trong một nghiên cứu gần đây của Pedretti et al.24. Tương tự như19,22, các tác giả cũng cho chó thấy những dự đoán tích cực cũng như sự thất vọng phi xã hội và phi xã hội, từ đó gợi lên các buổi kiểm tra. Họ cũng sử dụng DogFACS để phân tích nét mặt của chó trong những tình huống này, ngoài các hành vi khác như vẫy đuôi và đo nồng độ cortisol trong nước bọt trước và sau thử nghiệm. Họ phát hiện ra rằng hiện tượng "Tai hướng về phía trước" xảy ra nhiều hơn ở điều kiện tích cực so với điều kiện tiêu cực. Hơn nữa, biến số này bị ảnh hưởng tích cực bởi sự hiện diện của khán giả và có mối tương quan nghịch với nồng độ cortisol trước khi thử nghiệm, cho thấy đây có thể là một chỉ báo tốt về mức độ chú ý của chó. "Ears Flattener", "Chớp mắt", "Liếm mũi", "Vẫy đuôi" và "Rên rỉ" (hai từ sau không có trong các biến DogFACS) cũng có liên quan đến sự hiện diện của khán giả nhưng không tương quan với nồng độ cortisol, cho thấy một thành phần giao tiếp của những hành vi này.

improve your memory

Điều này cho thấy DogFACS cũng có thể dùng để điều tra các biểu hiện trên khuôn mặt của chó không chỉ dưới dạng tín hiệu (tức là tạo ra những thay đổi hành vi đi kèm với trạng thái cảm xúc) mà còn là tín hiệu (tức là các hành vi được tạo ra đặc biệt để truyền đạt cảm xúc cho đối tác giao tiếp), xem thêm 25. Do đó, hệ thống AnimalFACS cung cấp một phương tiện quan trọng để thúc đẩy sự hiểu biết về nét mặt của động vật. Tuy nhiên, việc sử dụng các hệ thống này để phân tích biểu hiện khuôn mặt có những thách thức, bao gồm cả sự phụ thuộc vào chú thích thủ công đòi hỏi phải đào tạo và chứng nhận con người rộng rãi, việc thực hiện này có thể tốn thời gian và có thể dễ xảy ra lỗi hoặc sai lệch của con người26.

Tự động hóa có tiềm năng cung cấp một tiến bộ bổ sung quan trọng cho quá trình này. Đặc biệt, người ta lập luận rằng các công cụ tự động có tính khách quan và độ tin cậy cao hơn mã hóa thủ công, loại bỏ tính chủ quan và sai lệch27,28, nhưng chúng cũng không phụ thuộc vào việc phát hiện tính năng đơn lẻ để thành công. Do đó, không có gì đáng ngạc nhiên khi mã hóa biểu cảm khuôn mặt tự động là một lĩnh vực sôi động trong nghiên cứu cảm xúc con người, với nhiều công cụ phần mềm thương mại có sẵn, chẳng hạn như FaceReader của Noldus29, Afdex30, EmoVu31, cũng như các cơ sở dữ liệu mở rộng như CAS(ME)332.

Mặt khác, ở động vật, việc tự động hóa phân tích nét mặt vẫn chưa được nghiên cứu. Điều này là do một số thách thức (như được thảo luận bởi 33,34), bao gồm cả sự tăng trưởng tương đối gần đây hoặc sự quan tâm đến nghiên cứu cảm xúc động vật, có nghĩa là có ít dữ liệu hơn nhiều so với lượng dữ liệu khổng lồ trong lĩnh vực con người. Thứ hai, đặc biệt là ở các loài đã được thuần hóa, sự khác biệt lớn về hình thái khuôn mặt đặt ra những thách thức về mặt kỹ thuật35. Cuối cùng, việc thiếu tự báo cáo bằng lời nói khiến việc thiết lập sự thật cơ bản về trạng thái cảm xúc trải qua ở động vật trở nên khó khăn, trong khi ở người, việc tự báo cáo là một cách tiếp cận tiêu chuẩn cho mục đích này. Do đó, các quy trình thu thập dữ liệu đối với động vật đòi hỏi phải có sự kiểm soát và điều chỉnh rộng rãi, các định nghĩa mang tính vận hành về các trạng thái cảm xúc được nghiên cứu (xem ví dụ18) hoặc có thể là sự đánh giá của các chuyên gia về con người—mặc dù điều này có khả năng gây ra sự thiên vị và đánh giá chủ quan.

Broomé và cộng sự36 đã cung cấp một cuộc khảo sát toàn diện gồm 20 nghiên cứu trình bày các phương pháp tiếp cận tiên tiến để tự động nhận biết cảm xúc và nỗi đau ở động vật. Phần lớn các công trình này tập trung vào sự xuất hiện của cơn đau. Các loài đã được đề cập trong bối cảnh này bao gồm loài gặm nhấm37–39, cừu40, ngựa33,41,42 và mèo43. Tất cả những công việc này đều cung cấp một bộ phân loại nhị phân cho mức độ đau/không đau bằng cách sử dụng kỹ thuật học máy.

Công việc tự động hóa rộng rãi hơn khả năng nhận dạng cảm xúc của động vật còn khan hiếm hơn nhiều. Hai nghiên cứu ở các loài linh trưởng không phải con người tập trung vào Đơn vị hành động/nhận dạng biểu cảm khuôn mặt có liên quan mà không đề cập rõ ràng đến các trạng thái cảm xúc44,45. Blumrosen và cộng sự.44 tự động nhận dạng bốn biểu hiện trên khuôn mặt của các loài linh trưởng không phải con người: bình thường, chép môi, nhai và mở miệng ngẫu nhiên với nỗ lực chú thích tối thiểu, trong khi Morozov và cộng sự.45 triển khai một hệ thống nguyên mẫu để mã hóa MaqFACS tự động cho khỉ Rhesus , được đào tạo để phân loại sáu biến MacFACS.

Chỉ có ba công trình cung cấp sự phân loại từ đầu đến cuối cho các trạng thái cảm xúc khác nhau được khảo sát trong Broomé và cộng sự36. Corujo và cộng sự46 đã xác định bốn trạng thái cảm xúc cho ngựa: "báo động", "khó chịu", "tò mò" và "thư giãn", xác định từng trạng thái đó về hành vi mắt, tai, mũi và cổ. Ví dụ, "thư giãn" được định nghĩa là mắt: nhắm một phần đến gần như nhắm, tai: thư giãn, mở hướng sang hai bên, mũi: thư giãn miệng và cổ: gần như song song. Một mô hình mạng lưới thần kinh tích chập (CNN) đã được đào tạo để dự đoán bốn "loại" cảm xúc này. Ferres và cộng sự47 đã sử dụng ước tính tư thế tự động bằng DeepLabCut48 để phân loại bốn loại cảm xúc "tức giận", "sợ hãi", "hạnh phúc" và "thư giãn" cho chó. Franzoni và cộng sự49 cũng sử dụng mô hình CNN để phân loại các thuộc tính hạn chế liên quan đến trạng thái cảm xúc: "nụ cười" (liên quan đến "niềm vui"), "gầm gừ" (liên quan đến "tức giận") và "ngủ" (liên quan đến thái độ trung lập). tình trạng).

Trong số ba tác phẩm liên quan đến chó47,49,50, hai tác phẩm tập trung vào cơ thể để nhận biết các trạng thái cảm xúc47 và nỗi đau50, và một tác phẩm tập trung vào biểu hiện cảm xúc trên khuôn mặt49. Tuy nhiên, các bộ dữ liệu được sử dụng trong nghiên cứu của Ferres và cộng sự.47 và Franzoni và cộng sự.49 đều chứa hình ảnh được thu thập từ internet và được chú thích bởi những người không phải chuyên gia và do đó có khả năng có độ tin cậy và giá trị thấp. Công việc của Zhu50 nghiên cứu khả năng nhận biết cơn đau dựa trên ngôn ngữ cơ thể chứ không phải nét mặt.

Nghiên cứu được trình bày ở đây là nghiên cứu đầu tiên khám phá khả năng nhận dạng tự động cảm xúc của chó từ nét mặt, sử dụng tập dữ liệu được thu thập từ một giao thức thử nghiệm được thiết kế cẩn thận trong đó bối cảnh bảo vệ các trạng thái cảm xúc22. Trong quy trình này, các trạng thái cảm xúc dự đoán tích cực (cảm xúc tích cực) và thất vọng (cảm xúc tiêu cực) đã được xác định bằng thực nghiệm (theo quy định18 và được tạo ra bằng thực nghiệm trong một mẫu gồm 29 đối tượng Labrador Retriever, giảm thiểu sự biến đổi về sự khác biệt về hình thái giữa các con chó. nét mặt mà những con chó tạo ra được mã hóa một cách khách quan bằng cách sử dụng hệ thống DogFACS được tiêu chuẩn hóa bởi các nhà lập trình DogFACS được chứng nhận. giảm sự biến đổi hình thái trên khuôn mặt của người tham gia do tiêu chuẩn hóa giống.

Theo to36, có hai cách tiêu chuẩn để phân loại trạng thái cảm xúc hoặc nỗi đau: sử dụng các tính năng thủ công hoặc sử dụng mô hình học sâu dựa trên các tính năng đã học được51. Các đặc điểm được tạo thủ công có thể được chia đại khái thành các đặc điểm cấp thấp, dựa trên số liệu thống kê hình ảnh (chẳng hạn như biểu đồ của độ dốc định hướng) thường được sử dụng trong tài liệu về thị giác máy tính51 và các đặc điểm cấp cao, có căn cứ về mặt ngữ nghĩa, theo loài- cấu trúc cơ thể và/hoặc khuôn mặt giải phẫu cụ thể, vảy nhăn nhó, đơn vị hành động, v.v. Ví dụ về các đơn vị sau là các điểm mốc trên khuôn mặt mèo52, các điểm chính trên cơ thể chó47 hoặc các đơn vị hành động đau cừu40. Các tính năng này thúc đẩy khả năng giải thích của các thuật toán học máy bằng cách đưa ra các quyết định của mô hình dựa trên các khái niệm hành vi. Mặt khác, phương pháp học sâu linh hoạt hơn và dự kiến ​​sẽ hoạt động tốt hơn (đặc biệt là khi có sẵn bộ dữ liệu lớn), nhưng đòi hỏi tài nguyên tính toán tốn kém và là 'hộp đen' theo nghĩa là nó không có tác dụng giải thích. theo thuật ngữ dễ hiểu của con người tại sao một quyết định phân loại cụ thể được đưa ra.

Trong nghiên cứu này, chúng tôi điều tra cả hai con đường thay thế này để phân loại tự động các trạng thái cảm xúc ở chó. Tuyến đầu tiên sử dụng các biến DogFACS làm tính năng cấp cao có thể giải thích được. Quy trình phân loại có hai giai đoạn trong trường hợp này: thứ nhất, tự động nhận dạng mã DogFACS và thứ hai, sử dụng chú thích để phân loại cảm xúc được nghiên cứu. Chúng tôi chứng minh tính tiện ích của cách biểu diễn có thể giải thích như vậy để hiểu cách sử dụng các biến DogFACS trong quá trình ra quyết định của máy. Lộ trình thứ hai áp dụng phương pháp học sâu (đơn giản hơn, một giai đoạn), cho phép máy học trực tiếp từ các tính năng dữ liệu mà con người không nhất thiết phải hiểu được. Chúng tôi so sánh thêm các khía cạnh về khả năng giải thích giữa hai phương pháp và sử dụng kỹ thuật trực quan hóa bản đồ nhiệt để làm nổi bật mối quan hệ của các đặc điểm đã học với các đối tượng ngữ nghĩa liên quan đến các bộ phận trên khuôn mặt của con chó.

Kết quả

Tập dữ liệu.

Chúng tôi đã sử dụng tập dữ liệu và chú thích DogFACS được tạo như một phần của nghiên cứu trước đây của Bremhorst và cộng sự22. Để giảm tác động của sự biến đổi hình thái, 29 đối tượng thuộc một giống không có đặc điểm khuôn mặt quá đặc biệt (Labrador Retriever) đã được thử nghiệm (19 con cái–13 bị thiến, 10 con đực–9 bị thiến; độ tuổi: 2–9,5 tuổi, tuổi trung bình {{9} }.22 năm). Hình 1 thể hiện sự phân bố về độ tuổi và giới tính của đối tượng.

Bộ dữ liệu bao gồm tổng thể 248 mẫu video có độ dài 3 giây được ghi ở tốc độ khung hình 25,25 khung hình/giây, với độ phân giải mỗi khung hình là 1920 × 1080 pixel. Camera sử dụng để ghi hình là HIKVision, IR Mini Bullet Network Camera; đầu ghi: Dòng HIKVision, DS{6}}. Các đối tượng được đặt phía sau một cửa sổ trong suốt bằng cách sử dụng giao thức được mô tả đầy đủ trong Bremhorst et al.22. Mỗi đối tượng được xét nghiệm 3 lần ở điều kiện dương tính và 6 lần ở điều kiện âm tính. Nhìn chung, 2/3 số video được chú thích là tiêu cực và 1/3 là tích cực. Trong suốt nghiên cứu này, giả định rằng điều kiện tiêu cực gây ra sự thất vọng và điều kiện tích cực gây ra dự đoán tích cực, do đó, từ đó chúng tôi sử dụng giá trị dương/âm để chỉ hai trạng thái cảm xúc. Hình 2 cho thấy các phần mặt chó được trích xuất từ ​​tập dữ liệu.

boost memory

Tập dữ liệu được cân bằng bằng cách lấy mẫu dưới ngẫu nhiên, để lại 82 video về tình trạng tích cực và 82 video về tình trạng tiêu cực từ (n = 29) cá nhân, tổng thể là 164 video. Việc cân bằng được thực hiện để duy trì cùng số lượng mẫu dương tính và âm tính cho mỗi cá nhân.

Tất cả các mẫu video đều được mã hóa bằng 39 biến DogFACS dựa trên hướng dẫn sử dụng DogFACS53 bởi một lập trình viên DogFACS được chứng nhận, bằng cách chú thích một khung hình trên 200 mili giây bằng Solomon Coder (phiên bản 15.03.15, Andràs Péter). Trong số 39 biến này, 11 biến được trình bày trong Bảng 1 đã được sử dụng trong nghiên cứu của Bremhorst22, dựa trên mức độ phổ biến ít nhất 10% trên tất cả các mẫu có điều kiện dương tính hoặc âm tính và ít nhất là mức độ đồng thuận đáng kể giữa các bộ mã hóa (xem22 để biết thêm chi tiết).

10 ways to improve memory

Tổng quan về hai phương pháp.

Ở đây chúng tôi trình bày so sánh hai cách tiếp cận khác nhau để phân loại tự động các điều kiện tích cực và tiêu cực: phương pháp học sâu dựa trên DogFACS và thuần túy (phương pháp DogFACS cũng có mô-đun học sâu để phát hiện biến DogFACS). Hình 3 trình bày tổng quan cấp cao về hai phương pháp.

Tính khả dụng của dữ liệu video cho phép chúng tôi làm việc với hai loại đầu vào: khung hình đơn hoặc chuỗi khung hình. Cái trước ngụ ý mất nhiều thông tin hơn, nhưng đơn giản hơn và dễ kiểm soát hơn; trong khi chiều thứ hai bao gồm chiều thời gian, chiều này đã được chứng minh là có tầm quan trọng đối với các nhiệm vụ như vậy, ví dụ: trong bối cảnh phát hiện cơn đau ở ngựa42,54. Tuy nhiên, cách tiếp cận phổ biến trong bối cảnh nhận biết tự động các trạng thái cảm xúc và nỗi đau ở động vật là cơ sở khung đơn (ví dụ: 33,39,41,55). Do tính chất thăm dò của nghiên cứu này, chúng tôi đã quyết định lựa chọn này.

Do đó, cả hai cách tiếp cận đều hoạt động trên cơ sở một khung hình, tức là việc phân loại được thực hiện trên các khung hình đơn lẻ được trích xuất từ ​​​​video. Tuy nhiên, việc tổng hợp thông tin từng khung được thực hiện khác nhau trong hai trường hợp. Sau bước tiền xử lý để trích xuất các khuôn mặt của con chó đã được cắt xén từ các khung (xem ví dụ ở Hình 2), trong phương pháp tiếp cận sâu, các khuôn mặt đã được cắt thô sẽ được mạng lưới thần kinh lấy làm đầu vào. Ở đây chúng tôi thử nghiệm kiến ​​trúc mạng thần kinh gồm hai loại: mạng thần kinh tích chập (Resnet5056) và mạng biến áp tầm nhìn57 (ViT) được giới thiệu gần đây. Sau đó, các quyết định của mạng đã chọn sẽ được tổng hợp bằng cách sử dụng biểu quyết đa số và đưa ra quyết định phân loại cho mỗi video.

Mặt khác, cách tiếp cận dựa trên DogFACS sử dụng một quy trình có hai bước liên tiếp. Đầu tiên là trình phát hiện biến DogFACS tự động, phát hiện một tập hợp các biến DogFACS trong mỗi khung. Các biến DogFACS sau đó được tổng hợp cho toàn bộ video. Bước thứ hai là cây quyết định, có đầu vào là tập hợp các biến DogFACS được phát hiện trong video được áp dụng để đưa ra quyết định phân loại cuối cùng.

Do đó, cách tiếp cận dựa trên DogFACS đưa ra quyết định phân loại dựa trên tập hợp các biến DogFACS được xác định trong video; mặt khác, phương pháp học sâu sẽ quyết định riêng từng khung hình, trích xuất các đặc điểm đã học từ hình ảnh thô, sau đó tổng hợp quyết định cho tất cả các khung hình cho video. Do đó, khi khám phá khả năng giải thích của hai cách tiếp cận, trước đây chúng ta dự kiến ​​sẽ có những 'lời giải thích' theo hướng của Bremhorst và cộng sự22 (xác định các biến phổ biến trong từng điều kiện hoặc sự kết hợp nào đó của chúng). Tuy nhiên, cách tiếp cận thứ hai dự kiến ​​sẽ mang lại những giải thích trực quan hơn về những đặc điểm hình ảnh mà mô hình tập trung vào, như được trình bày chi tiết dưới đây.

Để đánh giá hiệu suất của các mô hình, chúng tôi đã sử dụng các số liệu tiêu chuẩn về độ chính xác, độ chính xác và khả năng thu hồi, đây là phương pháp tiêu chuẩn trong bối cảnh học máy. Là một phương pháp xác thực, chúng tôi đã sử dụng xác thực chéo một chủ đề mà không có chủ đề chồng chéo, có nghĩa là sử dụng từng đối tượng chó như một bộ thử nghiệm riêng biệt. Phương pháp này được khuyến nghị cho các tập dữ liệu trong đó một cá nhân có nhiều mẫu liên quan36. Xem Broomé và cộng sự36 để thảo luận về tầm quan trọng của việc chọn phương pháp xác nhận thích hợp.

short term memory how to improve

Cách tiếp cận dựa trên DogFACS.

Bộ biến DogFACS. Chúng tôi đã thử nghiệm hai bộ biến DogFACS khác nhau:

1. Tập hợp mười một biến được trình bày trong Bảng 1 được sử dụng trong nghiên cứu của Bremhorst và cộng sự22, là những biến có triển vọng nhất hoặc có khả năng quan trọng nhất (dựa trên mức độ phổ biến ít nhất là 10% trên tất cả các mẫu của cả hai điều kiện tích cực hoặc tiêu cực) và chúng có thể được mã hóa một cách đáng tin cậy (với ít nhất sức mạnh đáng kể của thỏa thuận bộ mã hóa, xem22).

2. Toàn bộ bộ 39 biến DogFACS được mã hóa trong nghiên cứu của Bremhorst et al.22.

Classification results. To explore optimal performance, we used the manual DogFACS annotations from Bremhorst et al.22 to experiment with different machine learning techniques, including Decision Tree, XGBoost, and Random Forest. Table 2 presents a comparison of their performance, with Random Forest performing slightly better for the full set of DogFACS variables (39 variables), reaching accuracy > 71%. In the limited set (11 DogFACS variables), the three models converged to one tree, and thus are presented together, reaching a slightly lower accuracy of > 66%.

Tối thiểu hóa cây quyết định. Tiếp theo, chúng tôi đã thực hiện tìm kiếm có hệ thống cho một tập hợp biến DogFACS tối thiểu sẽ mang lại hiệu suất phân loại giống như được trình bày trong Bảng 2. Bảng 3 cho thấy rằng chỉ sử dụng một biến DogFACS làm tính năng sẽ đảm bảo hiệu suất tương tự như biến được trình bày trong Bảng 2. Biến 'Ears Flattener' là biến quan trọng nhất để phân loại bằng cách sử dụng bộ giới hạn gồm 11 biến DogFACS, sự hiện diện của nó dự đoán tình trạng âm tính. Hình 4 cho thấy cây quyết định được đơn giản hóa chỉ với một tính năng dự đoán điều kiện tích cực—sự vắng mặt của 'Ears Flattener' và điều kiện tiêu cực—sự hiện diện của nó (với độ chính xác > 66%).

Đáng chú ý, khi xem xét tất cả 39 biến DogFACS, 'Eyes Up' là biến quan trọng nhất để phân loại bằng cách sử dụng tất cả 39 biến, sự hiện diện của nó dự đoán các điều kiện tích cực với độ chính xác cao > 71%.

Tự động phát hiện các biến DogFACS. Dựa trên những phát hiện của chúng tôi, việc đào tạo trình phát hiện các biến DogFACS 'Ears Flattener' và 'Eyes Up' là đủ cho một quy trình phân loại hoàn toàn tự động. Chúng tôi cũng khám phá việc phát hiện các biến khác, sử dụng mạng thần kinh tích chập ResNet50 được đào tạo trước trên các bộ dữ liệu cân bằng (trên số lượng hình ảnh khác nhau do sự thay đổi tần số biến DogFACS). Hiệu suất của các máy dò thu được được trình bày trong Bảng 4.

ways to improve memory

Cách tiếp cận sâu sắc.

Theo cách tiếp cận này, chúng tôi đã sử dụng thiết lập "học chuyển giao" phổ biến, đào tạo một đầu dò tuyến tính trên nền tảng xương sống cố định được đào tạo trước bằng cách sử dụng các chú thích của con người. Chúng tôi khám phá sự phù hợp của các đường trục khác nhau cho nhiệm vụ này bằng cách lặp lại thử nghiệm với bốn đường trục được huấn luyện trước: ResNet và ViT được huấn luyện theo cách có giám sát để phân loại hình ảnh57 hoặc theo cách tự giám sát bằng DINO58.

Chúng tôi đã đào tạo bốn mô hình khác nhau (trên toàn bộ tập dữ liệu) và kiểm tra hiệu suất của chúng bằng cách sử dụng các khung từ cùng một tập dữ liệu cân bằng được mô tả ở trên (82 video về tình trạng âm tính, 82 video về tình trạng dương tính từ (n = 29) cá nhân, khiến Tổng cộng có 164 video).

Bảng 5 trình bày kết quả phân loại được phân tích trên mỗi video, tức là chúng tôi nói rằng một video được phân loại chính xác nếu phần lớn các khung hình của nó được phân loại chính xác. Có thể thấy, mô hình được huấn luyện với xương sống DINO-ViT cho hiệu suất tốt nhất với độ chính xác trên 89%. Bảng 6 trình bày kết quả phân loại được phân tích theo khung. Đúng như mong đợi, trong trường hợp này, các số đo có phần giảm đi so với phân tích được thực hiện trên tổng hợp khung, dẫn đến độ chính xác 85% cho mô hình được huấn luyện bằng xương sống DINO-ViT.

memory enhancement

Cuộc thảo luận

The present study is the first to explore automated recognition of canine emotional states focusing on diverse facial expressions, whilst using a carefully designed controlled experimental setup for dataset creation and annotation. We present classifiers of two different types: deep learning-based and DogFACS-based, both having a performance that is comparable to and in some cases outperforms those presented in previous studies addressing recognition of pain or emotional state from facial expressions, including mice38,39 (> 89% and 93% respectively), cats43 (> 72%), horses42,46 (> 75% and 65% respectively) and sheep55 (> 64%).

The DogFACS-based approach described here reached an accuracy of > 71% using the full set (n =  39) of DogFACS variables, but a lower accuracy of > 66% when using only the eleven DogFACS variables which were utilized in the study of Bremhorst et al.22 ( this accuracy was achieved based on manual DogFACS annotations and is expected to drop even lower in an end-to-end pipeline). Of the full set of 39 DogFACS variables, 'Eyes Up' were of considerable importance for classification, and including them in the Decision Tree leads to higher accuracy (>71%). Tuy nhiên, khi giải thích các biến định hướng như chuyển động của mắt và tầm quan trọng của chúng như các chỉ số cảm xúc tiềm ẩn, việc thiết lập thử nghiệm của nghiên cứu trong đó dữ liệu được thu thập phải luôn được xem xét. Trong Bremhorst và cộng sự22, người thí nghiệm đã trao phần thưởng thức ăn bằng chuyển động phía trên đường kẻ mắt của chó một chút. Điều này có thể đã khuyến khích những con chó nhìn lên (gây ra biến số 'Mắt ngước lên') để chờ đợi thức ăn. Do đó, chúng ta phải nhận ra rằng biến DogFACS này có thể là một sản phẩm của quy trình thử nghiệm. Khi lựa chọn các biến số như một phần của quá trình phát triển các chỉ số cảm xúc, điều quan trọng là phải cân nhắc nguy cơ xảy ra lỗi loại I (dương tính giả) so với lỗi loại II (âm tính giả) gần như không thể tránh khỏi. Khi làm việc với một nhóm 11 biến DogFACS đã giảm bớt, chúng tôi đã ưu tiên tránh kết quả âm tính giả so với kết quả dương tính giả để không sớm loại trừ một biến khỏi cuộc điều tra thêm. Chúng ta có thể mong đợi rằng các biến được chấp nhận sai sẽ bị loại trừ trong các nghiên cứu tiếp theo nếu xác định được sự thiếu giá trị dự đoán của chúng (như đã thảo luận ở phần 19).

As a byproduct of these results, we obtained automated detectors for nine DogFACS variables, of which five performed with an accuracy >70%, chứng tỏ tính khả thi của việc nhận dạng tự động chính xác các biến DogFACS. Thách thức chính đối với việc huấn luyện trình phát hiện cho từng biến là tính sẵn có của dữ liệu, tức là tần suất xuất hiện thấp của một số biến DogFACS, đòi hỏi nỗ lực tập trung để thu thập bộ dữ liệu cho các biến cụ thể. Hơn nữa, một số biến có kích thước thời gian và không thể được xử lý trên cơ sở một khung hình (ví dụ: chớp mắt hoặc thở hổn hển). Việc phát triển các máy dò cho chúng đòi hỏi các mô hình cũng sử dụng động lực học thời gian, chẳng hạn như cách tiếp cận của Broomé và cộng sự42.

Cần lưu ý thêm rằng vì tập dữ liệu của chúng tôi chỉ giới hạn ở một giống, nên nhu cầu nghiên cứu trước mắt trong tương lai là đánh giá khả năng khái quát của mô hình đối với các giống khác. Nếu hiệu suất giảm đáng kể khi chuyển kết quả sang các giống khác, thì các phương pháp thay thế cho phương pháp tiếp cận sâu được sử dụng ở đây sẽ được chỉ ra, ví dụ như trong Feighelstein et al.43.

improve your memory

Khám phá tính tổng quát của các mô hình được trình bày ở đây không chỉ quan trọng trong bối cảnh phát hiện biến DogFACS mà còn đối với việc phân loại cảm xúc. Bộ dữ liệu được sử dụng ở đây không chỉ được kiểm soát về giống mà còn được ghi lại trong các điều kiện môi trường được kiểm soát chặt chẽ. Khái quát hóa từ môi trường được kiểm soát đến bối cảnh tự nhiên cũng là một thách thức cực kỳ khó khăn trong lĩnh vực tính toán tình cảm của con người60. Feng và cộng sự61 đưa ra đánh giá về lĩnh vực con người về các cách mà kỹ thuật học chuyển giao có thể vượt qua các thách thức liên quan đến số lượng mẫu dữ liệu hạn chế, nhãn khan hiếm và sự biến đổi của môi trường, thúc đẩy các hệ thống tự động mạnh mẽ và có thể khái quát hóa để nhận dạng cảm xúc. Những cách tương tự có thể được khám phá trong khả năng tính toán tình cảm của loài chó; các kết quả được trình bày ở đây cung cấp cơ sở để khám phá thêm về hướng này.

Những câu hỏi như “Máy móc có thể nhận biết được trạng thái cảm xúc của động vật không?” rất thú vị và có những ứng dụng thực tế sâu rộng cho phúc lợi động vật. Kết quả nghiên cứu của chúng tôi cung cấp một số dấu hiệu cho thấy câu trả lời tích cực, ít nhất là trong trường hợp chó có sự thất vọng và mong đợi tích cực. Tuy nhiên, việc xây dựng các mô hình AI nhận biết cảm xúc của chó có giá trị gia tăng đáng kể trong việc giúp chúng ta hiểu cách máy móc phân loại cảm xúc, liệu chúng có nhạy cảm với các sắc thái mà chuyên gia con người không thể nhìn thấy hay không và nó có ý nghĩa gì đối với sự hiểu biết của chúng ta về cảm xúc động vật, và những điều đang diễn ra. tranh luận về tình cảm của động vật Vì lý do này, điều quan trọng và hứa hẹn là khám phá khả năng giải thích (lý do căn bản đằng sau quyết định của máy là gì?) và khả năng diễn giải (cấu trúc mô hình liên quan như thế nào đến việc đưa ra quyết định như vậy?)62. Những chủ đề này là nền tảng trong AI và được giải quyết bởi một lượng lớn nghiên cứu63–65, với phần lớn nỗ lực tập trung vào các phương pháp học sâu mà khả năng diễn giải bị hạn chế bởi cấu trúc phức tạp của chúng66. Các phương pháp giải thích về bản chất là theo từng lĩnh vực cụ thể: việc đưa ra lời giải thích để nhận dạng đặc điểm tính cách tự động trong các cuộc phỏng vấn việc làm là khác nhau, ví dụ, với việc đưa ra lý do chứng minh lâm sàng cho các quyết định y tế62.

increase brain power

Nghiên cứu của chúng tôi là nghiên cứu đầu tiên đề cập đến các khía cạnh có thể giải thích được của mô hình AI để nhận dạng cảm xúc động vật. Khi chúng tôi so sánh hai cách tiếp cận khác nhau để phân loại cảm xúc, khả năng so sánh cũng mang lại giá trị gia tăng cho những khác biệt về khía cạnh khả năng giải thích mà chúng giải quyết. Cách tiếp cận dựa trên DogFACS dẫn đến các mô hình ở dạng Cây quyết định đơn giản, mô hình hóa lý luận logic của con người dưới dạng kết hợp các điều kiện Boolean liên quan đến sự hiện diện/vắng mặt của một số biến DogFACS nhất định. Bản chất giải thích của Cây quyết định được phản ánh đặc biệt trong phiên bản đơn giản hóa của chúng chỉ với một nút, chẳng hạn như nút được nghiên cứu ở đây (với 'Ears Flattener'). Những cây như vậy có liên quan chặt chẽ đến các khái niệm hữu ích cho các chuyên gia về con người, đặc biệt là các chỉ số cảm xúc được nghiên cứu bởi Bremhorst et al.19. Các chỉ báo cảm xúc hợp lệ nhằm mục đích xác định chính xác một trạng thái cảm xúc cụ thể, hiện diện bất cứ khi nào cảm xúc hiện diện và vắng mặt nếu không.

Những đặc điểm này được mô tả bằng độ nhạy và độ đặc hiệu, số liệu thường được sử dụng để đánh giá tính chính xác của các xét nghiệm chẩn đoán. Bremhorst và cộng sự19 nhận thấy rằng không có biến số DogFACS nào được xem xét trong nghiên cứu có thể được coi là một chỉ số riêng lẻ cụ thể cho dự đoán tích cực hoặc sự thất vọng ở chó. Cụ thể, 'Ears Flattener' được chứng minh là có độ nhạy tương đối cao nhưng độ đặc hiệu thấp. Do đó, không có gì ngạc nhiên khi mô hình được mô tả trong nghiên cứu của chúng tôi, là Cây quyết định với tính năng duy nhất là 'Ears Flattener', đã không đạt được hiệu suất cao. Tuy nhiên, mối quan hệ giữa số liệu về các chỉ số cảm xúc được Bremhorst et al.19 sử dụng và số liệu được sử dụng ở đây để đánh giá hiệu suất của mô hình của chúng tôi không đơn giản. Trong khi cái trước tính toán độ nhạy, độ đặc hiệu cũng như giá trị dự đoán dương và âm cho toàn bộ dữ liệu không cân bằng, thì cái sau sẽ đánh giá hiệu suất trong một nhiệm vụ dự đoán. Điều này có nghĩa là dữ liệu được chia thành hai phần: đào tạo, được sử dụng để huấn luyện mô hình và kiểm tra để đánh giá hiệu suất của mô hình. Ngược lại với Bremhorst và cộng sự19, chúng tôi cũng cân bằng dữ liệu bằng cách sử dụng lấy mẫu dưới. Tuy nhiên, mối liên hệ trực quan giữa cả hai là nếu tìm thấy một chỉ báo cảm xúc xuất sắc bằng cách sử dụng phương pháp trước đây, chúng ta có thể mong đợi rằng Cây quyết định sử dụng nó làm tính năng cũng sẽ đạt được hiệu suất xuất sắc.

Ngoài khả năng giải thích, phương pháp học máy được trình bày ở đây để tìm kiếm các mô hình Cây quyết định tối ưu nhằm dự đoán cảm xúc của chó có khả năng mang lại những hiểu biết mới về các chỉ số cảm xúc. Như đã thảo luận ở trên, việc phát hiện ra các chỉ báo cảm xúc chính xác theo Bremhorst et al.19 có liên quan chặt chẽ đến vấn đề tìm các bộ phân loại Cây quyết định với một biến DogFACS duy nhất để dự đoán cảm xúc. Mặc dù các phân loại như vậy chưa được chứng minh là có độ chính xác cao trong nghiên cứu của chúng tôi (và thực tế là không có chỉ số cảm xúc chính xác nào được phát hiện vào năm 19), hiệu suất phân loại có thể được cải thiện bằng cách xem xét các dạng Cây quyết định phức tạp hơn, chẳng hạn như bằng cách nhóm các biến DogFACS thành từng cặp , bộ ba, v.v. Các thử nghiệm sơ bộ của chúng tôi sử dụng các cặp biến DogFACS làm nút, được hiển thị trong Hình 5, cho thấy rằng điều này đã cải thiện hiệu suất của mô hình về mặt thu hồi. Điều quan trọng là việc điều tra xem sự kết hợp nào của các biến DogFACS có thể cải thiện việc phân loại có thể được thực hiện một cách tự động, toàn diện và có hệ thống, có khả năng dẫn đến các khái niệm chi tiết hơn về các chỉ số cảm xúc. Điều này mở ra một hướng đi đầy hứa hẹn cho các nghiên cứu trong tương lai.

Mặt khác, phương pháp học sâu đã đạt được hiệu suất cao hơn rõ rệt trên 89%, chứng tỏ tiềm năng của những phương pháp như vậy trong việc phân loại cảm xúc. Hơn nữa, xương sống DINO-ViT dường như phù hợp nhất cho nhiệm vụ phân loại cảm xúc trong số bốn lựa chọn được nghiên cứu. Chúng tôi đưa ra giả thuyết rằng điều này là do các tính năng DINO-ViT nhạy cảm với các bộ phận của vật thể, như được hiển thị trong 67; và do tính chất của nhiệm vụ phân loại cảm xúc, đòi hỏi sự hiểu biết ở cấp độ đối tượng-bộ phận (các bộ phận trên khuôn mặt như mắt, tai, v.v.). Điều thú vị là các đường trục được huấn luyện trước bằng DINO tạo ra kết quả tốt hơn các đường trục được giám sát.

Cần lưu ý rằng trình phân loại deep learning hoạt động dựa trên hình ảnh, sau đó tổng hợp kết quả trên mỗi video. Điều này ngụ ý rằng mặc dù nhiều khung không thể hiện sự hiện diện của các biến DogFACS, mô hình vẫn thành công trong việc phân loại chính xác chúng. Điều này có thể cho thấy độ nhạy của mô hình đối với các chi tiết chi tiết ở mức pixel có thể vượt quá khả năng của mắt người. Tuy nhiên, nó cũng có thể liên quan đến những cạm bẫy tiềm ẩn dưới dạng một số thành kiến ​​cố hữu. Ngoài ra, biến 'Eyes Up', được thảo luận ở trên, có thể là công cụ cho mạng và ảnh hưởng của nó đến việc ra quyết định không dễ dàng bị vô hiệu hóa trong mạng học sâu. Việc điều tra những vấn đề này đòi hỏi phải thu thập thêm dữ liệu trong các điều kiện môi trường và thử nghiệm khác nhau để loại trừ những cạm bẫy như vậy.

Mặt khác, khả năng giải thích của phương pháp học sâu được xem xét ở đây có tính chất hoàn toàn khác, trực quan hơn so với phương pháp dựa trên DogFACS. Không giống như các mô hình Cây quyết định, việc giải thích việc ra quyết định của mạng lưới thần kinh theo thuật ngữ mà con người có thể hiểu được là vô cùng khó khăn do tính chất 'hộp đen' rất phức tạp của chúng68. Việc sử dụng phương pháp EigenCAM59 làm nổi bật sự khác biệt giữa các mô hình khác nhau mà chúng tôi đã thử nghiệm (ResNet/ViT, được giám sát/DINO). Như được minh họa trong Hình 6, có một số khác biệt giữa các mô hình. Các mô hình Te ViT dường như thể hiện khả năng định vị tốt hơn so với các mô hình ResNet, vì các vùng được kích hoạt cao (được đánh dấu bằng màu đỏ) nhỏ hơn và nằm trên các vùng nổi bật hơn (ví dụ: mắt, tai, mũi thay vì da). Hơn nữa, mô hình DINO-ViT dường như kích hoạt trên nhiều vùng nổi bật chứ không phải một vùng (ví dụ: kích hoạt ở tai, mắt và mũi thay vì chỉ kích hoạt ở tai ở ví dụ trên cùng bên phải). Chúng tôi cho rằng sự thành công của các mô hình dựa trên ViT là khả năng của ViT cung cấp tín hiệu cục bộ hơn so với các mô hình ResNet. Điều này xuất phát từ kiến ​​trúc của chúng—độ phân giải của các tính năng ViT không đổi trong suốt các lớp, trong khi độ phân giải của các tính năng CNN giảm dần khi các lớp trở nên sâu hơn.

Mặc dù việc đưa ra kết luận chắc chắn đòi hỏi phải nghiên cứu thêm, nhưng chúng tôi đã thử nghiệm phương pháp EigenCAM tập trung sự chú ý vào các khung hình thỏa mãn các điều kiện sau: (i) được mã hóa thủ công với biến 'Ears Flattener' và (ii) thuộc loại mẫu video của điều kiện tiêu cực và (iii) được mạng DINO-ViT phân loại chính xác là điều kiện tiêu cực. Trong phân tích của mình, chúng tôi chia các ví dụ thành ba loại, như được minh họa trong Hình 7. Ví dụ về loại A là các bản đồ nhiệt chỉ tập trung rõ ràng vào tai. Điều này có thể được coi là phù hợp với lời giải thích về 'Ears Flattener' liên quan đến DogFACS, tức là có thể mô hình đã học được các mẫu liên quan đến chuyển động của tai. Loại B cũng phù hợp với điều này, hiển thị bản đồ nhiệt tập trung vào cả tai và các khu vực khác, chẳng hạn như mắt, trán, mũi và miệng. Cái sau cũng có thể liên quan gián tiếp đến chuyển động 'Ears Flattener', cũng như các biến DogFACS khác hoặc một số đặc điểm tư thế khác có thể có trong khung. Tuy nhiên, danh mục hấp dẫn nhất là danh mục C: ở đây mô hình thu thập tín hiệu từ các bộ phận trên khuôn mặt ngoài tai, vẫn đưa ra phân loại chính xác. Những trường hợp này có thể là chìa khóa để hiểu được độ nhạy của mạng đối với các sắc thái mà mắt người không nhìn thấy được. Trong mọi trường hợp, cần lưu ý rằng chú thích DogFACS không thể bao quát toàn diện tất cả những thay đổi có thể có trong hành vi khuôn mặt, những thay đổi này có thể được phản ánh trong các mẫu pixel mà mạng rất nhạy cảm. Sau đó, chúng tôi cũng trích xuất bản đồ nhiệt từ các video không có biến DogFACS được chú thích. Có chín video không có biến số, tám trong số đó là 'tích cực' và một—'tiêu cực'. Điều đáng chú ý là phần lớn các video này (77%) vẫn được mô hình phân loại chính xác. Đây có thể là một dấu hiệu khác cho thấy mô hình đang nắm bắt được hành vi tinh tế trên khuôn mặt mà DogFACS không nắm bắt được. Khi kiểm tra các bản đồ nhiệt được tạo cho khung của những video này, chúng tôi nhận thấy rằng vùng mũi-miệng là trọng tâm chính của mô hình. Một số khung hình khác hiển thị tập trung vào các bộ phận khác trên khuôn mặt, trong khi có những trường hợp khung hình được phân loại chính xác nhưng bản đồ nhiệt bị mờ và không rõ ràng. Các ví dụ từ ba loại này được hiển thị trong Hình 8. Điều thú vị là các bản đồ nhiệt này thiếu sự tập trung vào các bộ phận cụ thể trên khuôn mặt, cho thấy rằng thực sự trong những trường hợp này, tín hiệu thị giác ít rõ ràng hơn đối với mô hình.

increase memory power

improve short term memory

Một vấn đề đáng chú ý khác liên quan đến cả hai phương pháp liên quan đến hiệu suất là độ dài ngắn của video (3 giây) trong tập dữ liệu hiện tại. Việc sử dụng video dài hơn dẫn đến thách thức trong việc xác định khoảng thời gian tối ưu trong đó trạng thái bên trong có thể được coi là không đổi. Vấn đề này đã được xem xét trong bối cảnh đau chỉnh hình ở mức độ thấp ở ngựa và là một hướng quan trọng cho nghiên cứu trong tương lai về trạng thái cảm xúc của chó.

Tóm lại, nghiên cứu này đã chứng minh giá trị của hai phương pháp phân loại tự động khác nhau đối với hai trạng thái cảm xúc ở chó dựa trên nét mặt của chúng: tình trạng tích cực và tiêu cực. Cả hai đều đạt được độ chính xác tốt có thể so sánh với các phương pháp tiên tiến khác trong việc nhận dạng tự động các hiệu ứng của động vật. Những kết quả này không chỉ lần đầu tiên đưa ra câu trả lời khẳng định cho câu hỏi “Máy móc có thể nhận ra cảm xúc tích cực/tiêu cực của chó không?” mà còn mở ra những hướng nghiên cứu mới để khám phá cách máy móc nhận ra chúng và làm thế nào để con người có thể giải thích được sự nhận biết này. . Thử nghiệm sâu hơn với các tập dữ liệu lớn hơn với đặc điểm người tham gia rộng hơn cũng sẽ nâng cao hiểu biết của chúng ta về cách phát triển các chỉ số cảm xúc tốt của động vật. Một hướng cụ thể có vẻ đặc biệt hứa hẹn là khám phá tiềm năng của các phương pháp tiếp cận liên quan đến phát hiện điểm mốc trên khuôn mặt, chẳng hạn như OpenFace70 và Google MediaPipe71. Các phương pháp tiếp cận tương tự mới chỉ bắt đầu được khám phá đối với các động vật không phải con người, ví dụ như nghiên cứu của Feighelstein và cộng sự43 trên khuôn mặt mèo. Giống như trong lĩnh vực con người, sự phát triển của chúng sẽ đòi hỏi những nỗ lực đa ngành sâu rộng để thu thập dữ liệu lớn về nhiều loài khác nhau.

phương pháp

Tập dữ liệu.

Tập dữ liệu liên quan đến những con chó được sử dụng cho nghiên cứu này đã được thu thập trước đây theo sự phê duyệt về mặt đạo đức sau đây của Đại học Lincoln, (UID: CoSREC252) theo Bremhorst và cộng sự.22 với bản sửa đổi cho nghiên cứu này được lấy từ Đại học Lincoln cho sử dụng tập dữ liệu gốc trong nghiên cứu này. Quy trình hiện tại sử dụng dữ liệu này đã được Ủy ban đạo đức của Đại học Haifa xem xét và không cần phê duyệt thêm.

Cắt xén và tiền xử lý.

Bước này phù hợp với cả phương pháp DogFACS và phương pháp tiếp cận sâu. Các khung hình video gốc có nền lộn xộn bao gồm phòng xung quanh, con người, cơ thể chó, v.v. Chúng tôi mong muốn tập trung vào nét mặt của những chú chó và tránh tìm hiểu các yếu tố dự đoán trạng thái cảm xúc khác (ví dụ: tư thế cơ thể chó). Do đó, chúng tôi đã huấn luyện Mask-RCNN72 để xác định khuôn mặt chó và sử dụng nó để cắt hộp giới hạn khuôn mặt từ mỗi hình ảnh. Chúng tôi đã đào tạo Mask-RCNN trên khoảng 200 hình ảnh được chú thích từ tập dữ liệu này, làm cho nó phù hợp nhất với thiết lập thử nghiệm cụ thể này. Có thể xem ví dụ về các loại cây trồng trên khuôn mặt thu được bằng giai đoạn tiền xử lý trong Hình 2.

Cách tiếp cận dựa trên DogFacs.

Từ video đến các biến DogFACS. Quy trình đầy đủ được mô tả trong sơ đồ sau, xem Hình 9. Quy trình này bao gồm các bước sau:

• Cắt khuôn mặt của chú chó ra khỏi khung bằng phương pháp được mô tả ở trên.

• Xây dựng bộ dữ liệu biến DogFACS Sử dụng mã hóa DogFACS thủ công của Bremhorst và cộng sự22, đối với mỗi biến DogFACS, chúng tôi đã tạo hai thư mục với các ví dụ tích cực và tiêu cực (mặt chó biểu thị hoặc không biểu thị biến DogFACS này). Đối với các mẫu dương tính (có biến), chúng tôi đã chọn hình ảnh của tất cả các khung được mã hóa thủ công bằng biến này. Đối với các mẫu âm tính, chúng tôi đã chọn các khung hình trong video không có biến được đánh dấu trên mã hóa của chúng cho đến khi biến đó xuất hiện lần đầu tiên (hoặc cho đến cuối video nếu không có). Sau đó, các tập dữ liệu được cân bằng, để lại số lượng hình ảnh bằng nhau cho các ví dụ tích cực và tiêu cực cho mỗi biến. Bảng 4 cho thấy kích thước của bộ dữ liệu cho tất cả các biến DogFACS mà trình phát hiện đã thu được.

Từ các biến DogFACS đến phân loại trạng thái cảm xúc. Chúng tôi đã sử dụng phương pháp học chuyển giao dựa trên kiến ​​trúc mạng ResNet50 được đào tạo trước được khởi tạo bằng trọng số Imagenet. Chúng tôi đã thay thế lớp trên cùng bằng lớp nhóm trung bình, lớp bỏ học 2{15}} phần trăm và lớp phân loại hai lớp. Mô hình đã được đào tạo trong 2{17}} kỷ nguyên bằng cách sử dụng trình tối ưu hóa Adam với tốc độ học tập là 0,0001. Mô hình đạt được độ chính xác tối đa trên tập dữ liệu xác thực được chọn là mô hình tốt nhất. Trong 10 kỷ nguyên đầu tiên, trọng số của tất cả các lớp đã được tinh chỉnh. Trong 10 kỷ nguyên đầu tiên, trọng lượng của tất cả các lớp đã được tinh chỉnh. Trong các thời kỳ còn lại, trọng số ResNet50 bị cố định và chỉ có trọng số của các lớp trên cùng mới được cập nhật. Đối với các biến không liên quan đến định hướng ('Ears Flattener', 'Lips Part', 'Ears Adductor', 'Ears Forward' và 'Nose Lick'), chúng tôi đã áp dụng kỹ thuật tăng cường dựa trên fip ngang hình ảnh ngẫu nhiên và xoay lên đến 20 độ. Để làm đầu vào cho bộ mã hóa, chúng tôi đã sử dụng một bảng đầu vào, trong đó mỗi hàng biểu thị sự hiện diện (1)/vắng mặt (0) của từng biến trong số 11 biến DogFACS trên mỗi video. Mục tiêu của bộ mã hóa là một bảng chứa điều kiện (âm (0)/dương (1)) của mỗi video.

supplements to boost memory

Cách tiếp cận sâu sắc.

Cho đến gần đây, mạng thần kinh tích chập (CNN) được coi là công nghệ tiên tiến trong các nhiệm vụ thị giác máy tính. Gần đây, kiến ​​trúc Vision Transformer (ViT)57 nổi lên như một giải pháp thay thế73. Phương pháp đào tạo DINO mới chỉ được giới thiệu vào năm 2021 dưới dạng khung học tập tự chắt lọc. Việc đào tạo một số đường trục DNN (ResNet50, Visit-small, vit-base, v.v.) trong cấu hình này cho thấy rằng đường trục ViT được huấn luyện bằng phương pháp DINO vượt trội hơn các kết quả phân loại trước đó trên tập dữ liệu tiêu chuẩn ImageNet74.

Chúng tôi đã sử dụng kiến ​​trúc ResNet5{11}} cho các đường trục được giám sát và đào tạo DINO; ViT-S/16 được huấn luyện dưới sự giám sát và ViT-S/8 được huấn luyện bằng DINO. Chúng tôi sử dụng trọng lượng ViT được đào tạo trước từ Thư viện Timm75. Chúng tôi đào tạo tất cả bốn mô hình cho 3{12}} kỷ nguyên bằng cách sử dụng trình tối ưu hóa Adam76 với beta=(0, 0,999) và tốc độ học tập: 10−4 cho đường trục ResNet và 5 · 10−6 cho đường trục ViT. Đường cong tổn thất của các mô hình đã huấn luyện được trình bày trong Hình 10.

Trực quan hóa bản đồ.

Chúng tôi chọn phương pháp Eigen-CAM59 để trực quan hóa các thành phần chính của lần kích hoạt cuối cùng cho từng mô hình. Người ta đã chứng minh rằng Eigen-CAM cung cấp kết quả dễ hiểu hơn với ít tính toán hơn so với các phương pháp CAM khác như Grad-CAM77 phổ biến. Hơn nữa, không giống như các phương pháp trực quan hóa khác như Grad-CAM59 và Grad-CAM++78, Eigen-CAM là một công cụ độc lập với lớp. Thuộc tính này cho phép Eigen-CAM trực quan hóa các mẫu đã học ngay cả khi dự đoán mô hình sai, trái ngược với các phương pháp CAM cũ hơn tạo ra các bản đồ không liên quan khi dự đoán của chúng không chính xác. Thuộc tính này của EigenCAM cho phép giải thích lý do dự đoán thất bại. Nó nhất quán và phân biệt đẳng cấp hơn so với các phương pháp trực quan hiện đại khác. Ngoài ra, EigenCAM không có mô hình cụ thể—nó có thể được sử dụng cho cả ViT và CNN mà không cần thay đổi lớp.

Tính khả dụng của dữ liệu

Bộ dữ liệu được sử dụng trong bài viết này được cung cấp theo yêu cầu từ tác giả tương ứng.


Người giới thiệu

Darwin, C. Te Biểu hiện cảm xúc ở động vật và con người Vol. Ngày 11 tháng 11 năm 1872 (Murray, 1872).

2. Ekman, P. & Friesen, WV Đo chuyển động khuôn mặt. Môi trường. Tâm thần. Hành vi phi ngôn ngữ. 1, 56–75 (1976).

3. Ekman, P. & Keltner, D. Những biểu hiện cảm xúc phổ biến trên khuôn mặt. Trong Giao tiếp phi ngôn ngữ: Nơi thiên nhiên gặp gỡ văn hóa (eds Segerstrale UP & Molnar, P.) tập. 27, 46 (1997).

4. Russell, JA, Bachorowski, J.-A. & Fernández-Dols, J.-M. Biểu cảm khuôn mặt và giọng nói của cảm xúc. Ann. Linh mục tâm lý. 54, 329–349 (2003).

5. Diogo, R., Abdala, V., Lonergan, N. & Wood, B. Từ fsh đến con người hiện đại - giải phẫu so sánh, tương đồng và sự tiến hóa của cơ đầu và cổ. J. Anat. 213, 391–424 (2008).

6. Descovich, KA và cộng sự. Biểu hiện trên khuôn mặt: Một công cụ chưa được tận dụng để đánh giá phúc lợi ở động vật có vú (Altex, 2017).

7. Mota-Rojas, D. và cộng sự. Những tiến bộ hiện tại trong việc đánh giá cảm xúc, nét mặt của chó và việc sử dụng chúng để nhận biết cơn đau trên lâm sàng. Động vật 11, 3334 (2021).

8. Ekman, P. & Friesen, Hệ thống mã hóa hành động trên khuôn mặt của WV: Cẩm nang (Nhà xuất bản tâm lý học tư vấn, 1978).

9. Ekman, P. & Friesen, W. Hệ thống mã hóa hành động trên khuôn mặt: một kỹ thuật đo chuyển động của khuôn mặt (1978).


For more information:1950477648nn@gmail.com




Bạn cũng có thể thích