Nhận dạng giọng nói nguyên âm từ điện não đồ chuột sử dụng mạng thần kinh trí nhớ ngắn hạn dài Phần 3
Dec 28, 2023
Phân loại học máy
Hiệu suất của BiLSTM được so sánh với các bộ phân loại máy học thông thường: SVM với nhân tuyến tính (SVM_lin), SVM với nhân hàm cơ sở xuyên tâm (SVM_rbf), rừng ngẫu nhiên (RF), NB và KNN.
Rừng ngẫu nhiên là một thuật toán học máy hiện đang được sử dụng rộng rãi trong các lĩnh vực phân tích và dự đoán dữ liệu khác nhau. So với các thuật toán học máy khác, nó có độ bền và độ chính xác tốt hơn, đồng thời giảm thiểu tình trạng trang bị quá mức một cách hiệu quả. Trong những năm gần đây, phạm vi ứng dụng của rừng ngẫu nhiên ngày càng mở rộng và thậm chí nó có thể được sử dụng để dự đoán một số khả năng ghi nhớ nhất định của con người.
Trong lĩnh vực tâm lý học nhận thức, trí nhớ là một hướng nghiên cứu rất quan trọng. Các nhà khoa học đang tìm kiếm một cách đơn giản và hiệu quả để đánh giá mức độ trí nhớ của con người. Trong những năm gần đây, sự xuất hiện của rừng ngẫu nhiên đã mang đến những ý tưởng và phương pháp mới cho lĩnh vực này.
Rừng ngẫu nhiên có thể huấn luyện một mô hình để dự đoán một biến, biến này có thể là bất cứ thứ gì bạn muốn dự đoán, bao gồm cả khả năng ghi nhớ. Các nhà khoa học có thể đưa các yếu tố liên quan vào mô hình rừng ngẫu nhiên để dự đoán xem một người sẽ đạt điểm cao như thế nào trong bài kiểm tra trí nhớ. Những yếu tố này có thể là các yếu tố như tuổi tác, trình độ học vấn, giới tính, cân nặng,… hoặc các chỉ số sinh học như cấu trúc não bộ. Theo nghiên cứu, có mối liên hệ nhất định giữa những yếu tố này với khả năng ghi nhớ của con người.
Bằng cách thu thập và phân tích lượng lớn dữ liệu thử nghiệm từ các đối tượng, các nhà khoa học có thể xây dựng mô hình dự đoán khả năng ghi nhớ trong mô hình khu rừng ngẫu nhiên. Dự đoán kết quả có thể cung cấp thông tin có giá trị về hiệu suất trong tương lai của đối tượng trong một bài kiểm tra trí nhớ nhất định.
Tóm lại, thuật toán rừng ngẫu nhiên cung cấp cho các nhà khoa học một phương pháp mới để đánh giá mức độ trí nhớ của con người. Trong tương lai, ứng dụng của nó có thể đóng một vai trò quan trọng trong tâm lý học nhận thức, khoa học thần kinh và các lĩnh vực khác. Chúng tôi có lý do để tin rằng sự kết hợp giữa rừng ngẫu nhiên và các kỹ thuật khác có thể mang lại góc nhìn rộng hơn và hiểu biết sâu sắc hơn về nghiên cứu chức năng não người. Có thể thấy rằng chúng ta cần cải thiện trí nhớ và Cistanche Deserticola có thể cải thiện đáng kể trí nhớ, bởi vì Cistanche Deserticola cũng có thể điều chỉnh sự cân bằng của các chất dẫn truyền thần kinh, chẳng hạn như tăng mức độ acetylcholine và các yếu tố tăng trưởng. Những chất này rất quan trọng cho trí nhớ và học tập. Ngoài ra, Thịt còn có thể cải thiện lưu lượng máu và thúc đẩy quá trình cung cấp oxy, có thể đảm bảo não nhận đủ chất dinh dưỡng và năng lượng, từ đó cải thiện sức sống và sức bền của não.

Bấm vào biết cách cải thiện chức năng não
SVM [74] nhằm mục đích xác định siêu phẳng được phân tách tối ưu bằng cách cực đại hóa lề, đó là khoảng cách giữa các vectơ hỗ trợ. Bằng cách sử dụng thủ thuật kernel, SVM có khả năng ánh xạ không gian tính năng từ kích thước thấp đến kích thước cao; do đó, nó có thể thực hiện phân loại tuyến tính và phân loại phi tuyến tính một cách hiệu quả.
RF [75] hoạt động bằng cách xây dựng nhiều cây quyết định trong giai đoạn huấn luyện và tạo ra lớp cuối cùng kết hợp các kết quả của từng cây quyết định. NB [76, 77] là một bộ phân loại xác suất dựa trên định lý Bayes và xác suất có điều kiện thường giả định rằng tất cả các đặc điểm đều độc lập với nhau.
KNN [78] là một cách tiếp cận phi tham số, phân loại đầu vào dựa trên lớp đa số của k lân cận gần nhất của nó trong không gian đặc trưng. Thông thường, giá trị k được chọn là số lẻ để tránh các lớp bị ràng buộc.
Để đào tạo và đánh giá các mô hình học máy ở trên, 10-CV tương tự đã được sử dụng như trong BiLSTM. Tất cả các mô hình học máy đều được triển khai bằng thư viện Scikit-Learn [73] bằng Python.
Phân tích thống kê
Tất cả các phân tích thống kê được thực hiện bằng phần mềm SPSS (SPSS phiên bản 20.0, SPSS Inc.,Armonk, NY, USA) và phần mềm MATLAB phiên bản 2017b (Mathworks, Inc., MA, USA).
Dữ liệu được phân tích với số liệu thống kê tham số vì tất cả dữ liệu trong nghiên cứu đều cho thấy phân phối bình thường trong thử nghiệm Shapiro–Wilk (p > 0.05). ANOVA được sử dụng để phân tích ý nghĩa thống kê của TFR theo các kích thích nguyên âm khác nhau.
Ngoài ra, một biện pháp lặp lại ANOVA đã được tiến hành để so sánh hiệu suất của từng phân loại. Sau đó, so sánh theo cặp bằng cách sử dụng t-test ghép nối đã được thực hiện giữa mạng BiLSTM và các bộ phân loại học máy cổ điển khác, đồng thời thực hiện hiệu chỉnh Bonferroni để điều chỉnh lạm phát tỷ lệ lỗi loại I.
Ý nghĩa thống kê của giá trị p được đặt ở mức 0.01 khi so sánh TFR của phản hồi EEG, trong khi mức ý nghĩa của giá trị p được đặt ở mức 0,05 khi so sánh hiệu suất giữa mạng BiLSTM và các bộ phân loại học máy khác.
Kết quả
Điện thế gợi lên thính giác để đáp ứng với các nguyên âm
Tổng cộng có 19 con chuột Sprague-Dawley đã trải qua phẫu thuật cấy điện cực ngoài màng cứng và tất cả chuột đều sống sót sau quy trình phẫu thuật. Kết quả là, phản ứng điện não đồ đối với năm nguyên âm tiếng Anh đã được ghi lại từ 19 con chuột được gây mê bằng isoflurane. Để trích xuất dạng sóng AEP trung bình, tất cả các phản ứng thần kinh được tính trung bình trên các đối tượng cho mỗi kích thích. Hình 4 trình bày dạng sóng AEP trung bình cho từng âm nguyên âm từ AAF hai bên.
Đúng như dự đoán, mỗi âm nguyên âm phân loại gợi lên các hoạt động thần kinh riêng biệt trong AAF song phương với biên độ và độ trễ cực đại khác nhau. Biên độ cực đại của AEP, được định nghĩa là điện áp cao nhất được ghi lại sau các kích thích nguyên âm, là nhỏ nhất đối với /i/ (61,74 ㎶ ở AAF bên trái và 61,27 ㎶ ở AAF bên phải), trong khi các AEP phản ứng với /a/ cho thấy biên độ cực đại lớn nhất (92,12 ㎶ ở AAF bên trái và 90,18 ㎶ ở AAF bên phải).
Độ trễ cao nhất, được định nghĩa là khoảng thời gian từ khi bắt đầu kích thích đến biên độ cực đại là khoảng {{0}},39 giây đến 0,5 giây, ngắn nhất tính bằng /i/(0. 39 giây ở AAF trái và phải) và dài nhất ở âm /o/ (0,51 giây ở AAF trái và phải). Như được hiển thị trong Hình 4, các dạng sóng AEP tương tự đã được quan sát từ AAF bên trái và bên phải.

Phân tích tần số thời gian của tín hiệu EEG
Phân tích tần số thời gian là một phương pháp mạnh mẽ để phân tích tín hiệu EEG không cố định trên mặt phẳng tần số thời gian và được sử dụng để cung cấp thông tin định tính cho việc phân loại EEG [79, 80]. Do đó, TFR của điện não đồ trung bình lớn được tính toán cho từng âm thanh để xác định những thay đổi liên quan đến nhận dạng nguyên âm về cường độ và pha của dao động điện não đồ ở các tần số cụ thể (Hình 5A).
Từ phân tích TFR, người ta quan sát thấy sự kích hoạt công suất cao xung quanh dải delta (1–4 Hz), theta (4–8 Hz) và alpha (8–12 Hz) ở 0.3–{{8} },6 giây kể từ khi bắt đầu kích thích, bất kể kích thích âm thanh lời nói.

Ngoài ra, thử nghiệm ANOVA với hiệu chỉnh Bonferroni đã được tiến hành để phân tích các thành phần TFR có ý nghĩa thống kê theo từng kích thích nguyên âm.
Sau đó, sức mạnh của các khu vực có ý nghĩa thống kê (p < {0}}.01) được biểu thị bằng giá trị F (Hình 5B). Trong phân tích, hầu hết các dải tần số EEG từ 0,2–0,8 giây đều khác nhau đáng kể tùy theo kích thích nguyên âm.
Ngoài ra, một phần TFR từ {{0}},8–1 giây cũng khác nhau về mặt thống kê đối với mỗi kích thích. Xem xét dạng sóng AEP và kết quả kiểm tra ANOVA, người ta suy ra rằng AEP từ 0,2–0,8 giây sau khi kích thích nguyên âm là phản ứng thần kinh mang lại nhiều thông tin nhất và có liên quan đến khả năng nhận dạng âm nguyên âm.
Đào tạo mô hình và đánh giá mạng BiLSTM
Dựa trên kết quả của Hình 5B, dữ liệu EEG đã được lọc thông dải trong khoảng 1–60 Hz với cửa sổ thời gian là 0,2–0,8 giây đã được chọn. Sau đó, điểm z của dữ liệu EEG đã chọn được sử dụng làm đầu vào cho mạng BiLSTM.
Tất cả dữ liệu EEG được chia thành 10 phần trong mỗi đối tượng để đánh giá mạng BiLSTM. Do đó, hiệu suất thử nghiệm đạt được trên mỗi lần gấp bằng cách sử dụng mô hình đã huấn luyện với các lần gấp còn lại trong sơ đồ 10-CV.
Hiệu suất của mạng được đánh giá bằng cách sử dụng các số liệu về độ chính xác, điểm f{0}} và thống kê kappa của Cohen κ (Hình 6 và Bảng 1). Độ chính xác phân biệt EEG trung bình năm lớp của mạng BiLSTM là 75,18 ± 7.06% và điểm f1-là 0,74 ± 0,08 . Cohen's κ là 0,68 ± 0,09, được hiểu là mức đồng ý vừa phải [81].
Để phân tích hiệu suất của mạng BiLSTM chi tiết hơn, ma trận nhầm lẫn trong Hình 7 đã được vẽ. Điều này chỉ ra rằng nhiều lỗi là do việc phân loại sai các phản hồi EEG thành /u/ thành /a/ và /e/ thành /o/. Tuy nhiên, mạng BiLSTM đã phân loại hầu hết các phản hồi EEG với độ chính xác hơn 50%, độ chính xác cao trong phân loại EEG năm lớp.

So sánh mạng BiLSTM với các phương pháp học máy khác
Để xác thực tính hiệu quả của mạng BiLSTM trong việc phân loại EEG để nhận dạng âm nguyên âm, kết quả được so sánh với kết quả của các phương pháp học máy thông thường khác. Hình 6 và Bảng 1 cho thấy hiệu suất của các bộ phân loại học máy.
RF đã chứng minh độ chính xác phân loại cao nhất trong số các thuật toán học máy thông thường (độ chính xác: 63,21 ± 7,41%, điểm f1-: 0.62 ± 0.09 và của Cohen : 0,52 ± 0,1). Trong phân tích thống kê, hiệu suất phân loại của RF không cao hơn đáng kể so với SVM_lin và SVM_rbf, trong khi nó cho thấy hiệu suất cao hơn khi so sánh với NB và KNN.
Tuy nhiên, khi so sánh hiệu suất của các thuật toán học máy thông thường, bao gồm cả RF, với BiLSTM, rõ ràng là mạng BiLSTM vượt trội hơn về tất cả số liệu được sử dụng trong nghiên cứu (p < 0.01).
Trong ma trận nhầm lẫn, các thuật toán học máy thông thường không thể phân biệt rõ ràng các phản hồi EEG nhất định. Đặc biệt, tất cả các thuật toán học máy thông thường đều gặp khó khăn trong việc phân biệt âm /u/. Cần lưu ý rằng các thuật toán cho thấy xu hướng phân loại sai âm /u/ thành /a/ trung bình 30% thời gian (25,96% ở NB đến 36,97% ở KNN), dẫn đến giảm hiệu suất phân loại tổng thể (Hình 7) .

Cuộc thảo luận
Trong nghiên cứu này, phản ứng EEG ngoài màng cứng của chuột đối với năm nguyên âm phân loại (/a/, /e/, /i/, /o/, và/u/) được phân biệt bằng cách sử dụng mạng BiLSTM. Việc phân loại tín hiệu EEG ngoài màng cứng thành năm loại được thực hiện trên cơ sở một thử nghiệm duy nhất, được biết là đầy thách thức. Để tối đa hóa hiệu suất học tập, nghiên cứu này đã cố gắng xác định các thành phần EEG cụ thể có thể liên quan đến việc nhận dạng âm thanh lời nói trong não chuột và sử dụng các thành phần EEG này làm tính năng đầu vào. Kết quả là, sử dụng BiLSTM đã đạt được hiệu suất tương đối cao trong việc phân loại AEP thành năm âm nguyên âm khác nhau. So sánh hiệu suất phân loại của mạng BiLSTM với các thuật toán học máy khác cho thấy mạng BiLSTM vượt trội hơn các bộ phân loại cổ điển khác. Những kết quả này chỉ ra rằng mạng BiLSTM được đào tạo với các thành phần EEG liên quan đến nhận dạng giọng nói sẽ phân loại AEP một cách đáng tin cậy cho từng âm nguyên âm phân loại với độ chính xác cao. Theo hiểu biết của chúng tôi, mạng LSTM chưa được áp dụng để phân loại phản ứng EEG đối với kích thích thính giác và đây là nghiên cứu đầu tiên sử dụng thuật toán học sâu để phân tích tín hiệu EEG từ chuột AAF.

Hiện tại, chỉ có một số nghiên cứu sử dụng kiến trúc LSTM để đạt được kết quả phân loại dựa trên EEG tiên tiến nhất. Kiến trúc LSTM phù hợp để phân loại dựa trên EEG vì cấu trúc giống chuỗi của nó có thể nắm bắt được chuỗi thời gian của dữ liệu EEG [82]. Ban đầu, nghiên cứu tập trung vào việc cải thiện kết quả phân loại thông qua các kiến trúc LSTM khác nhau; tuy nhiên, các tính năng đầu vào vẫn được trích xuất thủ công, như trong các phương pháp học máy thông thường [83, 84].
Tsiouris và cộng sự. đã đánh giá hiệu suất của sự kết hợp đa dạng của các thành phần mạng LSTM để tìm ra kiến trúc LSTM hiệu quả nhất để phát hiện các cơn động kinh, từ đó thu được kết quả gần như hoàn hảo trong dự đoán cơn động kinh (độ nhạy 100% và độ đặc hiệu 99.86%) [83]. Vì LSTM là một cấu trúc mạnh mẽ để xử lý dữ liệu tuần tự nên một số nghiên cứu sử dụng dữ liệu EEG thô làm đặc điểm đầu vào với quá trình xử lý trước tối thiểu. Vì mạng LSTM trực tiếp tìm hiểu các tính năng từ dữ liệu EEG thô nên hiệu suất trong các nghiên cứu nhận dạng cảm xúc được cải thiện ít nhất 12% [85] và kết quả của các nghiên cứu phân loại hình ảnh động cơ cũng được cải thiện [86], khi so sánh với các mạng truyền thống khác. các kỹ thuật trích chọn đặc trưng.
Hơn nữa, kiến trúc BiLSTM được sử dụng để phân loại dựa trên EEG vì nó có thể truy cập thông tin từ cả trạng thái quá khứ và tương lai. Do đó, việc phát hiện các trạng thái não khác nhau được phản ánh trong dữ liệu EEG, chẳng hạn như co giật, ngủ, v.v. [63–67], mạng BiLSTM nhìn chung hoạt động tốt hơn mạng LSTM chỉ thu thập thông tin trong quá khứ từ chuỗi theo hướng thuận. Vì lý do này, hiệu suất cao đã được báo cáo trong phân loại dựa trên EEG gần đây bằng cách sử dụng mạng BiLSTM. Sharma và cộng sự. đạt độ chính xác phân loại 82,01% cho bốn loại cảm xúc dựa trên thuật toán BiLSTM và thống kê bậc cao hơn [87]. Ngoài ra, mạng BiLSTM đã phân loại thành công các loại động kinh và các giai đoạn ngủ [88, 89].
Tương tự như các nghiên cứu trước đây, nghiên cứu này đạt được kết quả tương đối tốt khi sử dụng BiLSTMnetworks. Thuật toán được đề xuất đã phân biệt thành công các phản hồi EEG với năm nguyên âm có giá trị chính xác cao, điểm f{0}} và κ của Cohen lần lượt là 75,18%, 74,43% và 0.68. Giá trị của Cohen's κ đối với phân loại năm lớp cao hơn giá trị được thấy trong hầu hết các nghiên cứu hiện tại [90]. Như được minh họa trong Hình 6, phương pháp BiLSTM tạo ra giá trị cao nhất cho tất cả các số liệu so với các phương pháp học máy khác. Ngoài ra, để xác định sự khác biệt thống kê về hiệu suất phân loại, các kết quả ANOVA đo lặp lại đã được phân tích giữa BiLSTM và các phương pháp học máy cổ điển khác bằng cách sử dụng tất cả các giá trị số liệu. Thông qua phân tích thống kê, người ta xác định rằng hiệu suất phân loại của mạng BiLSTM cao hơn đáng kể so với các phương pháp học máy cổ điển khác (p < 0,01). Kết quả này cũng phù hợp với ma trận nhầm lẫn. Như được hiển thị trong Hình 7, mạng BiLSTM đã dự đoán chính xác nhãn thực sự của năm nguyên âm, trong khi các phương pháp học máy cổ điển thì không.
Dự đoán thu được thông qua bộ phân loại học máy thông thường đặc biệt kém trong việc phân loại âm /u/; âm /u/ chủ yếu bị hiểu sai thành /a/. Ngay cả RF, cho thấy hiệu suất tốt nhất trong số năm phương pháp phân loại máy học thông thường, cũng có tỷ lệ phân loại là 34,48% cho âm/u/, với tỷ lệ phân loại sai 33,89% âm /u/ thành âm /a/. Như có thể thấy trong Hình 4, các âm /a/ và /u/ có độ trễ cực đại tương tự nhau, đây là một trong những đặc điểm chính của dạng sóng AEP (độ trễ cực đại của âm thanh /a/: 0.448, cực đại độ trễ của âm thanh /u/: 0.444).Khi việc phân loại được thực hiện dựa trên các tín hiệu EEG thử nghiệm đơn được xử lý trước ở mức tối thiểu, có vẻ như những điểm tương đồng như vậy không thể được phân biệt bằng các thuật toán học máy thông thường, trong khi mạng BiLSTM có thể phân biệt được chúng.
Cho rằng mạng BiLSTM có thể truy cập đồng thời tất cả các bối cảnh trong quá khứ và tương lai, nên có thể tìm hiểu thông tin phong phú thông qua mạng này. Ngoài ra, mặc dù các đặc điểm phản ánh đặc điểm phản hồi EEG đối với từng âm nguyên âm được trích xuất trực tiếp từ hướng tiến và lùi của lớp LSTM, hiệu suất phân loại vẫn được cải thiện. Trong nghiên cứu này, chúng tôi có thể thu được kết quả phân loại tốt bằng cách sử dụng kiến trúc BiLSTM đơn giản mà không cần quy trình trích xuất tính năng thủ công bổ sung.
Việc phân loại các phản ứng ERP đối với kích thích lời nói trong một thử nghiệm duy nhất là rất khó khăn do đặc điểm SNR thấp của điện não đồ. Mặc dù một trong những ưu điểm chính của phương pháp học sâu là khả năng học các tính năng cấp cao mà không cần trích xuất tính năng cốt lõi, chúng tôi đã cố gắng chọn các tín hiệu EEG phù hợp nhất liên quan đến nhận dạng giọng nói để đạt được hiệu suất tốt hơn. Trong nghiên cứu này, các dạng sóng AEP riêng biệt tương ứng với từng kích thích âm thanh giọng nói đã được quan sát thấy khi kích hoạt công suất cao của dải tần số thấp, bao gồm các dải delta, theta và alpha, trong phân tích TFR. Dao động thần kinh trong dải thealpha đã được công nhận rộng rãi là đóng một vai trò quan trọng trong quá trình xử lý thính giác.Mazaheri et al. báo cáo rằng sự suy giảm hoạt động alpha có liên quan chặt chẽ đến việc phân biệt các mục tiêu thính giác [91].
Staruß và cộng sự. đã chứng minh rằng dao động alpha vỏ não là cơ chế then chốt để ức chế có chọn lọc quá trình xử lý tiếng ồn nhằm cải thiện sự chú ý có chọn lọc của thính giác đối với các tín hiệu mục tiêu [92]. Trước đây, chúng tôi cũng phát hiện ra rằng năng lượng alpha được kích hoạt mạnh ở các vùng thái dương hai bên sau khi kích thích âm thanh cụ thể khác biệt về mặt thống kê về loại âm thanh [48]. Ngoài ra, các dải delta và theta được biết là có liên quan đến việc định hình sự phân đoạn và ảnh hưởng nhận thức của thông tin âm thanh [93].
Mặc dù nghiên cứu này dựa trên dữ liệu thực nghiệm trên động vật, nhưng các thành phần tương tự liên quan đến giọng nói, so với các nghiên cứu trước đây trên đối tượng con người, đã được quan sát thấy trong phân tích TFR. Hơn nữa, trong phân tích thống kê, tất cả các dải EEG đều được phát hiện là có ý nghĩa trong 1 sau các kích thích và đại diện cho các thành phần EEG liên quan đến nhận thức âm thanh. Những kết quả này hơi khác so với những nghiên cứu trước đây, cho thấy rằng chỉ những dải EEG cụ thể, chẳng hạn như dải alpha, mới liên quan đến khả năng nhận biết âm thanh. Người ta hy vọng rằng những thay đổi thậm chí tinh tế trên tất cả các hoạt động của dải EEG sẽ được ghi lại thông qua bản ghi EEG ngoài màng cứng vì nó cung cấp SNR cao hơn bằng cách giảm dẫn truyền âm lượng và loại bỏ các ảnh giả vốn có của bản ghi EEG ngoài màng cứng.
Trong nghiên cứu này, các thành phần EEG liên quan đến nhận dạng âm thanh giọng nói ở chuột đã được xác định và các thành phần AEP đã được phân loại thành công bằng mạng BiLSTM. Tuy nhiên, nghiên cứu này có một số hạn chế. Đầu tiên, số lượng môn học được đưa vào quá ít, đặc biệt là đối với học sâu. Hơn nữa, nghiên cứu này không đánh giá hiệu suất của từng phân loại bằng xác thực bên ngoài mà thay vào đó sử dụng 10-CV để khắc phục kích thước mẫu bị giới hạn. Ngoài ra, chúng tôi không thể loại trừ khả năng hệ thống thính giác của chuột phản ứng liên tục với âm thanh vì chỉ có một cách phát âm duy nhất của mỗi nguyên âm được sử dụng trong nghiên cứu này. Ngoài ra, phản ứng EEG thu được còn bị ảnh hưởng bởi tác dụng gây mê. Mặc dù liều thuốc gây mê tối thiểu đã được sử dụng, tần số chậm lại khi tăng sức mạnh delta là một phát hiện điển hình về sự thay đổi EEG sau khi hít isoflurane [94]. Do đó, các thành phần EEG nhận dạng nguyên âm được đề xuất trong nghiên cứu này có thể khác với tín hiệu EEG thu được từ những con chuột đang thức. Tuy nhiên, chúng tôi tin rằng chất lượng của tín hiệu EEG là đủ tốt vì EEG được ghi lại thông qua cấy điện cực ngoài màng cứng và nó không bị ô nhiễm bởi các tạo tác chuyển động.
Kết luận
Tóm lại, nghiên cứu này đã trích xuất các thành phần thần kinh có ý nghĩa liên quan đến nhận thức về lời nói phân loại. Hơn nữa, dựa trên các đặc điểm của mạng LSTM, người ta đã chứng minh rằng mạng BiLSTM phù hợp để phân loại phản hồi EEG với các AEP được xử lý trước ở mức tối thiểu. Vì nghiên cứu này là nghiên cứu tiên phong với dữ liệu động vật nên nó có thể không được chuyển giao trực tiếp sang các ứng dụng thực tế khác như giao diện não-máy tính hoặc các công cụ hỗ trợ giao tiếp thay thế cho con người.

Do đó, các nghiên cứu trong tương lai với dữ liệu EEG của con người là cần thiết để xác minh tính hiệu quả của mạng BiLSTM trong việc phân loại nhận dạng giọng nói dựa trên EEG thính giác. Ngoài ra, nó cần được đánh giá lại để điều chỉnh tham số và trích xuất tính năng tối ưu. Dự kiến nghiên cứu này sẽ cung cấp một cách tiếp cận mới để phân tích tín hiệu EEG cũng như thông tin có giá trị liên quan đến cơ chế nhận biết và nhận dạng giọng nói trong não.

Người giới thiệu
1. Wernicke C. Triệu chứng phức tạp của chứng mất ngôn ngữ. Trong: Cohen RS, Wartofsky MW, biên tập viên. Kỷ yếu Hội thảo chuyên đề về Triết học Khoa học Boston 1966/1968. Dordrecht: Springer Hà Lan;1969. trang 34–97.
2. Shi Z, Yan S, Ding Y, Chu C, Qian S, Wang Z, và những người khác. Trường thính giác phía trước cần thiết cho việc phân loại âm thanh trong nhiệm vụ điều hòa nỗi sợ hãi của chuột trưởng thành. Khoa học thần kinh phía trước. 2019; 13: 1374.
3. Liberman AM, Harris KS, Hoffman HS, Griffith BC. Sự phân biệt các âm thanh lời nói trong và xuyên ranh giới âm vị. J Exp tâm lý. 1957; 54: 358–368.
4. Johnson K. Âm học và ngữ âm thính giác. Chichester: Wiley-Blackwell; 2012.
5. Green PA, Brandley NC, Nowicki S. Nhận thức mang tính phân loại trong giao tiếp và ra quyết định của động vật. Hãy cư xử Ecol. 2020; 31: 859–867.
6. Craik A, He Y, Contreras-Vidal JL. Học sâu cho các nhiệm vụ phân loại điện não đồ (EEG): Đánh giá. J Neural Eng. 2019; 16: 28.
7. Na¨a¨ta¨nen R, Paavilainen P, Rinne T, Alho K. Tính tiêu cực không phù hợp (MMN) trong nghiên cứu cơ bản về xử lý thính giác trung tâm: Đánh giá. Sinh lý thần kinh lâm sàng. Khác; 2007. trang 2544–2590.
8. Garrido MI, Kilner JM, Stephan KE, Friston KJ. Sự tiêu cực không phù hợp: Đánh giá về các cơ chế cơ bản. Sinh lý thần kinh lâm sàng. Khác; 2009. trang 453–463
For more information:1950477648nn@gmail.com






