Nghiên cứu về nhận dạng âm thanh dựa trên mạng lưới thần kinh sâu trong giảng dạy âm nhạc
Oct 10, 2023
Solfeggio là khóa học cơ bản quan trọng dành cho chuyên ngành âm nhạc và đào tạo nhận dạng âm thanh là một trong những mắt xích quan trọng. Với sự cải thiện hiệu suất máy tính, nhận dạng âm thanh đã được sử dụng rộng rãi trong các thiết bị đeo thông minh. Trong những năm gần đây, sự phát triển của deep learning đã đẩy nhanh quá trình nghiên cứu về nhận dạng âm thanh. Tuy nhiên, trong môi trường dạy nhạc có rất nhiều hiện tượng nhiễu âm thanh, dẫn đến hiệu suất của lớp âm thanh…ơ, không thể đáp ứng được nhu cầu thực tế. Để giải quyết vấn đề này, một hệ thống nhận dạng âm thanh cải tiến dựa trên YOLO-v4 đã được đề xuất, hệ thống này chủ yếu cải thiện cấu trúc mạng.
Hát và luyện tai không thể tách rời khỏi trí nhớ. Trong quá trình học âm nhạc, việc tập thị giác và thính giác là một kỹ năng rất quan trọng. Mục đích của việc luyện nghe thính giác bằng thị giác là cho phép học sinh rèn luyện kỹ năng âm nhạc và trí nhớ bằng cách nghe và hát những nốt cụ thể.
Nội dung chính của việc luyện tai nghe hát bao gồm cao độ, nhịp điệu, giọng nói, giai điệu, hòa âm, v.v. Thông qua việc luyện nghe bằng tai nghe, chúng ta có thể liên tục luyện tập đôi tai của mình, cho phép chúng ta xác định chính xác hơn các nốt và nhịp điệu khác nhau, đồng thời nhanh chóng chuyển đổi những nốt nhạc chúng ta nghe được thành các ký hiệu trên bản đồ âm nhạc, từ đó nâng cao khả năng ghi nhớ của Chúng ta.
Hát và luyện tai cũng có thể giúp chúng ta hiểu rõ hơn và nắm vững các quy luật của âm nhạc. Khi sử dụng đôi tai để cảm nhận và hiểu âm nhạc một cách trực tiếp, chúng ta có thể hiểu được nhịp điệu và giai điệu của âm nhạc một cách sâu sắc hơn, từ đó cải thiện khả năng ghi nhớ nhanh hơn.
Ngoài ra, việc rèn luyện thị giác và thính giác cũng có thể giúp chúng ta phát triển khả năng cảm nhận âm nhạc tốt và cảm xúc âm nhạc mạnh mẽ. Thông qua rèn luyện, sự hiểu biết và cảm nhận âm nhạc của chúng ta sẽ ngày càng sâu sắc hơn, từ đó nâng cao tình yêu và sự trân trọng âm nhạc của chúng ta.
Trí nhớ là yếu tố rất quan trọng trong quá trình học nhạc. Kỹ năng ghi nhớ tốt là một trong những điều kiện cần thiết để học bất kỳ loại nhạc cụ nào và sáng tác nhạc. Thông qua việc luyện tập thị giác và thính giác, chúng ta có thể cải thiện trí nhớ và nắm vững các kỹ thuật và kỹ năng âm nhạc tốt hơn. Khi đối mặt với những tiết mục phức tạp, chúng ta có thể ghi nhớ các nốt và nhịp điệu nhanh hơn, giúp chúng ta thể hiện tác phẩm âm nhạc tốt hơn.
Nói tóm lại, việc rèn luyện thính giác và trí nhớ bằng âm thanh không thể tách rời và cả hai bổ sung cho nhau. Thông qua việc rèn luyện khả năng nghe và hát liên tục, chúng ta có thể cải thiện kỹ năng âm nhạc và khả năng ghi nhớ để làm chủ âm nhạc tốt hơn. Có thể thấy, chúng ta cần cải thiện trí nhớ, và Cistanche Deserticola có thể cải thiện trí nhớ đáng kể vì Cistanche Deserticola là một dược liệu cổ truyền của Trung Quốc có nhiều tác dụng độc đáo, một trong số đó là cải thiện trí nhớ. Hiệu quả của thịt băm đến từ các hoạt chất khác nhau có trong nó, bao gồm axit, polysacarit, flavonoid, v.v. Những thành phần này có thể tăng cường sức khỏe não bộ theo nhiều cách khác nhau.

Bấm vào biết cách cải thiện chức năng não
Đầu tiên, số cestrum tần số Mel được sử dụng để xử lý âm thanh gốc và trích xuất các đặc điểm tương ứng. vi, hãy thử áp dụng mô hình YOLO-v4 trong …lĩnh vực học sâu đến …lĩnh vực nhận dạng âm thanh và cải thiện nó bằng cách kết hợp nó với mô-đun nhóm kim tự tháp không gian để tăng cường khả năng khái quát hóa dữ liệu ở các định dạng âm thanh khác nhau. Thứ hai, phương pháp xếp chồng trong học tập tổng hợp được sử dụng để hợp nhất các mô hình con độc lập của hai kênh khác nhau. Kết quả thử nghiệm cho thấy so với các công nghệ deep learning khác, mô hình YOLO-v4 cải tiến có thể cải thiện hiệu suất nhận dạng âm thanh và có hiệu suất xử lý dữ liệu ở các định dạng âm thanh khác nhau tốt hơn, cho thấy khả năng khái quát hóa tốt hơn.
1. Giới thiệu
Âm nhạc là một loại hình nghệ thuật trừu tượng với âm thanh là phương tiện biểu đạt. Trong quá trình giảng dạy âm nhạc, solfeggio có thể tăng cường khả năng ghi nhớ âm nhạc của học sinh, giúp học sinh xác định chính xác các tác phẩm âm nhạc và do đó có được “cảm nhận âm nhạc” tốt hơn. Là một mắt xích quan trọng trong solfeggio, việc đào tạo nhận dạng âm thanh là rất khó đối với học sinh cấp dưới. là vì học sinh cần nắm vững tất cả các loại khóa nhạc, phân biệt độ dài và thời lượng được biểu thị bằng các nốt khác nhau cũng như sự khác biệt về cao độ giữa các nốt khác nhau.
Phân tích tín hiệu âm thanh dựa trên các thiết bị thông minh nhúng ngày càng thu hút sự chú ý của các nhà nghiên cứu [1–7]. Các thiết bị đeo thông minh có chức năng nhận dạng âm thanh có thể giúp học sinh giải quyết các vấn đề trên và hỗ trợ giảng dạy âm nhạc. Nhiệm vụ nhận dạng âm thanh cần xử lý trước các tín hiệu âm thanh được thu thập…nghỉ ngơi, trích xuất các đặc điểm có giá trị để phân biệt các bản nhạc với chúng và…cuối cùng phân loại chúng theo các đặc điểm này. Phân loại…cation là một phương pháp khai thác dữ liệu rất quan trọng [8–10]. Phân loại…cation đề cập đến việc tạo ra một …hàm cation cổ điển theo các quy tắc nhất định dựa trên dữ liệu tập huấn luyện. Chức năng này có thể ánh xạ dữ liệu của tập kiểm tra vào một trong các danh mục nhất định, từ đó hiện thực hóa dự đoán danh mục của dữ liệu chưa biết. Hiện tại, các… phương pháp cổ điển phổ biến bao gồm cây quyết định, hồi quy logistic, máy vectơ hỗ trợ (SVM), Naive Bayes, thuật toán k-láng giềng gần nhất (KNN), mạng thần kinh BP và học sâu [11–13].
Các phương pháp học máy trước đây thường cần trích xuất thủ công các tính năng có thể biểu thị dữ liệu gốc làm đầu vào của lớp…er. Tuy nhiên, deep learning có thể tự động trích xuất các đặc điểm nhiều chiều của mẫu (không cần trích xuất đặc điểm thủ công), miễn là dữ liệu đầu vào bao phủ thông tin của dữ liệu gốc nhiều nhất có thể, phù hợp với dữ liệu quy mô lớn. *Phương pháp học sâu có thể thực hiện các nhiệm vụ nhận dạng âm thanh cụ thể với sự trợ giúp của một lượng lớn dữ liệu âm thanh được thu thập bởi các thiết bị thông minh. *e Mạng nơ ron tích chập (CNN), như một loại kiến trúc học sâu, được sử dụng rộng rãi trong phân loại hình ảnh, nhận dạng giọng nói, xử lý ngôn ngữ tự nhiên và các lĩnh vực khác nhờ hiệu suất vượt trội của nó trong học tập tính năng cục bộ [14]. Khác với các mô hình mạng nơron khác (như máy Boltzmann và mạng nơron hồi quy), CNN có đặc điểm hoạt động cốt lõi là hoạt động tích chập. *e Mạng YOLO rút ra bài học từ cấu trúc mạng phân loại CNN và cho thấy những ưu điểm tốt trong lĩnh vực nhận dạng hình ảnh nên đã thu hút được sự quan tâm của nhiều nhà nghiên cứu.
*Vì vậy, nghiên cứu này cố gắng áp dụng mô hình YOLO-v4 vào lĩnh vực nhận dạng âm thanh và cải thiện cấu trúc mạng của nó. Ngoài ra, phương pháp xếp chồng trong học tập tổng hợp được sử dụng để hợp nhất hai mô hình con độc lập của các kênh khác nhau và hiệu suất phân loại của hệ thống hợp nhất được cải thiện hơn nữa so với mô hình con đơn lẻ.
2. Công trình liên quan
Ngày nay, với sự xuất hiện của số lượng lớn thiết bị thông minh, hiệu suất máy tính vượt trội và sự phát triển của công nghệ deep learning đã cùng nhau thúc đẩy quá trình nghiên cứu trong lĩnh vực âm thanh. Kết hợp với các nội dung nghiên cứu chính của nghiên cứu này, hiện trạng nghiên cứu sẽ được giới thiệu từ hai khía cạnh: mạng nơ ron tích chập và nhận dạng âm thanh.
*Cấu trúc mạng nơ-ron tích chập có nguồn gốc từ một nghiên cứu của Yann LeCun vào năm 1998 có tên là mạng nơ-ron nhân tạo Le Net-5. *e Mạng nơ-ron tích chập, giống như các mạng nơ-ron khác, có thể được huấn luyện bằng thuật toán lan truyền ngược [15]. Năm 2012, Alex Krizhevsky và những người khác lần đầu tiên áp dụng công nghệ CNN trong các nhiệm vụ thị giác máy tính phức tạp. Bằng cách sử dụng 3 lớp được kết nối đầy đủ, 5 lớp tích chập và bộ phân loại Softmax, một mạng lưới thần kinh tích chập với 8 lớp được xây dựng, được đặt tên là AlexNet. AlexNet sử dụng chức năng kích hoạt ReLU, đồng thời, nó cũng sử dụng tính năng chính quy hóa (dropout) để ngăn chặn tình trạng trang bị quá mức. Vào năm 2014, nhóm thị giác máy tính của Google đã đưa ra mạng GoogLeNet [16], với độ sâu mạng là 22 lớp, chứa cấu trúc mới, sự cố. Nó tích hợp các tính năng của độ sâu khác nhau và cùng một tỷ lệ, và độ chính xác phát hiện được cải thiện. Dựa trên mạng GoogLeNet, thuật toán YOLO và SSD đã xuất hiện. Cả hai phương pháp đều dựa trên một mạng đầu cuối duy nhất, có thể hoàn thành đầu vào từ hình ảnh gốc đến đầu ra của vị trí và danh mục đối tượng.
Ở khía cạnh nhận dạng âm thanh, Yang và Zhao [17] đã đề xuất phương pháp phân loại cảnh âm thanh dựa trên máy vectơ hỗ trợ (SVM), giúp tăng cường kết cấu âm thanh để cải thiện độ chính xác của phân loại. Greco và cộng sự. [18] đề xuất một hệ thống nhận dạng giọng nói dựa trên phương pháp học sâu heuristic. Demir và cộng sự. [19] đã đề xuất một phương pháp CNN xếp tầng kim tự tháp mới để phân loại âm thanh môi trường. Zhu và cộng sự. [20] đã đề xuất thuật toán YOLO-v4 cải tiến cho các thiết bị tạo ảnh âm thanh, giúp cải thiện hiệu quả độ chính xác của việc phát hiện hình ảnh đám mây pha âm thanh. *Các phương pháp trên đều cho thấy hiệu suất tuyệt vời khi xử lý các tác vụ nhận dạng âm thanh trong một cảnh âm thanh duy nhất, nhưng có nhiều nhiễu loạn âm thanh trong môi trường giảng dạy âm nhạc và cần phải xử lý nhiều loại dữ liệu định dạng âm thanh khác nhau.
*Do đó, nghiên cứu này đề xuất một hệ thống nhận dạng âm thanh dựa trên mô hình mạng YOLO-v4 cải tiến. *e những đổi mới và đóng góp chính bao gồm: (1) cố gắng áp dụng kiến trúc mạng YOLO-v4, vốn rất xuất sắc trong lĩnh vực học sâu, vào lĩnh vực nhận dạng âm thanh và cải thiện nó bằng cách kết hợp mô-đun nhóm kim tự tháp không gian. *e Kiến trúc mạng YOLO-v4 được cải tiến sử dụng hiệu quả thông tin không gian trong các tệp âm thanh, do đó tăng cường khả năng khái quát hóa dữ liệu ở các định dạng âm thanh khác nhau. (2) *Phương pháp xếp chồng e trong học tập tổng hợp được sử dụng để hợp nhất hai mô hình con độc lập của các kênh khác nhau và hiệu suất phân loại của hệ thống hợp nhất được cải thiện.
3. Trích xuất và xử lý đặc tính âm thanh
Trích xuất biểu diễn tham số tốt nhất của tín hiệu âm thanh là một trong những nhiệm vụ quan trọng để tạo ra hiệu suất nhận dạng tốt hơn. *e Việc trích chọn đặc trưng ở giai đoạn này rất quan trọng đối với việc phân loại của bộ phân loại ở giai đoạn tiếp theo vì nó sẽ ảnh hưởng trực tiếp đến hiệu quả phân loại.
Trong nhiệm vụ phân loại, đặc biệt là nhiệm vụ phân loại âm thanh, hệ số cestrum tần số Mel (MFCC) mô tả hình dạng quang phổ đã có lịch sử lâu đời. Mặc dù quá trình trích xuất MFCC sẽ gây ra tình trạng nén dữ liệu bị mất mát nhưng hiệu quả phân loại và nhận dạng của nó vẫn khá khả dụng ngay cả khi tốc độ dữ liệu rất thấp. Ngoài ra, so với các đặc điểm phân loại khác, MFCC được sử dụng rộng rãi vì nó phù hợp hơn với đường cong đáp ứng tần số thính giác của tai người.

*Lý do con người có thể đánh giá các môi trường khác nhau trong môi trường âm thanh phức tạp nằm ở công dụng của ốc tai. *e ốc tai có thể được xem như một ngân hàng bộ lọc để giúp mọi người lọc âm thanh 20-20 kHz. *Vấn đề là độ nhạy của ốc tai với các tần số trong phạm vi thính giác không phải là tuyến tính mà có một mối quan hệ ánh xạ. MFCC có thể mô phỏng đáp ứng tần số của tai người. Trích xuất tính năng MFCC bao gồm bảy bước và toàn bộ quá trình được hiển thị trong Hình 1.
Các tín hiệu âm thanh thông thường có hiện tượng năng lượng tần số thấp lớn nhưng năng lượng tần số cao lại nhỏ. Nếu truyền trực tiếp sẽ dẫn đến tỷ lệ tín hiệu trên tạp âm cao ở tần số thấp và tỷ lệ tín hiệu trên tạp âm không đủ ở tần số cao. Để bù đắp cho việc mất tín hiệu âm thanh trong quá trình truyền, tính năng nhấn mạnh trước được đưa vào để bù cho tín hiệu đầu vào sao cho có thể làm nổi bật các đặc tính tần số cao của tín hiệu âm thanh. Việc nhấn mạnh trước thường đạt được bằng cách sử dụng bộ lọc thông cao [21–23].

Việc tạo khung chia các mẫu âm thanh thu được từ quá trình chuyển đổi tương tự sang số (ADC) thành các khung nhỏ có độ dài trong khoảng 20–40 mili giây. Sau khi hoàn thành việc tiền nhấn mạnh và đóng khung, cần thêm cửa sổ Hamming vào mỗi khung. Cửa sổ là để kiểm soát lượng xử lý dữ liệu và tại một thời điểm chỉ có dữ liệu trong cửa sổ được xử lý. *Dải tần số trong phổ biến đổi Fourier nhanh rất rộng, dẫn đến tín hiệu giọng nói không tuân theo thang tuyến tính [24–26]. *do đó, cần phải vượt qua dãy bộ lọc thang đo Mel như trong Hình 2.
Hình 2 cho thấy một tập hợp các bộ lọc hình tam giác, được sử dụng để tính tổng trọng số của các thành phần quang phổ của các bộ lọc sao cho đầu ra được xử lý gần đúng với thang đo Mel. *e Đáp ứng biên độ-tần số của mỗi bộ lọc là hình tam giác. *e Phổ Mel của tần số f cho trước được tính như sau:

13 đặc điểm khác biệt bậc nhất thể hiện sự thay đổi giữa các khung của cestrum trong các đặc điểm MFCC, trong khi 39 đặc điểm khác biệt bậc hai thể hiện sự thay đổi giữa các khung trong các đặc điểm khác biệt bậc nhất. *e chênh lệch bậc một được tính như sau:

4. Cấu trúc mạng SPP-YOLO-v4
4.1. Mô-đun bể bơi kim tự tháp không gian (SPP). SPP có thể tránh biến dạng thông tin do chia tỷ lệ, kéo dài, cắt bớt và các hoạt động khác, đồng thời cung cấp đầu ra không bị ảnh hưởng bởi kích thước đầu vào, điều này không thể đạt được bằng công nghệ gộp cửa sổ trượt [27]. Thứ hai, SPP có thể gộp nhiều tỷ lệ, trong khi gộp cửa sổ trượt chỉ sử dụng một tỷ lệ cửa sổ. *Cấu trúc cơ bản của mô-đun SPP được hiển thị trong Hình 3. Có thể thấy rằng do kích thước đầu vào linh hoạt nên SPP có thể kết hợp các tính năng của dữ liệu ở các định dạng âm thanh khác nhau. *Kích thước của vectơ đặc trưng được chuyển đổi giống với kích thước của lớp được kết nối đầy đủ đồng thời giảm bớt vấn đề khái quát hóa.
4.2. SPP-YOLO-v4. YOLO-v4 là thuật toán phát hiện một giai đoạn theo thời gian thực có độ chính xác cao tích hợp YOLO-v1, YOLO-v2 và YOLO-v3. YOLO-v4 xây dựng mạng một phần đa giai đoạn CSP (CSPNet) trong mô-đun dư, trong đó lớp tính năng là đầu vào và thông tin tính năng của lớp cao hơn là đầu ra. *cho thấy mục tiêu học tập của YOLO-v4 trong mô-đun ResNet là khác nhau giữa đầu ra và đầu vào. *Do đó, quá trình học tập dư thừa được thực hiện và các tham số mô hình giảm xuống, do đó khả năng học tập tính năng được nâng cao. Xem xét môi trường ứng dụng giảng dạy âm nhạc, một số thay đổi được thực hiện dựa trên mạng ban đầu và cấu trúc mạng cuối cùng được hiển thị trong Hình 4.
Đầu tiên, lớp tính năng được tích hợp ba lần, sau đó, lớp tính năng đầu vào được gộp tối đa bằng cách sử dụng số lõi gộp tối đa có kích thước khác nhau. Sau khi tích chập và lấy mẫu, các lớp tính năng khác nhau được kết nối nối tiếp để thực hiện phản ứng tổng hợp tính năng. *vi, thực hiện lấy mẫu xuống, nén chiều cao và chiều rộng, rồi cuối cùng xếp chồng với lớp đối tượng trước đó để nhận ra sự kết hợp nhiều tính năng hơn (5 lần). *Mô-đun phân loại sử dụng các tính năng được trích xuất từ mạng để đưa ra đánh giá phân loại. Lấy lưới 13 ×13 làm ví dụ, tương đương với việc chia biểu đồ phổ Mel đầu vào thành các ô vuông 13 ×13; sau đó, mỗi ô vuông sẽ được cài sẵn ba khung hình trước đó. *e kết quả phân loại của mạng sẽ điều chỉnh vị trí của ba hộp trước này và cuối cùng lọc theo thuật toán triệt tiêu không tối đa (NMS) [28], để có được kết quả phân loại cuối cùng.

5. Hệ thống nhận dạng âm thanh dựa trên SPPYOLO-v4
5.1. Kiến Trúc Hệ Thống. Như được hiển thị trong Hình 5, sau khi nhập âm thanh, hệ thống nhận dạng âm thanh được đề xuất trước tiên sẽ chia dữ liệu chuỗi âm thanh thành hai phần. *Phần đầu tiên đến từ kênh âm thanh nổi, trong khi phần thứ hai được nén thành kênh đơn âm. *e tín hiệu âm thanh của hai kênh được trích xuất bằng biểu đồ phổ MFCC và nhập vào mô hình SPP-YOLO-v4 dưới dạng tính năng. *vi, hai nhóm mô hình SPP-YOLO-v4 được tích hợp và phương pháp xếp chồng được áp dụng trong quá trình tích hợp. Sau khi học tích hợp hai mô hình, kết quả phân loại âm thanh cuối cùng cũng được đưa ra. *e chi tiết về mô hình SPP-YOLO-v4 được hiển thị trong Hình 4.
5.2. Xếp chồng học tập tích hợp. Như được hiển thị trong Hình 5, hệ thống sử dụng công nghệ học tập tổng hợp để có được kết quả phân loại cuối cùng. *Ý tưởng cơ bản của học tập tổng hợp là hình thành một bộ phân loại mạnh thông qua sự kết hợp của một số bộ phân loại yếu. Ngay cả khi một số bộ phân loại yếu đưa ra dự đoán sai, chúng vẫn có thể được sửa bởi các bộ phân loại yếu khác bằng các dự đoán chính xác, nhờ đó đạt được hiệu quả cải thiện hiệu suất của hệ thống.
Giả sử x là đầu vào thì mi (i � 1, 2, . . ., k) là một nhóm các bộ phân loại và đầu ra của các bộ phân loại là phân phối xác suất mi (x, cj) của mỗi lớp cj (i � 1, 2, . . ., k), đầu ra cuối cùng y(x) của bộ phân loại tích hợp có thể được biểu thị dưới dạng


mục tiêu phân loại. Hiện nay, các thuật toán học tập hợp phổ biến bao gồm xếp chồng, đóng bao, tăng cường, lựa chọn tập hợp, v.v. *Thuật toán học tập hợp được chọn trong nghiên cứu này là phương pháp xếp chồng.
Xếp chồng là một quá trình học bậc hai với đầu ra của quá trình học bậc một làm đầu vào, còn được gọi là "siêu học tập". *Phương pháp xếp chồng đã trở thành một phương pháp học tập tổng hợp phổ biến, không chỉ vì việc triển khai nó khá đơn giản mà còn vì nó có thể cải thiện đáng kể khả năng khái quát hóa của hệ thống, điều này rất phù hợp với mục đích của nghiên cứu này. * Nguyên tắc cơ bản của phương pháp xếp chồng được thể hiện trong Hình 6.
6. Phân tích thử nghiệm và kết quả
6.1. Môi trường thử nghiệm và bộ dữ liệu. *Nền tảng phần cứng của nghiên cứu này là CPU Intel Core i3-M350@ Dualcore 2,20 GHz, bộ nhớ DDR2 8 GB, GPU Nvidia RTX2080Ti và bộ nhớ video 11 GB. *e Công cụ phát triển tích hợp PyCharm được phát triển bằng ngôn ngữ Python 3.5.0. *e Khung chú thích YOLO được viết bằng Python được sử dụng để chuyển đổi định dạng số để YOLO có thể đọc được. *các phương pháp so sánh là mô hình hỗn hợp Gaussian (GMM), CNN và R-CNN.

*e tập dữ liệu thử nghiệm là các tệp âm thanh được ghi lại trong môi trường giảng dạy thực tế. *e tập dữ liệu bao gồm các loại âm thanh thuộc bốn nhãn khác nhau (D1, D2, D3 và D4). Tất cả các tệp âm thanh được cắt thành 30-clip thứ hai. *Có 12 định dạng tệp âm thanh bao gồm MPEG, MP3 và WMA. Mỗi bản ghi được thực hiện ở một vị trí khác nhau và thời lượng ghi trung bình là 3–5 phút. *thiết bị ghi âm bao gồm micrô nhét trong tai Soundman OKM II Classic/studio A3 hai kênh và máy ghi dạng sóng Roland Edirol R09 với tốc độ lấy mẫu 44,1 kHz và độ phân giải bit 24-.
*Tập dữ liệu đã sử dụng chứa 1404 tệp âm thanh và số lượng tệp âm thanh của mỗi loại là 351. Khoảng 70% dữ liệu được sử dụng để đào tạo mô hình nhận dạng âm thanh và 30% còn lại được sử dụng để thử nghiệm. *cài đặt hệ thống được đưa ra trong Bảng 1.


6.3. Xác minh hiệu suất SPP-YOLO-v4. Để xác minh hiệu quả thúc đẩy của YOLO-v4 (SPP-YOLO-v4) cải tiến được đề xuất đối với khả năng khái quát hóa, nó được so sánh với mô hình YOLO-v4 truyền thống. Trong thử nghiệm, 3 trong số 12 định dạng tệp âm thanh đã được chọn: MPEG, MP3 và WMA. *Khả năng khái quát hóa của SPP-YOLOv4 được đưa ra trong Bảng 2.
Từ Bảng 2, có thể thấy rằng độ chính xác tổng thể của SPP-YOLO-v4 cao hơn so với YOLO-v4 truyền thống, xác minh khả năng khái quát hóa dữ liệu ở các định dạng âm thanh khác nhau. *là do so với phương pháp ban đầu, SPP của SPP-YOLO-v4 chứa nhiều lớp hơn nhưng cũng làm tăng thời gian xử lý.
6.4. So sánh kết quả kiểm tra. Bảng 3 cung cấp kết quả về mức độ mất huấn luyện, mAP, v.v. cho tất cả các danh mục sau 8000 vòng huấn luyện. Có thể thấy rằng mô hình huấn luyện của phương pháp đề xuất có thể xác định hiệu quả các loại âm thanh. Nó có những ưu điểm nhất định về độ chính xác, tỷ lệ thu hồi và điểm F1, đồng thời giá trị tổn thất của nó cũng thấp nhất trong tất cả các phương pháp, chỉ 0,0122. *Vì vậy, độ ổn định và độ chính xác của phương pháp đề xuất là tốt hơn. *chủ yếu là do độ phân giải cao và trường tiếp nhận (RF) của SPP-YOLO-v4 và việc bổ sung mô-đun SPP trong lớp kết nối vẫn giữ được những lợi thế mà SPP mang lại. Về thời gian huấn luyện, SPP-YOLO-v4 chỉ hơn GMM một chút. *e CNN cần huấn luyện nhiều phép toán tích chập nên thời gian huấn luyện của nó dài hơn.

Cuối cùng, thử nghiệm sử dụng dữ liệu từ 12 định dạng âm thanh khác nhau để kiểm tra và so sánh bốn phương pháp. Bảng 4 cung cấp các giá trị về độ chính xác của phép thử và thời gian thử. Có thể thấy, độ chính xác trung bình của phương pháp được đề xuất trong nghiên cứu này là 99.0% và thời gian phát hiện trung bình là 0.449ss. *Do đó, phương pháp đề xuất đạt được hiệu quả tốt hơn trong số 4 phương pháp được so sánh. Có thể kết luận rằng việc lấy mẫu lại và gộp tối đa SPP-YOLO-v4 mang lại lợi ích đáng kể. Nhóm tối đa chọn giá trị tối đa từ các khu vực lân cận để xóa một chút nhiễu tần số tối đa trong chuỗi âm thanh. *Do đó, việc lấy mẫu con tích chập có thể được vận hành tốt hơn ở lớp lấy mẫu tiếp theo. *Với những ưu điểm này, SPP có thể cải thiện hiệu suất của mạng đường trục.

7. Kết luận
*là nghiên cứu trình bày một hệ thống nhận dạng âm thanh phù hợp với môi trường giảng dạy âm nhạc. Sử dụng SPP để cải thiện kiến trúc mạng YOLO-v4, nghĩa là sử dụng SPP để chọn các khu vực cục bộ trên các tỷ lệ khác nhau của cùng một lớp chập để tìm hiểu các đặc điểm của hệ thống nhiều tỷ lệ. Ngoài ra, phương pháp xếp chồng trong học tập tổng hợp được sử dụng để hợp nhất các mô hình con độc lập của hai kênh khác nhau. *e kết quả thử nghiệm cho thấy phương pháp đề xuất có thể cải thiện độ chính xác nhận dạng của các loại âm thanh và có hiệu suất tốt hơn đối với các định dạng tệp âm thanh khác nhau. Do hạn chế về điều kiện ghi âm, có rất ít loại âm thanh trong tập dữ liệu thử nghiệm và hiệu suất phân loại của các tệp âm thanh được ghi bởi các thiết bị khác nhau vẫn chưa được xác minh. Nhiều thử nghiệm khác sẽ được tiến hành về hai vấn đề này trong tương lai.
Tính sẵn có của dữ liệu
*dữ liệu được sử dụng để hỗ trợ các phát hiện của nghiên cứu này được tác giả tương ứng cung cấp theo yêu cầu.
Xung đột lợi ích
*Các tác giả tuyên bố rằng họ không có xung đột lợi ích.
Người giới thiệu
[1] S. Wu, D. Zhang, Z. Zhang, N. Yang, M. Li và M. Zhou, "Dịch máy thần kinh phụ thuộc vào phụ thuộc," Giao dịch IEEE/ACM về âm thanh, lời nói và ngôn ngữ Đang xử lý, tập. 26, không. 11, trang 2132–2141, 2018.
[2] J. Zou, W. Li, C. Chen và Q. Du, "Phân loại cảnh bằng cách sử dụng các tính năng cục bộ và toàn cầu với sự hợp nhất biểu diễn hợp tác," Khoa học thông tin, tập. 348, không. 2, trang 209–226, 2016.
[3] H. Phan, L. Hertel, M. Maass, P. Koch, R. Mazur và A. Mertins, "Cải thiện phân loại cảnh âm thanh dựa trên nhúng cây nhãn và mạng thần kinh tích chập," Giao dịch IEEE/ACM trên Xử lý âm thanh, lời nói và ngôn ngữ, tập. 25, không. 6, trang 1278–1290, 2017.
[4] S. Bayatli, "Trọng số không giám sát của các quy tắc truyền trong dịch máy dựa trên quy tắc sử dụng phương pháp entropy tối đa", Tạp chí Khoa học và Kỹ thuật Thông tin, tập. 36, không. 2, trang 309–322, 2020.
[5] A. Rakotomamonjy, "Học biểu diễn có giám sát để phân loại cảnh âm thanh," Giao dịch IEEE/ACM về xử lý âm thanh, lời nói và ngôn ngữ, tập. 25, không. 6, trang 1253–1265, 2017.
[6] W. Yang và S. Krishnan, "Kết hợp các đặc điểm thời gian bằng mẫu nhị phân cục bộ để phân loại cảnh âm thanh," Giao dịch IEEE/ACM về xử lý âm thanh, lời nói và ngôn ngữ, tập. 25, không. 6, trang 1315–1321, 2017.
[7] AS Dhanjal và W. Singh, "Một hệ thống dịch máy tự động cho lời nói đa ngôn ngữ sang ngôn ngữ ký hiệu Ấn Độ," Công cụ và ứng dụng đa phương tiện, tập. 81, không. 3, trang 4283–4321, 2021.
[8] MA . Alamir, "Một mô hình phân loại cảnh âm thanh mới sử dụng sự kết hợp muộn của mạng lưới thần kinh tích chập và các bộ phân loại tổng thể khác nhau," Âm học ứng dụng, tập. 172, không. 3, trang 112–122, 2020.
[9] JG Makin, DA Moses và EF Chang, "Dịch máy hoạt động vỏ não sang văn bản bằng khung mã hóa-giải mã," Khoa học thần kinh tự nhiên, tập. 23, không. 4, trang 575–582, 2020.
[10] S. Waldekar và G. Saha, "Phân loại cảnh âm thanh dựa trên sự kết hợp hai cấp độ," Âm học ứng dụng, tập. 170, không. 5, Điều ID 107502, 2020.
For more information:1950477648nn@gmail.com






