Audio content processing for automatic music genre classification : descriptors, databases, and classifiers

Guaus, Enric

Audio content processing for automatic music genre classification : descriptors, databases, and classifiers

Author

Guaus, Enric

Director

Serra, Xavier

Date of defense

2009-09-21

ISBN

9788496273234

Legal Deposit

B.42995-2009

Department/Institute

Universitat Pompeu Fabra. Departament de Tecnologies de la Informació i les Comunicacions

Doctorate programs

Programa de doctorat en Tecnologies de la Informació i les Comunicacions

Abstract

Aquesta tesi versa sobre la classiﬁcació automàtica de gèneres musicals, basada en l'anàlisi del contingut del senyal d'àudio, plantejant-ne els problemes i proposant solucions. Es proposa un estudi de la classiﬁcació de gèneres musicals des del punt de vista computacional però inspirat en teories dels camps de la musicologia i de la percepció. D'aquesta manera, els experiments presentats combinen diferents elements que inﬂueixen en l'encert o fracàs de la classiﬁcació, com ara els descriptors d'àudio, les tècniques d'aprenentatge, etc. L'objectiu és avaluar i comparar els resultats obtinguts d'aquests experiments per tal d'explicar els límits d'encert dels algorismes actuals, i proposar noves estratègies per tal de superar-los. A més a més, partint del processat de la informació d'àudio, s'inclouen aspectes musicals i culturals referents al gènere que tradicionalment no han estat tinguts en compte en els estudis existents. En aquest context, es proposa l'estudi de diferents famílies de descriptors d'àudio referents al timbre, ritme, tonalitat o altres aspectes de la música. Alguns d'aquests descriptors són proposats pel propi autor mentre que d'altres ja són perfectament coneguts. D'altra banda, també es comparen les tècniques d'aprenentatge artiﬁcial que s'usen tradicionalment en aquest camp i s'analitza el seu comportament davant el nostre problema de classiﬁcació. També es presenta una discussió sobre la seva capacitat per representar els diferents models de classiﬁcació proposats en el camp de la percepció. Els resultats de la classiﬁcació es comparen amb un seguit de tests i enquestes realitzades sobre un conjunt d'individus. Com a resultat d'aquesta comparativa es proposa una arquitectura especíﬁca de classiﬁcadors que també està raonada i explicada en detall. Finalment, es fa un especial èmfasi en comparar resultats dels classiﬁcadors automàtics en diferents escenaris que pressuposen la barreja de bases de dades, la comparació entre bases de dades grans i petites, etc. A títol de conclusió, es mostra com l'arquitectura de classiﬁcació proposada, justiﬁcada pels resultats dels diferents anàlisis, pot trencar el límit actual en tasques de classiﬁcació automàtica de gèneres musicals. De manera condensada, es pot dir que aquesta tesi contribueix al camp de la classiﬁcació de gèneres musicals en els següents aspectes: a) Proporciona una revisió multidisciplinar delsgèneres musicals i la seva classiﬁcació; b)Presenta una avaluació qualitativa i quantitativa de les famílies de descriptors d'àudio davant el problema de la classiﬁcació de gèneres; c) Avalua els pros i contres de les diferents tècniques d'aprenentatge artiﬁcial davant el gènere; d) Proposa una arquitectura nova de classiﬁcador d'acord amb una visió interdisciplinar dels gèneres musicals; e) Analitza el comportament de l'arquitecturaproposada davant d'entorns molt diversos en el que es podria implementar el classiﬁcador.

Esta tesis estudia la clasiﬁcación automática degéneros musicales, basada en el análisis delcontenido de la señal de audio, planteando sus problemas y proponiendo soluciones. Sepropone un estudio de la clasiﬁcación de los géneros musicales desde el punto de vista computacional, pero inspirado en teorías de los campos de la musicología y la percepción. De este modo, los experimentos persentados combinan distintos elementos que inﬂuyen en el acierto o fracaso de la clasiﬁcación, como por ejemplo los descriptores de audio, las técnicas de aprondiza je, etc. El objetivo es comparar y evaluar los resultados obtenidos de estos experimentos para explicar los límites de las tasas de acierto de los algorismos actuales, y proponer nuevas estrategias para superarlos. Además, partiendo del procesado de la información de Audio, se han incluido aspectos musicales y culturales al género que tradicionalmente no han sido tomados en cuenta en los estudios existentes. En este contexto, se propone el estudio de distintas famílias de descriptores de audio referentes al timbre, al ritmo, a la tonalidad o a otros aspectos de la música. Algunos de los descriptores son propuestos por el mismo autor, mientras que otros son perfectamente conocidos. Por otra parte, también se comparan las técnicas de aprendiza je artiﬁcial que se usan tradicionalmente, y analizamos su comportamiento en frente de nuestro problema de clasiﬁcación. Tambien planteamos una discusión sobre su capacidad para representar los diferentes modelos de clasiﬁcación propuestos en el campo de la percepción. Estos resultados de la clasiﬁcación se comparan con los resultados de unos tests y encuestas realizados sobre un conjunto de individuos. Como resultado de esta comparativa se propone una arquitectura especíﬁca de clasiﬁcadores que tambien está razonada y detallada en el cuerpo de la tesis. Finalmente, se hace un émfasis especial en comparar los resultados de los clasiﬁcadores automáticos en distintos escenarios que assumen la mezcla de bases de datos, algunas muy grandes y otras muy pequeñas, etc. Como conclusión, mostraremos como la arquitectura de clasiﬁcación propuesta permite romper el límite actual en el ámbito de la classiﬁcación automática de géneros musicales.De forma condensada, se puede decir que esta tesis contribuye en el campo de la clasiﬁcación de los géneros musicales el los siguientes aspectos: a) Proporciona una revisión multidisciplinar de los géneros musicales y su clasiﬁcación; b) Presenta una evaluación cualitativa y cuantitativa de las famílias de descriptores de audio para la clasiﬁcación de géneros musicales; c) Evalua los pros y contras de las distintas técnicas de aprendiza je artiﬁcial delante del género; d) Propone una arquitectura nueva del clasiﬁcador de acuerdo con una visión interdisciplinar de los géneros musicales; e) Analiza el comportamiento de la arquitectura propuesta delante de entornos muy diversos en los que se podria implementar el clasiﬁcador.

This dissertation presents, discusses, and sheds some light on the problems that appear when computers try to automatically classify musical genres from audio signals. In particular, a method is proposed for the automatic music genre classification by using a computational approach that is inspired in music cognition and musicology in addition to Music Information Retrieval techniques. In this context, we design a set of experiments by combining the different elements that may affect the accuracy in the classification (audio descriptors, machine learning algorithms, etc.). We evaluate, compare and analyze the obtained results in order to explain the existing glass-ceiling in genre classification, and propose new strategies to overcome it. Moreover, starting from the polyphonic audio content processing we include musical and cultural aspects of musical genre that have usually been neglected in the current state of the art approaches. This work studies different families of audio descriptors related to timbre, rhythm, tonality and other facets of music, which have not been frequently addressed in the literature. Some of these descriptors are proposed by the author and others come from previous existing studies. We also compare machine learning techniques commonly used for classification and analyze how they can deal with the genre classification problem. We also present a discussion on their ability to represent the different classification models proposed in cognitive science. Moreover, the classification results using the machine learning techniques are contrasted with the results of some listening experiments proposed. This comparison drive us to think of a specific architecture of classifiers that will be justified and described in detail. It is also one of the objectives of this dissertation to compare results under different data configurations, that is, using different datasets, mixing them and reproducing some real scenarios in which genre classifiers could be used (huge datasets). As a conclusion, we discuss how the classification architecture here proposed can break the existing glass-ceiling effect in automatic genre classification. To sum up, this dissertation contributes to the field of automatic genre classification: a) It provides a multidisciplinary review of musical genres and its classification; b) It provides a qualitative and quantitative evaluation of families of audio descriptors used for automatic classification; c) It evaluates different machine learning techniques and their pros and cons in the context of genre classification; d) It proposes a new architecture of classifiers after analyzing music genre classification from different disciplines; e) It analyzes the behavior of this proposed architecture in different environments consisting of huge or mixed datasets.

Keywords

mirex categorization; listening experiments; pca; simca; tonal panning; danceability; timbre; learning rhythm; datasets machine; descriptors; automatic music genre classification; processing; audio content

Subjects

531/534 - Mechanics; 62 - Engineering. Technology in general

Documents

tegt.pdf

5.010Mb

Export

DIDL MARC MARC_CCUC METS OAI_DC ORE QDC RDF

Rights

ADVERTIMENT. L'accés als continguts d'aquesta tesi doctoral i la seva utilització ha de respectar els drets de la persona autora. Pot ser utilitzada per a consulta o estudi personal, així com en activitats o materials d'investigació i docència en els termes establerts a l'art. 32 del Text Refós de la Llei de Propietat Intel·lectual (RDL 1/1996). Per altres utilitzacions es requereix l'autorització prèvia i expressa de la persona autora. En qualsevol cas, en la utilització dels seus continguts caldrà indicar de forma clara el nom i cognoms de la persona autora i el títol de la tesi doctoral. No s'autoritza la seva reproducció o altres formes d'explotació efectuades amb finalitats de lucre ni la seva comunicació pública des d'un lloc aliè al servei TDX. Tampoc s'autoritza la presentació del seu contingut en una finestra o marc aliè a TDX (framing). Aquesta reserva de drets afecta tant als continguts de la tesi com als seus resums i índexs.

This item appears in the following Collection(s)

Programa de Doctorat en Tecnologies de la Informació i les Comunicacions [376]

Audio content processing for automatic music genre classification : descriptors, databases, and classifiers

Author

Director

Date of defense

ISBN

Legal Deposit

Share

Department/Institute

Doctorate programs

Abstract

Keywords

Subjects

Documents

Export

Rights

This item appears in the following Collection(s)