Contribuciones a la aplicación de la factorización de matrices no negativas a las tecnologías del habla

e-Archivo Repository

Durante los días 23 y 24 de abril, e-Archivo no estará operativo por cambios en la infraestructura del repositorio. Disculpen las molestias.

Show simple item record

dc.contributor.advisor Gallardo Antolín, Ascensión
dc.contributor.author Ludeña Choez, Jimmy D.
dc.date.accessioned 2015-10-22T17:40:52Z
dc.date.available 2015-10-22T17:40:52Z
dc.date.issued 2015-04
dc.date.submitted 2015-04-16
dc.identifier.uri http://hdl.handle.net/10016/21843
dc.description.abstract El funcionamiento de los sistemas de procesamiento y clasificación de audio (incluida la voz) en escenarios reales, depende, en gran medida, de una adecuada representación de la señal de audio, tanto en condiciones limpias como ruidosas. Por este motivo, en esta Tesis abordamos la problemática del diseño de nuevos esquemas de preprocesamiento y extracción de características acústicas con aplicación a dos tareas distintas: reconocimiento automático del habla y clasificación de eventos acústicos. El nexo de unión de los métodos propuestos es la utilización de la técnica denominada factorización de matrices no negativas (NMF, Non-Negative Matrix Factorization) que ha demostrado ser una herramienta poderosa para el análisis de la señal de audio. En primer lugar, en este trabajo de tesis se propone un método de eliminación de ruido en señales de voz basado en NMF, que, a diferencia de otras aproximaciones previas, no asume un conocimiento a priori acerca de la naturaleza del ruido. La técnica es evaluada tanto para mejora de voz como para reconocimiento automático de habla mostrando un mejor funcionamiento que la técnica convencional de sustracción espectral. En segundo lugar, se proponen tres parametrizaciones novedosas para la tarea de clasificación de eventos acústicos. La primera de ellas es una extensión de los parámetros convencionales mel-cepstrales y consiste en el filtrado paso alto de la señal de audio. El segundo esquema consiste en una mejora de la técnica de integración temporal de características llamada coeficientes de banco de filtros (FC, Filter bank Coe_cients) en el que NMF se utiliza como método no supervisado para el aprendizaje del banco de filtros FC óptimo. Finalmente, en el último nuevo parametrizador se propone la inclusión de características cepstrales derivadas de los coeficientes de activación o ganancia de NMF, motivada por la robustez al ruido que NMF ofrece. Los experimentos realizados muestran que, en términos generales, estos tres esquemas mejoran el funcionamiento del sistema de clasificación de eventos acústicos con respecto al de referencia tanto en condiciones limpias como ruidosas.
dc.description.abstract In real scenarios, the performance of audio processing and classiffication systems depends largely on an adequate representation of the signal in both clean and noisy conditions. Therefore, in this Thesis we face the problem of designing new methods to preprocess audio signals and extract acoustic features with the intention of being applied to two different tasks: Automatic Speech Recognition (ASR) and Acoustic Event Classification (AEC). The proposed methods are based on the well-known Non-Negative Matrix Factorization (NMF) technique, which has proven to be a powerful tool for analyzing audio signals. Firstly, a method for speech denoising is proposed, that unlike other previous approaches it does not assume a prior knowledge about the nature of the kind of noise. The method is evaluated for both, speech enhancement and ASR, showing better performance than one of the state of art techniques known as Spectral Subtraction (SS). Secondly, we propose three new parameterization schemes for AEC. The first one is an extension of the conventional Mel Frequency Cepstral Coefficients (MFCC) and can be seen as a high-pass filtering of the audio signal. The second scheme is an improvement of the temporal feature integration technique named Filterbank Coefficients (FC), in which the NMF technique is used in an unsupervised manner, allowing to discover an optimal FC Filterbank. Finally, the last new parameterization scheme proposes the use of cepstral features derived from the NMF activation coefficients; this is mainly motivated by the robustness shown by NMF in noisy conditions. Experiments have shown that, in general terms, these three feature extraction modules improve the performance of the acoustic event classification systems with respect to the baseline based on MFCC, for both, clean and noisy conditions with different noises at different signal-to-noise ratio (SNR) levels.
dc.format.mimetype application/pdf
dc.language.iso spa
dc.rights Atribución-NoComercial-SinDerivadas 3.0 España
dc.rights.uri http://creativecommons.org/licenses/by-nc-nd/3.0/es/
dc.subject.other Factorización de matrices
dc.subject.other Reconocimiento del habla
dc.subject.other NMF, Non-Negative Matrix Factorization
dc.subject.other Clasificación de eventos acústicos
dc.subject.other Coeficientes Cepstrales en las Frecuencias de Mel
dc.subject.other Filter bank Coefficients (FC)
dc.title Contribuciones a la aplicación de la factorización de matrices no negativas a las tecnologías del habla
dc.type doctoralThesis
dc.subject.eciencia Telecomunicaciones
dc.rights.accessRights openAccess
dc.description.degree Programa de Doctorado en Multimedia y Comunicaciones
dc.description.responsability Presidente: Javier Macías Guarasa.- Secretario: Carmen Peláez Moreno.- Vocal: Rubén San Segundo Hernández
dc.contributor.departamento Universidad Carlos III de Madrid. Departamento de Teoría de la Señal y Comunicaciones
 Find Full text

Files in this item

*Click on file's image for preview. (Embargoed files's preview is not supported)


The following license files are associated with this item:

This item appears in the following Collection(s)

Show simple item record