{"id":2525,"date":"2023-10-18T10:42:23","date_gmt":"2023-10-18T13:42:23","guid":{"rendered":"https:\/\/icc.fcen.uba.ar\/?p=2525"},"modified":"2024-01-16T09:52:42","modified_gmt":"2024-01-16T12:52:42","slug":"transductores-diferenciables-para-sistemas-hibridos-una-alternativa-para-mejorar-el-reconocimiento-automatico-del-habla","status":"publish","type":"post","link":"https:\/\/icc.fcen.uba.ar\/en\/transductores-diferenciables-para-sistemas-hibridos-una-alternativa-para-mejorar-el-reconocimiento-automatico-del-habla\/","title":{"rendered":"Transductores diferenciables para sistemas h\u00edbridos: una alternativa para mejorar el reconocimiento autom\u00e1tico del habla"},"content":{"rendered":"<div class=\"fusion-fullwidth fullwidth-box fusion-builder-row-1 fusion-flex-container nonhundred-percent-fullwidth non-hundred-percent-height-scrolling\" style=\"--awb-border-radius-top-left:0px;--awb-border-radius-top-right:0px;--awb-border-radius-bottom-right:0px;--awb-border-radius-bottom-left:0px;--awb-flex-wrap:wrap;\" ><div class=\"fusion-builder-row fusion-row fusion-flex-align-items-flex-start fusion-flex-content-wrap\" style=\"max-width:1144px;margin-left: calc(-4% \/ 2 );margin-right: calc(-4% \/ 2 );\"><div class=\"fusion-layout-column fusion_builder_column fusion-builder-column-0 fusion_builder_column_1_1 1_1 fusion-flex-column\" style=\"--awb-bg-size:cover;--awb-width-large:100%;--awb-margin-top-large:0px;--awb-spacing-right-large:1.92%;--awb-margin-bottom-large:20px;--awb-spacing-left-large:1.92%;--awb-width-medium:100%;--awb-order-medium:0;--awb-spacing-right-medium:1.92%;--awb-spacing-left-medium:1.92%;--awb-width-small:100%;--awb-order-small:0;--awb-spacing-right-small:1.92%;--awb-spacing-left-small:1.92%;\"><div class=\"fusion-column-wrapper fusion-column-has-shadow fusion-flex-justify-content-flex-start fusion-content-layout-column\"><div class=\"fusion-text fusion-text-1\"><p><b>Los sistemas h\u00edbridos de reconocimiento del habla humana se caracterizan por combinar redes neuronales con transductores de estados finitos y buscan transcribir la voz a texto de una manera m\u00e1s controlada, reduciendo la aparici\u00f3n de errores. En este contexto, investigadores del ICC est\u00e1n trabajando en el desarrollo de algoritmos aplicados a estos sistemas para poder facilitar su uso y que posteriormente se puedan entrenar de forma conjunta las redes y los transductores.\u00a0\u00a0<\/b><\/p>\n<p><span style=\"font-weight: 400;\">Sin lugar a dudas, con el notorio avance de la inteligencia artificial y el desarrollo de\u00a0 asistentes virtuales cada vez m\u00e1s sofisticados, como por ejemplo ChatGPT, el procesamiento del habla humana pas\u00f3 a ser uno de los t\u00f3picos cr\u00edticos de investigaci\u00f3n dentro de esta disciplina.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">Actualmente el procesamiento del habla combina t\u00e9cnicas de las ciencias de la computaci\u00f3n con la ling\u00fc\u00edstica aplicada, para ayudar en temas usuales de traducci\u00f3n autom\u00e1tica, sistemas de di\u00e1logo interactivos, identificaci\u00f3n de hablantes y reconocimiento de emociones, entre muchas otras aplicaciones.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">El mejoramiento de la naturalidad de los sistemas de di\u00e1logo hablado, donde una persona interact\u00faa con una computadora mediante la voz, pas\u00f3 a ser una de las funciones m\u00e1s comunes de los asistentes virtuales, por ejemplo para pedir informaci\u00f3n de b\u00fasqueda a los <\/span><i><span style=\"font-weight: 400;\">smartphones<\/span><\/i><span style=\"font-weight: 400;\">. Para ello com\u00fanmente se utilizan herramientas de aprendizaje autom\u00e1tico (<\/span><i><span style=\"font-weight: 400;\">machine learning<\/span><\/i><span style=\"font-weight: 400;\">) y de redes neuronales. No obstante, lograr que estas tareas se realicen con cada vez m\u00e1s precisi\u00f3n y performance no es nada trivial, por los problemas que acarrean. Por ejemplo, es muy posible que un traductor autom\u00e1tico de la voz se equivoque al interpretar la palabra o frase que nosotros mismos como hablantes quisimos decir y debamos adaptar nuestra manera de pronunciarla para que el asistente virtual identifique los t\u00e9rminos correctamente. O incluso que en el proceso de transcripci\u00f3n a texto, escriba palabras muy distintas a las habladas en los sonidos que identific\u00f3.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">Considerando este escenario, investigadores del <\/span><a href=\"https:\/\/liaa.dc.uba.ar\/es\/procesamiento-del-habla\/\" target=\"_blank\" rel=\"noopener noreferrer\"><span style=\"font-weight: 400;\">Grupo de Procesamiento del Habla del Laboratorio de Inteligencia Artificial Aplicada (LIAA-ICC)<\/span><\/a><span style=\"font-weight: 400;\">, est\u00e1n trabajando para desarrollar modelos y algoritmos aplicados que permitan mejorar el reconocimiento autom\u00e1tico del habla humana.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">\u201c<\/span><i><span style=\"font-weight: 400;\">Las redes neuronales end-to-end para reconocimiento de habla son sistemas que se entrenan tomando de entrada el audio y generan el texto como salida, es la tecnolog\u00eda m\u00e1s directa para encarar este problema. No obstante su dificultad es que generan \u2018alucinaciones\u2019, comportamientos err\u00e1ticos comunes cuando transcriben autom\u00e1ticamente contenido totalmente ajeno al que contiene el audio<\/span><\/i><span style=\"font-weight: 400;\">\u201d, puntualiza <\/span><b>Pablo Riera<\/b><span style=\"font-weight: 400;\">, Investigador del LIAA y Doctor en Ciencias F\u00edsicas..<\/span><\/p>\n<p><span style=\"font-weight: 400;\">Riera aclara que recientemente la empresa OpenAI -encargada de desarrollar ChatGPT- lanz\u00f3 un nuevo sistema que se llama Whisper, que funciona como un transcriptor de voz a texto, y lo liber\u00f3 en versi\u00f3n <\/span><i><span style=\"font-weight: 400;\">open source<\/span><\/i><span style=\"font-weight: 400;\"> para que cualquier persona lo pueda utilizar. Lo parad\u00f3jico es que si bien el software funciona muy bien en algunas situaciones, en otros escenarios muestra comportamientos completamente err\u00e1ticos llegando a confundirse palabras comunes. Por ejemplo, un error com\u00fan es que puede generar transcripciones con muchas m\u00e1s palabras de las que se dijeron. La falta de control sobre estas redes neuronales y el hecho de no poder intervenir con reglas gramaticales o de pronunciaci\u00f3n\u00a0 para procesar el texto y realizar correcciones al sistema en el desarrollo de estas mismas operaciones, es una de sus principales limitaciones.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">Ante los obst\u00e1culos evidentes, se est\u00e1n queriendo volver a utilizar los\u00a0 \u201ctransductores de estados finitos\u201d (<\/span><i><span style=\"font-weight: 400;\">finate-state transducers<\/span><\/i><span style=\"font-weight: 400;\">); se trata de herramientas asociadas a conceptos te\u00f3ricos de Ciencias de la Computaci\u00f3n (entendidas como m\u00e1quinas de estado finito o aut\u00f3matas) que suelen ser muy \u00fatiles para hacer trabajos de edici\u00f3n y procesamiento de texto.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">\u201c<\/span><i><span style=\"font-weight: 400;\">Hasta hace muy pocos a\u00f1os este era el m\u00e9todo tradicional para procesamiento del habla y con la llegada de las redes neuronales end-to-end este m\u00e9todo de transductores qued\u00f3 en segundo plano. Sin embargo, ante los problemas mencionados, nosotros estamos recuperando el uso de estos transductores, y desarrollando los algoritmos para poder utilizar los transductores con la misma flexibilidad que se utilizan las redes neuronales<\/span><\/i><span style=\"font-weight: 400;\">\u201d, explica Riera.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">\u00bfC\u00f3mo funcionan estos sistemas? Usan tanto redes neuronales como transductores de estado finitos, pero de manera encadenada. Primero utilizan una red neuronal para analizar el sonido y despu\u00e9s el transductor, el cual se encarga de la parte de decodificaci\u00f3n para tratar de llegar al texto final, es decir, tiene que dar el OK sobre una palabra, despu\u00e9s determinar cu\u00e1l seguir\u00eda en esa misma cadena y as\u00ed sucesivamente. \u201c<\/span><i><span style=\"font-weight: 400;\">En este caso es donde uno puede tener totalmente el control, porque podemos adaptar el tipo de vocabulario y definir qu\u00e9 queremos realmente que diga el sistema. En un sistema end-to-end hay que volver a entrenar si se quiere incluir una nueva palabra<\/span><\/i><span style=\"font-weight: 400;\">\u201d, afirma Riera.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">\u00bfCu\u00e1l es el principal desaf\u00edo en la investigaci\u00f3n cient\u00edfica del uso de transductores? En este caso se busca lograr que la versi\u00f3n actualizada de los sistemas con transductores tenga la misma performance que un modelo end-to-end, sin perder la potencia de las redes neuronales, es decir, reunir lo mejor de ambos mundos.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">Hacer convivir las redes neuronales con los transductores, implica poder expresar las operaciones de estos mismos transductores pero no con algoritmos cl\u00e1sicos (que eran los que usaban tradicionalmente) sino con algoritmos que posean la misma tecnolog\u00eda que com\u00fanmente usan las redes neuronales.<\/span><\/p>\n<p><img decoding=\"async\" class=\"lazyload size-full wp-image-2526 aligncenter\" src=\"https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2023\/10\/interior-imagen.png\" data-orig-src=\"https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2023\/10\/interior-imagen.png\" alt=\"\" width=\"1005\" height=\"564\" srcset=\"data:image\/svg+xml,%3Csvg%20xmlns%3D%27http%3A%2F%2Fwww.w3.org%2F2000%2Fsvg%27%20width%3D%271005%27%20height%3D%27564%27%20viewBox%3D%270%200%201005%20564%27%3E%3Crect%20width%3D%271005%27%20height%3D%27564%27%20fill-opacity%3D%220%22%2F%3E%3C%2Fsvg%3E\" data-srcset=\"https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2023\/10\/interior-imagen-200x112.png 200w, https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2023\/10\/interior-imagen-300x168.png 300w, https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2023\/10\/interior-imagen-400x224.png 400w, https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2023\/10\/interior-imagen-600x337.png 600w, https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2023\/10\/interior-imagen-768x431.png 768w, https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2023\/10\/interior-imagen-800x449.png 800w, https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2023\/10\/interior-imagen.png 1005w\" data-sizes=\"auto\" data-orig-sizes=\"(max-width: 1005px) 100vw, 1005px\" \/><\/p>\n<p><span style=\"font-weight: 400;\">\u201c<\/span><i><span style=\"font-weight: 400;\">Este trabajo implica recurrir a operaciones de \u00e1lgebra lineal con tensores y ejecutarlas en las arquitecturas de hardware donde trabajan las redes neuronales, que son las GPUs, y al mismo tiempo lograr el mismo procedimiento cuando se entrena una red neuronal, que es un proceso de optimizaci\u00f3n de par\u00e1metros autom\u00e1tico, que se llama \u2018descenso por gradiente\u2019, donde para lograr eso hay que contar con un c\u00f3mputo que sea diferenciable, para poder calcular c\u00f3mo mover los par\u00e1metros del sistema para mejorar la performance<\/span><\/i><span style=\"font-weight: 400;\">\u201d, sostiene el investigador del ICC.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">Otra ventaja de los transductores es que permiten generar una representaci\u00f3n en formato de m\u00e1quina de estados, donde la informaci\u00f3n sea mucho m\u00e1s f\u00e1cil de acceder y de alguna manera tener una representaci\u00f3n que sea m\u00e1s rica que s\u00f3lo la salida de una red neuronal, la cual muchas veces no es comprensible. En este punto, cabe recalcar que las redes neuronales se entrenan por par\u00e1metros que se multiplican y despu\u00e9s se realizan much\u00edsimas operaciones; pero por su nivel de abstracci\u00f3n es muy dif\u00edcil modificar los par\u00e1metros o saber qu\u00e9 rol cumple cada par\u00e1metro. Mientras que los estados de los transductores o las transiciones tienen una interpretaci\u00f3n en general, entonces concretamente se podr\u00edan modificar a mano para tener el control de una transici\u00f3n y ver c\u00f3mo cambia el resultado, para que el prop\u00f3sito final sea corregir errores en la decodificaci\u00f3n.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">\u201c<\/span><i><span style=\"font-weight: 400;\">Desde ya los transductores presentan una buena alternativa donde tenemos algunas representaciones que ya no son las representaciones neuronales completamente abstractas sino que son representaciones intermedias tipo m\u00e1quinas de estado, que las podr\u00edamos usar para diferentes tareas. Nosotros ven\u00edamos aplicando t\u00e9cnicas de an\u00e1lisis de similaridad de representaciones neuronales para comparar espacios vectoriales de sonidos, y ahora podemos pensar en el uso de estas representaciones que generan los transductores no s\u00f3lo para transcribir texto sino para otras tareas de audio m\u00e1s complejas, por ejemplo identificar sonidos de fondo mientras alguien est\u00e1 hablando, reconocer la emoci\u00f3n o la salud en el audio, entre otras<\/span><\/i><span style=\"font-weight: 400;\">\u201d, complementa Riera.<\/span><\/p>\n<div id=\"attachment_2527\" style=\"width: 210px\"  class=\"wp-caption alignleft\"><img decoding=\"async\" class=\"lazyload wp-image-2527 size-fusion-200\" src=\"https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2023\/10\/PabloRiera-200x252.jpg\" data-orig-src=\"https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2023\/10\/PabloRiera-200x252.jpg\" alt=\"\" width=\"200\" height=\"252\" srcset=\"data:image\/svg+xml,%3Csvg%20xmlns%3D%27http%3A%2F%2Fwww.w3.org%2F2000%2Fsvg%27%20width%3D%27200%27%20height%3D%27252%27%20viewBox%3D%270%200%20200%20252%27%3E%3Crect%20width%3D%27200%27%20height%3D%27252%27%20fill-opacity%3D%220%22%2F%3E%3C%2Fsvg%3E\" data-srcset=\"https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2023\/10\/PabloRiera-200x252.jpg 200w, https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2023\/10\/PabloRiera-238x300.jpg 238w, https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2023\/10\/PabloRiera-400x504.jpg 400w, https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2023\/10\/PabloRiera-600x756.jpg 600w, https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2023\/10\/PabloRiera-768x967.jpg 768w, https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2023\/10\/PabloRiera-800x1008.jpg 800w, https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2023\/10\/PabloRiera-813x1024.jpg 813w, https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2023\/10\/PabloRiera-1200x1512.jpg 1200w, https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2023\/10\/PabloRiera-1219x1536.jpg 1219w, https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2023\/10\/PabloRiera.jpg 1294w\" data-sizes=\"auto\" data-orig-sizes=\"(max-width: 200px) 100vw, 200px\" \/><p class=\"wp-caption-text\">Dr. Pablo Riera.<\/p><\/div>\n<p><span style=\"font-weight: 400;\">Pero aclara que a\u00fan no est\u00e1n realizando ning\u00fan entrenamiento con datos de hablantes, porque est\u00e1n enfocados en el desarrollo de la tecnolog\u00eda propiamente dicha, en particular en la eficiencia de los algoritmos basados en \u00e1lgebra lineal. Tambi\u00e9n el investigador explica que una posible ventaja de estos sistemas es incorporar las disfluencias en el habla (interrupciones o bloqueos, que consisten en repetir sonidos, s\u00edlabas o palabras; estirar un sonido o detenerse repentinamente en medio de una s\u00edlaba o palabra), que com\u00fanmente los asistentes de voz eliminan o limpian para obtener el mensaje final y que, en este sentido, estos sistemas ser\u00edan m\u00e1s eficientes para el an\u00e1lisis del habla en ni\u00f1os. \u201c<\/span><i><span style=\"font-weight: 400;\">Estamos trabajando en otro proyecto con an\u00e1lisis de habla de ni\u00f1os para ver c\u00f3mo hablan,y medir la fluidez del habla a medida que crecen, y para hacer encuestas de monitoreo del desempe\u00f1o de lectura del ni\u00f1o o ni\u00f1a. Para eso necesitamos unas transcripciones que contengan todos los detalles y la mejor forma de lograrlo es con transductores<\/span><\/i><span style=\"font-weight: 400;\">\u201d, concluye Riera.<\/span><\/p>\n<p><b>Participaci\u00f3n en un workshop internacional y publicaciones destacadas<\/b><\/p>\n<p><span style=\"font-weight: 400;\">En el marco de JSALT 2023 (<\/span><i><span style=\"font-weight: 400;\">Jelinek Summer Workshop on Speech and Language Technology<\/span><\/i><span style=\"font-weight: 400;\">), el CLSP (<\/span><i><span style=\"font-weight: 400;\">Center for Language and Speech Processing<\/span><\/i><span style=\"font-weight: 400;\">) organiz\u00f3 y recibi\u00f3 a algunos equipos internacionales para un Workshop intensivo de investigaci\u00f3n de seis semanas sobre tecnolog\u00edas del habla y el lenguaje. Estos workshops se realizan desde hace m\u00e1s de 20 a\u00f1os y, en sus diferentes ediciones, han tenido un impacto generalizado en la comunidad de tecnolog\u00eda del lenguaje humano, convocando a los principales expertos en el \u00e1rea. En 2023, en su 30\u00aa edici\u00f3n, el Workshop se llev\u00f3 a cabo en Le Mans, Francia, del 26 de junio al 4 de agosto y fue organizado por el LIUM (<\/span><i><span style=\"font-weight: 400;\">Laboratoire Informatique de l&#8217;Universit\u00e9 du Mans<\/span><\/i><span style=\"font-weight: 400;\">).<\/span><\/p>\n<p><span style=\"font-weight: 400;\">\u201c<\/span><i><span style=\"font-weight: 400;\">En los workshops JSALT se viene trabajando desde sus comienzos en el desarrollo de sistemas de reconocimiento del habla y fue uno de los \u00e1mbitos donde se impuls\u00f3 el uso de transductores. En esta ocasi\u00f3n participaron tambi\u00e9n del workshop dos investigadoras del grupo, Jazm\u00edn Vidal y Lara Gauder. Habr\u00eda que averiguar, pero es probable que hayamos sido los primeros investigadores de la UBA que participamos de este encuentro <\/span><\/i><span style=\"font-weight: 400;\">\u201d, comenta entusiasmado Riera.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">Al mismo tiempo, el grupo public\u00f3 el paper sobre representaciones autosupervisadas del habla \u201c<\/span><a href=\"https:\/\/ieeexplore.ieee.org\/document\/10193460\/?denied=\" target=\"_blank\" rel=\"noopener noreferrer\"><span style=\"font-weight: 400;\">Phone and Speaker Spatial Organization in Self-Supervised Speech Representations<\/span><\/a><span style=\"font-weight: 400;\">\u201d en una conferencia internacional del \u00e1rea (ICASSPW) organizada por IEEE.<\/span><\/p>\n<\/div><\/div><\/div><\/div><\/div>\n","protected":false},"excerpt":{"rendered":"<p>Los sistemas h\u00edbridos de reconocimiento del habla humana se caracterizan por combinar redes neuronales con transductores de estados finitos y buscan transcribir la voz a texto de una manera m\u00e1s controlada, reduciendo la aparici\u00f3n de errores. En este contexto, investigadores del ICC est\u00e1n trabajando en el desarrollo de algoritmos aplicados a estos sistemas para poder facilitar su uso y que posteriormente se puedan entrenar de forma conjunta las redes y los transductores.<\/p>\n","protected":false},"author":9,"featured_media":2528,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[12],"tags":[29,40,28,30,27],"class_list":["post-2525","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-noticias","tag-aprendizaje-automatico","tag-automatas","tag-inteligencia-artificial","tag-lenguaje","tag-procesamiento-habla"],"_links":{"self":[{"href":"https:\/\/icc.fcen.uba.ar\/en\/wp-json\/wp\/v2\/posts\/2525","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/icc.fcen.uba.ar\/en\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/icc.fcen.uba.ar\/en\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/icc.fcen.uba.ar\/en\/wp-json\/wp\/v2\/users\/9"}],"replies":[{"embeddable":true,"href":"https:\/\/icc.fcen.uba.ar\/en\/wp-json\/wp\/v2\/comments?post=2525"}],"version-history":[{"count":2,"href":"https:\/\/icc.fcen.uba.ar\/en\/wp-json\/wp\/v2\/posts\/2525\/revisions"}],"predecessor-version":[{"id":2580,"href":"https:\/\/icc.fcen.uba.ar\/en\/wp-json\/wp\/v2\/posts\/2525\/revisions\/2580"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/icc.fcen.uba.ar\/en\/wp-json\/wp\/v2\/media\/2528"}],"wp:attachment":[{"href":"https:\/\/icc.fcen.uba.ar\/en\/wp-json\/wp\/v2\/media?parent=2525"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/icc.fcen.uba.ar\/en\/wp-json\/wp\/v2\/categories?post=2525"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/icc.fcen.uba.ar\/en\/wp-json\/wp\/v2\/tags?post=2525"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}