{"id":3078,"date":"2026-01-07T09:20:32","date_gmt":"2026-01-07T12:20:32","guid":{"rendered":"https:\/\/icc.fcen.uba.ar\/?p=3078"},"modified":"2026-04-13T11:05:23","modified_gmt":"2026-04-13T14:05:23","slug":"vision-en-primera-persona-cuando-las-computadoras-aprenden-de-la-experiencia-humana","status":"publish","type":"post","link":"https:\/\/icc.fcen.uba.ar\/en\/vision-en-primera-persona-cuando-las-computadoras-aprenden-de-la-experiencia-humana\/","title":{"rendered":"Visi\u00f3n en primera persona: cuando las computadoras aprenden de la experiencia humana"},"content":{"rendered":"<div class=\"fusion-fullwidth fullwidth-box fusion-builder-row-1 fusion-flex-container has-pattern-background has-mask-background nonhundred-percent-fullwidth non-hundred-percent-height-scrolling\" style=\"--awb-border-radius-top-left:0px;--awb-border-radius-top-right:0px;--awb-border-radius-bottom-right:0px;--awb-border-radius-bottom-left:0px;--awb-flex-wrap:wrap;\" ><div class=\"fusion-builder-row fusion-row fusion-flex-align-items-flex-start fusion-flex-content-wrap\" style=\"max-width:1144px;margin-left: calc(-4% \/ 2 );margin-right: calc(-4% \/ 2 );\"><div class=\"fusion-layout-column fusion_builder_column fusion-builder-column-0 fusion_builder_column_1_1 1_1 fusion-flex-column\" style=\"--awb-bg-size:cover;--awb-width-large:100%;--awb-margin-top-large:0px;--awb-spacing-right-large:1.92%;--awb-margin-bottom-large:20px;--awb-spacing-left-large:1.92%;--awb-width-medium:100%;--awb-order-medium:0;--awb-spacing-right-medium:1.92%;--awb-spacing-left-medium:1.92%;--awb-width-small:100%;--awb-order-small:0;--awb-spacing-right-small:1.92%;--awb-spacing-left-small:1.92%;\"><div class=\"fusion-column-wrapper fusion-column-has-shadow fusion-flex-justify-content-flex-start fusion-content-layout-column\"><div class=\"fusion-text fusion-text-1\"><p><b>El procesamiento digital de im\u00e1genes est\u00e1 dando un giro clave con la visi\u00f3n en primera persona. En este escenario, investigadores del ICC desarrollan modelos que reconocen acciones humanas cotidianas para comprender la percepci\u00f3n visual y asistir en la vida diaria.<\/b><\/p>\n<p><span style=\"font-weight: 400;\">Sin lugar a dudas que el procesamiento digital de im\u00e1genes resulta una tecnolog\u00eda esencial dentro de la inteligencia artificial (IA) y la visi\u00f3n artificial. Permite que las m\u00e1quinas analicen, modifiquen y mejoren im\u00e1genes digitales para extraer informaci\u00f3n \u00fatil y precisa. Este proceso es fundamental para aplicaciones como la detecci\u00f3n de objetos, el reconocimiento facial, el an\u00e1lisis de video en tiempo real y la mejora de im\u00e1genes m\u00e9dicas. A trav\u00e9s de diversas t\u00e9cnicas y algoritmos, el procesamiento digital de im\u00e1genes ha transformado la manera en que las computadoras \u201cven\u201d y entienden el mundo.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">En los \u00faltimos a\u00f1os, el aprendizaje profundo (<\/span><i><span style=\"font-weight: 400;\">deep learning<\/span><\/i><span style=\"font-weight: 400;\">) ha revolucionado el campo del procesamiento digital de im\u00e1genes. Las redes neuronales convolucionales (CNN), una forma avanzada de algoritmos de aprendizaje profundo, est\u00e1n dise\u00f1adas espec\u00edficamente para analizar im\u00e1genes y reconocer patrones complejos. Las CNN son capaces de aprender caracter\u00edsticas de las im\u00e1genes a trav\u00e9s de m\u00faltiples capas de procesamiento, lo que les permite detectar con mayor precisi\u00f3n objetos, personas y escenas.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">No obstante, con el surgimiento de la visi\u00f3n en primera persona (<\/span><i><span style=\"font-weight: 400;\">egocentric vision<\/span><\/i><span style=\"font-weight: 400;\">) se produjo un cambio conceptual y t\u00e9cnico importante tanto en el procesamiento digital de im\u00e1genes como en el dise\u00f1o y uso de redes neuronales convolucionales (CNNs). Esta visi\u00f3n en primera persona es un subcampo de la visi\u00f3n artificial que analiza im\u00e1genes y videos capturados por una c\u00e1mara port\u00e1til que generalmente el humano lleva puesta (dispositivo wearable), otorgando una visi\u00f3n del mundo en primera persona.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">Claramente la investigaci\u00f3n en este campo pas\u00f3 de simplemente reconocer objetos, patrones y analizar y clasificar im\u00e1genes, a reconocer secuencias de acciones, manipulaci\u00f3n de objetos y rutinas diarias donde el usuario es el centro de la escena y el movimiento es constante (ya que aparecen manos que manipulan objetos).<\/span><\/p>\n<p><span style=\"font-weight: 400;\">En este contexto, investigadores del Grupo de Procesamiento de Im\u00e1genes y Visi\u00f3n por Computadora del ICC, est\u00e1n desarrollando proyectos enfocados en la Visi\u00f3n en Primera Persona, que buscan reconocer acciones y actividades de la vida cotidiana en la percepci\u00f3n visual humana y modelar ese comportamiento. El objetivo por un lado es incrementar la comprensi\u00f3n y el conocimiento del \u00e1rea y, por otro lado, poder utilizar esos avances en aplicaciones de la vida diaria como, por ejemplo, desarrollar modelos basados en visi\u00f3n egoc\u00e9ntrica para asistir en tareas a personas con capacidades diferentes.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">\u201c<\/span><i><span style=\"font-weight: 400;\">A partir de esta visi\u00f3n egoc\u00e9ntrica o en primera persona (First Person View-FPV), buscamos entender las caracter\u00edsticas de los humanos al ver, moverse, centrar la atenci\u00f3n y hacer movimientos de acuerdo a lo que les llame la atenci\u00f3n en su acci\u00f3n y qu\u00e9 dificultades surgen en esas actividades cotidianas. Nuestro enfoque parte desde la detecci\u00f3n de la mano y el objeto que est\u00e1 manipulando<\/span><\/i><span style=\"font-weight: 400;\">\u201d, puntualiza <\/span><b>Mar\u00eda Elena Buemi<\/b><span style=\"font-weight: 400;\">, investigadora del Grupo de Procesamiento de Im\u00e1genes del ICC. De este modo, existen distintos enfoques que los investigadores utilizan para abordar el desaf\u00edo de analizar los videos. Por ejemplo la postura de la mano y su movimiento, el movimiento de la cabeza, la direcci\u00f3n de la mirada y la importancia de los objetos en este contexto.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">De este modo, los datos visuales capturan la parte de la escena en la que el usuario se centra para realizar la tarea en cuesti\u00f3n (mover una cuchara para servirse az\u00facar en el caf\u00e9 y revolverlo, o tomar una botella de la mesa de la cocina) y ofrecen una perspectiva valiosa para comprender sus actividades y su contexto en un entorno natural.<\/span><\/p>\n<p><img decoding=\"async\" class=\"lazyload alignnone size-fusion-800 wp-image-3079\" src=\"https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2025\/12\/Imagen-interior1-800x328.png\" data-orig-src=\"https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2025\/12\/Imagen-interior1-800x328.png\" alt=\"\" width=\"800\" height=\"328\" srcset=\"data:image\/svg+xml,%3Csvg%20xmlns%3D%27http%3A%2F%2Fwww.w3.org%2F2000%2Fsvg%27%20width%3D%27800%27%20height%3D%27328%27%20viewBox%3D%270%200%20800%20328%27%3E%3Crect%20width%3D%27800%27%20height%3D%27328%27%20fill-opacity%3D%220%22%2F%3E%3C%2Fsvg%3E\" data-srcset=\"https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2025\/12\/Imagen-interior1-200x82.png 200w, https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2025\/12\/Imagen-interior1-300x123.png 300w, https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2025\/12\/Imagen-interior1-400x164.png 400w, https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2025\/12\/Imagen-interior1-600x246.png 600w, https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2025\/12\/Imagen-interior1-768x314.png 768w, https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2025\/12\/Imagen-interior1-800x328.png 800w, https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2025\/12\/Imagen-interior1.png 972w\" data-sizes=\"auto\" data-orig-sizes=\"(max-width: 800px) 100vw, 800px\" \/><\/p>\n<p><img decoding=\"async\" class=\"lazyload alignnone size-fusion-800 wp-image-3080\" src=\"https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2025\/12\/Imagen-interior2-800x316.png\" data-orig-src=\"https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2025\/12\/Imagen-interior2-800x316.png\" alt=\"\" width=\"800\" height=\"316\" srcset=\"data:image\/svg+xml,%3Csvg%20xmlns%3D%27http%3A%2F%2Fwww.w3.org%2F2000%2Fsvg%27%20width%3D%27800%27%20height%3D%27316%27%20viewBox%3D%270%200%20800%20316%27%3E%3Crect%20width%3D%27800%27%20height%3D%27316%27%20fill-opacity%3D%220%22%2F%3E%3C%2Fsvg%3E\" data-srcset=\"https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2025\/12\/Imagen-interior2-200x79.png 200w, https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2025\/12\/Imagen-interior2-300x118.png 300w, https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2025\/12\/Imagen-interior2-400x158.png 400w, https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2025\/12\/Imagen-interior2-600x237.png 600w, https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2025\/12\/Imagen-interior2-768x303.png 768w, https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2025\/12\/Imagen-interior2-800x316.png 800w, https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2025\/12\/Imagen-interior2.png 1004w\" data-sizes=\"auto\" data-orig-sizes=\"(max-width: 800px) 100vw, 800px\" \/><\/p>\n<p><span style=\"font-weight: 400;\">La c\u00e1mara port\u00e1til que mira hacia adelante suele complementarse con una c\u00e1mara que mira hacia el interior del ojo del usuario y que puede medir su mirada, lo cual resulta \u00fatil para detectar la atenci\u00f3n y comprender mejor su actividad e intenciones. Tal es as\u00ed que los dispositivos usuales consisten en anteojos inteligentes (<\/span><i><span style=\"font-weight: 400;\">Smart Glasses<\/span><\/i><span style=\"font-weight: 400;\">), c\u00e1maras de acci\u00f3n como las GoPro y dispositivos de seguimiento ocular (<\/span><i><span style=\"font-weight: 400;\">Eye Trackers<\/span><\/i><span style=\"font-weight: 400;\">). Y el FPV tiene m\u00faltiples aplicaciones: atenci\u00f3n m\u00e9dica, monitoreo no invasivo, seguimiento de productos en consumo masivo, aplicaciones deportivas, visi\u00f3n en robots, entre otras.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">Cabe recalcar que el trabajo precursor a estos avances es del investigador del MIT Steve Mann, referente del \u00e1rea, quien en 1996 propuso &#8220;WearCam&#8221;, un sistema multimedia port\u00e1til con capacidad de procesamiento de v\u00eddeo y conexi\u00f3n inal\u00e1mbrica a Internet, que se puede usar como un dispositivo prot\u00e9sico para ayudar a personas con discapacidad visual. En particular, describi\u00f3 dos ejemplos de aplicaci\u00f3n: el &#8220;asistente visual personal&#8221; que incorpora un filtro visual espacial que reconfigura el sistema visual humano, proporcionando una transformaci\u00f3n de coordenadas. Y la &#8220;pr\u00f3tesis de memoria visual&#8221;, que incorpora un filtro visual temporal que proporciona flashbacks inducidos por ordenador para superar la amnesia visual.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">\u201c<\/span><i><span style=\"font-weight: 400;\">Entre los problemas cl\u00e1sicos que resuelve el enfoque de la FPV pueden destacarse obtener videos de las escenas m\u00e1s importantes, poder abordar la variabilidad en los datasets, los cambios en la iluminaci\u00f3n de las escenas y la posici\u00f3n de los objetos. Y sobre todo si alguien hace una acci\u00f3n o actividad poder reconocer y predecir la siguiente actividad: por ejemplo si el sujeto est\u00e1 en la cocina con una sart\u00e9n, y entre los ingredientes tiene huevos, papas y aceite, todo indicar\u00eda que est\u00e1 por hacer una tortilla de papas<\/span><\/i><span style=\"font-weight: 400;\">\u201d, explica Buemi. Y subraya que al reconocer el entorno, hacer un mapeo de objetos y actividades y entender c\u00f3mo interact\u00faa con los dispositivos que lleva puestos, este tipo de enfoque resulta de una enorme utilidad para la investigaci\u00f3n actual, especialmente en aplicaciones de la vida cotidiana.<\/span><\/p>\n<p><b>Problemas y desaf\u00edos de la visi\u00f3n en primera persona<\/b><\/p>\n<p><span style=\"font-weight: 400;\">Los videos egoc\u00e9ntricos comenzaron a estudiarse en la \u00faltima d\u00e9cada gracias a dispositivos livianos y portables (GoPro y similares). Esto hizo que se tengan cada vez m\u00e1s conjuntos de datos. Esto dio lugar a investigaciones que inicialmente se pueden dividir en dos \u00e1reas: A) reconocimiento\/clasificaci\u00f3n de actividades; B) resumen de videos y detecci\u00f3n de objetos.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">Actualmente existen dos t\u00e9rminos que aparecen como contradictorios: acciones y actividades. Luego de arduas discusiones entre los investigadores, se concluy\u00f3 que ambos t\u00e9rminos son sem\u00e1nticamente diferentes: una acci\u00f3n es un evento breve, como &#8220;abrir un frasco&#8221;, mientras que una actividad es un evento sem\u00e1nticamente m\u00e1s complejo en el que se combinan varias acciones, con una duraci\u00f3n que va desde varios minutos hasta horas.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">Adem\u00e1s, algunos trabajos incluso denotan el movimiento utilizando el t\u00e9rmino &#8220;acci\u00f3n&#8221;, es decir, el movimiento generado al cortar algo se denominar\u00eda acci\u00f3n, independientemente de los objetos presentes en la escena.\u00a0<\/span><\/p>\n<p><span style=\"font-weight: 400;\">Entre algunos de los problemas que se presentan a la hora de generar videos FPV, est\u00e1 la dificultad para distinguir entre frente y fondo de una escena, la dificultad en la calibraci\u00f3n de la c\u00e1mara y la necesidad de m\u00f3dulos de alto nivel para obtener <\/span><i><span style=\"font-weight: 400;\">features<\/span><\/i><span style=\"font-weight: 400;\"> de escala, rotaci\u00f3n y traslaci\u00f3n. En tanto que los desaf\u00edos consisten en detecci\u00f3n y seguimiento de objetos en tiempo real, seguimiento de actividades, mapeo del entorno, interacci\u00f3n hombre-m\u00e1quina y detecci\u00f3n de interacci\u00f3n entre personas.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">\u201c<\/span><i><span style=\"font-weight: 400;\">Recientemente empiezan a aparecer varios datasets con cientos de horas de video que permiten modelar el comportamiento humano desde diferentes perspectivas, estos datos de FPV son provistos, por ejemplo, por la Universidad de Carnegie Mellon y la Universidad de Georgia, incluso existen datos de alta resoluci\u00f3n capturados por sujetos que realizan actividades diarias y proporciona anotaciones de acci\u00f3n, cuadros delimitadores de objetos y manos<\/span><\/i><span style=\"font-weight: 400;\">\u201d, destaca la investigadora del ICC, quien explica que est\u00e1n desarrollando diferentes proyectos de investigaci\u00f3n y tesis de licenciatura centradas en estos enfoques (ya defendidas como la de Maximiliano Giusto y en proceso como las tesis de Juan Ignacio Bustos Gorostegui y de Nicol\u00e1s Pacheco).\u00a0<\/span><\/p>\n<p><span style=\"font-weight: 400;\">Y se\u00f1ala que en las investigaciones que llevan adelante \u201c<\/span><i><span style=\"font-weight: 400;\">diferenciamos entre acciones y actividades, y entre acciones y movimiento, siendo el movimiento para nosotros el movimiento generado a partir de una acci\u00f3n, independientemente del objeto<\/span><\/i><span style=\"font-weight: 400;\">\u201d.\u00a0<\/span><\/p>\n<p><b>FPV usando modelos de atenci\u00f3n con localizaci\u00f3n de la mirada<\/b><\/p>\n<p><span style=\"font-weight: 400;\">Como un ejemplo donde se resumen claramente estas investigaciones, el grupo public\u00f3 en una de las principales conferencias del \u00e1rea (<\/span><i><span style=\"font-weight: 400;\">11th International Workshop on Assistive Computer Vision and Robotics<\/span><\/i><span style=\"font-weight: 400;\">) el art\u00edculo \u201c<\/span><a href=\"https:\/\/iplab.dmi.unict.it\/acvr2023\/program\/Attention-based%20performance%20improvement%20for%20gaze%20localization.pdf\" target=\"_blank\" rel=\"noopener\"><span style=\"font-weight: 400;\">Attention-based performance improvement for gaze localization<\/span><\/a><span style=\"font-weight: 400;\">\u201d, cuyos autores son Axel Straminsky, Daniel Acevedo, Mar\u00eda Elena Buemi y Julio Jacobo-Berlles .<\/span><\/p>\n<p><span style=\"font-weight: 400;\">El paper busca proponer mejoras a uno de los algoritmos del estado del arte en FPV (algoritmo de Lu) para obtener resultados comparables con recursos m\u00e1s reducidos. Para ello, los investigadores adaptaron un modelo de reconocimiento de acciones en videos egoc\u00e9ntricos basado en mecanismos de atenci\u00f3n combinados con flujo \u00f3ptico, de modo de entender en qu\u00e9 objetos y actividades est\u00e1 puesto el inter\u00e9s que realiza el sujeto. Se trata de un modelo de arquitectura que utiliza dos submodelos en paralelo: uno basado en Flujo \u00d3ptico y otro basado en el propio v\u00eddeo (im\u00e1genes RGB). Tal es as\u00ed que se introdujeron las siguientes mejoras: precisi\u00f3n mixta en el ciclo de entrenamiento, uso de Ranger Optimizer en lugar de SGD est\u00e1ndar en el mecanismo de atenci\u00f3n y el uso de varias funciones de activaci\u00f3n. Y para las pruebas, usaron el conjunto de datos EGTEA Gaze+, que consta de v\u00eddeos de acciones cotidianas en primera persona y la experimentaci\u00f3n realizada, junto con los resultados obtenidos.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">\u201c<\/span><i><span style=\"font-weight: 400;\">Este trabajo abre la posibilidad de probar conjuntos de datos m\u00e1s complejos, ya que al expandir el mecanismo de atenci\u00f3n y utilizar un modelo entrenado con cientos de iteraciones, probablemente obtengamos una mejor performance<\/span><\/i><span style=\"font-weight: 400;\">\u201d, afirma Buemi.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">A su vez, el mismo grupo public\u00f3 junto al estudiante y becario BIICC, Nicol\u00e1s Pacheco, el art\u00edculo \u201c<\/span><a href=\"https:\/\/ego4d-data.org\/workshops\/eccv22\/#program\" target=\"_blank\" rel=\"noopener\"><span style=\"font-weight: 400;\">Hand and Object Detection in Egocentric Videos with Local Color Features and Random Forest<\/span><\/a><span style=\"font-weight: 400;\">\u201d (2nd International Ego4D Workshop-ECCV 2022). Se trata de un interesante trabajo que, en el an\u00e1lisis de im\u00e1genes de video en tiempo real, propone el reconocimiento de brazos y manos para encontrar el centro de atenci\u00f3n y as\u00ed saber qu\u00e9 objeto tiene en sus manos el usuario que porta la c\u00e1mara. Y, al mismo tiempo, tiene como prop\u00f3sito identificar los objetos que est\u00e1n en la imagen, para entender el contexto en el que est\u00e1 sucediendo la acci\u00f3n.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">\u201c<\/span><i><span style=\"font-weight: 400;\">En este proyecto usamos algoritmos de random forest (un algoritmo de aprendizaje autom\u00e1tico de uso com\u00fan que combina el resultado de m\u00faltiples \u00e1rboles de decisi\u00f3n para llegar a un resultado \u00fanico) que nos permitieron detectar la piel de la mano a nivel de p\u00edxel usando la funci\u00f3n de color y armar m\u00e1scaras con conjuntos de datos, principalmente de RGB, para detectar objetos en la cocina (por ejemplo caf\u00e9 y s\u00e1ndwich)<\/span><\/i><span style=\"font-weight: 400;\">\u201d, comenta la investigadora y doctora en ciencias de la computaci\u00f3n.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">A partir de la piel y objetos detectados, los investigadores pudieron reconocer que los objetos en la imagen brindan un contexto y una sem\u00e1ntica y distinguir los objetos que est\u00e1n realmente en la mano, con los que se puede detectar la acci\u00f3n en el momento y los tipos de cambios que suceden en la acci\u00f3n.<\/span><\/p>\n<p><img decoding=\"async\" class=\"lazyload alignnone size-fusion-800 wp-image-3081\" src=\"https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2025\/12\/Imagen-interior3-800x144.png\" data-orig-src=\"https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2025\/12\/Imagen-interior3-800x144.png\" alt=\"\" width=\"800\" height=\"144\" srcset=\"data:image\/svg+xml,%3Csvg%20xmlns%3D%27http%3A%2F%2Fwww.w3.org%2F2000%2Fsvg%27%20width%3D%27800%27%20height%3D%27144%27%20viewBox%3D%270%200%20800%20144%27%3E%3Crect%20width%3D%27800%27%20height%3D%27144%27%20fill-opacity%3D%220%22%2F%3E%3C%2Fsvg%3E\" data-srcset=\"https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2025\/12\/Imagen-interior3-200x36.png 200w, https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2025\/12\/Imagen-interior3-300x54.png 300w, https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2025\/12\/Imagen-interior3-400x72.png 400w, https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2025\/12\/Imagen-interior3-600x108.png 600w, https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2025\/12\/Imagen-interior3-768x139.png 768w, https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2025\/12\/Imagen-interior3-800x144.png 800w, https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2025\/12\/Imagen-interior3.png 987w\" data-sizes=\"auto\" data-orig-sizes=\"(max-width: 800px) 100vw, 800px\" \/><\/p>\n<p><span style=\"font-weight: 400;\">Adem\u00e1s, la investigadora Buemi aclara que uno de los pr\u00f3ximos desaf\u00edos de estos proyectos es resolver el punto de no retorno (PNR) en v\u00eddeos egoc\u00e9ntricos. \u201c<\/span><i><span style=\"font-weight: 400;\">PNR se le dice a aquellos puntos en los que hubo un cambio f\u00edsico en la actividad y ya no puede volverse atr\u00e1s, por ejemplo donde se hace un caf\u00e9 instant\u00e1neo, en la contra si se sirve un vaso de agua no hay PNR porque no hay cambio f\u00edsico. O quemar un papel no tiene vuelta atr\u00e1s, pero verter un vaso de agua s\u00ed<\/span><\/i><span style=\"font-weight: 400;\">\u201d, aclara.<\/span><\/p>\n<p><b>Visi\u00f3n en primera persona en la frontera de la interdisciplina<\/b><\/p>\n<p><span style=\"font-weight: 400;\">Para concluir, Buemi explica que este nuevo enfoque propio del procesamiento digital de im\u00e1genes, tiene un fuerte car\u00e1cter interdisciplinario. \u201c<\/span><i><span style=\"font-weight: 400;\">A medida que podamos modelar el comportamiento humano con la visi\u00f3n en primera persona, vamos a poder comprender mejor c\u00f3mo el ojo y el cerebro humano perciben los objetos de su entorno, lo cual tiene un fuerte cruce con la neurociencia\u201d<\/span><\/i><span style=\"font-weight: 400;\">, argumenta. Y aclara que est\u00e1n interactuando con investigadores de otras disciplinas de Exactas para, desde el procesamiento de im\u00e1genes, contribuir a la resoluci\u00f3n de nuevos problemas. \u201cEstamos colaborando fuertemente no s\u00f3lo en proyectos de nuestra \u00e1rea sino en otros dominios para mejorar im\u00e1genes digitales en biolog\u00eda, medioambiente y salud\u201d.<\/span><\/p>\n<div id=\"attachment_3082\" style=\"width: 310px\"  class=\"wp-caption alignleft\"><img decoding=\"async\" class=\"lazyload wp-image-3082 size-medium\" src=\"https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2025\/12\/Maria-Elena-Buemi-300x260.jpg\" data-orig-src=\"https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2025\/12\/Maria-Elena-Buemi-300x260.jpg\" alt=\"\" width=\"300\" height=\"260\" srcset=\"data:image\/svg+xml,%3Csvg%20xmlns%3D%27http%3A%2F%2Fwww.w3.org%2F2000%2Fsvg%27%20width%3D%27300%27%20height%3D%27260%27%20viewBox%3D%270%200%20300%20260%27%3E%3Crect%20width%3D%27300%27%20height%3D%27260%27%20fill-opacity%3D%220%22%2F%3E%3C%2Fsvg%3E\" data-srcset=\"https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2025\/12\/Maria-Elena-Buemi-200x173.jpg 200w, https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2025\/12\/Maria-Elena-Buemi-300x260.jpg 300w, https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2025\/12\/Maria-Elena-Buemi-400x346.jpg 400w, https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2025\/12\/Maria-Elena-Buemi-600x519.jpg 600w, https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2025\/12\/Maria-Elena-Buemi-768x665.jpg 768w, https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2025\/12\/Maria-Elena-Buemi-800x692.jpg 800w, https:\/\/icc.fcen.uba.ar\/wp-content\/uploads\/2025\/12\/Maria-Elena-Buemi.jpg 893w\" data-sizes=\"auto\" data-orig-sizes=\"(max-width: 300px) 100vw, 300px\" \/><p class=\"wp-caption-text\">Dra. Mar\u00eda Elena Buemi<\/p><\/div>\n<p><span style=\"font-weight: 400;\">Por \u00faltimo, la investigadora recalca el potencial de estas tecnolog\u00edas para ayudar en la vida cotidiana a personas con discapacidad visual o intelectual. \u201c<\/span><i><span style=\"font-weight: 400;\">Sin dudas que estos avances no s\u00f3lo tendr\u00e1n funciones de pr\u00f3tesis visual, sino que tambi\u00e9n ayudar\u00e1n a personas con dificultades de atenci\u00f3n o memoria para recordar hechos pasados o eventos de corto plazo. Por ejemplo, una persona que se olvid\u00f3 las llaves en alguna parte de la casa y el sistema reconoce d\u00f3nde (en la mesa del comedor), por lo que le ayuda a resolver el problema<\/span><\/i><span style=\"font-weight: 400;\">\u201d, complementa.<\/span><\/p>\n<p><span style=\"font-weight: 400;\">Y postula que estos avances tecnol\u00f3gicos son cada vez m\u00e1s din\u00e1micos y r\u00e1pidos, por lo que desde su grupo resulta necesario estar permanentemente actualizado. \u201c<\/span><i><span style=\"font-weight: 400;\">Tenemos cada vez m\u00e1s desaf\u00edos t\u00e9cnicos e innovaciones que surgen en tiempos cada vez m\u00e1s cortos, que nos obligan a conocer las nuevas t\u00e9cnicas de procesamiento que aparecen y estar atentos a los desarrollos de la visi\u00f3n por computadora, para poder incorporarlos sucesivamente a nuestros proyectos de investigaci\u00f3n<\/span><\/i><span style=\"font-weight: 400;\">\u201d, concluye.<\/span><\/p>\n<\/div><\/div><\/div><\/div><\/div>\n","protected":false},"excerpt":{"rendered":"<p>El procesamiento digital de im\u00e1genes est\u00e1 dando un giro clave con la visi\u00f3n en primera persona. En este escenario, investigadores del ICC desarrollan modelos que reconocen acciones humanas cotidianas para comprender la percepci\u00f3n visual y asistir en la vida diaria.<\/p>\n","protected":false},"author":9,"featured_media":3083,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[12],"tags":[],"class_list":["post-3078","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-noticias"],"_links":{"self":[{"href":"https:\/\/icc.fcen.uba.ar\/en\/wp-json\/wp\/v2\/posts\/3078","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/icc.fcen.uba.ar\/en\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/icc.fcen.uba.ar\/en\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/icc.fcen.uba.ar\/en\/wp-json\/wp\/v2\/users\/9"}],"replies":[{"embeddable":true,"href":"https:\/\/icc.fcen.uba.ar\/en\/wp-json\/wp\/v2\/comments?post=3078"}],"version-history":[{"count":4,"href":"https:\/\/icc.fcen.uba.ar\/en\/wp-json\/wp\/v2\/posts\/3078\/revisions"}],"predecessor-version":[{"id":3089,"href":"https:\/\/icc.fcen.uba.ar\/en\/wp-json\/wp\/v2\/posts\/3078\/revisions\/3089"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/icc.fcen.uba.ar\/en\/wp-json\/wp\/v2\/media\/3083"}],"wp:attachment":[{"href":"https:\/\/icc.fcen.uba.ar\/en\/wp-json\/wp\/v2\/media?parent=3078"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/icc.fcen.uba.ar\/en\/wp-json\/wp\/v2\/categories?post=3078"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/icc.fcen.uba.ar\/en\/wp-json\/wp\/v2\/tags?post=3078"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}