Interacción multimodal

La interacción multimodal proporciona al usuario múltiples modos de interactuar con un sistema. Una interfaz multimodal proporciona varias herramientas distintas para la entrada y salida de datos.

La interacción multimodal persona-computadora implica una comunicación natural con entornos virtuales y físicos. Facilita la comunicación libre y natural entre usuarios y sistemas automatizados, permitiendo entradas (voz, escritura, gestos) y salidas ( síntesis de voz , gráficos) flexibles. La fusión multimodal combina aportaciones de diferentes modalidades, abordando ambigüedades.

Dos grupos principales de interfaces multimodales se centran en métodos de entrada alternativos y entrada/salida combinada. Múltiples modalidades de entrada mejoran la usabilidad, beneficiando a los usuarios con discapacidades. Los dispositivos móviles suelen emplear XHTML+Voice para la entrada. Los sistemas biométricos multimodales utilizan múltiples datos biométricos para superar las limitaciones. El análisis de sentimientos multimodal implica el análisis de datos de texto, audio y visuales para la clasificación de sentimientos. GPT-4 , un modelo de lenguaje multimodal , integra varias modalidades para mejorar la comprensión del lenguaje. Los sistemas de salida multimodales presentan información a través de señales visuales y auditivas, utilizando el tacto y el olfato. La fusión multimodal integra información de diferentes modalidades, empleando una fusión multinivel híbrida, basada en decisiones y basada en reconocimiento.

Las ambigüedades en la entrada multimodal se abordan mediante métodos de prevención, resolución a-posterior y resolución de aproximación.

Introducción

La interacción multimodal humano-computadora se refiere a la "interacción con el entorno virtual y físico a través de modos naturales de comunicación", ^[1] Esto implica que la interacción multimodal permite una comunicación más libre y natural, conectando a los usuarios con sistemas automatizados tanto en entrada como en salida. ^[2] Específicamente, los sistemas multimodales pueden ofrecer un entorno flexible, eficiente y utilizable que permite a los usuarios interactuar a través de modalidades de entrada, como el habla , la escritura , los gestos con las manos y la mirada , y recibir información del sistema a través de modalidades de salida, como la síntesis de voz. , gráficos inteligentes y otras modalidades, oportunamente combinadas. Entonces un sistema multimodal tiene que reconocer las entradas de las diferentes modalidades combinándolas según restricciones temporales y contextuales ^[3] para permitir su interpretación. Este proceso se conoce como fusión multimodal, y es objeto de varios trabajos de investigación desde la década de los noventa hasta la actualidad. ^[4]^[5]^[6]^[7]^[8]^[9]^[10]^[11] Las entradas con fusibles son interpretadas por el sistema. La naturalidad y la flexibilidad pueden producir más de una interpretación para cada modalidad (canal) diferente y para su uso simultáneo, y en consecuencia pueden producir ambigüedad multimodal ^[12] generalmente debido a imprecisiones, ruidos u otros factores similares. Para resolver ambigüedades se han propuesto varios métodos. ^[13]^[14]^[15]^[16]^[17]^[18] Finalmente el sistema retorna a las salidas del usuario a través de los distintos canales modales (desagregados) ordenados según una retroalimentación consistente (fisión). ^[19] El uso generalizado de dispositivos móviles, sensores y tecnologías web puede ofrecer recursos computacionales adecuados para gestionar la complejidad que implica la interacción multimodal. "El uso de la nube para involucrar recursos computacionales compartidos en la gestión de la complejidad de la interacción multimodal representa una oportunidad. De hecho, la computación en la nube permite entregar recursos informáticos compartidos, escalables y configurables que se pueden aprovisionar y liberar de forma dinámica y automática". ^[20]

Entrada multimodal

Se han fusionado dos grupos principales de interfaces multimodales, uno relacionado con métodos de entrada alternativos y el otro con entrada/salida combinada. El primer grupo de interfaces combinaba varios modos de entrada del usuario más allá de la entrada/salida tradicional con teclado y ratón , como voz, lápiz, tacto, gestos manuales, ^[21] mirada y movimientos de cabeza y cuerpo. ^[22] La interfaz más común combina una modalidad visual (por ejemplo, una pantalla, teclado y mouse) con una modalidad de voz ( reconocimiento de voz para entrada, síntesis de voz y audio grabado para salida). Sin embargo, se pueden utilizar otras modalidades, como la entrada basada en lápiz o la entrada/salida háptica . Las interfaces de usuario multimodales son un área de investigación en la interacción persona-computadora (HCI).

La ventaja de múltiples modalidades de entrada es una mayor usabilidad : las debilidades de una modalidad se compensan con las fortalezas de otra. En un dispositivo móvil con una pequeña interfaz visual y un teclado, una palabra puede ser bastante difícil de escribir pero muy fácil de decir (por ejemplo, Poughkeepsie ). Considere cómo accedería y buscaría en catálogos de medios digitales desde estos mismos dispositivos o decodificadores. Y en un ejemplo del mundo real, los miembros del equipo quirúrgico acceden verbalmente a la información del paciente en un entorno de quirófano para mantener un entorno antiséptico, y la presentan casi en tiempo real de forma auditiva y visual para maximizar la comprensión.

Las interfaces de usuario de entrada multimodal tienen implicaciones para la accesibilidad . ^[23] Una aplicación multimodal bien diseñada puede ser utilizada por personas con una amplia variedad de discapacidades. Los usuarios con discapacidad visual dependen de la modalidad de voz con alguna entrada del teclado. Los usuarios con discapacidad auditiva dependen de la modalidad visual con cierta entrada de voz. Otros usuarios estarán "discapacitados situacionalmente" (por ejemplo, usar guantes en un entorno muy ruidoso, conducir o tener que introducir un número de tarjeta de crédito en un lugar público) y simplemente utilizarán las modalidades apropiadas según lo deseen. Por otro lado, una aplicación multimodal que requiere que los usuarios puedan operar todas las modalidades está muy mal diseñada.

La forma más común de multimodalidad de entrada en el mercado utiliza el lenguaje de marcado web XHTML+Voice (también conocido como X+V), una especificación abierta desarrollada por IBM , Motorola y Opera Software . Actualmente, el W3C está considerando X+V y combina varias recomendaciones del W3C , incluido XHTML para marcado visual, VoiceXML para marcado de voz y XML Events , un estándar para integrar lenguajes XML . Los navegadores multimodales que soportan X+V incluyen IBM WebSphere Everyplace Multimodal Environment, Opera para Linux y Windows integrados y ACCESS Systems NetFront para Windows Mobile . Para desarrollar aplicaciones multimodales, los desarrolladores de software pueden utilizar un kit de desarrollo de software , como IBM WebSphere Multimodal Toolkit, basado en el marco de código abierto Eclipse , que incluye un depurador , editor y simulador X+V . ^[^{cita necesaria}^]

Biometría multimodal

Los sistemas biométricos multimodales utilizan múltiples sensores o datos biométricos para superar las limitaciones de los sistemas biométricos unimodales. ^[24] Por ejemplo, los sistemas de reconocimiento del iris pueden verse comprometidos por el envejecimiento del iris ^[25] y el reconocimiento electrónico de huellas dactilares puede empeorar por huellas dactilares desgastadas o cortadas. Si bien los sistemas biométricos unimodales están limitados por la integridad de su identificador, es poco probable que varios sistemas unimodales sufran limitaciones idénticas. Los sistemas biométricos multimodales pueden obtener conjuntos de información del mismo marcador (es decir, múltiples imágenes de un iris o escaneos del mismo dedo) o información de diferentes sistemas biométricos (que requieren escaneos de huellas dactilares y, mediante reconocimiento de voz , un código de acceso hablado). ^[26]^[27]

Los sistemas biométricos multimodales pueden fusionar estos sistemas unimodales de forma secuencial, simultánea, una combinación de los mismos, o en serie, que se refieren a modos de integración secuencial, paralelo, jerárquico y serial, respectivamente. La fusión de la información biométrica puede ocurrir en diferentes etapas de un sistema de reconocimiento. En caso de fusión a nivel de características, se fusionan los datos en sí o las características extraídas de múltiples datos biométricos. La fusión de niveles de puntuación coincidente consolida las puntuaciones generadas por múltiples clasificadores pertenecientes a diferentes modalidades. Finalmente, en caso de fusión de niveles de decisión, los resultados finales de múltiples clasificadores se combinan mediante técnicas como la votación por mayoría . Se cree que la fusión de niveles de características es más efectiva que los otros niveles de fusión porque el conjunto de características contiene información más rica sobre los datos biométricos de entrada que la puntuación coincidente o la decisión de salida de un clasificador. Por lo tanto, se espera que la fusión a nivel de características proporcione mejores resultados de reconocimiento. ^[24]

Los ataques de suplantación de identidad consisten en enviar rasgos biométricos falsos a los sistemas biométricos y son una amenaza importante que puede reducir su seguridad. Se cree comúnmente que los sistemas biométricos multimodales son intrínsecamente más resistentes a los ataques de suplantación de identidad, pero estudios recientes ^[28] han demostrado que pueden evadirse falsificando incluso un solo rasgo biométrico.

Análisis de sentimiento multimodal

El análisis de sentimiento multimodal es una tecnología para el análisis de sentimiento tradicional basado en texto , que incluye modalidades como datos de audio y visuales. ^[29] Puede ser bimodal, que incluye diferentes combinaciones de dos modalidades, o trimodal, que incorpora tres modalidades. ^[30] Con la gran cantidad de datos de redes sociales disponibles en línea en diferentes formas, como videos e imágenes, el análisis de sentimiento convencional basado en texto ha evolucionado hacia modelos más complejos de análisis de sentimiento multimodal, ^[31] que se pueden aplicar en el desarrollo. de asistentes virtuales , ^[32] análisis de reseñas de películas de YouTube, ^[33] análisis de videos de noticias, ^[34] y reconocimiento de emociones (a veces conocido como detección de emociones ) como el monitoreo de la depresión , ^[35] entre otros.

De manera similar al análisis de sentimientos tradicional , una de las tareas más básicas en el análisis de sentimientos multimodal es la clasificación de sentimientos , que clasifica diferentes sentimientos en categorías como positivo, negativo o neutral. ^[36] La complejidad de analizar características de texto, audio y visuales para realizar tal tarea requiere la aplicación de diferentes técnicas de fusión, como la fusión a nivel de características, a nivel de decisión y híbrida. ^[31] El rendimiento de estas técnicas de fusión y los algoritmos de clasificación aplicados están influenciados por el tipo de características textuales, de audio y visuales empleadas en el análisis. ^[37]

Modelos de lenguaje multimodal

Transformador generativo preentrenado 4 ( GPT-4 ) es un modelo de lenguaje grande multimodal creado por OpenAI y el cuarto de su serie de modelos básicos GPT . ^[38] Se lanzó el 14 de marzo de 2023, ^[38] y se puso a disposición del público a través del producto de chatbot de pago ChatGPT Plus , a través de la API de OpenAI y a través del chatbot gratuito Microsoft Copilot . ^[39] Como modelo basado en transformador , GPT-4 utiliza un paradigma en el que se utiliza un entrenamiento previo que utiliza tanto datos públicos como "datos con licencia de proveedores externos" para predecir el siguiente token . Después de este paso, el modelo se ajustó con comentarios de aprendizaje reforzado de humanos e inteligencia artificial para la alineación humana y el cumplimiento de políticas. ^[40]^{: 2}

Los observadores informaron que la iteración de ChatGPT usando GPT-4 fue una mejora con respecto a la iteración anterior basada en GPT-3.5, con la salvedad de que GPT-4 conserva algunos de los problemas de revisiones anteriores. ^[41] GPT-4, equipado con capacidades de visión (GPT-4V), ^[42] es capaz de tomar imágenes como entrada en ChatGPT. ^[43] OpenAI se ha negado a revelar varios detalles técnicos y estadísticas sobre GPT-4, como el tamaño preciso del modelo. ^[44]

Salida multimodal

El segundo grupo de sistemas multimodales presenta a los usuarios pantallas multimedia y resultados multimodales, principalmente en forma de señales visuales y auditivas. Los diseñadores de interfaces también han comenzado a utilizar otras modalidades, como el tacto y el olfato. Los beneficios propuestos del sistema de producción multimodal incluyen sinergia y redundancia. La información que se presenta a través de varias modalidades está fusionada y hace referencia a varios aspectos de un mismo proceso. El uso de varias modalidades para procesar exactamente la misma información proporciona un mayor ancho de banda de transferencia de información. ^[45]^[46]^[47] Actualmente, la salida multimodal se utiliza principalmente para mejorar el mapeo entre el medio de comunicación y el contenido y para respaldar la gestión de la atención en un entorno rico en datos donde los operadores enfrentan demandas considerables de atención visual. ^[48]

Un paso importante en el diseño de interfaces multimodales es la creación de mapeos naturales entre las modalidades y la información y las tareas. El canal auditivo se diferencia de la visión en varios aspectos. Es omnidireccional, transitorio y siempre reservado. ^[48] La producción del habla, una forma de información auditiva, recibió considerable atención. Se han desarrollado varias pautas para el uso del habla. Michaelis y Wiggins (1982) sugirieron que la salida del habla debería usarse para mensajes cortos simples a los que no nos referiremos más adelante. También se recomendó que el discurso se genere a tiempo y requiera una respuesta inmediata.

El sentido del tacto se utilizó por primera vez como medio de comunicación a finales de los años cincuenta. ^[49] No sólo es un canal de comunicación prometedor, sino también único. A diferencia de la visión y el oído, los dos sentidos tradicionales empleados en HCI, el sentido del tacto es proximal: detecta objetos que están en contacto con el cuerpo y es bidireccional en el sentido de que apoya tanto la percepción como la acción sobre el entorno.

Ejemplos de retroalimentación auditiva incluyen íconos auditivos en sistemas operativos de computadoras que indican las acciones de los usuarios (por ejemplo, eliminar un archivo, abrir una carpeta, error), salida de voz para presentar guías de navegación en vehículos y salida de voz para advertir a los pilotos en las cabinas de los aviones modernos. Ejemplos de señales táctiles incluyen vibraciones de la palanca de las señales de giro para advertir a los conductores de un automóvil en su punto ciego, la vibración del asiento del automóvil como advertencia a los conductores y el agitador de palanca en los aviones modernos que alerta a los pilotos sobre una pérdida inminente. ^[48]

Los espacios de interfaz invisibles estuvieron disponibles mediante tecnología de sensores. Hoy en día se utilizan habitualmente infrarrojos, ultrasonidos y cámaras. ^[50] La transparencia de la interfaz con el contenido se mejora al proporcionar un vínculo inmediato y directo a través de un mapeo significativo, por lo que el usuario tiene retroalimentación directa e inmediata a la entrada y la respuesta del contenido se convierte en una posibilidad de interfaz (Gibson 1979).

Fusión multimodal

El proceso de integrar información de varias modalidades de entrada y combinarlas en un comando completo se denomina fusión multimodal. ^[5] En la literatura, se han propuesto tres enfoques principales para el proceso de fusión, según los principales niveles arquitectónicos (reconocimiento y decisión) en los que se puede realizar la fusión de las señales de entrada: basado en reconocimiento, ^[9]^[10]^[51] basada en decisiones, ^[7]^[8]^[11]^[52]^[53]^[54]^[55] y fusión multinivel híbrida. ^[4]^[6]^[56]^[57]^[58]^[59]^[60]^[61]

La fusión basada en reconocimiento (también conocida como fusión temprana) consiste en fusionar los resultados de cada reconocedor modal mediante el uso de mecanismos de integración, como por ejemplo técnicas de integración estadística, teoría de agentes, modelos ocultos de Markov, redes neuronales artificiales, etc. Algunas de las estrategias de fusión basadas en reconocimiento son el marco de acción, ^[51] los vectores de entrada ^[9] y las ranuras. ^[10]

La fusión basada en decisiones (también conocida como fusión tardía) fusiona la información semántica que se extrae mediante procedimientos de fusión específicos basados en diálogos para producir la interpretación completa. Ejemplos de estrategias de fusión basadas en decisiones son estructuras de características tipificadas, ^[52]^[57] crisoles, ^[54]^[55] marcos semánticos, ^[7]^[11] y celosías con marca de tiempo. ^[8]

Las aplicaciones potenciales de la fusión multimodal incluyen entornos de aprendizaje, relaciones con el consumidor, seguridad/vigilancia, animación por computadora, etc. Individualmente, los modos se definen fácilmente, pero surge la dificultad de que la tecnología los considere una fusión combinada. ^[62] Es difícil para los algoritmos tener en cuenta la dimensionalidad; existen variables fuera de las capacidades de cálculo actuales. Por ejemplo, significado semántico: dos oraciones podrían tener el mismo significado léxico pero diferente información emocional. ^[62]

En la fusión híbrida multinivel, la integración de modalidades de entrada se distribuye entre los niveles de reconocimiento y decisión. La fusión híbrida multinivel incluye las siguientes tres metodologías: transductores de estados finitos, ^[57] gramáticas multimodales ^[6]^[56]^[58]^[59]^[60]^[61]^[63] y movimientos de diálogo. ^[64]

Ambigüedad

Las acciones o comandos del usuario producen entradas multimodales (mensaje multimodal ^[3] ), que deben ser interpretadas por el sistema. El mensaje multimodal es el medio que permite la comunicación entre usuarios y sistemas multimodales. Se obtiene fusionando información que se transmite a través de varias modalidades considerando los diferentes tipos de cooperación entre varias modalidades, ^[65] las relaciones temporales ^[66] entre las modalidades involucradas y las relaciones entre fragmentos de información conectados con estas modalidades. ^[67]

El mapeo natural entre la entrada multimodal, que es proporcionada por varias modalidades de interacción (canal visual y auditivo y sentido del tacto), y la información y las tareas implica gestionar los problemas típicos de la comunicación entre humanos, como la ambigüedad. Una ambigüedad surge cuando es posible más de una interpretación de la entrada. Una ambigüedad multimodal ^[12] surge tanto si un elemento proporcionado por una modalidad tiene más de una interpretación (es decir, las ambigüedades se propagan a nivel multimodal) como si los elementos relacionados con cada modalidad se interpretan unívocamente. , pero la información referida a diferentes modalidades es incoherente a nivel sintáctico o semántico (es decir, una oración multimodal que tiene diferentes significados o diferente estructura sintáctica).

En "La gestión de ambigüedades", ^[14] los métodos para resolver ambigüedades y para proporcionar la interpretación correcta de la entrada del usuario se organizan en tres clases principales: prevención, resolución a-posterior y métodos de resolución de aproximación. ^[13]^[15]

Los métodos de prevención imponen a los usuarios seguir un comportamiento de interacción predefinido de acuerdo con un conjunto de transiciones entre diferentes estados permitidos del proceso de interacción. Ejemplos de métodos de prevención son: método procesal, ^[68] reducción del poder expresivo de la gramática del lenguaje, ^[69] mejora del poder expresivo de la gramática del lenguaje. ^[70]

La resolución a-posterior de ambigüedades utiliza un enfoque de mediación. ^[16] Ejemplos de técnicas de mediación son: repetición, por ejemplo, repetición por modalidad, ^[16] granularidad de reparación ^[71] y deshacer, ^[17] y elección. ^[18]

Los métodos de resolución de aproximación no requieren la participación del usuario en el proceso de desambiguación. Todos ellos pueden requerir el uso de algunas teorías, como la lógica difusa , el campo aleatorio de Markov , las redes bayesianas y los modelos ocultos de Markov . ^[13]^[15]

Ver también

Independencia del dispositivo
Sistema biométrico multimodal
Búsqueda multimodal
Reconocimiento de voz
Actividad de interacción multimodal del W3C : una iniciativa del W3C que tiene como objetivo proporcionar medios (principalmente XML ) para soportar escenarios de interacción multimodal en la Web.
Accesibilidad web
Guante con cable
XHTML+Voz

Referencias

^ Bourguet, ML (2003). "Diseño y creación de prototipos de comandos multimodales". Actas de interacción persona-computadora (INTERACT'03), págs. 717-720.
^ Stivers, T., Sidnell, J. Introducción: interacción multimodal. Semiótica, 156(1/4), págs.1-20. 2005.
^ ab Caschera MC, Ferri F., Grifoni P. (2007). "Sistemas de interacción multimodal: características de información y tiempo". Revista internacional de servicios web y grid (IJWGS), vol. 3 - Número 1, págs. 82-99.
^ ab D'Ulizia, A., Ferri, F. y Grifoni, P. (2010). "Generación de gramáticas multimodales para el procesamiento de diálogos multimodales". Transacciones IEEE sobre sistemas, hombre y cibernética, Parte A: Sistemas y humanos, Vol 40, no 6, págs. 1130 – 1145.
^ ab D'Ulizia, A. (2009). "Explorando estrategias de fusión de entradas multimodales". En: Grifoni P (ed) Manual de investigación sobre interacción multimodal persona-computadora y servicios generalizados: técnicas evolutivas para mejorar la accesibilidad. Publicación IGI, págs. 34-57.
^ abc Sun, Y., Shi, Y., Chen, F. y Chung, V. (2007). "Un procesador de lenguaje multimodal eficiente para cadenas de entrada paralelas en fusión de entrada multimodal", en Proc. de la Conferencia internacional sobre Computación Semántica, págs. 389-396.
^ abc Russ, G., Sallans, B., Hareter, H. (2005). "Fusión de información basada en semántica en una interfaz multimodal". Conferencia internacional sobre interacción persona-computadora (HCI'05), Las Vegas, Nevada, EE. UU., 20 a 23 de junio, págs. 94-100.
^ abc Corradini, A., Mehta M., Bernsen, NO, Martin, J.-C. (2003). "Fusión de entrada multimodal en la interacción persona-computadora en el ejemplo del proyecto NICE en curso". En Actas de la conferencia OTAN-ASI sobre fusión de datos para el seguimiento de situaciones, detección de incidentes, gestión de alertas y respuestas, Ereván, Armenia.
^ abc Pavlovic, VI, Berry, GA, Huang, TS (1997). "Integración de información audiovisual para su uso en la interacción inteligente persona-computadora". Actas de la Conferencia Internacional sobre Procesamiento de Imágenes de 1997 (ICIP '97), Volumen 1, págs. 121-124.
^ abc Andre, M., Popescu, VG, Shaikh, A., Medl, A., Marsic, I., Kulikowski, C., Flanagan JL (1998). "Integración del habla y los gestos para la interacción multimodal persona-computadora". En Segunda Conferencia Internacional sobre Comunicación Multimodal Cooperativa. 28-30 de enero, Tilburg, Países Bajos.
^ abc Vo, MT, Wood, C. (1996). "Construcción de un marco de aplicación para la integración de entrada de voz y lápiz en interfaces de aprendizaje multimodal". En Actas de Acústica, Habla y Procesamiento de Señales (ICASSP'96), 7 al 10 de mayo, IEEE Computer Society, Volumen 06, págs. 3545-3548.
^ ab Caschera, MC, Ferri, F., Grifoni, P. (2013). "De las ambigüedades modales a las multimodales: un enfoque de clasificación", Journal of Next Generation Information Technology (JNIT), vol. 4, núm. 5, págs. 87-109.
^ abc Caschera, MC, Ferri, F., Grifoni, P. (2013). InteSe: un modelo integrado para resolver ambigüedades en oraciones multimodales". IEEE Transactions on Systems, Man, and Cybernetics: Systems, Volumen: 43, Número: 4, págs. 911 - 931.18. Spilker, J., Klarner, M., Görz , G. (2000), "Procesamiento de autocorrecciones en un sistema de habla a voz", COLING 2000, págs. 1116-1120.
^ ab Caschera MC, Ferri F., Grifoni P., (2007). "La Gestión de las ambigüedades". En Lenguajes visuales para informática interactiva: definiciones y formalizaciones. Editorial IGI. págs.129-140.
^ abc J. Chai, P. Hong y MX Zhou, (2004). "Un enfoque probabilístico para la resolución de referencia en una interfaz de usuario multimodal" en Proc. 9° Int. Conf. Intel. User Interf., Madeira, Portugal, enero de 2004, págs. 70–77.
^ abc Dey, AK Mankoff, J., (2005). "Diseño de mediación para aplicaciones contextuales". Transmisión ACM. Comput.-Hum. Interactuar. 12(1), págs. 53-80.
^ ab Spilker, J., Klarner, M., Görz, G. (2000). "Procesamiento de autocorrecciones en un sistema de habla a voz". COLING 2000. págs. 1116-1120.
^ ab Mankoff, J., Hudson, SE, Abowd, GD (2000). "Proporcionar soporte integrado a nivel de kit de herramientas para la ambigüedad en interfaces basadas en reconocimiento". Actas de la conferencia ACM CHI'00 sobre factores humanos en sistemas informáticos. págs. 368 – 375.
^ Grifoni P (2009) Fisión multimodal. En: Interacción multimodal persona-computadora y servicios generalizados. IGI Global, págs. 103-120
^ Patrizia Grifoni, Fernando Ferri, Maria Chiara Caschera, Arianna D'Ulizia, Mauro Mazzei, "MIS: Servicios de interacción multimodal en una perspectiva de la nube", JNIT: Journal of Next Generation Information Technology, vol. 5, núm. 4, págs. 01 ~ 10, 2014
^ Kettebekov, Sanshzar y Rajeev Sharma (2001). "Hacia el control natural del habla y los gestos en una pantalla grande". ActasEHCI '01 Actas de la octava conferencia internacional IFIP sobre ingeniería para la interacción persona-computadora Páginas 221-234
^ Marius Vassiliou, V. Sundareswaran, S. Chen, R. Behringer, C. Tam, M. Chan, P. Bangayan y J. McGee (2000), "Interfaz multimodal integrada persona-computadora y realidad aumentada para aplicaciones de visualización interactiva ", en Darrel G. Hopper (ed.) Cockpit Displays VII: Displays for Defense Applications (Proc. SPIE. 4022), 106-115. ISBN 0-8194-3648-8
^ Vitense, HS; Jacko, JA; Emery, VK (2002). "Retroalimentación multimodal: establecimiento de una base de desempeño para mejorar el acceso de personas con discapacidad visual". Conferencia ACM. sobre Tecnologías de Asistencia .
^ ab Haghighat, Mohammad; Abdel-Mottaleb, Mohamed; Alhalabi, Wadee (2016). "Análisis de correlación discriminante: fusión de niveles de funciones en tiempo real para el reconocimiento biométrico multimodal". Transacciones IEEE sobre seguridad y ciencia forense de la información . 11 (9): 1984–1996. doi :10.1109/TIFS.2016.2569061. S2CID 15624506.
^ "Preguntas planteadas sobre los sistemas de reconocimiento de iris". Ciencia diaria . 12 de julio de 2012. Archivado desde el original el 22 de octubre de 2012.
^ Saylor, Michael (2012). La ola móvil: cómo la inteligencia móvil lo cambiará todo. Libros de Perseo/Vanguard Press. pag. 99.ISBN 9780306822988.
^ Bill Flook (3 de octubre de 2013). "Esta es la 'guerra biométrica' de la que hablaba Michael Saylor". Diario de negocios de Washington . Archivado desde el original el 7 de octubre de 2013.
^ Zahid Akhtar, "Seguridad de los sistemas biométricos multimodales contra ataques falsos" (PDF). Archivado el 2 de abril de 2015 en Wayback Machine . Departamento de Ingeniería Eléctrica y Electrónica, Universidad de Cagliari. Cagliari, Italia, 6 de marzo de 2012.
^ Soleymani, Mohammad; García, David; Jou, Brendan; Schuller, Björn; Chang, Shih-Fu; Pantic, Maja (septiembre de 2017). "Una encuesta de análisis de sentimiento multimodal". Computación de Imagen y Visión . 65 : 3–14. doi :10.1016/j.imavis.2017.08.003. S2CID 19491070.
^ Karray, Fakhreddine; Milad, Alemzadeh; Saleh, Jamil Abou; Mo Nours, árabe (2008). "Interacción persona-computadora: descripción general del estado del arte" (PDF) . Revista internacional sobre sensores inteligentes y sistemas inteligentes . 1 : 137-159. doi : 10.21307/ijssis-2017-283 .
^ ab Poria, Soujanya; Cambria, Erik; Bajpai, Rajiv; Hussain, Amir (septiembre de 2017). "Una revisión de la computación afectiva: del análisis unimodal a la fusión multimodal". Fusión de información . 37 : 98-125. doi :10.1016/j.inffus.2017.02.003. hdl : 1893/25490 . S2CID 205433041.
^ "Google AI para hacer llamadas telefónicas por usted". Noticias de la BBC . 8 de mayo de 2018 . Consultado el 12 de junio de 2018 .
^ Wollmer, Martín; Weninger, Félix; Knaup, Tobías; Schuller, Björn; Sol, Congkai; Sagae, Kenji; Morency, Louis-Philippe (mayo de 2013). "Reseñas de películas de YouTube: análisis de sentimientos en un contexto audiovisual" (PDF) . Sistemas inteligentes IEEE . 28 (3): 46–53. doi :10.1109/MIS.2013.34. S2CID 12789201.
^ Pereira, Moisés HR; Pádua, Flávio LC; Pereira, Adriano CM; Benevenuto, Fabricio; Dalip, Daniel H. (9 de abril de 2016). "Fusionar características visuales, textuales y de audio para el análisis de sentimientos de videos de noticias". arXiv : 1604.02612 [cs.CL].
^ Zucco, Chiara; Calabrese, Bárbara; Cannataro, Mario (noviembre de 2017). "Análisis de sentimientos y computación afectiva para el seguimiento de la depresión". Conferencia Internacional IEEE 2017 sobre Bioinformática y Biomedicina (BIBM) . IEEE. págs. 1988-1995. doi :10.1109/bibm.2017.8217966. ISBN 978-1-5090-3050-7. S2CID 24408937.
^ Pang, Bo; Lee, Lilian (2008). Minería de opiniones y análisis de sentimiento . Hannover, MA: Ahora editores. ISBN 978-1601981509.
^ Sol, Shiliang; Luo, Chen; Chen, Junyu (julio de 2017). "Una revisión de técnicas de procesamiento del lenguaje natural para sistemas de minería de opiniones". Fusión de información . 36 : 10–25. doi :10.1016/j.inffus.2016.10.004.
^ ab Edwards, Benj (14 de marzo de 2023). "El GPT-4 de OpenAI exhibe un" rendimiento a nivel humano "en puntos de referencia profesionales". Ars Técnica . Archivado desde el original el 14 de marzo de 2023 . Consultado el 15 de marzo de 2023 .
^ Wiggers, Kyle (6 de julio de 2023). "OpenAI hace que GPT-4 esté disponible de forma generalizada". TechCrunch . Archivado desde el original el 16 de agosto de 2023 . Consultado el 16 de agosto de 2023 .
^ AbiertoAI (2023). "Informe técnico GPT-4". arXiv : 2303.08774 [cs.CL].
^ Belfield, Haydn (25 de marzo de 2023). "Si tu modelo de IA se va a vender, tiene que ser seguro". Vox . Archivado desde el original el 28 de marzo de 2023 . Consultado el 30 de marzo de 2023 .
^ "Tarjeta del sistema GPT-4V (ision)". openai.com . Consultado el 5 de febrero de 2024 .
^ Roose, Kevin (28 de septiembre de 2023). "El nuevo ChatGPT puede 'ver' y 'hablar'. Así es como es". Los New York Times . Archivado desde el original el 31 de octubre de 2023 . Consultado el 30 de octubre de 2023 .
^ Vincent, James (15 de marzo de 2023). "El cofundador de OpenAI habla sobre el enfoque anterior de la empresa para compartir abiertamente investigaciones:" Nos equivocamos"". El borde . Archivado desde el original el 17 de marzo de 2023 . Consultado el 18 de marzo de 2023 .
^ Oviatt, S. (2002), "Interfaces multimodales", en Jacko, J.; Sears, A (eds.), Manual de interacción persona-computadora (PDF) , Lawrence Erlbaum
^ Bauckhage, C.; Fritsch, J.; Rohlfing, KJ; Wachsmuth, S.; Sagerer, G. (2002). "Evaluación de la comprensión integrada del habla y la imagen". En t. Conf. sobre interfaces multimodales . doi :10.1109/ICMI.2002.1166961.
^ Ismail, NA; O'Brien, EA (2008). "Habilitación de la interacción multimodal en la navegación de fotografías digitales personales basada en la web" (PDF) . En t. Conf. en Ingeniería Informática y de las Comunicaciones . Archivado desde el original (PDF) el 18 de julio de 2011 . Consultado el 3 de marzo de 2010 .
^ abc Sarter, NB (2006). "Presentación de información multimodal: orientación de diseño y desafíos de investigación". Revista Internacional de Ergonomía Industrial . 36 (5): 439–445. doi :10.1016/j.ergon.2006.01.007.
^ Geldar, FA (1957). "Aventuras en alfabetización táctil". Psicólogo americano . 12 (3): 115-124. doi :10.1037/h0040416.
^ Brooks, A.; Petersson, E. (2007). "SoundScapes: potenciales de aprendizaje no formal a partir de vehículos virtuales interactivos". SÍGRAFO . doi :10.1145/1282040.1282059.
^ ab Vo, MT (1998). "Un marco y un conjunto de herramientas para la construcción de interfaces de aprendizaje multimodal", PhD. Tesis, Universidad Carnegie Mellon, Pittsburgh, EE.UU.
^ ab Cohen, relaciones públicas; Johnston, M.; McGee, D.; Oviat, SL; Pittman, J.; Smith, IA; Chen, L.; Clow, J. (1997). "Quickset: interacción multimodal para aplicaciones distribuidas", ACM Multimedia, págs. 31-40.
^ Johnston, M. (1998). "Análisis multimodal basado en unificación". Actas de la 36ª Reunión Anual de la Asociación de Lingüística Computacional y la 17ª Conferencia Internacional sobre Lingüística Computacional (COLING-ACL '98), 10 al 14 de agosto, Universidad de Montréal, Montreal, Quebec, Canadá. págs. 624-630.
^ ab Nigay, L.; Coutaz, J. (1995). "Una plataforma genérica para abordar el reto multimodal". Actas de la Conferencia sobre factores humanos en sistemas informáticos, ACM Press.
^ ab Bouchet, J.; Nigay, L.; Ganille, T. (2004). "Componentes de software Icare para interfaces multimodales en rápido desarrollo". ICMI '04: Actas de la sexta conferencia internacional sobre interfaces multimodales (Nueva York, NY, EE. UU.), ACM, págs.
^ ab D'Ulizia, A.; Ferri, F.; Grifoni P. (2007). "Un enfoque híbrido basado en gramática para la especificación de lenguajes multimodales", Actas del taller OTM 2007, 25 a 30 de noviembre de 2007, Vilamoura, Portugal, Springer-Verlag, Lecture Notes in Computer Science 4805, págs.
^ abcJohnston , M.; Bangalore, S. (2000). "Análisis y comprensión multimodal de estados finitos", en actas de la Conferencia internacional sobre lingüística computacional, Saarbruecken, Alemania.
^ ab sol, Y.; Chen, F.; Shi, YD; Chung, V. (2006). "Un método novedoso para la fusión de datos multisensoriales en la interacción multimodal entre humanos y computadoras". En Actas de la vigésima conferencia del grupo de interés especial sobre interacción computadora-humano (CHISIG) de Australia sobre interacción computadora-humano: diseño: actividades, artefactos y entornos, Sydney, Australia, págs. 401-404
^ ab Shimazu, H.; Takashima, Y. (1995). "Gramática de cláusulas definidas multimodales", Sistemas y computadoras en Japón, vol. 26, núm. 3, págs. 93-102.
^ ab Johnston, M.; Bangalore, S. (2005). "Comprensión y integración multimodal de estados finitos", Nat. Lang. Inglés, vol. 11, núm. 2, págs. 159-187.
^ ab Reitter, D.; Panttaja, EM; Cummins, F. (2004). "UI sobre la marcha: generación de una interfaz de usuario multimodal", en Proc. del HLT-NAACL-2004, Boston, Massachusetts, EE.UU.
^ ab Guan, Ling. "Métodos y técnicas para la fusión de información multimodal" (PDF) . Sociedad de Circuitos y Sistemas .
^ D'Ulizia, A.; Ferri, F.; Grifoni P. (2011). "Un algoritmo de aprendizaje para la inferencia gramatical multimodal", Transacciones IEEE sobre sistemas, hombre y cibernética - Parte B: Cibernética, vol. 41 (6), págs. 1495 - 1510.
^ Pérez, G.; Amores, G.; Manchón, P. (2005). "Dos estrategias para la fusión multimodal". En Actas de interacción multimodal para la visualización y exploración de datos científicos, Trento, Italia, 26–32.
^ Martín, JC (1997). "Hacia una cooperación inteligente entre modalidades: el ejemplo de un sistema que permite la interacción multimodal con un mapa", Actas del taller de la Conferencia Internacional Conjunta sobre Inteligencia Artificial (IJCAI'97) sobre 'Sistemas multimodales inteligentes', Nagoya, Japón
^ Allen, JF; Ferguson, G. (1994). "Acciones y eventos en lógica temporal de intervalo", Journal of Logic and Computation, vol. 4, núm. 5, págs. 531–579
^ Bellik, Y. (2001). "Requisitos técnicos para una interacción multimodal exitosa", Taller internacional sobre presentación de información y diálogo multimodal natural, Verona (Italia), 14 y 15 de diciembre
^ Lee, YC; Chin, F. (1995). "Un lenguaje de consulta icónico para relaciones topológicas en SIG". Revista Internacional de Sistemas de Información Geográfica 9(1). págs. 25-46
^ Calcinelli, D.; Mainguenaud, M. (1994). "Cigales, un lenguaje visual para sistemas de información geográfica: la interfaz de usuario". Revista de Lenguajes Visuales y Computación 5 (2). págs. 113-132
^ Ferri, F.; Rafanelli, M. (2005). "GeoPQL: un lenguaje de consulta pictórico geográfico que resuelve ambigüedades en la interpretación de consultas". J. Semántica de datos III. págs.50-80
^ Suhm, B., Myers, B. y Waibel, A. (1999). "Evaluación empírica y basada en modelos de corrección de errores interactiva multimodal". En Proc. De CHI'99, mayo de 1999, págs. 584-591

enlaces externos

Actividad de interacción multimodal del W3C
XHTML+Perfil de voz 1.0, nota W3C del 21 de diciembre de 2001
Hoste, Lode, Dumas, Bruno y Signer, Beat: Mudra: A Unified Multimodal Interaction Framework, en actas de la 13ª Conferencia Internacional sobre Interacción Multimodal (ICMI 2011), Alicante, España, noviembre de 2011.
Toselli, Alejandro Héctor, Vidal, Enrique, Casacuberta, Francisco: Reconocimiento y aplicaciones de patrones interactivos multimodales, Springer, 2011.