GIF de espera

Gracias por la puntualidad

En breve comenzamos

Pensamiento

Sensorial

Clase 4

Preguntar y percibir

¿En qué quedamos?

Tres cosas distintas que la clase pasada aprendimos a separar

Lo que nosotros construimos Modelo conceptual lo volvemos perceptible Lo único que la persona recibe Imagen del sistema ella la interpreta Lo que la persona construye Modelo mental Vive en nuestra cabeza y en nuestros documentos Acá trabajamos nosotros Vive en su cabeza, y no la podemos ver

Lo que nosotros construimos

Modelo conceptualvive en nuestra cabeza
↓
Imagen del sistemalo único que la persona recibe · acá trabajamos
↓
Modelo mentallo que ella construye, y no lo podemos ver

Nadie recibe nuestro modelo conceptual. Recibe una imagen, y con esa imagen se arma el suyo

Y para eso, la semana pasada, cada grupo diseñó para una persona

Las cinco personas de la clase pasada

Ninguna de las cinco existe. Las escribí yo, una tarde, antes de la clase

Eso no las vuelve inútiles

Una representación de usuario —una persona, un perfil, un arquetipo— sirve para alinear a un equipo y para poder discutir decisiones sin hablar de uno mismo. El problema no es inventarla.

El problema es tratarla como un dato. Una representación de usuario es una hipótesis sobre personas reales, y una hipótesis existe para ser contrastada. Si nadie la contrasta nunca, deja de ser una herramienta de diseño y se vuelve una manera elegante de seguir diseñando para nosotros mismos.

Entonces la pregunta de hoy es de dónde saldría una ficha que sí se pueda contrastar

Actividad

La prueba cruzada

Antes de eso hay una deuda: los prototipos de la semana pasada todavía no los ha usado nadie

Cómo se hace

  1. 01Le entregan su prototipo a otro grupo. Sin decir una palabra: ni cómo se usa, ni qué querían lograr.
  2. 02Ese grupo lo recorre con la ficha A de su persona en la mano, tratando de completar un pedido.
  3. 03Ustedes observan y anotan. Sin intervenir, aunque duela.
  4. 04Al final sí se habla: primero se describe lo que se vio, después se interpreta por qué.

Mientras miran, busquen esto

Si hay que explicarlo, la imagen del sistema todavía no está haciendo su trabajo

Y después hablamos

Simular a alguien nos da una hipótesis. No nos da conocimiento sobre nadie

Volvemos a eso al final de la clase. Antes hay que resolver un problema más viejo

Volvamos a la interfaz

Esto ya lo dijimos: una interfaz es todo lo que hacemos para comunicarle a alguien qué puede hacer y qué pasó cuando lo hizo

Una interfaz es aquello que media una relación: la hace posible y, al hacerlo, la organiza, la traduce y la transforma.

Nuestra definición, versión 1.0 · clase 1

Nunca dijimos que fuera una pantalla. Y aun así, todo lo que hemos diseñado en este curso se comunica por los ojos

No es un descuido. En lo digital nos apoyamos en la vista porque es donde viven las convenciones

Qué se ve clicable, qué se ve deslizable, qué se ve desactivado

Se puede presionar. Lo dicen el relieve, el color lleno y el borde. Y al pasar el mouse, se hunde.

Existe y no se puede. Mismo objeto, sin contraste y sin relieve. El cursor lo confirma: tachado.

Se arrastra. Un riel y una perilla encima. Nadie explicó nunca que eso significa «agárrame y muéveme».

Ver el restaurante

Lleva a otra parte. Subrayado y de otro color. Una convención que viene de antes de las apps.

Se escribe. Una caja hundida, un texto gris que se va solo y un cursor que cambia a una viga.

☰  Arepa de chócolo

Se mueve de lugar. El asa de tres rayas y la sombra despegada. El cursor se vuelve una mano abierta.

Nada de esto está escrito en ninguna parte. Lo aprendimos mirando, y por eso funciona sin que nadie lo explique.

La pregunta de hoy: ¿y si quitamos el sentido donde viven todas esas convenciones?

Lo que una interfaz sostiene, tenga la forma que tenga

Persona intención · interpretación Interfaz hace posible · organiza traduce · transforma Sistema estado · reglas acción respuesta ¿Qué quiere hacer? ¿Cómo sabe que puede? ¿Qué información deja pasar y cuál no? ¿Qué sabe el sistema? ¿Cómo avisa que pasó algo? Nada de esto exige que la interfaz se vea. Solo que se perciba.

Lo que una interfaz sostiene

Persona¿qué quiere hacer? ¿cómo sabe que puede?
↓
Interfazhace posible, organiza, traduce, transforma
↓
Sistema¿qué sabe? ¿cómo avisa que pasó algo?
↑

La respuesta vuelve por el mismo camino. Nada de esto exige que la interfaz se vea.

Cuatro sistemas que comunican lo que es posible sin una sola convención de pantalla

¿Qué hace la persona? ¿Cómo sabe que puede? ¿Cómo responde el sistema? TORNIQUETE Empujar con el cuerpo hasta que ceda. Por la forma del eje: gira en un solo sentido y de a una persona. Cede o no cede. La respuesta es el propio movimiento. SEMÁFORO SONORO Escuchar y esperar el cambio de ritmo. Porque el pito lento y el rápido significan cosas distintas. Acelera hasta cortarse. Nunca dice cuánto tiempo queda. PUERTA AUTOMÁTICA Caminar hacia ella. Nada más. Porque vio a otro pasar o porque se abrió sola. Se abre. Y si no, no hay manera de insistir. MENÚ TELEFÓNICO Oír la lista completa y marcar un número. Porque una voz se las enumera. Una vez. Repite, avanza o cuelga. Las cuatro median una relación. Solo la última le exige a la persona recordar lo que acaba de oír.

Cuatro interfaces sin pantalla

Torniqueteempuja · la forma del eje se lo dice · cede o no cede
Semáforo sonoroescucha · el ritmo del pito · acelera hasta cortarse
Puerta automáticacamina · vio a otro pasar · se abre o nada
Menú telefónicooye y marca · una voz enumera, una vez · repite o cuelga

Solo la última le exige a la persona recordar lo que acaba de oír.

En ninguno de los cuatro hay algo que se vea presionable. Lo posible se comunica por la forma, el ritmo o lo que hace otra persona

Una misma tarea

Tres contextos

Pedir dos almuerzos

Presencialmente, por teléfono o por una app

Pedir dos almuerzos, en tres contextos

En persona Por teléfono En pantalla Hablar Señalar Preguntar Corregir Escuchar Recordar Hablar Esperar Confirmar Mirar Comparar Seleccionar Revisar El error se arregla mientras se habla Todo lo dicho hay que sostenerlo en la cabeza Queda escrito, pero solo existe lo que alguien previó En amarillo, lo que cada canal le exige a la persona y los otros dos no.

La misma intención, tres veces

En personahablar · señalar · preguntar · corregir
Por teléfonoescuchar · recordar · hablar · esperar · confirmar
En pantallamirar · comparar · seleccionar · revisar

Preguntar y corregir, recordar, comparar: cada canal exige algo que los otros no.

¿Es la misma tarea?

Sí. Y no es la misma interacción

Y lo que más cambia ni siquiera está en la lista de acciones

En persona, el error lo arregla el otro

La cara del cajero avisa antes de que uno termine la frase. La reparación cuesta una frase y ocurre antes de que el pedido exista.

En pantalla, el error lo arregla la persona

Y solo lo descubre cuando llega el domicilio. La reparación cuesta una llamada, un reembolso o un almuerzo botado.

Quién carga con el error y cuándo se entera, no lo decide la tarea. Lo decide el contexto.

La tarea no cambió. Cambió la relación que construimos con el sistema

Modalidades

Una modalidad es el canal por el que ocurre el intercambio: qué sentido recibe lo que el sistema emite y qué parte del cuerpo produce la acción.

La definición que vamos a usar hoy

Una lente para mirarlas, no una clasificación

Gráfica ocupa espacio Todo está al tiempo y sigue estando. Se puede volver a mirar. Lo que no cabe, no existe. Voz ocupa tiempo antes ahora Solo existe lo último. Lo anterior ya no está. Alguien tiene que sostenerlo: la persona o el sistema. Gesto ocupa el cuerpo La acción ocurre y no deja huella. No hay dónde leer qué gestos existen. Sirve para hacer preguntas, no para clasificar. Casi toda experiencia real mezcla las tres.

Una lente, no una clasificación

Gráfica · espaciotodo está al tiempo y sigue estando. Lo que no cabe, no existe.
Voz · tiemposolo existe lo último. Alguien tiene que sostener lo anterior.
Gesto · cuerpola acción ocurre y no deja huella. No hay dónde leer qué gestos existen.

Casi toda experiencia real mezcla las tres.

Estas tres familias tienen nombre, y los van a encontrar en todas partes

Tres siglas que conviene saber leer

GUI

Graphical User Interface

Interfaz gráfica de usuario. Se opera mirando y señalando una superficie: ventanas, íconos, listas, botones. Es la familia con más convenciones ya aprendidas, y por eso la más fácil de dar por obvia.

VUI

Voice User Interface

Interfaz de usuario por voz. Se opera hablando, y el sistema responde hablando. Hereda las reglas de una conversación: turnos, confirmación, y un hilo que alguien tiene que sostener. Pearl, 2016.

NUI

Natural User Interface

Interfaz natural de usuario. El nombre que la industria le puso a operar con el cuerpo: tocar, arrastrar, gesticular, moverse, mirar.

Las dos primeras describen un canal. La tercera describe una promesa — y por eso está marcada.

«Natural» es una palabra de marketing, no una propiedad

Norman lo escribió el mismo año en que la industria llenaba todo de gestos: ningún gesto es natural. Pellizcar para achicar, deslizar para pasar, dos dedos para volver atrás — todos hubo que aprenderlos, igual que hubo que aprender que un rectángulo con relieve se presiona.

La diferencia es que la GUI dejó sus convenciones a la vista y la NUI no: un gesto que nadie enseñó, y que no deja rastro de que existe, es más difícil de descubrir que un botón feo. Cambiar de canal no exime de lo de siempre — que la persona pueda saber qué es posible, y qué pasó cuando actuó.

Norman, D. A. «Natural user interfaces are not natural», Interactions 17(3), 2010.

Voz · lo que aparece cuando el canal no persiste

La voz sirve bien para expresar una intención completa de una vez —«pídeme lo de siempre del restaurante de siempre»—, para preguntar, para responder y para confirmar. Y al mismo tiempo abre cuatro problemas que en una pantalla no existen:

Memoria. Lo dicho hace tres turnos ya no está en ninguna parte.
Secuencia. Hay un orden obligatorio: no se puede «mirar todo primero».
Ambigüedad. «Ese» y «el otro» dependen de un contexto que el sistema puede no tener.
Feedback. Confirmar cuesta un turno entero, así que confirmar todo vuelve la conversación insoportable — y no confirmar nada la vuelve insegura.

Pearl, Designing Voice User Interfaces, 2016

Con el gesto, la pregunta interesante no es cuál gesto usamos

Es qué significa ese gesto dentro del sistema y cómo lo aprende alguien que llega por primera vez

Multimodalidad

¿Y qué pasa cuando podemos combinar varias?

1980, MIT · alguien señala una pantalla de pared y dice tres palabras

La pantalla de pared un sitio vacío «Pon eso ahí » la voz dice la acción el dedo dice cuál y dónde «Eso» y «ahí» son palabras vacías: no significan nada hasta que el dedo las llena, en el mismo instante en que se dicen.

«Pon eso ahí»

Ponla voz dice la acción
esopalabra vacía — el dedo señala cuál objeto
ahípalabra vacía — el dedo señala qué sitio

No significan nada hasta que el dedo las llena, en el mismo instante en que se dicen.

Un sistema multimodal procesa dos o más canales de entrada de manera combinada: no repite lo mismo por dos vías, sino que los interpreta juntos para producir un significado que ninguno tenía por separado.

A partir de Oviatt, Ten Myths of Multimodal Interaction, 1999 · el caso es Bolt, «Put-That-There», SIGGRAPH 1980

Cada modalidad aporta una parte de la información. Ninguna tiene que aportarla toda

Receso

Quince minutos

Actividad

Pedir sin mirar

Vamos a diseñar una experiencia nueva para pedir domicilios

Lo que dejó la investigación inicial

01 · Las personas se agobian cuando tienen que navegar entre demasiadas opciones. No es que no sepan usar la app: es que abrir cuatrocientos restaurantes para volver a pedir lo mismo de siempre es un trabajo que nadie pidió hacer.

02 · Este nicho vive con dispositivos encima. Usa Apple Watch y AirPods Pro, y ya está acostumbrado a que sus aparatos respondan a la voz, al movimiento y al contexto. No da por hecho que el teléfono tenga que ser el centro de todo.

Es un nicho específico, no «los usuarios de una app de domicilios».

El escenario

Es la hora del almuerzo. La persona va camino a casa, con los AirPods puestos y el reloj en la muñeca. Quiere pedir lo de siempre, del restaurante de siempre.

No quiere sacar el teléfono. No quiere recorrer una lista. Quiere pedir.

El reto: que esta persona pueda pedir su comida habitual sin depender de navegar una pantalla llena de opciones

Lo que tienen disponible · el cuerpo y los aparatos

La persona actúa El sistema responde Voz palabras, preguntas, confirmar, cancelar Cabeza · AirPods asentir o negar, si el sistema habló primero Muñeca · Apple Watch doble toque, giro de muñeca, corona, pantalla Dedos · pantalla tocar, mantener, deslizar, arrastrar Vástago · AirPods Pro presionar, doble o triple, mantener, volumen (Pro 2 y 3) Voz del sistema anuncia, pregunta, lee, confirma Sonido tonos cortos: recibido, error, listo Vibración háptica en la muñeca, con ritmo e intensidad Pantalla del reloj un vistazo, poco texto, estado Pantalla del teléfono si deciden que aparezca, y cuándo Ustedes deciden qué va en cada lado y qué no se usa.

La persona actúa

Vozpalabras, preguntas, confirmar, cancelar
Cabeza · AirPodsasentir o negar, solo si el sistema habló primero
Muñeca · Apple Watchdoble toque, giro de muñeca, corona, pantalla
Dedos · pantallatocar, mantener, deslizar, arrastrar

El sistema responde

Voz del sistemaanuncia, pregunta, lee, confirma
Sonido · vibración · pantalla del reloj · pantalla del teléfono

Una restricción real, y es la más interesante de todas

Los gestos de cabeza de los AirPods —asentir para aceptar, negar para rechazar— solo existen dentro de un anuncio: funcionan cuando Siri acaba de leer una llamada o una notificación. No son un control libre.

Eso significa que, si quieren usar la cabeza, el sistema tiene que hablar primero. La conversación no la abre la persona: la abre el sistema. Y eso ya es una decisión sobre quién manda en la interacción.

Verificado en la documentación de Apple. Disponible en AirPods Pro 2 y posteriores, AirPods 4 y AirPods Max 2 — no en modelos anteriores.

Y dos capacidades que no son de todos los relojes

Doble toque —juntar índice y pulgar dos veces— existe desde watchOS 10.1 y solo en Apple Watch Series 9, SE 3, Ultra 2 y posteriores.

Giro de muñeca —voltear la muñeca para descartar— llegó con watchOS 26, en los mismos modelos.

Los pueden usar. Pero si los usan, en la presentación tienen que poder decir qué le pasa a alguien cuyo reloj no los tiene.

Verificado en la documentación de Apple. No funcionan en Series 8 ni en Apple Watch SE de 1.ª o 2.ª generación.

La regla principal: no diseñen gestos. Diseñen una interacción

Lo que no queremos ver

La app de hoy, pero ahora con voz. Si su propuesta es la misma lista de cuatrocientos restaurantes leída en voz alta, empeoraron el problema: ahora hay que recordarla.

Un gesto porque el gesto existe. No tienen que usar todas las modalidades. No tienen que eliminar la pantalla. No tienen que usar la voz para todo. La pregunta es qué debería hacer la persona y cuál es la mejor manera de que pueda hacerlo.

El proceso · cuatro pasos

  1. 01Definan la experiencia. ¿Qué tiene que hacer la persona para completar el pedido? Dibujen la secuencia. No hacen falta pantallas.
  2. 02Distribuyan la interacción. Qué hace con la voz, con la cabeza, con la muñeca, con los dedos — y qué hace el sistema solo, sin preguntar.
  3. 03Diseñen el feedback. Para cada acción importante: ¿cómo sabe la persona que el sistema entendió? ¿Y qué pasa si no entendió?
  4. 04Prototipen actuando. No hay que programar nada. Una persona hace de usuario, otra de sistema, y la interacción se ejecuta de principio a fin.La voz, los sonidos, la vibración y el reloj los representan ustedes con el cuerpo y con objetos.

La hoja que hay que llenar en el paso 02

Momento La persona El sistema ¿Cómo sabe que pasó? Empezar Elegir qué Cambiar algo Confirmar Equivocarse ¿con qué? ¿voz, cabeza, muñeca? ¿qué hace solo? ¿voz, sonido, vibración? La fila difícil Casi todos los grupos van a llenar las cuatro primeras filas. La quinta es la que separa un diseño de una demostración.

La hoja del paso 02

Cinco momentosempezar · elegir qué · cambiar algo · confirmar · equivocarse
↓
Tres columnasqué hace la persona · qué hace el sistema · cómo sabe que pasó
Equivocarsela fila que separa un diseño de una demostración

Y cada grupo tiene que poder responder: ¿por qué esta modalidad, aquí?

«Porque sería chévere hacerlo con la cabeza» no es una razón. «Porque va caminando y tiene las manos ocupadas» sí lo es

Qué presenta cada grupo

  1. 01La situación. Qué está haciendo la persona cuando empieza.
  2. 02La secuencia. Qué ocurre desde que comienza hasta que termina.
  3. 03El modelo de interacción. Qué hace la persona, qué hace el sistema, cómo se reparten.
  4. 04La demostración. Ejecutan la experiencia delante de todos.
  5. 05Una decisión que quieran defender. «Elegimos hacer X con Y porque…».

El brief completo está acá

Código QR hacia el brief de la actividad catedra.dejesumensaje.com/pensamiento-sensorial/pedir-sin-mirar

Para la próxima

Dos cosas

Una es presentar lo que hoy no alcanzamos a ver. La otra es una investigación

1 · La próxima clase abre con las presentaciones: cada grupo presenta Pedir sin mirar

Qué presenta cada grupo

  1. 01La situación. Qué está haciendo la persona cuando empieza.
  2. 02La secuencia. Qué ocurre desde que comienza hasta que termina.
  3. 03El modelo de interacción. Qué hace la persona, qué hace el sistema, cómo se reparten.
  4. 04La demostración. Ejecutan la experiencia delante de todos.
  5. 05Una decisión que quieran defender. «Elegimos hacer X con Y porque…».

2 · Y una investigación por grupo: ¿qué sabemos de verdad?

La consigna está acá. Se entrega por correo, un correo por grupo, antes de la próxima sesión

Código QR hacia la consigna de la investigación catedra.dejesumensaje.com/pensamiento-sensorial/que-sabemos-de-verdad

Referentes