Gracias por la puntualidad
En breve comenzamos
Pensamiento
Sensorial
Clase 4
Preguntar y percibir
¿En qué quedamos?
Tres cosas distintas que la clase pasada aprendimos a separar
Lo que nosotros construimos
Nadie recibe nuestro modelo conceptual. Recibe una imagen, y con esa imagen se arma el suyo
Y para eso, la semana pasada, cada grupo diseñó para una persona
Las cinco personas de la clase pasada
Ninguna de las cinco existe. Las escribí yo, una tarde, antes de la clase
Eso no las vuelve inútiles
Una representación de usuario —una persona, un perfil, un arquetipo— sirve para
alinear a un equipo y para poder discutir decisiones sin hablar de uno mismo.
El problema no es inventarla.
El problema es tratarla como un dato. Una representación de usuario es
una hipótesis sobre personas reales, y una hipótesis existe para
ser contrastada. Si nadie la contrasta nunca, deja de ser una herramienta de
diseño y se vuelve una manera elegante de seguir diseñando para nosotros mismos.
Entonces la pregunta de hoy es de dónde saldría una ficha que sí se pueda contrastar
Actividad
La prueba cruzada
Antes de eso hay una deuda: los prototipos de la semana pasada todavía no los ha usado nadie
Cómo se hace
Mientras miran, busquen esto
Si hay que explicarlo, la imagen del sistema todavía no está haciendo su trabajo
Y después hablamos
Simular a alguien nos da una hipótesis. No nos da conocimiento sobre nadie
Volvemos a eso al final de la clase. Antes hay que resolver un problema más viejo
Volvamos a la interfaz
Esto ya lo dijimos: una interfaz es todo lo que hacemos para comunicarle a alguien qué puede hacer y qué pasó cuando lo hizo
Una interfaz es aquello que media una relación: la hace posible y, al hacerlo, la organiza, la traduce y la transforma.
Nuestra definición, versión 1.0 · clase 1
Nunca dijimos que fuera una pantalla. Y aun así, todo lo que hemos diseñado en este curso se comunica por los ojos
No es un descuido. En lo digital nos apoyamos en la vista porque es donde viven las convenciones
Qué se ve clicable, qué se ve deslizable, qué se ve desactivado
Se puede presionar. Lo dicen el relieve, el color lleno y el borde. Y al pasar el mouse, se hunde.
Existe y no se puede. Mismo objeto, sin contraste y sin relieve. El cursor lo confirma: tachado.
Se arrastra. Un riel y una perilla encima. Nadie explicó nunca que eso significa «agárrame y muéveme».
Lleva a otra parte. Subrayado y de otro color. Una convención que viene de antes de las apps.
Se escribe. Una caja hundida, un texto gris que se va solo y un cursor que cambia a una viga.
Se mueve de lugar. El asa de tres rayas y la sombra despegada. El cursor se vuelve una mano abierta.
Nada de esto está escrito en ninguna parte. Lo aprendimos mirando, y por eso funciona sin que nadie lo explique.
La pregunta de hoy: ¿y si quitamos el sentido donde viven todas esas convenciones?
Lo que una interfaz sostiene, tenga la forma que tenga
Lo que una interfaz sostiene
La respuesta vuelve por el mismo camino. Nada de esto exige que la interfaz se vea.
Cuatro sistemas que comunican lo que es posible sin una sola convención de pantalla
Cuatro interfaces sin pantalla
Solo la última le exige a la persona recordar lo que acaba de oír.
En ninguno de los cuatro hay algo que se vea presionable. Lo posible se comunica por la forma, el ritmo o lo que hace otra persona
Una misma tarea
Tres contextos
Pedir dos almuerzos
Presencialmente, por teléfono o por una app
Pedir dos almuerzos, en tres contextos
La misma intención, tres veces
Preguntar y corregir, recordar, comparar: cada canal exige algo que los otros no.
¿Es la misma tarea?
Sí. Y no es la misma interacción
Y lo que más cambia ni siquiera está en la lista de acciones
En persona, el error lo arregla el otro
La cara del cajero avisa antes de que uno termine la frase. La reparación cuesta una frase y ocurre antes de que el pedido exista.
En pantalla, el error lo arregla la persona
Y solo lo descubre cuando llega el domicilio. La reparación cuesta una llamada, un reembolso o un almuerzo botado.
Quién carga con el error y cuándo se entera, no lo decide la tarea. Lo decide el contexto.
La tarea no cambió. Cambió la relación que construimos con el sistema
Modalidades
Una modalidad es el canal por el que ocurre el intercambio: qué sentido recibe lo que el sistema emite y qué parte del cuerpo produce la acción.
La definición que vamos a usar hoy
Una lente para mirarlas, no una clasificación
Una lente, no una clasificación
Casi toda experiencia real mezcla las tres.
Estas tres familias tienen nombre, y los van a encontrar en todas partes
Tres siglas que conviene saber leer
Graphical User Interface
Interfaz gráfica de usuario. Se opera mirando y señalando una superficie: ventanas, íconos, listas, botones. Es la familia con más convenciones ya aprendidas, y por eso la más fácil de dar por obvia.
Voice User Interface
Interfaz de usuario por voz. Se opera hablando, y el sistema responde hablando. Hereda las reglas de una conversación: turnos, confirmación, y un hilo que alguien tiene que sostener. Pearl, 2016.
Natural User Interface
Interfaz natural de usuario. El nombre que la industria le puso a operar con el cuerpo: tocar, arrastrar, gesticular, moverse, mirar.
Las dos primeras describen un canal. La tercera describe una promesa — y por eso está marcada.
«Natural» es una palabra de marketing, no una propiedad
Norman lo escribió el mismo año en que la industria llenaba todo de gestos:
ningún gesto es natural. Pellizcar para achicar, deslizar para pasar, dos dedos
para volver atrás — todos hubo que aprenderlos, igual que hubo
que aprender que un rectángulo con relieve se presiona.
La diferencia es que la GUI dejó sus convenciones a la vista y la NUI no: un gesto
que nadie enseñó, y que no deja rastro de que existe, es más difícil de descubrir
que un botón feo. Cambiar de canal no exime de lo de siempre — que la persona
pueda saber qué es posible, y qué pasó cuando actuó.
Norman, D. A. «Natural user interfaces are not natural», Interactions 17(3), 2010.
Voz · lo que aparece cuando el canal no persiste
La voz sirve bien para expresar una intención completa de una vez —«pídeme lo de
siempre del restaurante de siempre»—, para preguntar, para responder y para
confirmar. Y al mismo tiempo abre cuatro problemas que en una pantalla no existen:
Memoria. Lo dicho hace tres turnos ya no está en ninguna parte.
Secuencia. Hay un orden obligatorio: no se puede «mirar todo primero».
Ambigüedad. «Ese» y «el otro» dependen de un contexto que el sistema puede no tener.
Feedback. Confirmar cuesta un turno entero, así que confirmar todo vuelve la conversación insoportable — y no confirmar nada la vuelve insegura.
Pearl, Designing Voice User Interfaces, 2016
Con el gesto, la pregunta interesante no es cuál gesto usamos
Es qué significa ese gesto dentro del sistema y cómo lo aprende alguien que llega por primera vez
Multimodalidad
¿Y qué pasa cuando podemos combinar varias?
1980, MIT · alguien señala una pantalla de pared y dice tres palabras
«Pon eso ahí»
No significan nada hasta que el dedo las llena, en el mismo instante en que se dicen.
Un sistema multimodal procesa dos o más canales de entrada de manera combinada: no repite lo mismo por dos vías, sino que los interpreta juntos para producir un significado que ninguno tenía por separado.
A partir de Oviatt, Ten Myths of Multimodal Interaction, 1999 · el caso es Bolt, «Put-That-There», SIGGRAPH 1980
Cada modalidad aporta una parte de la información. Ninguna tiene que aportarla toda
Receso
Quince minutos
Actividad
Pedir sin mirar
Vamos a diseñar una experiencia nueva para pedir domicilios
Lo que dejó la investigación inicial
01 · Las personas se agobian cuando tienen que navegar entre demasiadas
opciones. No es que no sepan usar la app: es que abrir cuatrocientos
restaurantes para volver a pedir lo mismo de siempre es un trabajo que nadie
pidió hacer.
02 · Este nicho vive con dispositivos encima. Usa Apple Watch y
AirPods Pro, y ya está acostumbrado a que sus aparatos respondan a la voz, al
movimiento y al contexto. No da por hecho que el teléfono tenga que ser el centro
de todo.
Es un nicho específico, no «los usuarios de una app de domicilios».
El escenario
Es la hora del almuerzo. La persona va camino a casa, con los AirPods puestos y el
reloj en la muñeca. Quiere pedir lo de siempre, del restaurante de siempre.
No quiere sacar el teléfono. No quiere recorrer una lista. Quiere pedir.
El reto: que esta persona pueda pedir su comida habitual sin depender de navegar una pantalla llena de opciones
Lo que tienen disponible · el cuerpo y los aparatos
La persona actúa
El sistema responde
Una restricción real, y es la más interesante de todas
Los gestos de cabeza de los AirPods —asentir para aceptar, negar para
rechazar— solo existen dentro de un anuncio: funcionan cuando Siri
acaba de leer una llamada o una notificación. No son un control libre.
Eso significa que, si quieren usar la cabeza, el sistema tiene que hablar
primero. La conversación no la abre la persona: la abre el sistema. Y eso
ya es una decisión sobre quién manda en la interacción.
Verificado en la documentación de Apple. Disponible en AirPods Pro 2 y posteriores, AirPods 4 y AirPods Max 2 — no en modelos anteriores.
Y dos capacidades que no son de todos los relojes
Doble toque —juntar índice y pulgar dos veces— existe desde
watchOS 10.1 y solo en Apple Watch Series 9, SE 3, Ultra 2 y posteriores.
Giro de muñeca —voltear la muñeca para descartar— llegó con
watchOS 26, en los mismos modelos.
Los pueden usar. Pero si los usan, en la presentación tienen que poder decir qué le
pasa a alguien cuyo reloj no los tiene.
Verificado en la documentación de Apple. No funcionan en Series 8 ni en Apple Watch SE de 1.ª o 2.ª generación.
La regla principal: no diseñen gestos. Diseñen una interacción
Lo que no queremos ver
La app de hoy, pero ahora con voz. Si su propuesta es la misma
lista de cuatrocientos restaurantes leída en voz alta, empeoraron el problema:
ahora hay que recordarla.
Un gesto porque el gesto existe. No tienen que usar todas las
modalidades. No tienen que eliminar la pantalla. No tienen que usar la voz para
todo. La pregunta es qué debería hacer la persona y cuál es la mejor manera de
que pueda hacerlo.
El proceso · cuatro pasos
La hoja que hay que llenar en el paso 02
La hoja del paso 02
Y cada grupo tiene que poder responder: ¿por qué esta modalidad, aquí?
«Porque sería chévere hacerlo con la cabeza» no es una razón. «Porque va caminando y tiene las manos ocupadas» sí lo es
Qué presenta cada grupo
Para la próxima
Dos cosas
Una es presentar lo que hoy no alcanzamos a ver. La otra es una investigación
1 · La próxima clase abre con las presentaciones: cada grupo presenta Pedir sin mirar
Qué presenta cada grupo
2 · Y una investigación por grupo: ¿qué sabemos de verdad?
La consigna está acá. Se entrega por correo, un correo por grupo, antes de la próxima sesión
Referentes