Preguntar y percibir
¿Cómo averiguamos lo que una persona necesita, y de cuántas maneras puede un sistema dejarse percibir?
¿Qué sabemos de nuestro diseño antes de que otra persona lo use?
La presentación
Se abre en una ventana nueva, lista para proyectar. Pide la contraseña en clase.
En esta sesión
Apertura · Lo que quedó pendiente
Se recupera el triángulo de la sesión 3 —modelo conceptual, imagen del sistema, modelo mental— con un diagrama que se puede señalar por partes. Y se admite algo que la semana pasada quedó tácito: las cinco personas para las que cada grupo diseñó no existen; las escribió el profesor una tarde antes de la clase. El punto no es que inventar personas esté mal: una representación de usuario sirve para alinear a un equipo y para discutir decisiones sin hablar de uno mismo. El punto es que es una hipótesis sobre personas reales, y una hipótesis existe para ser contrastada. Si nadie la contrasta nunca, deja de ser una herramienta de diseño y se vuelve una manera elegante de seguir diseñando para nosotros mismos. De ahí la pregunta que abre la sesión: ¿de dónde saldría una ficha que sí se pueda contrastar?
Actividad · La prueba cruzada de los domicilios
La actividad que la sesión 3 no alcanzó a hacer. Cada grupo entrega su prototipo a otro grupo, que lo recorre con la ficha A de su persona en la mano y sin una sola explicación; quienes lo diseñaron observan y no hablan. Después se compara: qué fue lo más difícil de simular, qué daban por supuesto que su persona no daba por supuesto, en qué se equivocó el otro grupo que no habían previsto. El bloque cierra con la distinción que sostiene la clase entera: simular a otra persona produce una lista de preguntas, no una respuesta sobre nadie. Imaginar cómo piensa alguien produce una hipótesis; averiguar cómo piensa produce conocimiento.
Volvamos a la interfaz
El bloque no redefine nada: recoge lo que ya se dijo en clase —una interfaz es todo lo que hacemos para comunicarle a alguien qué puede hacer y qué pasó cuando lo hizo— y vuelve a proyectar la definición de la sesión 1. El giro está en otra parte: nunca dijimos que fuera una pantalla, y aun así todo lo que hemos diseñado en el curso se comunica por los ojos. Eso no es un descuido. En lo digital nos apoyamos en la vista porque es donde viven las convenciones: qué se ve clicable, qué se ve deslizable, qué se ve desactivado. Esa afirmación no se enuncia, se comprueba: el deck trae una tira de seis componentes que funcionan de verdad —un botón que se hunde al pasar el mouse, el mismo botón desactivado con el cursor tachado, un slider que se arrastra, un enlace, un campo donde se escribe y una tarjeta con asa— y en ninguno hay una instrucción escrita. Todo eso se aprendió mirando, y por eso funciona sin que nadie lo explique. De ahí la pregunta que abre el resto de la clase: qué queda para comunicar lo posible si se quita el sentido donde viven todas esas convenciones. Cuatro casos sirven de respuesta parcial —torniquete, semáforo sonoro, puerta automática, menú telefónico— leídos contra los verbos de la definición: organizar, traducir, transformar, hacer posible y limitar. En ninguno hay algo que se vea presionable; lo posible se comunica por la forma, por el ritmo o por lo que hace otra persona.
Una misma tarea, tres contextos
Pedir dos almuerzos: presencialmente, por teléfono y por una app. La tarea es idéntica en los tres casos, y no hay ninguna complicación añadida — esa es la gracia. Lo que cambia es todo lo demás: lo que se puede señalar en vez de describir, lo que hay que sostener en la cabeza porque nadie lo escribió, lo que queda registrado y lo que solo existe si alguien lo previó. Un diagrama de tres secuencias en paralelo permite compararlas de un vistazo y marca lo que cada contexto le exige a la persona y los otros dos no: preguntar y corregir en el mostrador, recordar por teléfono, comparar en la pantalla. Y hay algo que no aparece en ninguna lista de acciones: quién arregla el malentendido y cuándo se entera. En el mostrador lo arregla el cajero, cuesta una frase y ocurre antes de que el pedido exista; en la app lo arregla la persona sola, después, y cuesta una llamada o un almuerzo perdido. La tarea no cambió: cambió la relación que se construye con el sistema.
Modalidades · Qué le cuesta a cada canal
El bloque abre con una definición explícita: una modalidad es el canal por el que ocurre el intercambio —qué sentido recibe lo que el sistema emite y qué parte del cuerpo produce la acción—, y de sus propiedades físicas se siguen consecuencias que no se esquivan diseñando mejor. Después de la lente vienen los nombres, que es vocabulario que se van a encontrar por todas partes: GUI —graphical user interface, la que se opera mirando y señalando—, VUI —voice user interface, la que hereda las reglas de una conversación— y NUI —natural user interface, el nombre que la industria le puso a operar con el cuerpo—. Las dos primeras describen un canal; la tercera describe una promesa, y por eso se acompaña de la crítica de Norman (2010): ningún gesto es natural. Pellizcar, deslizar, dos dedos para volver atrás, todos hubo que aprenderlos, igual que hubo que aprender que un rectángulo con relieve se presiona; la diferencia es que la interfaz gráfica dejó sus convenciones a la vista y la «natural» no. Tres fichas con la misma estructura, cada una precedida de la pregunta que responde. ¿Dónde vive la información?: en la interfaz gráfica persiste en el espacio, sigue estando ahí cuando la persona deja de mirar, y por eso permite comparar y revisar, al precio de que todo tenga que ocupar un lugar. ¿Cuánto dura?: en la voz la información transcurre y no deja rastro, lo que permite pedir sin manos y sin mirar; acá se hace la precisión que evita el lugar común —no es que la voz dependa de la memoria del usuario, es que el canal no persiste y por eso sostener lo ya dicho pasa a ser trabajo del sistema (Pearl, 2016)—. ¿Con qué se actúa?: en el gesto la acción la produce el cuerpo sin ninguna superficie que la registre, lo que resuelve de un movimiento la cantidad y la separación, pero deja sin resolver dónde se lee qué gestos existen (Saffer, 2008; Norman y Nielsen, 2010).
Multimodalidad
El caso es «Put-That-There» (Bolt, 1980): alguien frente a una pantalla de pared señala un punto y dice «pon eso ahí». El «eso» y el «ahí» no están en la voz, están en el dedo. De ahí la definición que se proyecta: un sistema multimodal procesa dos o más canales de entrada de manera combinada; no repite lo mismo por dos vías, sino que los interpreta juntos para producir un significado que ninguno tenía por separado (Oviatt, 1999). La distinción es entre un sistema que oye y ve, y uno que entiende que lo que oye y lo que ve son la misma frase.
Laboratorio · Pedir sin mirar
Los cinco grupos reciben exactamente el mismo brief: rediseñar la experiencia de pedir un domicilio para un nicho que vive con Apple Watch y AirPods Pro encima, a partir de dos hallazgos de investigación —que las personas se agobian navegando entre demasiadas opciones, y que este nicho ya está acostumbrado a que sus aparatos respondan a la voz, al movimiento y al contexto—. El escenario es concreto: hora de almuerzo, camino a casa, quiere lo de siempre y no quiere sacar el teléfono. Se les entrega un vocabulario de interacción, no un menú de soluciones: voz, gestos de cabeza en los AirPods, doble toque y giro de muñeca en el reloj, la pantalla, y como respuestas la voz del sistema, tonos, vibración y las dos pantallas. Ninguna capacidad trae significado puesto: que asentir signifique aceptar lo decide cada grupo. Las capacidades se verificaron en la documentación de Apple antes de publicarse, y una de ellas cambia el ejercicio: los gestos de cabeza solo existen respondiendo a algo que Siri acaba de anunciar, así que usarlos obliga a que el sistema hable primero — y eso ya es una decisión sobre quién abre la interacción. El proceso son cuatro pasos: definir la experiencia, distribuir la interacción entre canales, diseñar el feedback —incluido qué pasa cuando el sistema entiende mal— y prototipar actuando, sin programar nada. La regla que gobierna todo: no diseñen gestos, diseñen una interacción; y cada grupo tiene que poder responder por qué esa modalidad en ese punto, con el problema de diseño y no con que estaba disponible. Como todos partieron del mismo brief, la discusión final compara las diferencias: quién inicia, cuánto decide el sistema, qué hay que recordar, cuándo aparece la pantalla, qué significa cada gesto y qué pasa cuando algo sale mal. Y termina en la pregunta que abre la sesión 5: qué relación propone cada experiencia entre la persona y el sistema.
¿Dónde está la interfaz aquí?
Tres casos breves donde la interacción no está organizada como una aplicación: los retratos que solo aparecen dentro de la sombra de quien pasa (Lozano-Hemmer, Body Movies, 2001), el espejo de 830 tablitas de madera con un motor cada una que arman una cara con sombras (Rozin, Wooden Mirror, 1999), y el juego cuyo idioma tampoco se entiende, de modo que jugar es descifrarlo (Chants of Sennaar, 2023). Cada uno se proyecta con video —el registro de V2_, donde la obra se estrenó; el de WIRED sobre los espejos de Rozin; y el tráiler del editor del juego—, porque una instalación no se puede contar: hay que verla moverse. No van como inspiración estética: cada uno se acompaña de sus propias preguntas —qué tiene que aprender la persona, cómo descubre que puede hacer algo, cómo responde el sistema cuando se equivoca, quién controla el ritmo—. En los tres hay un sistema, una persona y algo en el medio. Cómo se llaman esas relaciones no se responde en esta sesión: es la puerta a la sesión 5.
Volver a investigar
Si no podemos suponer cómo piensa una persona, tampoco podemos suponer qué le va a llegar por el canal que elijamos. Sanders y Stappers (2012) separan tres clases de conocimiento que no se consiguen con el mismo método: lo explícito, que la persona alcanza a formular si se le pregunta y es lo primero que se agota; lo observable, que se consigue mirándola actuar en su contexto y que contradice lo que dice más seguido de lo que uno esperaría; y lo tácito y latente, que no aparece preguntando ni mirando sino cuando la persona construye algo con las manos y explica lo que hizo. De ahí el contraste práctico entre «¿usarías esto?», que pide una predicción y produce cortesía, y «cuéntame la última vez que…», que pide un recuerdo con fecha, lugar y desenlace y produce algo que se puede seguir investigando. Sobre observar se hace una precisión que importa: cuando lo que alguien dice y lo que hace no coinciden, la lectura fácil es que mintió, y casi nunca es eso — una contradicción es una pregunta nueva sobre qué había en esa situación que no había en su recuerdo. Cierra nombrando el sesgo de confirmación: no investigamos para demostrar que nuestra idea era correcta, sino para averiguar qué tan buena era nuestra hipótesis.
Actividad · ¿Qué sabemos de verdad?
La clase venía diciendo que hay que investigar sin hacer que nadie investigara. Acá se cierra el arco. El deck solo lo anuncia —una frase y el QR— porque proyectar una consigna entera es la manera más segura de que nadie la lea; el detalle vive en la consigna publicada y se explica en vivo. Lo que sigue es lo que hay que explicar, y el orden de los pasos es lo que sostiene la actividad. Primero, para qué y para quién: cada grupo decide qué tipo de experiencia quiere hacer —un sitio, un videojuego, una instalación; el tipo, no la idea— y describe en tres o cuatro líneas a quién le quiere proponer esa interacción. Después escribe cinco cosas que supone de ese público, todas empezando por «creemos que…». Ese público no existe: es lo que estamos fingiendo saber, y es justamente lo que se va a poner a prueba. Solo entonces buscan a una persona real que pueda ser ese público y hablan con ella doce minutos, con alguien preguntando y alguien escribiendo sus palabras y no un resumen. La regla que gobierna la entrevista es la menos evidente: no preguntarle por lo que nosotros queremos hacer. Si vamos a hacer una instalación y arrancamos con «¿tú has ido a una instalación interactiva?», la respuesta va a ser que no y ahí se acaba la conversación; y si dice que sí, va a hablar de la instalación y no de ella. Lo que interesa es cómo esa persona se relaciona con las cosas, y eso aparece preguntando por lo que la marcó: qué es lo último que vio, jugó o visitó que se le quedó pegado, y sobre todo por qué ese y no otro. Al anotar se separan tres cosas que no valen lo mismo: lo que dijo y lo que notamos mientras hablaba, que son de ella y son evidencia —lo explícito y lo observable de Sanders—, y lo que inferimos, que es nuestro y puede estar mal. El artefacto final no es una persona de manual, sin foto ni edad ni hobbies, sino una ficha de modelo mental con cinco campos: lo que sabemos respaldado por algo que dijo, lo que nos parece, lo que todavía no sabemos, qué le pasó a dos de las hipótesis iniciales —si se confirmó, cambió o resultó falsa— y una sola frase sobre qué parece significar interactuar para esa persona, que sigue siendo una hipótesis. El cierre de la actividad es el punto: ahora sabemos más, y sabemos mejor qué todavía no sabemos. Investigar no elimina la incertidumbre, la hace visible — y con una incertidumbre visible ya se puede trabajar.
Tarea · Presentar Pedir sin mirar
La sesión se evacuó después de las instrucciones del laboratorio, antes de las presentaciones. Por eso la sesión 5 abre con ellas: cada grupo presenta la situación, la secuencia, el modelo de interacción y la demostración actuada de su propuesta, y cierra con una decisión que quiere defender — «elegimos hacer X con Y porque…». La consigna no cambió.
Tarea · ¿Qué sabemos de verdad?
La investigación que la clase no alcanzó a anunciar quedó completa como tarea. Cada grupo decide qué tipo de experiencia quiere hacer y para quién, escribe cinco hipótesis sobre ese público —todas empezando por «creemos que…»— y busca una persona real que se le parezca para hablar con ella: preguntas por experiencias y no por opiniones, notas que separan lo dicho de lo observado y de lo inferido. El resultado es una ficha de modelo mental con lo que sabemos, lo que nos parece, lo que todavía no sabemos y qué les pasó a las hipótesis iniciales. La entrega es un solo correo por grupo, antes de la próxima sesión, con la ficha.
Material de la semana
- Actividad · Pedir sin mirar
- Tarea · ¿Qué sabemos de verdad?
- Put-That-There. Voice and Gesture at the Graphics InterfaceRichard A. Bolt (abre en otra pestaña)
- Body Movies. Relational Architecture 6Rafael Lozano-Hemmer (abre en otra pestaña)
- Body Movies (2001), registro en videoV2_ Lab for the Unstable Media (abre en otra pestaña)
- Wooden MirrorDaniel Rozin (abre en otra pestaña)
- How This Guy Makes Amazing Mechanical MirrorsWIRED (abre en otra pestaña)
- Chants of Sennaar, tráiler de lanzamientoFocus Entertainment (abre en otra pestaña)
Las tres primeras sesiones dejaron una herramienta y una deuda. La herramienta es el triángulo de Norman: alguien propone un modelo conceptual, alguien más arma su modelo mental y entre los dos solo existe lo que el sistema hace perceptible. La deuda es que la semana pasada trabajamos ese triángulo con personas inventadas. Cada grupo recibió una ficha, imaginó cómo pensaba esa persona y diseñó para ella. Eso no es conocimiento sobre nadie: es una hipótesis, y las hipótesis se ponen a prueba.
Esta sesión abre la deuda por los dos lados. Por uno, la investigación: qué clase de conocimiento produce preguntar, cuál produce observar y por qué hay cosas que una persona sabe sin poder decirlas. Por el otro, una consecuencia de algo que ya sabíamos y no habíamos empujado hasta el final: si una interfaz es todo lo que hacemos para comunicar qué es posible y qué resultó de una acción, entonces la pantalla nunca fue la definición — pero sí ha sido nuestro canal por defecto, porque en lo digital nos apoyamos en la vista y es ahí donde viven las convenciones que la gente ya sabe leer. Quitar ese apoyo obliga a preguntarse con qué más se comunica una posibilidad. La voz, el gesto, el sonido, el tacto y el espacio median interacciones igual, y no son la misma interfaz traducida a otro canal: cada uno decide qué parte de un mensaje llega barata y cuál se pierde.
El laboratorio lo pone a prueba diseñando. Los cinco grupos reciben el mismo brief —el mismo usuario, el mismo escenario, los mismos hallazgos y las mismas tecnologías— y tienen que resolver cómo pide un domicilio alguien que va caminando, con audífonos y un reloj, y que no quiere recorrer una lista. No se pide elegir un canal: se pide repartir la interacción entre varios y sostener por qué. Como el punto de partida es idéntico para todos, las diferencias entre las cinco propuestas no son de gusto: son decisiones de diseño distintas sobre el mismo problema, y eso es lo que se discute.
Y termina donde empezó, pero del otro lado. La sesión abre admitiendo que las cinco personas de la semana pasada las inventó el profesor, y cierra con cada grupo imaginando un público, escribiendo qué supone de él, y saliendo a buscar a alguien que se le parezca. Doce minutos de entrevista en los que no se pregunta por lo que queremos hacer —se pregunta por lo que a esa persona la marcó, y por qué—, y una ficha que obliga a separar lo que dijo de lo que nosotros interpretamos. No se sale de ahí con la verdad sobre nadie: se sale con unas cuantas suposiciones reemplazadas por evidencia y con preguntas nuevas, que es el material con el que empieza la sesión 5.
La clase no cierra con una lista de principios. Cierra con una pregunta que todavía no sabemos responder: qué tendríamos que saber de una persona antes de decidir cómo debería ser su interacción con un sistema.
Preguntar y percibir
Es para quienes están en el curso. La contraseña se dice en clase.