Pregunta de la semana
¿Qué le pide un investigador a un modelo multimodal cuando le pide que describa una imagen, y qué recibe a cambio?
Por qué esta semana
Con el catálogo construido y la gramática en la mano, el curso entra en la delegación. Un modelo multimodal recibe una imagen y un texto y devuelve un texto; pedirle una descripción es la operación más simple que admite y la más útil para un corpus grande. Produce, en segundos y por cada imagen, un párrafo que enumera objetos, personas, colores, disposición y, si se le pide, atmósfera y posible contexto. Lo hace con una fluidez que parece observación experta. Esta semana enseña a pedir esa descripción por capas, para que cada frase caiga en una celda conocida de la plantilla, y a conocer los costos y los límites de la operación. Smits y Wevers (2022) dan el marco: los modelos de visión no son ventanas sino instrumentos ópticos con agencia propia, y lo que ven depende de los conjuntos de datos con que fueron construidos.
Contenido de la sesión
- Un modelo multimodal es un modelo de lenguaje que acepta imágenes como parte de la entrada. La imagen se convierte en una secuencia de fragmentos que el modelo trata como si fueran palabras, y la salida es texto generado por el mismo mecanismo de predicción de cualquier modelo de lenguaje: cada fragmento es el más probable dado lo anterior, y ningún paso lleva consigo un criterio de corrección. Validación del razonamiento con IA en ciencias sociales, semana 7 describe ese mecanismo, con la cadena de pensamiento y los modelos de recompensa por proceso, y concluye que el criterio de validez es extrínseco, local y estadístico: no está en el modelo. Eso tiene una consecuencia directa: la descripción no es un registro de lo que el modelo "vio" sino el texto más probable dado la imagen y el prompt, en el género de las descripciones de imagen con que fue entrenado. Ese género incluye textos alternativos, pies de foto, cartelas de museo y leyendas de bancos de imágenes, en su mayoría en inglés y sobre objetos del norte global.a
-
La descripción densa es la que cubre la imagen con afirmaciones localizadas, no un resumen. El término viene de la visión por computador (describir regiones, no la imagen entera) y el curso lo usa en un sentido cercano al de Geertz: una descripción que registra lo suficiente para que otro pueda interpretar. En la práctica, densa quiere decir que enumera, localiza y califica: qué hay, dónde en el cuadro, de qué tamaño relativo, en qué relación con lo demás. Un modelo produce esa densidad con facilidad; lo que no produce con facilidad es la distinción entre lo que ve y lo que supone.
-
El prompt por capas pide la descripción en el orden de la plantilla y prohíbe mezclar. Primero la denotación de la narrativa interna: personas, objetos, lugar, disposición, texto visible, sin interpretar. Segundo, los índices materiales visibles: tipo de imagen (fotografía, grabado, captura de pantalla), señales de época (grano, color, formato), marcas de agua o de recorte. Tercero, y por separado, lo que el modelo supone: época probable, lugar probable, género, función, con el grado de confianza y la razón. Cuarto, lo que el modelo declara no poder saber. La separación es lo que hace auditable el resultado: una frase de la tercera capa que aparezca en la primera es un infortunio detectable.
| Prompt plano ("describe esta imagen en detalle") | Prompt por capas |
|---|---|
| Un párrafo fluido que mezcla lo que ve con lo que supone. | Cuatro bloques en orden: denotación, índices, suposiciones, lo que no sabe. |
| La suposición llega con el tono de la observación. | La suposición llega etiquetada, con confianza y razón. |
| Más agradable de leer; imposible de auditar frase por frase. | Menos fluido; cada frase cae en una celda de la ficha. |
| El modelo elige qué contar. | El investigador fija qué debe contarse y en qué orden. |
| Produce una descripción. | Produce una descripción auditable, que es otra cosa. |
-
El caso demostrativo usó un prompt estructurado por las tres capas de Banks sobre lotes de imágenes elegidos por muestreo teórico, como entrada de un pipeline de teoría fundamentada (microanálisis, codificación abierta, axial, evaluación de saturación). Las salidas se convirtieron en la materia prima del descubrimiento de categorías que la semana 6 retoma. En la sesión el docente muestra salidas reales de ese pipeline y lo que se espera encontrar en cualquier corpus local: detalle abundante en lo que el género de las leyendas nombra bien (vestuario, vehículos, objetos) y poco o ninguno en lo que solo un lector situado reconoce (una fachada de barrio, una estética que una telenovela hizo legible, un gesto de duelo popular). Eso no se corrige con un prompt más largo: es el límite de la precomprensión del modelo, y es el tema de la semana 5.
-
Los costos son de tres tipos y hay que presupuestarlos antes de empezar. El costo monetario depende del proveedor, del tamaño de la imagen y de la longitud de la salida; con cuotas gratuitas, 20 imágenes se describen sin pagar y 1.800 exigen un plan o varios días. El costo de tiempo es el de revisar: una descripción de 200 palabras por imagen son 360.000 palabras para el corpus del caso, que nadie lee enteras, y por eso la auditoría es por muestra. El costo ético es el envío de la imagen a un servidor ajeno: el curso lo evita con material sensible hasta tener el protocolo de la semana 7, y recomienda modelos locales cuando el corpus lo exige.b
- Los límites conocidos conviene listarlos antes de verlos. El modelo tiende a completar: si ve tres figuras parcialmente ocultas, describe cuatro. Tiende a nombrar: si ve un uniforme, le asigna un cuerpo armado aunque no pueda saberlo. Tiende a la escena típica: una mesa con botellas se vuelve "celebración". Lee el texto visible con buena tasa y lo interpreta con mala. Y no ve lo que no está en su género: una foto de un cadáver cubierto puede describirse como "una persona descansando". Ninguno de estos límites es una alucinación; cada uno es el texto más probable para quien no participa de la forma de vida que produjo la imagen.
- La práctica de esta semana compara dos prompts sobre las mismas 20 imágenes. El primero pide "describe esta imagen en detalle"; el segundo es el prompt por capas de la guía. El estudiante guarda las dos salidas por imagen con fecha, modelo y prompt literal, y en la bitácora anota qué cambió. Lo que suele cambiar no es la cantidad de detalle sino su clasificación: el prompt plano mezcla; el prompt por capas obliga al modelo a declarar sus suposiciones, y declararlas es lo que permite rechazarlas.
IA y exigencia
Se le pide al modelo que describa 20 imágenes con dos prompts y que, en el segundo, separe lo que ve de lo que supone. Se le exige al estudiante que pueda explicar, sin el modelo, por qué el orden de las capas importa, qué género de texto está imitando el modelo cuando describe, y cuánto costó, en dinero, tiempo y exposición de material, describir sus 20 imágenes, extrapolado a su corpus completo.
Lecturas
Central
- Smits, T. y Wevers, M. (2022). "The agency of computer vision models as optical instruments". Visual Communication, 21(2), 329-349. https://doi.org/10.1177/1470357221992097
- Guía de la práctica 2:
practicas/practica-02-descripcion-y-auditoria.md.
Complementaria
- Arnold, T. y Tilton, L. (2023). Distant Viewing: Computational Exploration of Digital Images. Cambridge, MA: MIT Press. Cap. 1. Acceso abierto: https://doi.org/10.7551/mitpress/14046.001.0001
- Manovich, L. (2020). Cultural Analytics. Cambridge, MA: MIT Press. Cap. 1.
- Zainea, C. I. (2026). "Los modelos de lenguaje no alucinan: cometen infortunios". https://izainea.github.io/blog/alucinacion-o-infortunio/
Guía de lectura
- Smits y Wevers leen los conjuntos de datos de referencia como instrumentos ópticos con agencia, siguiendo a Latour y a Crary. ¿Qué categorías del conjunto con que se entrenó el modelo que usted usa coinciden con las de su corpus, y cuáles de las suyas no existen allí?
- Los autores muestran que la categoría "persona" en esos conjuntos está desigualmente poblada por región y por género. ¿Qué espera que haga el modelo con las personas de su corpus que no se parecen a las del conjunto?
- Arnold y Tilton (2023) insisten en que toda anotación automática es una interpretación codificada en el modelo, no una medición. ¿Cuál de las cuatro capas de su prompt se parece más a una medición, y por qué incluso esa no lo es?
- En la entrada sobre infortunios, el error del modelo se describe como un acto con la forma de una aserción fundamentada sin sus condiciones. ¿Qué forma tiene una descripción de imagen "fundamentada", y cuál de sus condiciones no puede cumplir el modelo por construcción?
Taller de la segunda hora
Práctica 2, primera parte. Guía completa en practicas/practica-02-descripcion-y-auditoria.md. En resumen:
- Para cada una de las 20 imágenes, obtener la descripción con el prompt plano y con el prompt por capas. Guardar modelo, fecha, prompt literal y salida.
- Elegir tres imágenes y, en la tabla, anotar para cada capa de la salida estructurada cuántas afirmaciones contiene y cuántas de ellas usted habría escrito igual.
- Anotar el costo: tokens o llamadas usadas, tiempo de ejecución, tiempo de lectura de las 40 salidas.
| Imagen | Afirmaciones en capa 1 | De ellas, escritas igual por mí | Suposiciones en capa 3 | De ellas, que yo rechazaría | Algo que el modelo declaró no saber |
|---|---|---|---|---|---|
Variante para grupos. Dos estudiantes describen las mismas cinco imágenes con el mismo prompt por capas en dos modelos distintos y comparan la capa de suposiciones. Las suposiciones en que los modelos coinciden no son por eso más ciertas; son más probables en el género, y conviene anotar la diferencia.
Guion de la sesión
| Minuto | Momento | Qué hace el docente | Qué hace el estudiante | Material |
|---|---|---|---|---|
| 0 a 15 | Apertura | Muestra dos descripciones del caso (sin la imagen) y pide adivinar cuál usó el prompt por capas | Distingue por la estructura, no por el contenido | Dos salidas del caso |
| 15 a 35 | Mecanismo | Expone qué es un modelo multimodal y qué género imita, con Smits y Wevers | Nombra qué textos de su campo se parecen a las salidas | Pizarra |
| 35 a 50 | Prompt | Recorre la figura 4 y el prompt de la guía | Adapta el prompt a su corpus en dos frases | Figura 4, guía |
| 50 a 60 | Costos | Presupuesta en vivo el corpus del caso | Presupuesta el suyo | Calculadora |
| 60 a 105 | Práctica 2 | Acompaña; resuelve acceso al modelo | Describe 20 imágenes con dos prompts | Guía, cuaderno o interfaz web |
| 105 a 115 | Puesta en común | Pide un caso de suposición escrita como denotación | Lee el suyo | Salidas |
| 115 a 120 | Cierre | Anuncia la auditoría de la semana 5 | Elige 15 descripciones para auditar | Syllabus |
Notas para el docente. Suele fallar que los estudiantes envíen imágenes con personas identificables; revisar la selección antes de empezar. Suele fallar que la cuota gratuita se agote en la sesión; tener dos proveedores alternativos y la opción local probada. Y suele fallar que la comparación de prompts se lea como "el segundo es mejor"; insistir en que el segundo es más auditable, que es otra cosa.
Bitácora
Registre las 40 salidas con sus metadatos, en el formato que después usará para todo el corpus, la tabla de las tres imágenes, el presupuesto extrapolado al corpus completo y una lista de las suposiciones del modelo que usted no habría hecho. Añada una pregunta abierta sobre lo que el modelo no vio.
Para la próxima semana
Leer Pouget et al. (2024), al menos las secciones 1, 3 y 6, y Schneider et al. (2025), secciones 1 y 5. Tener elegidas 15 descripciones por capas de la práctica para auditarlas con la tabla de tres columnas de la semana 5.