Cuatro imágenes sintéticas con su cartela. Para cada una, una "descripción de modelo" escrita para la ocasión. Mire la imagen primero. Luego marque cada afirmación: está, no está, o requiere contexto local. Abajo, marque lo que está en la imagen y el modelo no describió. Al final la app resume el sesgo.
Qué se lleva de aquí: las dos primeras columnas miden rendimiento; la tercera mide otra cosa, la precomprensión desde la que el modelo describe. En esa columna no hay respuesta correcta sin decir desde dónde se mira.