Curso 5. Patrones estables en datos de las ciencias sociales
Curso corto de ocho sesiones en modalidad híbrida, adaptable a formatos de microcredencial o de educación continua. Quinto curso del programa Tunjos para la IA, capa de Juicio.
Pregunta del curso. Cuando un método computacional encuentra un patrón en textos o imágenes, un grupo, una red, una tendencia, ¿cuándo ese patrón es una hipótesis que vale la pena perseguir y cuándo es un artefacto del método?
Respuesta que el curso construye. Embeddings, agrupamiento, redes de coocurrencia y series temporales son instrumentos inductivos de enorme alcance que no eligen entre hipótesis. Cada uno tiene parámetros, y mover el parámetro cambia el patrón: el número de grupos, el umbral de una arista, el ancho de una ventana. La lectura de un patrón es un acto abductivo que exige un trasfondo desde el cual algo sorprende y un investigador que se compromete a probarlo. Por eso cada vista computacional del curso se entrega con dos cosas que el método no produce: su lectura interpretativa y la prueba de que el patrón sobrevive a mover el parámetro.
Contenido
| Carpeta | Qué hay |
|---|---|
| programa/ | Syllabus, guía de cada una de las ocho semanas, evaluación y bibliografía con enlaces |
| plantillas/ | Ficha de patrón, lectura de grafo y registro de frontera computacional |
| practicas/ | Guías de las dos prácticas y el cuaderno de apoyo en Python |
| apps/ | Cinco mini apps que muestran cómo cambia un patrón al mover su parámetro |
Productos del estudiante
- Representación y agrupamiento del corpus propio con prueba de estabilidad (semana 3): el corpus como vectores, una partición en grupos, y la evidencia de qué grupos sobreviven a cambiar la semilla, el número de grupos y la representación.
- Grafo de coocurrencia con lectura interpretativa (semana 5): una red de códigos, actores o etiquetas del corpus propio, con sus medidas, su prueba frente al umbral y una lectura que distingue lo que la red muestra de lo que el investigador propone.
- Tablero analítico con ficha de hipótesis y registro de frontera (semana 8): las vistas del corpus reunidas en un tablero para investigar, cada una con lo que afirma y con sus parámetros declarados; una ficha de hipótesis sobre un patrón propio; y el registro de dónde terminó el cálculo y dónde empezó la lectura.
Prerrequisito
Se recomienda haber cursado Corpus de textos con procedencia en ciencias sociales o Descripción auditada de imágenes en investigación social, o tener nociones básicas de Python. En Corpus de textos con procedencia en ciencias sociales un conjunto disperso de documentos se convierte en un corpus con procedencia, derechos y criterio de inclusión documentados para cada pieza, con un catálogo maestro y un cuaderno de Python que lo reproduce desde las fuentes, y se enseña Python desde cero. En Descripción auditada de imágenes en investigación social se hace lo mismo con imágenes, catalogadas, descritas por capas con un modelo multimodal y auditadas, de modo que cada afirmación sobre una imagen tiene origen conocido. Este curso recibe ese corpus, o uno equivalente, como una tabla con una fila por documento o por imagen. Quien no programe puede seguir el curso con las mini apps y con el cuaderno de apoyo, que se copia bloque a bloque.
Página del curso
izainea.github.io/tunjos-para-la-ia/curso-5/
Cómo se hizo este material
El material de este curso se elaboró con ayuda de modelos de lenguaje bajo la guía de autoría, la revisión y la responsabilidad del docente. Qué hizo la máquina, qué decidió el autor y qué queda por verificar está en la declaración de uso de IA del programa.
Syllabus
Datos generales
| Nombre | Métodos computacionales para el sentido |
| Programa | Tunjos para la IA, quinto de siete cursos. Capa de Juicio |
| Duración | Ocho sesiones semanales de dos horas y trabajo autónomo guiado, unas 96 horas en total. Se adapta al formato de microcredencial o de curso de educación continua de cada institución |
| Modalidad | Híbrida: una sesión presencial de dos horas por semana, con participación remota sincrónica, y trabajo asincrónico guiado. La modalidad virtual es alternativa |
| Docente | Carlos Isaac Zainea Maya |
| Prerrequisitos | Recomendado: Corpus de textos con procedencia en ciencias sociales o Descripción auditada de imágenes en investigación social, donde se construye el corpus catalogado con procedencia que aquí se analiza y se enseña Python desde cero, o nociones básicas de Python. El curso provee un cuaderno de apoyo que se copia bloque a bloque y mini apps que no requieren programar |
| Público | Egresados y estudiantes de posgrado en ciencias sociales y humanidades que ya tienen un corpus, textual o visual, y quieren aplicarle métodos computacionales sin perder el criterio para leer lo que sale |
Problema que atiende
Los métodos computacionales llegaron a las ciencias sociales y a las humanidades con una promesa y un riesgo. La promesa es la escala: miles de documentos o de imágenes representados como vectores, agrupados, conectados en redes y seguidos en el tiempo. El riesgo es que cada uno de esos instrumentos produce patrones con la misma facilidad con que un microscopio desenfocado produce formas. El número de grupos lo fija quien corre k-means; las comunidades de un grafo cambian con el umbral de peso; la fecha en que un tema "emerge" depende del ancho de la ventana. Quien no sabe esto presenta como hallazgo lo que es una decisión de parámetro. Quien lo sabe sin método se paraliza. El curso enseña lo que está en medio: cómo obtener el patrón, cómo probar si sobrevive a mover el parámetro, y cómo leerlo como lo que es, una hipótesis que alguien tiene que comprometerse a perseguir.
Competencias
Al terminar el curso el estudiante puede:
- Representar un corpus propio, textual o visual, como vectores, y explicar qué conserva y qué pierde cada representación, desde la bolsa de palabras hasta los embeddings de un modelo entrenado en otra parte.
- Aplicar agrupamiento, redes de coocurrencia y series temporales al corpus propio, y someter cada patrón obtenido a una prueba de estabilidad frente a sus parámetros.
- Leer un patrón como hipótesis abductiva: distinguir patrón de artefacto, decir desde qué trasfondo sorprende, formular la hipótesis con su prueba y su costo.
- Construir un tablero analítico que declare lo que cada vista afirma y sus parámetros, y registrar la frontera entre lo que calculó la máquina y lo que interpretó el investigador.
Resultados de aprendizaje y evidencias
| Competencia | Evidencia verificable | Semana |
|---|---|---|
| 1 y 2 | Representación y agrupamiento del corpus propio con prueba de estabilidad | 3 |
| 2 y 3 | Grafo de coocurrencia con lectura interpretativa | 5 |
| 3 y 4 | Tablero analítico con ficha de hipótesis y registro de frontera computacional, y presentación ante pares | 8 |
| 1 a 4 | Bitácora semanal | 1 a 8 |
Programa por semanas
| Semana | Tema | Lectura central | Actividad |
|---|---|---|---|
| 1 | Qué es un patrón. De la frecuencia al vector; distancia y similitud; lo que se pierde al representar | Grimmer, Roberts y Stewart (2022), caps. 1 a 3 | Medir la similitud entre fragmentos del corpus propio y anotar qué no captura la medida |
| 2 | Embeddings de texto e imagen. Qué codifican y qué no; el sesgo del entrenamiento como precomprensión ajena | Mikolov et al. (2013). Reimers y Gurevych (2019) | Calcular embeddings del corpus propio y leer los vecinos más cercanos |
| 3 | Agrupamiento. k-means y jerárquico; el número de grupos como decisión; estabilidad; cuándo un grupo es una categoría | Grimmer, Roberts y Stewart (2022), cap. 12 | Entrega: representación y agrupamiento con prueba de estabilidad |
| 4 | Redes. Coocurrencia de códigos, actores y etiquetas; grado, centralidad, comunidades; el grafo como hipótesis relacional | Newman (2018), caps. 6 y 7. Barabási (2016), cap. 2 | Construir el grafo del corpus propio y leerlo con tres umbrales |
| 5 | Tiempo. Series del corpus por periodo; ventanas, tendencias, rupturas; cuándo emerge algo | Kleinberg (2003). Grimmer, Roberts y Stewart (2022), cap. 2 | Entrega: grafo de coocurrencia con lectura interpretativa |
| 6 | Modelado de temas y lectura distante. Temas como sugerencias | Blei (2012). Moretti (2015), "Conjeturas sobre la literatura mundial". Arnold y Tilton (2019) | Modelar temas del corpus propio con dos valores de K y comparar |
| 7 | Visualización que no engaña. Escalas, colores, lo que una vista afirma; tableros para investigar, no para vender | Tufte (2001), caps. 2 y 4. Drucker (2011) | Montar el tablero: cada vista con su pregunta y sus parámetros |
| 8 | Del patrón a la hipótesis. Ficha de hipótesis sobre un patrón propio; registro de frontera; presentación | Peirce (1903). Timmermans y Tavory (2012) | Entrega final y presentación ante pares |
Metodología
El curso se enseña con el método que enseña. Cada semana el estudiante obtiene un patrón de su corpus con un instrumento, mueve el parámetro del instrumento, registra qué cambia, y escribe la lectura que el instrumento no escribe. Tres momentos:
- Lectura guiada (asincrónica, 4 a 5 horas). Un texto central con guía de lectura y una lectura complementaria opcional. Las lecturas técnicas se leen por lo que miden, no por sus fórmulas.
- Sesión sincrónica (2 horas). La primera hora discute la lectura sobre una mini app que muestra el mecanismo de la semana. La segunda es taller sobre el corpus propio, con el cuaderno de apoyo o con las apps.
- Bitácora (asincrónica, 3 a 4 horas). El estudiante registra el patrón obtenido, los parámetros usados, el resultado de moverlos y su lectura. Las bitácoras alimentan los tres productos.
Las prácticas usan bibliotecas abiertas de Python y modelos de embeddings de descarga libre. Quien no programe puede hacer todo el curso con las mini apps y con una hoja de cálculo, salvo el cálculo de embeddings del corpus propio, para el que el cuaderno trae bloques que se copian sin modificar.
Evaluación
| Producto | Peso | Criterio principal |
|---|---|---|
| Tablero analítico con ficha de hipótesis y registro de frontera | 40 % | Cada vista declara lo que afirma y sus parámetros; la hipótesis está formulada con su prueba; la frontera entre cálculo y lectura es precisa |
| Representación y agrupamiento con prueba de estabilidad | 25 % | La representación está justificada y los grupos que se presentan como categorías sobrevivieron a cambiar semilla, k y representación |
| Grafo de coocurrencia con lectura interpretativa | 20 % | La lectura distingue lo que la red muestra de lo que el investigador propone, y declara qué cambia con el umbral |
| Bitácora semanal | 15 % | Continuidad y honestidad en el registro de parámetros, pruebas y dudas |
La rúbrica detallada está en evaluacion.md.
Articulación
El curso cierra la ruta Computacional del programa, que forman Corpus de textos con procedencia en ciencias sociales, Descripción auditada de imágenes en investigación social y este curso, y pertenece a la capa de Juicio junto con Validar y defender investigación social asistida por IA y Exterioridad y gobernanza de la IA en ciencias sociales. Recibe el corpus catalogado que se construye en Corpus de textos con procedencia en ciencias sociales o en Descripción auditada de imágenes en investigación social: una tabla con una fila por documento o por imagen, con la procedencia, los derechos y el criterio de inclusión de cada pieza, producida por un cuaderno que otro puede volver a ejecutar. Cuando lo hay, recibe también el libro de códigos de Codificación cualitativa con IA en ciencias sociales, donde se codifica material cualitativo con ayuda de un modelo de lenguaje y se concluye que el modelo configura, ordena fragmentos bajo nombres, pero no valida, y que el libro de códigos es una aserción del investigador. Entrega a Validar y defender investigación social asistida por IA un conjunto de patrones con su lectura y su prueba de estabilidad, que es el material sobre el que allí se valida y se escribe: en ese curso se distinguen tres sentidos de validar, comprobar la corrección del resultado, justificar el proceso y responder por lo afirmado, y los hallazgos se escriben como aserciones propias con una declaración de uso de IA. Se articula con cursos de métodos cuantitativos, análisis de redes sociales y humanidades digitales de programas de posgrado, a los que aporta lo que no suelen cubrir: la prueba de estabilidad como condición de la lectura.
Política de uso de modelos de lenguaje
Los modelos de lenguaje se usan de forma declarada para escribir y depurar código, para proponer etiquetas de grupos y temas, y para redactar lecturas preliminares que el estudiante corrige. Cada entrega declara qué modelo se usó, para qué, y qué parte del resultado es decisión del estudiante. Las etiquetas que un modelo propone para un grupo o un tema son hipótesis del modelo, no del estudiante, hasta que él las lee contra los miembros del grupo y las adopta o las rechaza con razones. Un uso no declarado se trata como infortunio de autoridad: el estudiante presenta como propio algo por lo que no puede responder, y la entrega se devuelve para que escriba el registro que faltaba.