Carlos Isaac
Zainea Maya

Tunjos para la IA
Programa de cursos

Razonamiento, validación e inteligencia artificial en ciencias sociales y humanidades.

Curso 2 · Oficio · ocho sesiones · híbrido

Semana 1. Qué es un corpus y qué lo hace válido

¿Qué distingue un corpus de una carpeta con archivos, y quién decide qué entra?

Pregunta de la semana

¿Qué distingue un corpus de una carpeta con archivos, y quién decide qué entra?

Por qué esta semana

El curso empieza antes del primer programa, porque el error más caro no es técnico. Un corpus mal delimitado se puede procesar con elegancia y seguirá siendo un corpus del que nadie responde. Esta semana fija la tesis que el resto del curso convierte en oficio: un corpus es una decisión documentada, no una carpeta de archivos. La decisión tiene criterios que se pueden escribir, cada pieza tiene una procedencia que se puede seguir, y el investigador puede decir por qué algo entró y por qué algo quedó afuera. Las siete semanas siguientes enseñan a escribir esa decisión en forma de programa, a ejecutarla, a documentarla y a leer el resultado. Pero la decisión es anterior al programa, y el programa no la reemplaza.

Contenido de la sesión

  1. La carpeta y el corpus se parecen por fuera y difieren en una sola cosa: el corpus tiene una frontera que alguien trazó con razones. Se muestra el caso demostrativo del curso, un conjunto de notas de prensa histórica colombiana de dominio público y de textos normativos publicados por la Secretaría del Senado, primero como carpeta (archivos con nombres opacos, sin fecha, sin fuente) y después como corpus (cada archivo con identificador, origen, fecha, derechos y criterio de inclusión). La diferencia no está en los archivos sino en lo que se sabe de ellos.

  2. Delimitar es decidir en cuatro dimensiones: qué tipo de documento, de qué periodo, de qué productores y sobre qué asunto. Cada dimensión produce exclusiones, y las exclusiones son parte del corpus tanto como las inclusiones. Un corpus de prensa sobre un conflicto laboral entre 1920 y 1930 excluye la prensa posterior, excluye las revistas, excluye quizá los periódicos de los que solo sobrevive un número. Esas exclusiones se escriben, porque sin ellas el lector del informe no puede saber qué significa la ausencia de algo en el corpus.

  3. El muestreo que sirve aquí rara vez es probabilístico. En la tradición cualitativa, el muestreo teórico de Glaser y Strauss (1967) elige los casos siguientes según lo que los casos anteriores enseñaron, y detiene la recolección cuando las piezas nuevas ya no agregan nada: la saturación.a En lingüística de corpus, Biber (1993) argumenta que la representatividad depende de cubrir la variedad de situaciones de producción del texto antes que de alcanzar un volumen. Las dos tradiciones coinciden en algo que el curso retoma cada semana: el tamaño no valida un corpus; lo valida la relación explícita entre lo que contiene y la pregunta que se le hace.

  1. Valles (1997), siguiendo a Scott (1990), propone cuatro criterios para evaluar cualquier fuente documental: autenticidad, si el documento es lo que dice ser y proviene de donde dice provenir; credibilidad, si está libre de error y distorsión en lo que afirma; representatividad, si es típico de su clase y, cuando no lo es, en qué sentido; e interpretabilidad, si su significado es claro y comprensible para quien lo lee hoy.b Los cuatro se aplican a cada pieza y al corpus entero, y el curso los convierte en columnas del protocolo de corpus que se entrega en la semana 3.
  1. Los derechos entran en la delimitación, no después de ella. Tres marcos colombianos deciden qué se puede recolectar y qué se puede publicar: la Ley 23 de 1982 sobre derechos de autor, que permite reproducir las normas y actos oficiales y protege las obras hasta ochenta años después de la muerte del autor; la Ley 1581 de 2012 sobre datos personales, que convierte en problema cualquier documento con nombres, cédulas o datos sensibles de personas vivas; y la Ley 1712 de 2014 sobre acceso a la información pública, que fija lo que las entidades deben publicar.c Un documento que no se puede citar, o que no se puede guardar sin tratar datos personales, no está fuera del corpus por capricho: está fuera por un criterio que se escribe.
  1. La máquina aparece desde el principio como lo que es en este curso: un instrumento que ejecuta criterios y que puede proponer criterios, pero que no decide. Si un modelo de lenguaje filtra diez mil notas y devuelve mil "relevantes", el investigador que acepta esas mil sin poder decir qué criterio aplicó el modelo tiene una carpeta, no un corpus. La frontera entre lo que la máquina hace y lo que el investigador decide es la que traza Validación del razonamiento con IA en ciencias sociales, el curso de fundamentos del programa: allí se distinguieron deducción, inducción y abducción por su régimen de validez, y se concluyó que una máquina puede verificar las dos primeras, pero que la tercera, la que introduce hipótesis nuevas, solo vale porque alguien se compromete a perseguirla y a responder por ella. Esa frontera se aplica ahora a la primera operación del oficio: decidir qué cuenta como dato.
Carpeta lo que hay nota_final2.txt scan (1).pdf copia de nota.docx Sin título.txt ¿De dónde salió? ¿Cuándo? ¿Se puede citar? ¿Por qué está? sin respuesta decisión Corpus lo que se sabe de lo que hay frontera con razones P-0001 · El Tiempo · 1910-03-02 · dominio público · criterio 2 P-0002 · El Espectador · 1910-03-05 · dominio público · criterio 2 N-0001 · Ley 23 de 1982 · norma oficial · criterio 4 P-0003 · El Tiempo · 1910-03-09 · dominio público · criterio 1 excluidos: revistas; números únicos; notas sin fecha legible Cada pieza responde: de dónde, cuándo, con qué derechos, por qué entró. La lista de exclusiones es parte del corpus.
Figura 1. La carpeta y el corpus contienen los mismos archivos. Lo que hay que ver es que la diferencia está en lo que se sabe de cada pieza y en la frontera trazada con razones, incluidas las exclusiones.
  1. La cadena de procedencia es el instrumento de la semana y el hilo del curso. Un documento pasa de la fuente a la captura, de la captura al archivo crudo, del archivo al registro en el catálogo, del registro al texto limpio, del texto al fragmento citado y del fragmento a la afirmación del informe. Cada eslabón guarda algo que el siguiente necesita. La mini app muestra qué deja de poder responderse cuando se omite un eslabón.

IA y exigencia

Esta semana se le pide al modelo una sola cosa: proponer, a partir de la pregunta de investigación del estudiante, una lista de tipos de documento y de fuentes posibles. El estudiante compara esa lista con la suya y anota qué propuso el modelo que él no había pensado y qué propuso que él descarta, con la razón. Lo que debe poder defender sin la máquina es la frontera de su corpus: por qué estos documentos y no otros, por qué este periodo, qué queda afuera y por qué.

Lecturas

Central

  • Valles, M. S. (1997). Técnicas cualitativas de investigación social. Reflexión metodológica y práctica profesional. Madrid: Síntesis. Cap. 4, "Técnicas de lectura y documentación".
  • Nguyen, D., Liakata, M., DeDeo, S., Eisenstein, J., Mimno, D., Tromble, R. y Winters, J. (2020). "How We Do Things With Words: Analyzing Text as Social and Cultural Data". Frontiers in Artificial Intelligence 3, 62. https://doi.org/10.3389/frai.2020.00062

Complementaria

Guía de lectura

  • Valles presenta los cuatro criterios como preguntas que el investigador le hace al documento, no como propiedades que el documento tiene. Un mismo periódico puede ser auténtico y poco creíble, o creíble y nada representativo. ¿Cuál de los cuatro criterios es el más difícil de evaluar para las fuentes de su proyecto, y qué necesitaría para evaluarlo?
  • Nguyen y sus coautores describen el análisis de texto como una cadena de decisiones, desde la pregunta hasta la validación, en la que cada paso puede introducir un sesgo. Insisten en que "los datos no están dados". ¿En qué paso de su proyecto la decisión sobre qué cuenta como dato está más oculta, y quién la tomó?
  • Biber separa representatividad de tamaño: un corpus grande de una sola situación comunicativa es menos representativo que uno pequeño que cubre varias. Si duplicara el tamaño de su corpus con más documentos de la misma fuente, ¿qué ganaría y qué no?
  • Las dos leyes colombianas fijan lo que se puede guardar y lo que se puede pedir. Léalas como un lector de documentos, no como abogado. ¿Hay en su corpus piezas con datos personales de personas vivas? ¿Qué haría con ellas?

Taller de la segunda hora

Trabajo sobre el propio proyecto. Cada estudiante llega con una pregunta de investigación y una idea de los documentos que la responderían. Llena la ficha de delimitación:

Dimensión Entra Queda afuera Por qué
Tipo de documento
Periodo
Productores o fuentes
Asunto o criterio temático
Régimen de derechos

Luego elige una pieza concreta de su corpus futuro y la pasa por la mini app de la cadena de procedencia: escribe, para cada eslabón, qué sabe hoy y qué no. Lo que no sabe es la lista de tareas de la semana 3.

Guion de la sesión

Momento Docente Estudiante Material
0 a 10 min Presenta el curso en una frase y el caso demostrativo como carpeta Mira la carpeta y anota qué preguntas no puede responder Carpeta del caso, sin metadatos
10 a 35 min Expone delimitación, muestreo teórico y los cuatro criterios de Valles Aplica los cuatro criterios a dos piezas del caso Dos notas de prensa del caso
35 a 50 min Expone derechos: Ley 23, Ley 1581, Ley 1712 Clasifica cinco piezas del caso por régimen de derechos Lista de cinco piezas
50 a 60 min Muestra la cadena de procedencia con la mini app Prueba omitir eslabones y lee qué se rompe apps/cadena-procedencia.html
60 a 70 min Pausa
70 a 105 min Acompaña el taller mesa por mesa Llena la ficha de delimitación del propio proyecto Ficha de delimitación
105 a 120 min Cierra: tres fichas leídas en voz alta Anota lo que cambiaría de la suya

Notas para el docente. Lo que suele fallar: el estudiante llega sin una pregunta de investigación y quiere delimitar "todo lo que hay sobre el tema"; conviene devolverlo a la pregunta antes de la ficha. El segundo fallo es confundir representatividad con cantidad; el ejemplo de Biber de las conversaciones frente a los editoriales suele bastar. El tercero es la ansiedad por el código: decir desde el primer minuto que esta semana no se programa y que la semana 2 empieza desde cero.

Bitácora

Registre la ficha de delimitación y la cadena de procedencia de una pieza. Anote la lista que propuso el modelo y lo que tomó y descartó de ella, con razones. Añada una pregunta que le haya quedado abierta sobre su corpus. Esta bitácora es la primera versión del protocolo de corpus de la semana 3.

Para la próxima semana

Instalar Python 3.11 o superior y un cuaderno, o abrir una cuenta en un servicio gratuito de cuadernos; la guía de instalación está en practicas/cuaderno-apoyo.md. Leer los capítulos 3 y 7 del tutorial oficial de Python en español. Traer diez archivos de texto de su corpus futuro, o diez del caso demostrativo si aún no los tiene, en una carpeta llamada crudo.