Pregunta de la semana
¿Qué distingue un corpus de una carpeta con archivos, y quién decide qué entra?
Por qué esta semana
El curso empieza antes del primer programa, porque el error más caro no es técnico. Un corpus mal delimitado se puede procesar con elegancia y seguirá siendo un corpus del que nadie responde. Esta semana fija la tesis que el resto del curso convierte en oficio: un corpus es una decisión documentada, no una carpeta de archivos. La decisión tiene criterios que se pueden escribir, cada pieza tiene una procedencia que se puede seguir, y el investigador puede decir por qué algo entró y por qué algo quedó afuera. Las siete semanas siguientes enseñan a escribir esa decisión en forma de programa, a ejecutarla, a documentarla y a leer el resultado. Pero la decisión es anterior al programa, y el programa no la reemplaza.
Contenido de la sesión
-
La carpeta y el corpus se parecen por fuera y difieren en una sola cosa: el corpus tiene una frontera que alguien trazó con razones. Se muestra el caso demostrativo del curso, un conjunto de notas de prensa histórica colombiana de dominio público y de textos normativos publicados por la Secretaría del Senado, primero como carpeta (archivos con nombres opacos, sin fecha, sin fuente) y después como corpus (cada archivo con identificador, origen, fecha, derechos y criterio de inclusión). La diferencia no está en los archivos sino en lo que se sabe de ellos.
-
Delimitar es decidir en cuatro dimensiones: qué tipo de documento, de qué periodo, de qué productores y sobre qué asunto. Cada dimensión produce exclusiones, y las exclusiones son parte del corpus tanto como las inclusiones. Un corpus de prensa sobre un conflicto laboral entre 1920 y 1930 excluye la prensa posterior, excluye las revistas, excluye quizá los periódicos de los que solo sobrevive un número. Esas exclusiones se escriben, porque sin ellas el lector del informe no puede saber qué significa la ausencia de algo en el corpus.
-
El muestreo que sirve aquí rara vez es probabilístico. En la tradición cualitativa, el muestreo teórico de Glaser y Strauss (1967) elige los casos siguientes según lo que los casos anteriores enseñaron, y detiene la recolección cuando las piezas nuevas ya no agregan nada: la saturación.a En lingüística de corpus, Biber (1993) argumenta que la representatividad depende de cubrir la variedad de situaciones de producción del texto antes que de alcanzar un volumen. Las dos tradiciones coinciden en algo que el curso retoma cada semana: el tamaño no valida un corpus; lo valida la relación explícita entre lo que contiene y la pregunta que se le hace.
- Valles (1997), siguiendo a Scott (1990), propone cuatro criterios para evaluar cualquier fuente documental: autenticidad, si el documento es lo que dice ser y proviene de donde dice provenir; credibilidad, si está libre de error y distorsión en lo que afirma; representatividad, si es típico de su clase y, cuando no lo es, en qué sentido; e interpretabilidad, si su significado es claro y comprensible para quien lo lee hoy.b Los cuatro se aplican a cada pieza y al corpus entero, y el curso los convierte en columnas del protocolo de corpus que se entrega en la semana 3.
- Los derechos entran en la delimitación, no después de ella. Tres marcos colombianos deciden qué se puede recolectar y qué se puede publicar: la Ley 23 de 1982 sobre derechos de autor, que permite reproducir las normas y actos oficiales y protege las obras hasta ochenta años después de la muerte del autor; la Ley 1581 de 2012 sobre datos personales, que convierte en problema cualquier documento con nombres, cédulas o datos sensibles de personas vivas; y la Ley 1712 de 2014 sobre acceso a la información pública, que fija lo que las entidades deben publicar.c Un documento que no se puede citar, o que no se puede guardar sin tratar datos personales, no está fuera del corpus por capricho: está fuera por un criterio que se escribe.
- La máquina aparece desde el principio como lo que es en este curso: un instrumento que ejecuta criterios y que puede proponer criterios, pero que no decide. Si un modelo de lenguaje filtra diez mil notas y devuelve mil "relevantes", el investigador que acepta esas mil sin poder decir qué criterio aplicó el modelo tiene una carpeta, no un corpus. La frontera entre lo que la máquina hace y lo que el investigador decide es la que traza Validación del razonamiento con IA en ciencias sociales, el curso de fundamentos del programa: allí se distinguieron deducción, inducción y abducción por su régimen de validez, y se concluyó que una máquina puede verificar las dos primeras, pero que la tercera, la que introduce hipótesis nuevas, solo vale porque alguien se compromete a perseguirla y a responder por ella. Esa frontera se aplica ahora a la primera operación del oficio: decidir qué cuenta como dato.
- La cadena de procedencia es el instrumento de la semana y el hilo del curso. Un documento pasa de la fuente a la captura, de la captura al archivo crudo, del archivo al registro en el catálogo, del registro al texto limpio, del texto al fragmento citado y del fragmento a la afirmación del informe. Cada eslabón guarda algo que el siguiente necesita. La mini app muestra qué deja de poder responderse cuando se omite un eslabón.
IA y exigencia
Esta semana se le pide al modelo una sola cosa: proponer, a partir de la pregunta de investigación del estudiante, una lista de tipos de documento y de fuentes posibles. El estudiante compara esa lista con la suya y anota qué propuso el modelo que él no había pensado y qué propuso que él descarta, con la razón. Lo que debe poder defender sin la máquina es la frontera de su corpus: por qué estos documentos y no otros, por qué este periodo, qué queda afuera y por qué.
Lecturas
Central
- Valles, M. S. (1997). Técnicas cualitativas de investigación social. Reflexión metodológica y práctica profesional. Madrid: Síntesis. Cap. 4, "Técnicas de lectura y documentación".
- Nguyen, D., Liakata, M., DeDeo, S., Eisenstein, J., Mimno, D., Tromble, R. y Winters, J. (2020). "How We Do Things With Words: Analyzing Text as Social and Cultural Data". Frontiers in Artificial Intelligence 3, 62. https://doi.org/10.3389/frai.2020.00062
Complementaria
- Scott, J. (1990). A Matter of Record: Documentary Sources in Social Research. Cambridge: Polity Press. Cap. 1.
- Biber, D. (1993). "Representativeness in Corpus Design". Literary and Linguistic Computing 8(4), 243-257. https://doi.org/10.1093/llc/8.4.243
- Flick, U. (2015). El diseño de la investigación cualitativa. Madrid: Morata. Cap. sobre muestreo.
- Congreso de Colombia. Ley 1581 de 2012, por la cual se dictan disposiciones generales para la protección de datos personales. http://www.secretariasenado.gov.co/senado/basedoc/ley_1581_2012.html
- Congreso de Colombia. Ley 1712 de 2014, por medio de la cual se crea la Ley de Transparencia y del Derecho de Acceso a la Información Pública Nacional. http://www.secretariasenado.gov.co/senado/basedoc/ley_1712_2014.html
Guía de lectura
- Valles presenta los cuatro criterios como preguntas que el investigador le hace al documento, no como propiedades que el documento tiene. Un mismo periódico puede ser auténtico y poco creíble, o creíble y nada representativo. ¿Cuál de los cuatro criterios es el más difícil de evaluar para las fuentes de su proyecto, y qué necesitaría para evaluarlo?
- Nguyen y sus coautores describen el análisis de texto como una cadena de decisiones, desde la pregunta hasta la validación, en la que cada paso puede introducir un sesgo. Insisten en que "los datos no están dados". ¿En qué paso de su proyecto la decisión sobre qué cuenta como dato está más oculta, y quién la tomó?
- Biber separa representatividad de tamaño: un corpus grande de una sola situación comunicativa es menos representativo que uno pequeño que cubre varias. Si duplicara el tamaño de su corpus con más documentos de la misma fuente, ¿qué ganaría y qué no?
- Las dos leyes colombianas fijan lo que se puede guardar y lo que se puede pedir. Léalas como un lector de documentos, no como abogado. ¿Hay en su corpus piezas con datos personales de personas vivas? ¿Qué haría con ellas?
Taller de la segunda hora
Trabajo sobre el propio proyecto. Cada estudiante llega con una pregunta de investigación y una idea de los documentos que la responderían. Llena la ficha de delimitación:
| Dimensión | Entra | Queda afuera | Por qué |
|---|---|---|---|
| Tipo de documento | |||
| Periodo | |||
| Productores o fuentes | |||
| Asunto o criterio temático | |||
| Régimen de derechos |
Luego elige una pieza concreta de su corpus futuro y la pasa por la mini app de la cadena de procedencia: escribe, para cada eslabón, qué sabe hoy y qué no. Lo que no sabe es la lista de tareas de la semana 3.
Guion de la sesión
| Momento | Docente | Estudiante | Material |
|---|---|---|---|
| 0 a 10 min | Presenta el curso en una frase y el caso demostrativo como carpeta | Mira la carpeta y anota qué preguntas no puede responder | Carpeta del caso, sin metadatos |
| 10 a 35 min | Expone delimitación, muestreo teórico y los cuatro criterios de Valles | Aplica los cuatro criterios a dos piezas del caso | Dos notas de prensa del caso |
| 35 a 50 min | Expone derechos: Ley 23, Ley 1581, Ley 1712 | Clasifica cinco piezas del caso por régimen de derechos | Lista de cinco piezas |
| 50 a 60 min | Muestra la cadena de procedencia con la mini app | Prueba omitir eslabones y lee qué se rompe | apps/cadena-procedencia.html |
| 60 a 70 min | Pausa | ||
| 70 a 105 min | Acompaña el taller mesa por mesa | Llena la ficha de delimitación del propio proyecto | Ficha de delimitación |
| 105 a 120 min | Cierra: tres fichas leídas en voz alta | Anota lo que cambiaría de la suya |
Notas para el docente. Lo que suele fallar: el estudiante llega sin una pregunta de investigación y quiere delimitar "todo lo que hay sobre el tema"; conviene devolverlo a la pregunta antes de la ficha. El segundo fallo es confundir representatividad con cantidad; el ejemplo de Biber de las conversaciones frente a los editoriales suele bastar. El tercero es la ansiedad por el código: decir desde el primer minuto que esta semana no se programa y que la semana 2 empieza desde cero.
Bitácora
Registre la ficha de delimitación y la cadena de procedencia de una pieza. Anote la lista que propuso el modelo y lo que tomó y descartó de ella, con razones. Añada una pregunta que le haya quedado abierta sobre su corpus. Esta bitácora es la primera versión del protocolo de corpus de la semana 3.
Para la próxima semana
Instalar Python 3.11 o superior y un cuaderno, o abrir una cuenta en un servicio gratuito de cuadernos; la guía de instalación está en practicas/cuaderno-apoyo.md. Leer los capítulos 3 y 7 del tutorial oficial de Python en español. Traer diez archivos de texto de su corpus futuro, o diez del caso demostrativo si aún no los tiene, en una carpeta llamada crudo.