Curso: Descripción y Visualización de Datos

Profesor: Naim Bro (naim.bro.k [at] uai.cl)
Ayudantes: Matías Albornoz (matalbornoz [at] alumnos.uai.cl), Karina Villagra (kavillagra [at] alumnos.uai.cl), Martín Castillo (martincastillo [at] alumnos.uai.cl)
Carrera/Programa: Doble título Sociología - Ingeniería Comercial
Escuela: Universidad Adolfo Ibáñez, 2026
Horario de clases: lunes, 10:00-12:40
Horario de oficina: Oficina 260-A (coordinar por mail previamente)
(Recursos actualizados semanalmente)

Equipo docente: formularios de trabajo

Este recuadro es para los ayudantes. Los estudiantes pueden saltárselo: sus entregas y su bitácora están más abajo, en el calendario de clases.

Descripción general

Este curso introduce herramientas para describir, procesar, visualizar y comunicar datos. En 2026, el curso forma parte del Proyecto de Metodologías de Aprendizaje Transformadoras (MAT), por lo que se organiza como un proyecto semestral de aprendizaje activo. En lugar de trabajar solamente con ejercicios aislados, los estudiantes formarán grupos y construirán una plataforma web de datos sobre un dominio de interés: vivienda, educación, salud, seguridad, empleo, transporte, cultura, deporte, medioambiente, inteligencia artificial u otro tema aprobado por el profesor.

La misión de cada grupo será convertirse en un pequeño observatorio de datos sobre su tema. Para ello deberán identificar preguntas relevantes, buscar y evaluar fuentes de datos, limpiar y sistematizar información, producir visualizaciones claras, explicar sus decisiones y comunicar sus resultados a una audiencia real o potencial.

Pregunta guía general del curso: ¿Cómo podemos transformar datos dispersos en una plataforma visual que ayude a entender un problema, industria o fenómeno social? Esta pregunta orienta el trabajo común; cada equipo deberá formular una pregunta descriptiva propia, acotada y susceptible de responderse con las fuentes disponibles.

Competencias del perfil de egreso

La asignatura tributa explícitamente a las competencias (3) Razonamiento crítico y resolutivo y (4) Metodologías de la investigación social.

Resultados de aprendizaje

Al finalizar el curso, los estudiantes serán capaces de:

  1. Construir una plataforma web de datos orientada a comunicar un problema, industria o fenómeno social a una audiencia definida, integrando búsqueda y evaluación de fuentes, limpieza de datos, visualizaciones, narrativa pública, trazabilidad metodológica y uso reflexivo de inteligencia artificial.
  2. Formular preguntas descriptivas relevantes para un dominio de interés, delimitando su alcance, público objetivo, fuentes disponibles y límites de interpretación.
  3. Sistematizar datos provenientes de fuentes diversas mediante procedimientos básicos de limpieza, transformación, documentación y construcción de indicadores reproducibles.
  4. Diseñar visualizaciones de datos claras y pertinentes, seleccionando tipos de gráficos, escalas, anotaciones y criterios visuales adecuados a la pregunta y a la audiencia.
  5. Comunicar y defender hallazgos descriptivos en formato visual y oral, explicando decisiones metodológicas, limitaciones del análisis, aprendizajes del proceso y contribuciones individuales dentro del trabajo colaborativo.

Metodología de aprendizaje

El curso combina cápsulas técnicas breves, trabajo guiado en sala, revisión entre pares, uso reflexivo de IA y entregas incrementales. Cada bloque técnico se conecta con una necesidad concreta del proyecto grupal: describir el dominio, construir indicadores, elegir visualizaciones, diseñar una narrativa y publicar los resultados.

Filosofía sobre el uso de IA en el proceso pedagógico:

Audiencia, contraparte y vinculación profesional

Todos los proyectos deberán definir una audiencia específica e identificable, justificar su necesidad de información y realizar al menos una prueba de comprensión con un usuario potencial. Además, se incentivará que los grupos identifiquen una contraparte externa o destinatario real para su plataforma de datos.

La contraparte del proyecto seguirá siendo opcional y no deberá supervisar formalmente el trabajo. Su rol puede ser ayudar a definir una pregunta relevante, sugerir fuentes de datos, entregar contexto o comentar la utilidad de los resultados. Esta contraparte es distinta de la actividad obligatoria de vinculación profesional, que consiste en visitar una organización y entregar posteriormente al profesor un cuestionario de cuatro preguntas.

Alineamiento entre metodología y evaluación

La evaluación está diseñada para recoger evidencias del proceso completo de aprendizaje: formulación de preguntas, búsqueda y evaluación de fuentes, sistematización de datos, diseño visual, comunicación pública, reflexión individual, vinculación profesional y mejora progresiva. Cada sprint entrega retroalimentación para la siguiente etapa; los equipos deberán documentar cómo la incorporaron. La bitácora y la presentación oral complementan la evidencia grupal con información sobre el aprendizaje y la contribución individual.

Clases

Las clases se realizan los lunes de 10:00 a 12:40. No habrá clase el lunes 14 de septiembre por suspensión de clases UAI ni el lunes 12 de octubre por feriado legal.

Actividad fuera del horario regular: en octubre se realizará la visita de vinculación con el entorno profesional. La fecha exacta dependerá de la coordinación con la organización asignada y se comunicará por Webcursos.
  1. Introducción a la visualización de datos y al proyecto MAT (lunes 03-08-2026, 10:00-12:40)
  2. Caso: describiendo a mis compañeros de clase (primeros pasos en Google Colab con R) (lunes 10-08-2026, 10:00-12:40)
    • Google Colab: celdas de texto y de código, entorno de ejecución y copia en Drive; no requiere instalar nada. Leer errores sin frustrarse y uso responsable de IA para entenderlos.
    • Primeras líneas de código en R: objetos, tipos de variables (numeric, character, logical), vectores y el data frame como forma de describir a una población.
    • Describir y limpiar: tendencia central y dispersión (mean(), median(), table(), summary(), sd()) y datos sucios, como una columna de estaturas que mezcla metros, centímetros y texto, dejando registro de cada decisión.
    • Primeros gráficos (histograma, barras, dispersión y boxplot) y puente al proyecto: ¿qué indicadores básicos necesita mi dominio?
    • Actividad: responder la encuesta del curso (respuestas, acceso del profesor); sus respuestas son la base de datos que analizaremos en clases.
    • Cuadernos de la clase: 1. conociendo Google Colab; 2. nuestra primera encuesta; 3. una encuesta de verdad, con 458 respuestas de estudiantes UAI (planilla original).
    • Juego ML2 actividad de repaso y discusión con preguntas abiertas.
  3. Dominios, preguntas y fuentes de datos (lunes 17-08-2026, 10:00-12:40)
    • De un tema amplio a una pregunta descriptiva investigable.
    • Tipos de fuentes: datos públicos, APIs, encuestas, registros administrativos, scraping liviano y datos entregados por organizaciones.
    • Evaluación inicial de calidad: cobertura, granularidad, periodicidad, sesgos y límites.
    • Mapa de actores: audiencia, usuarios potenciales y contraparte opcional.
    • Presentación de la lista de organizaciones para la actividad de vinculación profesional.
    • Primeros pasos con dplyr: library(), read.csv(), glimpse() y sobre todo count() para responder "¿cuántos hay de cada uno?".
    • Cuaderno de la clase: contar con dplyr, con ejercicios repetidos sobre las respuestas del propio curso.
    • Ejercicio individual: abre un cuaderno de Colab en blanco y arma desde cero un mini-reporte sobre la encuesta del curso, con cinco piezas en este orden: (1) un título; (2) la pregunta que quieres responder; (3) library(dplyr) y read.csv() para cargar la tabla; (4) un count() con dos columnas y el argumento sort = TRUE; (5) una conclusión de dos o tres líneas. Deja el enlace en la carpeta de Webcursos con el acceso abierto: en Colab, Compartir → Acceso general → Cualquier persona con el enlace. Un enlace restringido cuenta como no entregado.
    • Catálogo de fuentes de datos: once fuentes verificadas por dominio, con cobertura, granularidad, periodicidad y límites, más la ficha de fuente del taller.
    • Caso en pantalla: la Encuesta CEP, base consolidada 1994-2026 (versión del curso, 96.122 casos).
    • Inicio Sprint 1: propuesta de dominio, pregunta, fuentes y audiencia (instrucciones del sprint). Se presenta el lunes 31 de agosto.
    • Bitácora individual, semana 1 (cubre el inicio del Sprint 1): se completa hasta el domingo 23 de agosto, 23:59 — formulario (respuestas, acceso del profesor).
    • Juego ML2 actividad de repaso y discusión con preguntas abiertas.
  4. Introducción a dplyr (1): el pipe, filter(), select() y mutate() (lunes 24-08-2026, 10:00-12:40)
  5. Introducción a dplyr (2): variables derivadas e indicadores (lunes 31-08-2026, 10:00-12:40)
    • Profundización de %>%, filter(), select() y mutate() sobre bases más grandes que la encuesta del curso.
    • Condiciones múltiples en filter() y limpieza de columnas sucias con mutate().
    • Construcción de variables derivadas e indicadores simples.
    • Cuaderno de la clase: arreglar y crear columnasclass() para descubrir que minutos_viaje es texto, mutate() con as.numeric() para arreglarla, ifelse() para convertir un número en categoría y & / | dentro de filter(). Retoma la trampa con la que cerró la clase 4: el mismo filtro devuelve diez personas antes de limpiar y catorce después.
    • Clínica de proyecto: primeros problemas de importación y limpieza.
    • Entrega Sprint 1: propuesta de dominio, pregunta descriptiva, fuentes y audiencia (instrucciones del sprint).
    • Presentaciones del Sprint 1 en un bloque: 4 minutos por grupo con el Colab proyectado, más un minuto de comentarios del curso y de los ayudantes. Ejemplo de referencia: el demo de cuatro minutos de la clase 4.
    • Pauta de presentaciones del Sprint 1: los tres ayudantes la completan en sala, una vez por grupo, durante el minuto de comentarios. Las cuatro dimensiones y sus pesos son los mismos que se anunciaron a los estudiantes — la pregunta (35%), fuente y audiencia (35%), el Colab (20%) y la presentación (10%) — con cuatro niveles descritos en cada una, de modo que las tres lecturas converjan. El promedio ponderado se calcula después, no en la sala — pauta (respuestas, acceso del profesor).
    • Bitácora individual, semana 3 (cubre la entrega del Sprint 1): se completa hasta el domingo 6 de septiembre, 23:59 — formulario (respuestas, acceso del profesor).
    • Juego ML2 actividad de repaso y discusión con preguntas abiertas.
  6. Introducción a dplyr (3): agrupar, resumir y comparar (lunes 07-09-2026, 10:00-12:40)
    • Mapa del semestre: de la pregunta a la plataforma.
    • Retroalimentación del Sprint 1.
    • Métodos group_by() y summarise().
    • Láminas de la clase: la sala es una redacción — el montaje, las tres preguntas del editor y el reparto de los seis encargos entre los nueve grupos.
    • Pizarra de la clase: el cuaderno que se proyecta — la CEP cargada y el resto en blanco. Es donde se escribe el código en vivo durante la clase; queda acá para quien quiera repetir en su casa lo que se hizo en pantalla.
    • Cuaderno de la clase, como tarea: agrupar y resumirmutate(), summarise(), group_by() y arrange(), con ocho ejercicios. Se resuelve en una copia propia y se sube el .ipynb a la carpeta de la clase 6 en Webcursos.
    • Estudio de caso con juego de roles — la sala es una redacción: se trabaja con los mismos nueve grupos del Sprint 1, y cada uno recibe un encargo sobre la serie CEP 1994–2026 elegido según el tema de su propio proyecto y el profesor hace de editor, que exige un titular con un número y una comparación, y pregunta por el n() de cada grupo. Los seis encargos traen una trampa distinta: el año 2020 que no existe, el segmento E con nueve casos, las regiones creadas después de 2010, y una columna que dejó de preguntarse en 2021.
    • Cuaderno de arranque del encargo: la sala de máquinas de cada grupo — trae la CEP cargada, la receta de cuatro líneas para adaptar, los tres chequeos del editor y la celda del titular. Cada grupo guarda su propia copia en Drive y presenta desde ahí.
    • Segundo bloque: cada grupo expone su encargo en tres minutos y responde las preguntas del editor.
    • tutorial de R
    • Juego ML2 actividad de repaso y discusión con preguntas abiertas.
  7. Taller de calidad y prototipo de datos (lunes 21-09-2026, 10:00-12:40)
    • Semana de trabajo guiado en grupos.
    • Revisión de bases limpias, diccionarios de variables, trazabilidad de decisiones e indicadores preliminares.
    • Ética mínima de datos: privacidad, representación y límites de inferencia.
    • Actividad: ficha de calidad de datos para el proyecto grupal.
    • Feedback cruzado entre grupos: ¿se entiende qué mide cada indicador?
    • Preparación del prototipo de datos.
    • Bitácora individual, semana 4: se completa hasta el domingo 27 de septiembre, 23:59 — formulario (respuestas, acceso del profesor).
    • Juego ML2 actividad de repaso y discusión con preguntas abiertas.
  8. Introducción a la gramática de gráficos con ggplot2 (lunes 28-09-2026, 10:00-12:40)
    • La lógica de ggplot2: datos, estética, geometrías, escalas y temas.
    • Gráficos de distribución, comparación y relación.
    • Buenas prácticas: títulos, ejes, etiquetas, unidades y fuentes.
    • Entrega Sprint 2: prototipo de datos y primeros indicadores.
    • Bitácora individual, semana 5 (cubre la entrega del Sprint 2): se completa hasta el domingo 4 de octubre, 23:59 — formulario (respuestas, acceso del profesor).
    • Juego ML2 actividad de repaso y discusión con preguntas abiertas.
  9. Elegir el gráfico correcto (lunes 05-10-2026, 10:00-12:40)
    • Qué gráfico usar según la pregunta: ranking, tendencia, distribución, composición, correlación o mapa.
    • Caso de estudio: Demographic Profiles, una visualización interactiva que integra población, mortalidad y fecundidad.
    • Errores comunes de visualización y cómo evitarlos.
    • Color, contraste, jerarquía visual y anotaciones.
    • Actividad: rediseño de una visualización confusa.
    • Retroalimentación del Sprint 2 y plan de incorporación de observaciones.
    • Bitácora del ayudante, entrada del Sprint 2: cada ayudante registra una entrada por cada uno de sus estudiantes — Matías (respuestas), Karina (respuestas), Martín (respuestas).
    • Juego ML2 actividad de repaso y discusión con preguntas abiertas.
  10. Visualizaciones multivariadas y narrativas (lunes 19-10-2026, 10:00-12:40)
  11. Diseño de plataformas web de datos (lunes 26-10-2026, 10:00-12:40)
    • Estructura mínima de una plataforma: portada, contexto, datos, visualizaciones, metodología y conclusiones.
    • Opciones de publicación: GitHub Pages, Quarto, Google Sites, Flourish, Datawrapper u otras herramientas aprobadas.
    • Principios de navegación y lectura en pantalla.
    • Entrega Sprint 3: prototipo visual y arquitectura de la plataforma.
    • Bitácora individual, semana 7 (cubre la entrega del Sprint 3): se completa hasta el domingo 1 de noviembre, 23:59 — formulario (respuestas, acceso del profesor).
    • Juego ML2 actividad de repaso y discusión con preguntas abiertas.
  12. Contraparte, usuario y prueba de comprensión (lunes 02-11-2026, 10:00-12:40)
    • Cómo pedir feedback útil a una audiencia no experta.
    • Preparación de una conversación breve con contraparte consultiva o usuario potencial.
    • Prueba de comprensión: ¿qué entiende una persona externa al mirar la plataforma?
    • Actividad: prueba con al menos un usuario potencial.
    • Retroalimentación del Sprint 3 y plan de incorporación de observaciones.
    • Bitácora del ayudante, entrada del Sprint 3: cada ayudante registra una entrada por cada uno de sus estudiantes — Matías (respuestas), Karina (respuestas), Martín (respuestas).
    • Juego ML2 actividad de repaso y discusión con preguntas abiertas.
  13. Comunicación oral de datos (lunes 09-11-2026, 10:00-12:40)
  14. Taller final de plataforma (lunes 16-11-2026, 10:00-12:40)
    • Trabajo guiado en sala.
    • Revisión final de claridad visual, coherencia narrativa y trazabilidad de datos.
    • Preparación de presentación final: máximo 10 minutos + 5 minutos de preguntas.
    • Revisión final de la bitácora individual y de la evidencia de contribuciones.
    • Bitácora individual, semana 9 (víspera del demo day): se completa hasta el domingo 22 de noviembre, 23:59 — formulario (respuestas, acceso del profesor).
    • Juego ML2 actividad de repaso y discusión con preguntas abiertas.
  15. Presentaciones finales: demo day de plataformas de datos (lunes 23-11-2026, 10:00-12:40)

Evaluación

La evaluación del curso se compone de los siguientes elementos, cuyas ponderaciones suman 100%:

Calendario de la bitácora individual: se completa nueve veces durante el semestre, siempre los domingos hasta las 23:59, cubriendo la semana que termina. No hay bitácora en las clases introductorias, en las clases de retroalimentación, en las semanas sin clase ni en el demo day. Se cuentan las ocho mejores de las nueve entradas: perder una semana no afecta la nota. Cada entrada toma unos tres minutos: dos preguntas breves y un texto libre. Los ayudantes las leen antes de la clínica del lunes, así que es también la vía más rápida para avisar que algo se está trabando. La síntesis final de la bitácora se entrega el 23 de noviembre.
Bitácora del ayudante: en paralelo, cada ayudante lleva su propio registro de seguimiento de los estudiantes que tiene asignados: una entrada por estudiante y por sprint, más una síntesis final del semestre. No es una evaluación adicional ni pondera en la nota; es la contraparte docente de la bitácora individual, y sirve para que una dificultad detectada en septiembre no se descubra recién en noviembre. Las cuatro entradas caen justo en las clases que no tienen bitácora de estudiante, con las bitácoras de la semana a la vista. Cada ayudante tiene su propio formulario, y cada registro lo ven sólo el profesor y quien lo escribió.

Después de cada sprint, los equipos recibirán retroalimentación mediante una rúbrica y comentarios escritos u orales. La entrega siguiente deberá señalar qué observaciones se incorporaron, cuáles no y por qué.

Criterios transversales