Inscríbete para acceder a todas las lecciones de este curso.
Lección 1 de 26· Empieza aquí: pandas en acción
Imagina que alguien te pasa un archivo con miles de pedidos de una tienda: fechas escritas de mil formas, ciudades con espacios de más, precios sueltos, algunas casillas vacías. La pregunta que te hacen es simple —«¿qué categoría vende más?», «¿cuánto factura cada ciudad?»— pero la respuesta está enterrada bajo el desorden. Ese trabajo de sacar la respuesta limpia y clara desde datos crudos es exactamente lo que hace un analista, y es exactamente lo que vas a aprender aquí.
La herramienta que usaremos es pandas: la biblioteca estándar para trabajar con datos tabulares en Python. Piensa en ella como una hoja de cálculo con superpoderes de programación: cargas datos, los filtras, los limpias, los agrupas y los resumes con unas pocas líneas, de forma reproducible y sobre miles o millones de filas sin despeinarte. Es una de las herramientas más usadas en análisis de datos, ciencia de datos y reporting del mundo real.
La buena noticia: no necesitas ser programador experto. Si sabes leer sintaxis básica de Python (variables, funciones, listas) y has visto NumPy, tienes todo lo necesario. Iremos paso a paso, ejecutando código de verdad, y en pocos minutos ya estarás manipulando tu primer DataFrame.
Este curso es corto, práctico y completable en pocas sesiones. Al final vas a poder tomar un dataset real y:
groupby y tablas dinámicas.merge y concat.Para que todo encaje y no saltes de un ejemplo de juguete a otro, usaremos un mismo dataset durante todo el curso: las ventas de ElectroAndina, una tienda online de electrónica en Latinoamérica. Trabajarás con dos tablas relacionadas:
| Tabla | Qué contiene |
|---|---|
ventas | Un pedido por fila: order_id, fecha, cliente_id, producto, categoria, precio, cantidad, ciudad_envio. |
clientes | Un cliente por fila: cliente_id, nombre, segmento (nuevo/recurrente/vip), ciudad, fecha_alta. |
Y sí: estos datos vienen desordenados a propósito —categorías vacías, ciudades como " medellin " frente a "Medellín", algún envío sin ciudad—. Ese desorden es tu materia prima: aprenderás a limpiarlo y a sacarle respuestas de negocio reales, como en cualquier trabajo de análisis.
Casi todo el curso ocurre en cuadernos interactivos que corren dentro de tu navegador. Gracias a Pyodide (Python compilado para la web), no tienes que instalar nada: el código se ejecuta en tu propia pestaña. Cada cuaderno alterna explicación y celdas de código que puedes ejecutar y modificar —cambia un valor, vuelve a correr, observa qué pasa—. Aprender datos es aprender haciendo, así que ejecuta todo y experimenta sin miedo: nada se rompe.
Cada cuaderno reconstruye el dataset de ElectroAndina inline, así que siempre parte de datos idénticos y reproducibles. Asumimos que ya conoces NumPy y la sintaxis básica de Python; nos apoyaremos en ellos pero el foco es 100% pandas.
Este es el flujo que recorreremos, y es el mismo que seguirás en cualquier proyecto de análisis real:
Cada etapa te acerca un poco más a convertir un archivo desordenado en una conclusión que puedas mostrar a alguien.
No hay mejor forma de entender pandas que verlo funcionar. En la próxima lección construirás tu primer DataFrame en menos de 3 minutos: cargarás los pedidos de ElectroAndina en una tabla de pandas y la explorarás con tus propias manos. Vas a poder hacerlo —nos vemos en la siguiente celda.
Gratis