Inscríbete para acceder a todas las lecciones de este curso.
Lección 1 de 56· Empieza aquí: por qué las características deciden el modelo
Dos científicos de datos reciben el mismo dataset de solicitudes de crédito y el mismo encargo: predecir qué solicitudes entrarán en mora.
No es una historia excepcional. Es el patrón más repetido del machine learning aplicado: el techo de tu modelo lo pone la representación de tus datos, no el algoritmo. Cambiar de modelo te mueve unos puntos; cambiar cómo representas la información te mueve el problema entero.
(Cifras ilustrativas del caso que trabajarás en el curso: las medirás tú mismo en la próxima lección, sobre datos reales generados en tu navegador.)
Este curso empieza donde terminan los fundamentos de machine learning. Damos por hecho que ya has hecho esto al menos una vez:
| Ya lo sabes hacer | Lo repasaremos solo en una línea |
|---|---|
Separar X / y y hacer un train_test_split | Sí, pero aquí se vuelve una frontera sagrada |
modelo.fit(X_train, y_train) y .predict() | Sí, es el último eslabón de todo lo que construiremos |
| Leer una métrica (accuracy, ROC-AUC, RMSE) | Sí, la usaremos como juez de cada feature nueva |
| Distinguir clasificación de regresión | Sí, damos por sentado el vocabulario |
Si eso te suena familiar, estás exactamente donde debes estar. Todo lo que veremos ocurre ANTES del .fit() del modelo — ese territorio que en los tutoriales aparece como una línea mágica de X = pd.get_dummies(df) y que en el trabajo real se lleva el 70 % del tiempo y casi toda la ganancia.
Este es el flujo completo que sabrás construir al terminar. No te preocupes si ahora hay cajas que no reconoces: cada una es un módulo del curso.
Fíjate en la caja final: el entregable no es un modelo suelto, es un Pipeline completo que va de datos crudos a predicción. Esa es la diferencia entre un notebook bonito y algo que puede usarse en producción sin que nadie tenga que reconstruir a mano diez transformaciones.
Para que las técnicas no se sientan sueltas, todo el curso gira alrededor de un caso realista y coherente: una fintech latinoamericana, AndinaCredit, que otorga créditos de consumo y necesita anticipar qué solicitudes entrarán en mora a 90 días.
Cada fila del dataset solicitudes es una solicitud de crédito, y contiene deliberadamente todos los dolores de cabeza reales a la vez:
| Columna | Tipo | Por qué está aquí |
|---|---|---|
edad, antiguedad_laboral_meses | numérica con nulos | practicar imputación |
ingreso_mensual | numérica muy sesgada, con nulos | practicar transformaciones no lineales |
monto_solicitado, plazo_meses, tasa_ofrecida | numéricas en escalas dispares | practicar escalado y razones derivadas |
ciudad | categórica de alta cardinalidad | ver dónde one-hot se rompe |
nivel_educativo | categórica con orden real | ver cuándo el orden importa |
tipo_empleo, canal, tiene_vivienda_propia | categóricas nominales (con nulos) | one-hot y manejo de faltantes |
fecha_solicitud | fecha ISO | descomponer el tiempo en señales |
proposito_texto | texto libre | TF-IDF y features simples de texto |
mora_90d | 0/1 | la variable objetivo |
A partir del módulo 9 se suma un segundo dataset, pagos: el histórico de cuotas por cliente (varias filas por persona), del que aprenderás a agregar el pasado en features a nivel de solicitud — con toda la disciplina que eso exige para no mirar al futuro.
No hay que descargar nada: cada notebook genera el mismo dataset en tu navegador, con los mismos valores, así que puedes retomar cualquier lección sin preparar nada.
Este curso es sobre todo manos a la obra. Lo que te vas a encontrar:
handle_unknown='ignore'? ¿qué imputa SimpleImputer(strategy='median')?) entran a un sistema de repaso espaciado que te los vuelve a mostrar justo antes de que los olvides.Una regla de oro del curso: usamos Pipeline y ColumnTransformer de scikit-learn desde temprano, no transformaciones a mano. No es purismo. Es la única forma sistemática de evitar la fuga de datos (data leakage) — ese error silencioso en el que tu validación miente y descubres el problema en producción.
Los módulos 1 a 14 construyen las piezas. El módulo 15 las junta: un proyecto de extremo a extremo en el que asumes el encargo real de AndinaCredit y entregas un pipeline de riesgo crediticio completo, en cinco hitos:
ColumnTransformer completo, con un tratamiento por tipo de variable.Es, literalmente, la pieza que enseñarías en una entrevista técnica. Y el módulo 16 te lleva de este navegador a tu propia máquina, para que sigas construyendo con Python instalado localmente.
Al terminar sabrás mirar un dataset crudo y saber exactamente qué hacer con cada columna — y encapsularlo en un pipeline reproducible que no te traicione cuando llegue un dato nuevo, una categoría desconocida o un valor faltante inesperado.
No hace falta que domines todo desde el primer día. Cada lección añade una pieza y la practicas de inmediato; para el módulo 6 ya estarás construyendo ColumnTransformer completos casi sin pensarlo.
En la próxima lección, "Tu primera mejora medible en 5 minutos", vas a abrir un notebook y hacer esto tú mismo: entrenar una LogisticRegression sobre los datos crudos de AndinaCredit, ver su ROC-AUC, aplicar tres transformaciones básicas, y volver a medir. En unos minutos vas a tener tu propio número — la evidencia, con tu código, de que las features deciden el modelo.
No necesitas instalar nada. Solo pulsar ejecutar. Nos vemos ahí.
US$ 39,00 USD