Lesson 1 of 33· Orientación: el sistema RAG que vas a construir
Imagina que entras a NimbusTech, una empresa SaaS con cientos de documentos internos —políticas de RR.HH., manuales de producto, guías de soporte, notas de seguridad—. Un empleado pregunta: "¿Cuántos días por semana puedo trabajar de forma remota?". En lugar de buscar a mano entre PDFs, tu sistema recupera el fragmento exacto de la política correcta, redacta una respuesta clara y cita el documento fuente para que cualquiera pueda verificarla.
Eso es lo que vas a construir de principio a fin en este proyecto: un sistema RAG (Retrieval-Augmented Generation) empresarial, completo y funcional, que responde preguntas fundamentadas en una base de conocimiento real, con citas verificables. Al terminar tendrás un artefacto de portafolio que demuestra que sabes ensamblar el patrón que hoy está detrás de la mayoría de los asistentes corporativos de IA.
No es una demo de juguete. Es un pipeline por etapas que vas a ir armando hito a hito hasta integrarlo en una sola clase RAGSystem con un único punto de entrada: le pasas una pregunta, te devuelve una respuesta con sus citas. Por el camino construirás cada pieza:
| Etapa | Lo que construyes |
|---|---|
| Ingesta | Cargar, explorar y limpiar el corpus de NimbusTech |
| Chunking | Trocear los documentos en fragmentos con solapamiento |
| Indexación | Convertir cada chunk en un vector y montar el índice en memoria |
| Recuperación | Encontrar los top-k fragmentos más cercanos por similitud coseno |
| Re-ranking | Reordenar los candidatos para subir lo verdaderamente relevante |
| Generación citada | Redactar la respuesta fundamentada en el contexto, con citas a la fuente |
| Evaluación | Medir la calidad con recall@k, MRR y groundedness |
| Robustez | Endurecerlo frente a preguntas sin respuesta, inyección de prompts y fugas de contexto |
Al final no solo funciona: sabrás qué tan bien funciona y por qué, porque lo habrás medido y estresado tú mismo.
Antes de entrar en detalle, quédate con la foto de alto nivel. Todo lo que construirás encaja en este flujo: la pregunta entra por la izquierda y sale por la derecha convertida en una respuesta con sus fuentes.
Fíjate en esa flecha punteada de abajo: un buen RAG empresarial no solo responde bien, también sabe cuándo callar. Si la base de conocimiento no contiene la respuesta, inventarla es peor que admitir que no la tiene. Construir esa honestidad es parte del proyecto.
Este es un curso ~90 % práctico: casi cada lección es un notebook ejecutable que vas completando y corriendo. Aprenderás construyendo, no leyendo teoría.
Dos frases de contexto sobre el punto de partida: das por sentado que ya entiendes qué es un embedding, cómo la similitud semántica mide cercanía de significado y en qué consiste el patrón RAG a grandes rasgos. Aquí no re-explicamos esos fundamentos: los aplicamos sobre un corpus más grande y realista, y los convertimos en un sistema completo y evaluado. Si necesitas refrescar alguno, lo recordaremos en una línea justo donde haga falta.
Un detalle importante sobre el entorno:
documents) y un conjunto de evaluación con preguntas de referencia (eval_rag). Los reutilizamos lección tras lección para que cada pieza que construyas encaje en la anterior.Si ya llegaste hasta aquí es porque tienes la base necesaria. La diferencia entre "entiendo RAG en teoría" y "construí un sistema RAG que funciona, lo evalué y lo endurecí" es exactamente lo que este proyecto te da. Ve hito a hito, ejecuta cada celda, y al final tendrás algo concreto que mostrar.
Lo que sigue: en la próxima lección no habrá teoría. Cargarás el corpus de NimbusTech y, en un par de minutos, harás tu primera pregunta y obtendrás una respuesta con citas a la fuente —el sistema completo en miniatura— para que veas de una vez hacia dónde vamos. Abre el siguiente notebook y empecemos.
Free