IA y Machine Learning · revisado en agosto de 2026
Embeddings
Un embedding es una representación numérica de un texto (o imagen) como un vector de números en un espacio de muchas dimensiones, construida de forma que elementos con significado parecido queden cerca entre sí en ese espacio. Es la base de la búsqueda semántica y de sistemas como RAG.
# similitud coseno entre dos embeddings ya calculados
import numpy as np
def similitud(a, b):
return np.dot(a, b) / (np.linalg.norm(a) * np.linalg.norm(b))Preguntas frecuentes
¿En qué se diferencia un embedding de un token?
Un token es una unidad de texto discreta; un embedding es el vector numérico continuo que representa el significado de un texto completo (o de un token) dentro de un modelo, permitiendo comparar significados con operaciones matemáticas como similitud coseno.
¿Para qué sirve la búsqueda por similitud de embeddings?
Para encontrar documentos o fragmentos relevantes a una pregunta aunque no compartan las mismas palabras exactas — buscando por cercanía semántica en el espacio vectorial en lugar de coincidencia de texto literal.
¿Dónde se guardan los embeddings para consultarlos rápido?
En una base de datos vectorial (o una extensión vectorial de una base relacional), optimizada para buscar los vectores más cercanos a uno dado entre millones de embeddings.