Las claves verificadas
- Una base vectorial almacena vectores y busca elementos cercanos mediante una métrica de similitud. Ver evidencia
- Los índices vectoriales pueden combinar búsqueda de vecinos con filtros y metadatos. Ver evidencia
- pgvector agrega búsqueda de similitud vectorial a PostgreSQL. Ver evidencia
- Versionar el modelo de embeddings evita comparar vectores incompatibles. Ver evidencia
Qué es una base de datos vectorial
Una base de datos vectorial guarda representaciones numéricas llamadas vectores y permite buscar los elementos más cercanos a una consulta. Esas representaciones suelen provenir de un modelo de embeddings: una frase, imagen o registro se convierte en una lista de números que captura relaciones útiles para una tarea. Pinecone y Weaviate describen índices especializados para ese tipo de búsqueda.
También puede servirte: Embedding: qué es y cómo se usa en inteligencia artificial
La cercanía se calcula con una métrica, como distancia coseno o producto interno. El resultado no es una verdad sobre el contenido: es una lista ordenada según el modelo y la métrica elegida. Para que sea útil, los vectores deben conservar metadatos que permitan filtrar por permisos, fecha, idioma o tipo de documento.
Cómo se usa en una aplicación de IA
En un flujo de recuperación, la aplicación divide documentos en fragmentos, genera un embedding para cada uno y guarda vector, texto y metadatos. Cuando llega una pregunta, calcula otro embedding y consulta los vecinos más cercanos. Luego entrega esos fragmentos al modelo generativo como contexto. La base vectorial acelera la búsqueda, pero no decide qué afirmación es correcta.
El índice debe actualizarse cuando cambia la fuente. También hay que guardar el identificador del documento y la versión del modelo que creó el embedding. Si se mezclan vectores producidos con modelos incompatibles, las distancias dejan de ser comparables aunque el sistema siga respondiendo.

Guía para elegir una base vectorial
Primero definí la forma de la consulta y el tamaño del conjunto. Para una aplicación pequeña, una extensión como pgvector puede aprovechar PostgreSQL y simplificar operaciones. Para cargas distribuidas, un servicio dedicado puede ofrecer particionado, réplicas y filtros específicos. La elección depende de latencia, volumen, actualizaciones y capacidad del equipo, no sólo del algoritmo de similitud.
Probá con consultas reales y una colección representativa. Medí recuperación de documentos relevantes, tiempo de respuesta, costo y comportamiento cuando se agregan filtros. Guardá ejemplos que deberían aparecer y ejemplos que deberían quedar fuera. Esa evaluación muestra si el problema está en el índice, el modelo de embeddings, el corte de similitud o el texto que se envía al modelo.
Errores frecuentes al buscar por vectores
Un vecino cercano no siempre es una respuesta suficiente. La recuperación puede traer un fragmento parecido pero desactualizado, sin permisos o demasiado corto para sostener una afirmación. Revisá el origen, aplicá filtros antes de mostrar resultados y conservá citas que permitan volver al documento que produjo el vector.
También es un error medir sólo la velocidad. Un índice rápido que recupera contexto irrelevante degrada el resultado final y puede aumentar el costo porque obliga a reintentar. Versioná el modelo, controlá cambios de esquema y registrá la consulta, filtros y documentos recuperados para explicar por qué una respuesta fue posible.

Qué aporta VisteEsto: Nuestro trabajo en esta nota
VisteEsto convierte la definición en un método de decisión: separar vector, texto y metadatos, versionar embeddings y medir relevancia además de latencia.
Fuentes, actualizaciones y metodología 3 fuentes
Fuentes consultadas
- Fuente primariaPinecone: Getting started
- Fuente primariaWeaviate: Vector index
- Fuente primariapgvector: Open-source vector similarity search
Historial de actualización
- Publicación inicial basada en documentación oficial de Pinecone, Weaviate y pgvector sobre índices vectoriales, embeddings y búsqueda de similitud.
Cómo elaboramos esta nota
Definimos la consulta principal “base de datos vectorial qué es y cómo se usa en IA”, contrastamos los datos con 3 fuentes —3 primarias— y revisamos contexto, imágenes y posibles vacíos antes de publicar. Conocé nuestra política editorial y de verificación.



