- Prototipo de RAG en horas, no días
- Uno menos servicio que operar
- Cost inline en cada operación (mismo tokenización que /v1/embeddings)
- Aisla por org via RLS de Supabase
- Más de ~1M chunks — el índice HNSW empieza a costar RAM en Postgres
- Metadata filtering complejo (hybrid search, reranking) — usa una DB dedicada
- Ya tienes pipeline de embeddings — no ganas nada
Crear colección
id del store, que usarás en las siguientes llamadas.
Subir texto
- Split del texto en chunks de ~512 tokens con 64 de overlap
- Embed todos los chunks (batch al proveedor)
- Insert en pgvector con tu
metadata - Cobra los
input_tokensdel embedding
Consultar top-k
similarity va de 1 (idéntico) a -1 (opuesto). En la práctica útil > 0.7.
Otros endpoints
GET /v1/vector-stores— lista todos los stores de tu orgGET /v1/vector-stores/:id— detalle + filesDELETE /v1/vector-stores/:id— borra store + cascade a files y chunks
Costos
- Embedding de upload y query: tokens × precio del modelo del store
- Almacenamiento: gratis en v1 (subject a change si empieza a costar)
- Query: solo el embedding de la query (no del corpus almacenado)
Roadmap
- Upload de PDF/DOCX con parsing server-side
- Hybrid search (BM25 + vectors)
- Metadata filtering con
filter: { key: value } - Chunking configurable por semantic boundaries (usando LLM)