Skip to main content
Vector stores es RAG-as-a-service: creas una colección, subes texto, y Geek Hub se encarga de chunking + embedding + almacenamiento en pgvector con índice HNSW. Consulta con top-k por similitud coseno. Cuándo usar esto en vez de tu propio pgvector/Pinecone:
  • Prototipo de RAG en horas, no días
  • Uno menos servicio que operar
  • Cost inline en cada operación (mismo tokenización que /v1/embeddings)
  • Aisla por org via RLS de Supabase
Cuándo NO:
  • Más de ~1M chunks — el índice HNSW empieza a costar RAM en Postgres
  • Metadata filtering complejo (hybrid search, reranking) — usa una DB dedicada
  • Ya tienes pipeline de embeddings — no ganas nada

Crear colección

Devuelve el id del store, que usarás en las siguientes llamadas.

Subir texto

El gateway:
  1. Split del texto en chunks de ~512 tokens con 64 de overlap
  2. Embed todos los chunks (batch al proveedor)
  3. Insert en pgvector con tu metadata
  4. Cobra los input_tokens del embedding
Response:

Consultar top-k

Response:
similarity va de 1 (idéntico) a -1 (opuesto). En la práctica útil > 0.7.

Otros endpoints

  • GET /v1/vector-stores — lista todos los stores de tu org
  • GET /v1/vector-stores/:id — detalle + files
  • DELETE /v1/vector-stores/:id — borra store + cascade a files y chunks

Costos

  • Embedding de upload y query: tokens × precio del modelo del store
  • Almacenamiento: gratis en v1 (subject a change si empieza a costar)
  • Query: solo el embedding de la query (no del corpus almacenado)

Roadmap

  • Upload de PDF/DOCX con parsing server-side
  • Hybrid search (BM25 + vectors)
  • Metadata filtering con filter: { key: value }
  • Chunking configurable por semantic boundaries (usando LLM)