Skip to main content
Endpoint /v1/audio/speech compatible con el SDK de OpenAI: mismo body shape, misma forma de respuesta (audio binario con Content-Type según el formato). Soporta respuesta completa o streaming y respeta las flags ZDR de la organización.

Sintaxis

La respuesta es el audio binario directamente (no JSON). El header Content-Type indica el formato.

Formatos de salida

Streaming en tiempo real

Pasa stream: true para recibir audio en chunks a medida que el modelo lo genera (latencia perceptual menor):

Instrucciones de tono (gpt-4o-mini-tts)

El modelo openai/gpt-4o-mini-tts acepta instructions con prompt de estilo:

Modelos disponibles

Estructura de precios

Los modelos TTS se cobran por caracteres de texto sintetizado, no por tokens ni segundos. Esto refleja como facturan los proveedores y hace el costo predecible: 1000 caracteres son ~150 palabras independientemente de cuánto duren al hablar. Geek Hub aplica el +5% de markup estándar.

Pre-flight ZDR

Si tu org exige ZDR para el grupo del modelo TTS, o si la request lleva zdr: true, el gateway verifica antes de procesar. Si no está verificado, HTTP 422 con la lista de modelos alternativos. Ver Zero Data Retention.