/v1/audio/speech compatible con el SDK de OpenAI: mismo body shape, misma forma de respuesta (audio binario con Content-Type según el formato). Soporta respuesta completa o streaming y respeta las flags ZDR de la organización.
Sintaxis
Content-Type indica el formato.
Formatos de salida
Streaming en tiempo real
Pasastream: true para recibir audio en chunks a medida que el modelo lo genera (latencia perceptual menor):
Instrucciones de tono (gpt-4o-mini-tts)
El modeloopenai/gpt-4o-mini-tts acepta instructions con prompt de estilo:
Modelos disponibles
Estructura de precios
Los modelos TTS se cobran por caracteres de texto sintetizado, no por tokens ni segundos. Esto refleja como facturan los proveedores y hace el costo predecible: 1000 caracteres son ~150 palabras independientemente de cuánto duren al hablar. Geek Hub aplica el +5% de markup estándar.Pre-flight ZDR
Si tu org exige ZDR para el grupo del modelo TTS, o si la request llevazdr: true, el gateway verifica antes de procesar. Si no está verificado, HTTP 422 con la lista de modelos alternativos.
Ver Zero Data Retention.