Skip to main content
POST
cURL

Overview

The Speech-to-Text transcription endpoint converts audio files into text using state-of-the-art speech recognition models. Supports multiple languages, speaker diarization, and various audio formats. Looking for a drop-in OpenAI-compatible STT endpoint? Use POST /api/v1/audio/transcriptions. See api-reference/endpoint/audio-transcriptions.mdx.

Supported Models

  • Whisper-Large-V3: High-accuracy transcription (~$0.0005/min) - Synchronous
  • Wizper: Fast and efficient transcription ($0.01/min) - Synchronous
  • Elevenlabs-STT: Premium transcription with diarization ($0.03/min) - Asynchronous
  • gpt-4o-mini-transcribe: Efficient OpenAI transcription ($0.003/min) - Synchronous
  • gpt-4o-mini-transcribe-2025-03-20: Snapshot ($0.003/min) - Synchronous
  • gpt-4o-mini-transcribe-2025-12-15: Snapshot ($0.003/min) - Synchronous
  • gpt-4o-mini-transcribe-latest: Alias ($0.003/min) - Synchronous
  • openai-whisper-with-video: Video-to-text transcription ($0.06/min) - Synchronous
  • qwen-voice-clone: Voice cloning ($0.25/run) - Asynchronous
  • minimax-voice-clone: Voice cloning ($1.00/run) - Asynchronous

Upload Methods

Direct File Upload (≤3MB)

URL Upload (≤500MB)

Advanced Features - Speaker Diarization

Use Elevenlabs-STT for speaker identification (asynchronous processing):

Language Support

Supports 97+ languages with auto-detection:

Response Examples

Synchronous Response (most models)

Asynchronous Response (Elevenlabs-STT and voice cloning)

Initial response (202):
Final response (when completed):

Authorizations

x-api-key
string
header
required

Body

Audio transcription parameters. Use multipart/form-data for file uploads or application/json for URL-based requests.

audio
file

Direct file upload (max 3MB). Supported formats: MP3, WAV, M4A, OGG, AAC

audioUrl
string<uri>

URL to audio file (alternative to direct upload, supports up to 500MB)

model
enum<string>
default:Whisper-Large-V3

The STT model to use for transcription

Available options:
Whisper-Large-V3,
Wizper,
Elevenlabs-STT,
gpt-4o-mini-transcribe,
gpt-4o-mini-transcribe-2025-03-20,
gpt-4o-mini-transcribe-2025-12-15,
gpt-4o-mini-transcribe-latest,
openai-whisper-with-video,
qwen-voice-clone,
minimax-voice-clone
language
string
default:auto

Language code for transcription (ISO 639-1 or ISO 639-3). Use 'auto' for auto-detection

Example:

"en"

actualDuration
string

Actual audio duration in minutes for accurate billing

diarize
enum<string>
default:false

Enable speaker diarization (Elevenlabs-STT only)

Available options:
true,
false
tagAudioEvents
enum<string>
default:false

Tag non-speech audio events like [laughter], [applause] (Elevenlabs-STT only)

Available options:
true,
false

Response

Synchronous transcription response (Whisper/Wizper models)

transcription
string
required

The transcribed text

Example:

"Hello, this is a test transcription."

metadata
object
required