OpenAI logo
OpenAI

Whisper

Powerful speech recognition model supporting multilingual transcription and translation

Category Audio Model ID whisper-1
Language Support99+ languages
Model TypeAutomatic Speech Recognition (ASR)
Input Formatmp3, mp4, wav, m4a, etc.

Pricing & Specs

💰 Pricing

Price$0.006 / minute

⚙️ Specs

Language Support99+ languages
Model TypeAutomatic Speech Recognition (ASR)
Input Formatmp3, mp4, wav, m4a, etc.
Max File Size25MB

API Examples

Python

from openai import OpenAI

client = OpenAI(
    base_url="https://api.zairouter.com/v1",
    api_key="your-api-key"
)

audio_file = open("audio.mp3", "rb")
transcript = client.audio.transcriptions.create(
    model="whisper-1",
    file=audio_file,
    language="zh"  # Optional: specify language
)

print(transcript.text)

cURL

curl https://api.zairouter.com/v1/audio/transcriptions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -F file="@audio.mp3" \
  -F model="whisper-1" \
  -F language="zh"

Model Features

Whisper is OpenAI's advanced speech recognition model, supporting multilingual and multi-task capabilities:

  • Multilingual Support: Recognizes and transcribes 99+ languages
  • High Accuracy: Maintains high accuracy across various audio quality conditions
  • Speech Translation: Directly translates foreign language audio to English
  • Strong Robustness: Can handle background noise and accents

Use Cases

  • Meeting recording and transcription
  • Subtitle generation
  • Voice content analysis
  • Multilingual translation
  • Voice assistants

Performance Advantages

Whisper maintains excellent recognition accuracy across various languages and audio quality conditions, making it the preferred solution for speech-to-text conversion.