OpenAI
Whisper
Powerful speech recognition model supporting multilingual transcription and translation
Language Support99+ languages
Model TypeAutomatic Speech Recognition (ASR)
Input Formatmp3, mp4, wav, m4a, etc.
Pricing & Specs
💰 Pricing
Price$0.006 / minute
⚙️ Specs
Language Support99+ languages
Model TypeAutomatic Speech Recognition (ASR)
Input Formatmp3, mp4, wav, m4a, etc.
Max File Size25MB
API Examples
Python
from openai import OpenAI
client = OpenAI(
base_url="https://api.zairouter.com/v1",
api_key="your-api-key"
)
audio_file = open("audio.mp3", "rb")
transcript = client.audio.transcriptions.create(
model="whisper-1",
file=audio_file,
language="zh" # Optional: specify language
)
print(transcript.text)cURL
curl https://api.zairouter.com/v1/audio/transcriptions \
-H "Authorization: Bearer YOUR_API_KEY" \
-F file="@audio.mp3" \
-F model="whisper-1" \
-F language="zh"Model Features
Whisper is OpenAI's advanced speech recognition model, supporting multilingual and multi-task capabilities:
- Multilingual Support: Recognizes and transcribes 99+ languages
- High Accuracy: Maintains high accuracy across various audio quality conditions
- Speech Translation: Directly translates foreign language audio to English
- Strong Robustness: Can handle background noise and accents
Use Cases
- Meeting recording and transcription
- Subtitle generation
- Voice content analysis
- Multilingual translation
- Voice assistants
Performance Advantages
Whisper maintains excellent recognition accuracy across various languages and audio quality conditions, making it the preferred solution for speech-to-text conversion.