Context
N/A
Input
audio
Output
text
Tool calling
Not listed
About this model
Saarika v2.5 is Sarvam AI's legacy speech recognition model designed for Indian languages and accents. It transcribes audio in the same language spoken, excelling in multi-speaker conversations, telephony audio (8kHz), and code-mixed speech. Supports 11 languages (Hindi, Bengali, Gujarati, Kannada, Malayalam, Marathi, Odia, Punjabi, Tamil, Telugu, English) with automatic language detection and speaker diarization. Achieves 4.96% CER and 18.32% WER on VISTAAR benchmark.
Input modalities
audio
Accepted as model input
Providers
Available routing options for this model through OneInfer.
Available
Speech transcription
$0.350 / hour
Routing
OneInfer optimized
Pricing
Current OneInfer pricing for this model.
| Usage | Price |
|---|---|
| Speech transcriptionSTT | $0.350 / hour |
Performance
Published evaluation results associated with this model.
Accuracy
IndicVoices WER (%)20.8
Telephony WER (%)22.1
Efficiency
Real-time Factor0.08
Auto-LID Accuracy (%)94.5
API example
curl -X POST https://api.oneinfer.ai/v1/ula/generate-audio \
-H "Authorization: Bearer YOUR_JWT_TOKEN" \
-F "provider=sarvam" \
-F "model=sarvam/saarika:v2.5" \
-F "file=@audio.mp3"