Sarvam

saarika:v2.5

sarvam/saarika:v2.5
Context

N/A

Input

audio

Output

text

Tool calling

Not listed

About this model

Saarika v2.5 is Sarvam AI's legacy speech recognition model designed for Indian languages and accents. It transcribes audio in the same language spoken, excelling in multi-speaker conversations, telephony audio (8kHz), and code-mixed speech. Supports 11 languages (Hindi, Bengali, Gujarati, Kannada, Malayalam, Marathi, Odia, Punjabi, Tamil, Telugu, English) with automatic language detection and speaker diarization. Achieves 4.96% CER and 18.32% WER on VISTAAR benchmark.

Input modalities

audio

Accepted as model input

Providers

Available routing options for this model through OneInfer.

Available

Speech transcription

$0.350 / hour

Routing

OneInfer optimized

Pricing

Current OneInfer pricing for this model.

UsagePrice
Speech transcriptionSTT$0.350 / hour

Performance

Published evaluation results associated with this model.

Accuracy

IndicVoices WER (%)20.8
Telephony WER (%)22.1

Efficiency

Real-time Factor0.08
Auto-LID Accuracy (%)94.5

API example

curl -X POST https://api.oneinfer.ai/v1/ula/generate-audio \
  -H "Authorization: Bearer YOUR_JWT_TOKEN" \
  -F "provider=sarvam" \
  -F "model=sarvam/saarika:v2.5" \
  -F "file=@audio.mp3"