Audio and Speech Models

collections/audio · 32 models

Audio routes covering speech synthesis, transcription, music, and sound design. Billing is per character or per minute depending on the model, and the unit is shown on the card.

Models

32

Labs

10

model creators

From (input)

Varies

per 1M tokens

Max context

Varies

Private routes

8 / 32

up to Private

In this collection32

Ordered by strongest privacy.

Nvidia
Parakeet ASR
nvidia/parakeet-asr
Private

Parakeet ASR is a speech-to-text transcription model. Accurate transcription across languages, accents, and noisy audio.

Private|Unknown context|$0.006/min|
OpenAI
Whisper Large V3
openai/whisper-large-v3
Private

Whisper Large V3 is a speech-to-text transcription model. Accurate transcription across languages, accents, and noisy audio.

Private|Unknown context|$0.006/min|
OpenAI
Wizper (Whisper v3)
openai/wizper-whisper-v3
Private

Wizper (Whisper v3) is a speech-to-text transcription model. Accurate transcription across languages, accents, and noisy audio.

Private|Unknown context|$0.006/min|
Qwen
Qwen 3 TTS 0.6B
qwen/qwen-3-tts-0.6b
Private

Qwen 3 TTS 0.6B is a text-to-speech model. Natural, expressive speech with clear articulation.

Private|Unknown context|$87.50/1M chars|
Qwen
Qwen 3 TTS 1.7B
qwen/qwen-3-tts-1.7b
Private

Qwen 3 TTS 1.7B is a text-to-speech model. Natural, expressive speech with clear articulation.

Private|Unknown context|$112.50/1M chars|
Venice
Chatterbox HD (Resemble AI)
venice/chatterbox-hd-resemble-ai
Private

Chatterbox HD (Resemble AI) is a text-to-speech model. Natural, expressive speech with clear articulation.

Private|Unknown context|$50.00/1M chars|
Venice
Kokoro Text to Speech
venice/kokoro-text-to-speech
Private

Kokoro Text to Speech is a text-to-speech model. Natural, expressive speech with clear articulation.

Private|Unknown context|$3.50/1M chars|
Venice
Orpheus TTS
venice/orpheus-tts
Private

Orpheus TTS is a text-to-speech model. Natural, expressive speech with clear articulation.

Private|Unknown context|$62.50/1M chars|
ace
ACE-Step 1.5
ace-step/ace-step-1.5
Anonymous

Feature-rich song generation with optional lyrics and detailed musical controls.

Anonymous|Unknown context||from $0.03/track
ElevenLabs
ElevenLabs Multilingual v2
elevenlabs/elevenlabs-multilingual-v2
Anonymous

Multilingual text-to-speech using ElevenLabs. Supports 29 languages with high-quality natural-sounding voices, configurable speed, and accent accuracy.

Anonymous|Unknown context||$0.12/1K chars
ElevenLabs
ElevenLabs Music
elevenlabs/elevenlabs-music
Anonymous

High-quality instrumental music generation with configurable duration. Best for polished, production-ready tracks across a wide range of genres.

Anonymous|Unknown context||from $0.69/track
ElevenLabs
ElevenLabs Music v2
elevenlabs/elevenlabs-music-v2
Anonymous

High-quality realistic music generation with optional vocals and configurable duration. Best for polished, production-ready tracks across a wide range of genres.

Anonymous|Unknown context||from $0.69/track
ElevenLabs
ElevenLabs Music v2.5
elevenlabs/elevenlabs-music-v2.5
Anonymous

Latest ElevenLabs music generation with higher-quality realistic tracks, optional vocals, and configurable duration. Best for polished, production-ready songs across a wide range of genres.

Anonymous|Unknown context||from $0.69/track
ElevenLabs
ElevenLabs Scribe V2
elevenlabs/elevenlabs-scribe-v2
Anonymous

ElevenLabs Scribe V2 is a speech-to-text transcription model. Accurate transcription across languages, accents, and noisy audio.

Anonymous|Unknown context|$0.01/min|
ElevenLabs
ElevenLabs Sound Effects
elevenlabs/elevenlabs-sound-effects
Anonymous

Generate high-quality sound effects from text descriptions using ElevenLabs. Ideal for films, games, and digital content with configurable duration.

Anonymous|Unknown context||$0.14/min
ElevenLabs
ElevenLabs TTS v3
elevenlabs/elevenlabs-tts-v3
Anonymous

Generate natural text-to-speech audio using ElevenLabs Eleven-v3. High-quality voices with stability control and automatic text normalization.

Anonymous|Unknown context||$0.12/1K chars
ElevenLabs
ElevenLabs Turbo v2.5
elevenlabs/elevenlabs-turbo-v2.5
Anonymous

ElevenLabs Turbo v2.5 is a text-to-speech model. Natural, expressive speech with clear articulation.

Anonymous|Unknown context|$62.50/1M chars|
Gemini
Gemini 3.1 Flash TTS
google/gemini-3.1-flash-tts
Anonymous

Gemini 3.1 Flash TTS is a text-to-speech model. Natural, expressive speech with clear articulation.

Anonymous|Unknown context|$187.50/1M chars|
DeepMind
Lyria 3 Pro
google/lyria-3-pro
Anonymous

Google's Lyria 3 Pro generates full-length, structured songs up to 3 minutes long from a single text prompt. Supports vocals, lyrics, and multi-language generation across genres.

Anonymous|Unknown context||$0.10/track
Minimax
MiniMax Music 2.0
minimax/minimax-music-2.0
Anonymous

Full song generation with vocals and lyrics. Provide your own lyrics with verse/chorus structure for complete songs with singing.

Anonymous|Unknown context||$0.04/track
Minimax
MiniMax Music 2.5
minimax/minimax-music-2.5
Anonymous

Advanced song generation with vocals, lyrics optimizer, and instrumental mode. Supports structure tags and up to 3500 character lyrics.

Anonymous|Unknown context||$0.18/track
Minimax
MiniMax Music 2.6
minimax/minimax-music-2.6
Anonymous

Latest MiniMax song generation with vocals, instrumental mode, and support for rich structure tags in lyrics.

Anonymous|Unknown context||$0.18/track
Minimax
MiniMax Speech-02 HD
minimax/minimax-speech-02-hd
Anonymous

Clone your voice from a short recording and generate natural speech in it across 30+ languages.

Anonymous|Unknown context|$125.00/1M chars|
Stability
Stable Audio 2.5
stabilityai/stable-audio-2.5
Anonymous

Fast, lightweight audio generation for sound effects, ambient textures, and short musical clips. Flexible duration from 5 seconds to over 3 minutes.

Anonymous|Unknown context||$0.19/track
Venice
Gradium TTS
venice/gradium-tts
Anonymous

Gradium TTS is a text-to-speech model. Natural, expressive speech with clear articulation.

Anonymous|Unknown context|$47.50/1M chars|
Venice
Inworld TTS-1.5 Max
venice/inworld-tts-1.5-max
Anonymous

Inworld TTS-1.5 Max is a text-to-speech model. Natural, expressive speech with clear articulation.

Anonymous|Unknown context|$12.50/1M chars|
Venice
MMAudio V2
venice/mmaudio-v2
Anonymous

Generate synchronized audio and sound effects from text prompts with MMAudio V2.

Anonymous|Unknown context||$0.06/min
Venice
Seed Audio 1.0
venice/seed-audio-1.0
Anonymous

Generate expressive multilingual speech and audio from a text prompt with BytePlus Seed Audio 1.0 (20 languages, timestamp length control).

Anonymous|Unknown context||$0.17/min
Venice
Sonilo V1.1 Music
venice/sonilo-v1.1-music
Anonymous

Generate licensed, commercial-use-safe music with precise control over style, mood, instrumentation, and duration.

Anonymous|Unknown context||$0.17/min
Venice
Sonilo V1.1 Sound Effects
venice/sonilo-v1.1-sound-effects
Anonymous

Generate licensed, commercial-use-safe sound effects with precise control over type, texture, intensity, and duration.

Anonymous|Unknown context||$0.12/min
Grok
xAI Speech to Text v1
x-ai/xai-speech-to-text-v1
Anonymous

xAI Speech to Text v1 is a speech-to-text transcription model. Accurate transcription across languages, accents, and noisy audio.

Anonymous|Unknown context|$0.00186/min|
Grok
xAI TTS v1
x-ai/xai-tts-v1
Anonymous

xAI TTS v1 is a text-to-speech model. Natural, expressive speech with clear articulation.

Anonymous|Unknown context|$18.75/1M chars|

This list is rebuilt from the live catalog rather than stored as a snapshot, so it tracks pricing, context windows, and privacy tiers as providers change them. Ordering is yours to pick, and there is no popularity option: prompts are never retained, and the usage metadata kept for billing is not turned into a public ranking.

Explore more collections

Strongest guarantee in this collection:Private

Audio and Speech Models - AnonRouter