Transcribe audio
Upload or record. Tiny model detects language from audio, then Whisper transcribes.
Live transcribe
Stream mic audio to the backend over WebSocket. Partial transcripts appear as you speak.
Idle
Synthesize speech
Kokoro TTS — one model preloaded; pick language or a specific voice.
Kokoro keeps all voices in memory after first load.