Audio AI UX patterns
Audio patterns for voice input, live transcription, summarization, and voice-driven actions.
Essential
Show listening state, live transcript, and safe interrupt for voice turns.
More in Audio
Audio
Interruptibility
Single gesture to pause or cancel
Audio
Real-time Translation
Live translation during voice conversations
Audio
Voice Cloning
Clone and use custom voices
Audio
Audio Enhancement
Noise reduction, clarity improvement
Audio
Activation Boundaries
Explicit starts and stops for always-on agents
Audio
Voice Confirmation
Spoken approval for high-stakes voice actions
Audio
Multi-User Awareness
Identify speaker and scope to their permissions
Frequently asked questions
What should I design first for voice AI?
Start with capture feedback, transcript visibility, and clear handoff between listening, processing, and action, not only a mic icon.
How do voice input and dictation modes differ?
Voice input often implies conversational turn-taking. Dictation is one-way speech-to-text into a field. Use different indicators and interruption rules.
When is a live transcript required?
For meetings, interviews, accessibility, and any flow where users must correct words in real time. Delayed transcripts-only hide errors until too late.
What should voice visualizers communicate?
Listening vs processing vs speaking states, and errors like low volume or denied mic permission. Animation without state labels confuses users.
How do voice command patterns stay safe?
Confirm destructive commands, show what will run, and offer text fallback. Ambient voice without confirmation causes costly mistakes.
Which audio patterns support multilingual products?
Real-time translation and language-toggle patterns appear in the catalog. Pair with clear source/target language display so users know what was heard.