Microphone Configuration
Dictation
Ambient Conversation
Maintain average loudness around –12 dBFS RMS with peaks near –3 dBFS for optimal speech-to-text normalization.
Channel Configuration
Choosing the right channel configuration ensures accurate transcription, speaker separation, and diarization across different use cases.Streams Endpoint
Mono Audio Stream with Diarization
Mono Audio Stream with Diarization
Multichannel Audio Stream with Participants
Multichannel Audio Stream with Participants
Diarization Disabled
Diarization Disabled
Transcripts Endpoint
Mono Audio File with Diarization
Mono Audio File with Diarization
Multichannel Audio File with Participants
Multichannel Audio File with Participants
Audio File Diarization Disabled
Audio File Diarization Disabled
Audio streaming recommendations
Additional Notes
- Enabling diarization is typically only required on mono audio.
- Mono audio with diarization disabled will produce transcripts with one channel (-1), whereas diarized-mono transcripts will have two channels (0, 1).
- For multichannel audio, each channel should capture only one speaker’s microphone feed in order to avoid cross-talk or echo between channels.
- A maximum of 8 audio channels are supported in a given audio stream or recording.
- Keep all channels aligned in time; do not trim or delay audio streams independently.
- Ensure each channel contains only one participant’s feed to avoid duplicated transcript content.
- Recommended capture format is 16-bit / 16 kHz PCM
Please contact us if you need more information about supported audio formats or are having issues processing an audio file.Additional references and resources: