Agents en klantcontact
Wat is tekst-naar-spraak?
Tekst-naar-spraak of TTS zet geschreven tekst om in een gesproken stem. Het is de laatste stap van een voice-agent: het antwoord van het taalmodel wordt hoorbaar gemaakt. Moderne stemmen klinken natuurlijk genoeg dat bellers ze in een kort gesprek vaak niet van een mens onderscheiden.
Ook wel: TTS · Text-to-speech · Spraaksynthese
Er zijn twee dingen die de kwaliteit bepalen en die niets met de stem zelf te maken hebben. Het eerste is snelheid: hoe eerder de eerste lettergreep klinkt, hoe normaler het gesprek voelt. Het tweede is uitspraak van eigennamen, waar elke Nederlandse stem over struikelt als je hem niet helpt.
Dat helpen doe je door de naam fonetisch te schrijven in plaats van correct. Een merknaam die op papier klopt maar verkeerd klinkt, kost je meer geloofwaardigheid dan een spelfout die niemand hoort.
Je kunt ook een stem laten klonen, bijvoorbeeld die van een medewerker. Dat mag alleen met uitdrukkelijke toestemming van die persoon, en dat leg je vast.
Verwante begrippen
Wat is een voice-agent?
Een voice-agent is een AI die telefoongesprekken voert in gewone spreektaal. Hij neemt op, verstaat wat de beller zegt, antwoordt met een natuurlijke stem, en kan onderweg in je agenda of je CRM kijken. Onder de motorkap zitten drie stappen: spraakherkenning, een taalmodel, en tekst-naar-spraak.
Lees verderWat is spraakherkenning?
Spraakherkenning, ook ASR of speech-to-text genoemd, zet gesproken taal om in geschreven tekst. Het is de eerste stap in elke voice-agent: pas als er tekst staat, kan een taalmodel er iets mee. De kwaliteit bepaalt alles wat erna komt, want een verkeerd verstaan woord wordt nooit meer goed.
Lees verder