ArtikelLjud

AI-röst som uttalar rätt: bygg en uttalslista före inspelningen

Ett namn blir fel efter sju minuters perfekt uppläsning. Du rättar ordet, genererar om stycket och får en ny betoning i nästa mening. Problemet började inte i rösten utan i arbetsordningen. Flytta uttalskontrollen före slutgenereringen: märk riskerna, prova dem i en kort remsa och spara den lösning som faktiskt hördes rätt.

Publicerad · Senast granskad

Lila anslagstavla med vita pappersremsor, en genomskinlig linjal och en lodrät lila markering
Samla uttalsriskerna på en kort provremsa och dra gränsen före slutgenereringen: efter godkännandet ska varje namn, siffra och förkortning ha en dokumenterad lösning.

Kort sagt

Prova de osäkra orden innan du provar hela manuset. Markera namn, förkortningar, tal, datum, klockslag, symboler och språkbyten. Lägg varje risk i en naturlig mening på en provremsa. Korrigera först genom att skriva ut det som ska sägas, därefter med ett alias och sist med en uttalsordbok om verktyget stöder det. Lås original, talad form, metod, röst och testdatum i samma lista. Då är ett godkänt uttal en produktionsinställning, inte ett minne.

Markera riskerna utan att rätta dem

Börja i det godkända manuset och gör ett rent riskpass. Ändra ingenting ännu. Ring i stället in sådant som kan läsas på mer än ett rimligt sätt: person- och ortnamn, produktnamn, initialförkortningar, måttenheter, webbadresser, belopp, datum och klockslag. Markera också enstaka engelska ord i svensk text. En språkmodell kan byta uttalsmönster mitt i meningen även när varje ord ser självklart ut på skärmen.

Särskilt tal behöver få en avsikt. 12/9 kl. 08.30 kan i en kalendertext betyda den tolfte september klockan åtta trettio, medan ett ledigare manus kanske vill säga på fredag halv nio. Båda kan vara begripliga men bara en form passar beställningen. Samma sak gäller 3,5 %, X2 och 1177: skriv bredvid hur lyssnaren faktiskt ska höra dem.

Håll risklistan kort. Vanliga svenska ord som rösten redan läser rätt behöver inte flyttas över. Om allt markeras går det inte att se vad som kräver beslut, och du börjar lätt införa hjälpskrivningar som försämrar ett uttal som fungerade från början. Ljudguiden visar helhetsflödet från röstbeställning till mix och leverans; här stannar vi vid den uttalskontroll som ska vara klar innan rösttagningen låses.

Namn och fackord. Markera varje ord där beställaren eller en sakkunnig behöver avgöra vad som är rätt.
Tal och tecken. Markera siffror, datum, tider, valutor, procent, snedstreck och måttenheter.
Förkortningar. Bestäm om de ska läsas som bokstäver, som ett ord eller utvecklas till hela uttrycket.
Språkbyten. Markera främmande namn och fraser även när stavningen ser enkel ut.

Bygg en provremsa som är kort men inte konstgjord

Klistra inte in ett ensamt riskord tio gånger. Uttalet påverkas av orden före och efter, skiljetecknen och den språkmodell som rösten uppfattar i meningen. Gör i stället en provremsa på ungefär sex rader. Varje rad ska bära en risk i samma sorts sammanhang som i slutmanuset. Ta gärna med två ord före och två efter. Då hör du både själva ordet och om korrigeringen skapar en märklig paus eller betoning.

Använd samma röst, modell, språkval och grundinställningar som i produktionen. Byter du röst mellan prov och slutgenerering har du bara bevisat att den första rösten kunde läsa remsan. Spara ljudfilen med versionsnummer, exempelvis uttalsprov-v03.wav, och skriv versionsnumret i listan. Ett grönt statusfält utan motsvarande ljudprov är inget godkännande.

Provremsa före slutgenerering
1  Välkommen till Nordform X2 i Västerås.
2  Provet börjar den tolfte september klockan åtta trettio.
3  Förbrukningen minskade med tre komma fem procent.
4  Frågan skickas vidare till E U-gruppen efter lunch.
5  Läs mer på exempel punkt se snedstreck ljud.
6  Ring elva sjuttiosju om textens avsändare kräver den formen.

RÖST/MODELL: [exakt val]
SPRÅK:       [inställning]
PROVFIL:     uttalsprov-v03.wav
LYSSNARE:    [namn eller roll]
UTFALL:      [radnummer godkända / behöver ny variant]

Exemplen visar arbetsformen, inte ett facit för varje uppdrag. Om varumärkesägaren vill att X2 ska sägas på engelska eller vårdredaktionen föreskriver en annan läsning är det den avsikten som ska in i remsan. Uttalslistan ska dokumentera ett beslut, inte gissa fram ett officiellt uttal.


Välj den minsta korrigering som håller

Testa en metod i taget. Om du samtidigt skriver om meningen, byter språk och lägger till fonetik vet du inte vilken ändring som löste felet. Börja med den metod som är lättast att läsa, flytta och granska.

1
Skriv ut den talade formen. Byt 3,5 % mot tre komma fem procent i röstmanuset. För datum, tal, symboler och förkortningar är detta ofta den tydligaste lösningen. Behåll den skrivna originalformen i det publicerade transkriptet när den är lättare att läsa där.
2
Prova ett alias eller en hjälpskrivning. Om ett namn fortfarande blir fel, ersätt det i röstverktyget med en stavning eller fras som ger rätt ljud. Aliaset hör hemma i uttalslistan och röstmanuset, inte i rubriker, undertexter eller kundens originalmanus.
3
Använd uttalsordbok när stödet är verifierat. Ett fonetiskt lexikon kan ge konsekvens över många manus, men bara om vald modell, språk och format stöder regeln. Lås därför verktygs- och modellversion tillsammans med posten och provlyssna igen efter modellbyte.
4
Skriv om meningen om ordet fortfarande faller. Flytta riskordet, dela meningen eller ersätt en symbol med en hel fras. Den bästa korrigeringen är ibland att ge rösten bättre sammanhang, inte mer fonetik.

ElevenLabs aktuella dokumentation rekommenderar att tal, datum, symboler och förkortningar skrivs ut med ord så som de ska sägas. Dokumentationen beskriver också automatisk textnormalisering, men normalisering är inte ett facit: ett tal kan fortfarande ha flera avsedda läsningar. På webben är normalisering påslagen som standard och i Studio är standardläget automatiskt, enligt dokumentationen kontrollerad den 22 augusti 2026. Skriv därför ut den kritiska formen själv när uttalet måste vara bestämt.

Verktygsberoende råd — ElevenLabs uttalsordböcker, verifierat 22 augusti 2026. Leverantörens API-guide anger att fonemtaggar i uttalsordböcker bara fungerar med modellerna eleven_flash_v2 och eleven_v3. Andra modeller hoppar över fonemtaggarna och behöver alias. För IPA- eller CMU-uttal på andra språk än engelska anger guiden eleven_v3. Det här är ett exempel på varför listan måste bära modell och testdatum; stödet ska kontrolleras igen vid modellbyte.

Lås listan så att den går att återanvända

En användbar uttalslista behöver både det läsbara originalet och den maskinella lösningen. Spara minst åtta fält: original, kategori, avsedd talad form, vald metod, exakt inmatning i verktyget, provmening, röst eller modell samt status och testdatum. Lägg gärna till vem som godkände namn som kräver sakkunskap. Då kan nästa producent se skillnaden mellan låter rimligt och godkänt av beställaren.

Uttalslista per produktion
ORIGINAL:       12/9 kl. 08.30
KATEGORI:      datum och tid
SKA HÖRAS SOM: den tolfte september klockan åtta trettio
METOD:         utskriven form
INMATNING:     den tolfte september klockan åtta trettio
PROVMENING:    Provet börjar [INMATNING] i sal två.
RÖST/MODELL:   [exakt val]
STATUS:        godkänd i uttalsprov-v03.wav
TESTAD:        2026-08-22
GODKÄND AV:    [namn eller roll]

ÄNDRAS NÅGOT AV RÖST, MODELL, SPRÅK ELLER MENING:
sätt status till "måste provas igen".

Håll listan nära manusversionen. Om en godkänd post återkommer i nästa film kan du återanvända lösningen som första kandidat, men inte godkännandet. En ny röst, en uppdaterad modell eller bara en annan mening kan ändra uttal och prosodi. Det är också därför hjälpskrivningen aldrig får ersätta originalet i listan: annars vet nästa person inte vilket läsbart ord aliaset hör till.

När remsan är godkänd gör du en sista sökning i hela röstmanuset efter varje originalform. Kontrollera att rätt metod används vid varje träff och att inget nytt datum, namn eller artikelnummer har tillkommit efter språkgranskningen. Generera sedan ett kort stycke ur slutmanuset innan du beställer hela filen. Den kontrollen fångar skillnaden mellan provmeningen och verklig kontext utan att du behöver göra om en lång tagning.


Håll isär det rösten läser och det publiken läser

Röstmanuset får innehålla tre komma fem procent och ett alias för ett svåruttalat namn. Undertexten ska däremot följa den skrivna formen som publiken behöver, exempelvis 3,5 % och namnets korrekta stavning. Om hjälpskrivningen kopieras till transkriptet har du löst ett ljudfel genom att skapa ett textfel.

Exportera därför två tydligt namngivna filer: ett röstmanus med uttalsstyrning och ett publiceringsmanus utan den. När ljudet är färdigt kontrolleras transkript och undertexter mot den faktiska uppläsningen enligt arbetsgången för undertexter och transkript. Om du först vill jämföra språk och modell i Adobe Firefly finns det korta grundprovet i nyheten om Generate Speech; den här listan tar vid när en produktion ska låsas oavsett verktyg.

Vanligaste leveransfelet

Ett alias smyger in i den synliga texten. Sök efter varje hjälpskrivning före export och kontrollera att den bara finns i röstmanuset eller verktygets uttalsordbok. Originalstavningen ska finnas kvar i manusarkiv, undertexter och transkript.


Definition av klart

Alla namn, tal, datum, förkortningar, symboler och språkbyten i slutmanuset har bedömts som risk eller vanlig text. Varje risk finns i en kort provremsa och i uttalslistan med original, avsedd talad form, metod, exakt inmatning, röst eller modell, provfil, testdatum och godkännare. En sökning visar att lösningen används vid varje träff i röstmanuset. Ett stycke ur den verkliga sluttexten är provlyssnat, och inga alias eller fonetiska hjälpskrivningar har följt med till den publika texten.