Guide 3Ljud

Ljud: röst och musik har helt olika villkor

Ljud brukar behandlas som ett material. Det är tre: en röst som säger något, musik som bär en stämning och ljudmiljön som binder ihop dem. De har olika krav, olika fällor och — i röstens fall — en fråga om samtycke som ingen prompt löser.

Publicerad · Senast granskad

Del tre av fyra. Del två om rörligt går igenom klippning; det här är ljudspåret till samma produktion.

Arbetsprovet: röst och ljud till Formarkivet


Kort sagt

Röst är en identitetsfråga, musik är en hantverksfråga. En röst tillhör någon, och den som lånar ut sin röst ska veta till vad och hur länge. Musik och ljudmiljö handlar i stället om att beställa något som går att klippa: rätt längd, rätt uppbyggnad och utrymme för tal.

Arbeta i två pass. Lås först manus, uttal och rösttagning. Bygg därefter musik, miljö och mix runt den godkända rösten. Om musiken väljs först börjar du lätt regissera rösten för att passa ett bakgrundsspår som egentligen skulle ha anpassats till talet.

Rösten: samtycke före teknik

En syntetisk röst byggd på en verklig person är den enda delen av det här materialet där tekniken är den enkla halvan. Frågan är inte om det går utan om personen vet vad hen gått med på.

Praktiskt betyder ett användbart samtycke fyra saker: vad rösten får användas till, var den får publiceras, hur länge tillståndet gäller, och hur personen tar tillbaka det. Ett muntligt ”javisst, kör på” i en inspelningspaus är inget av detta. Det behöver inte vara ett tungt dokument, men det ska finnas skrivet och personen ska ha en kopia.

Två gränser är värda att sätta hårt, oavsett vad avtalet säger. En syntetisk röst ska aldrig läsa något som personen skulle kunna hållas ansvarig för — påståenden, löften, ställningstaganden. Och den ska aldrig användas där lyssnaren rimligen tror att det är en direkt inspelning av personen i en verklig situation.

Aldrig utan personen

Att klona en röst från publicerat material — en podd, en intervju, ett föredrag — är tekniskt enkelt och alltid fel utan personens vetskap. Det gäller också röster som ”bara” används internt, i ett utkast eller för att prova en idé. Ett utkast läcker.

Avtalsformuleringar, rättslig grund och märkning av syntetisk röst i arbetslivet behandlas i yrkesguiden för kommunikatörer på AI på svenska. Den här guiden stannar vid produktionens del: fråga först, skriv ner det och spara beslutet tillsammans med ljudfilerna.


Uppläsning: skriv för örat, inte för ögat

En text som fungerar på skärm behöver ofta skrivas om för uppläsning, och felet kan ligga i texten snarare än i rösten. Långa inskjutna satser kan tappa lyssnaren. Siffror och förkortningar behöver provlyssnas. Parenteser saknar en självklar hörbar motsvarighet.

Skriv om siffror och förkortningar. ”ca 15 %” blir ”cirka femton procent”. Det är enklare att skriva ut i manus än att felsöka en konstig uppläsning.
Korta meningarna. Det som kräver ett andetag i mitten är för långt. Dela.
Markera pauser med interpunktion. Punkt och nytt stycke gör mer för rytmen än någon inställning i verktyget.
Lyssna igenom hela, en gång, utan att göra något annat. Fel i uppläsning hörs; de syns inte i vågformen.

Namn är en återkommande fälla: personnamn, ortnamn och produktnamn kan uttalas fel på samma sätt genom hela tagningen. Skriv namnet fonetiskt i manus om verktyget inte har ett uttalslexikon, och kontrollera just de raderna först.

Röstbeställning
SPRÅK: Svenska med neutral och konsekvent regional färgning
RÖSTKARAKTÄR: Tydlig, varm och saklig; mellanregister utan press
TEMPO: Jämnt, ungefär 135–145 ord per minut
ENERGI: Inbjudande men inte reklammässig
NÄRHET: Nära och ren studioröst, utan viskning
UTTAL ATT PROVA: Formarkivet; Ytor som minns; Storgatan tolv
PAUSER: Kort paus efter evenemangets namn och före tid och plats
HÅLL FAST: Samma tempo, tonhöjd och avstånd genom hela tagningen
Verktygsberoende råd — ElevenLabs Voice Design, verifierat 15 augusti 2026. Leverantörens Voice Design-guide använder bland annat språk, röstkaraktär, klang, tempo och känsloläge som styrning. Dokumentationssidan anger ingen modellversion, så fälten ovan är ett arbetsunderlag, inte ett löfte om att alla röstverktyg har samma reglage eller tolkar orden likadant. Kontrollera igen senast 15 november 2026 eller när funktionen byter modell.

Från skärmtext till röstmanus

Faktaarket innehåller komprimerade uppgifter som fungerar på en affisch men inte i en uppläsning. Skriv först ut allt som örat annars behöver avkoda.

Underlag, inte uppläsningsklart

Formarkivet: kvällsvisning ”Ytor som minns”, tors 10/9 kl. 18–20, Storgatan 12. Fri entré. Boka via länken.

Manus för örat

På torsdag, den tionde september, öppnar Formarkivet kvällsvisningen Ytor som minns. Vi ses på Storgatan tolv, mellan klockan arton och tjugo. Entrén är fri. Boka din plats via länken i inlägget.

Om ”Formarkivet” uttalas som två felaktiga ord gör du en separat provrad med en fonetisk hjälpskrivning, exempelvis ”Form-arkivet”, eller lägger uttalet i verktygets uttalslexikon. Hjälpskrivningen används bara i röstverktyget och tas bort ur det publicerade transkriptet. Lägg inte in fonetik i hela manuset innan du har hört ett verkligt uttalsfel.

Välj röst med samma prov varje gång

Prova aldrig en röst med tre olika texter. Då vet du inte om skillnaden ligger i rösten eller i repliken. Använd hela Formarkivet-manuset och sätt ett betyg från ett till tre på fyra saker: begriplighet, uttal av namn och siffror, jämnhet mellan meningar och om tonen passar en informationsfilm. En etta på begriplighet eller uttal fäller rösten oavsett totalpoäng.

Två tagningar med samma röst
TAGNING A — PROV
Läs med hög energi och tydligt säljande betoning. Håll tempot uppe.
RESULTAT: Evenemangets namn hörs, men datumet pressas ihop och tonen
          låter som reklam. Underkänd.

TAGNING B — VALD
Läs lugnt och sakligt med en lätt inbjudande ton. Gör en kort paus
efter ”Ytor som minns” och före ”mellan klockan arton och tjugo”.
RESULTAT: Namn, datum och tid går att skriva ner efter en lyssning.
          Godkänd som röstspår.

Musik: beställ en byggsten, inte ett verk

Musik till en produktion har ett annat jobb än musik man lyssnar på. Den ska rymma tal, tåla att klippas och gärna kunna sluta någorlunda där ditt material slutar.

Musikbeställning
ROLL: [bakgrund under tal / anslag / övergång / eftertext]
KÄNSLA: [två eller tre ord, inte fem]
INSTRUMENT: [det som ska höras, och det som inte ska höras]
TEMPO OCH PULS: [långsam jämn puls / ingen tydlig puls]
UTVECKLING: [håller samma nivå hela vägen / bygger mot slutet]
LÄNGD: [den längd du faktiskt behöver, plus marginal]

INTE MED: [sång eller ord, om musiken ligger under tal;
           plötsliga slag; abrupt slut]
Ifylld musikbeställning för Formarkivet
ROLL: Bakgrund under berättarröst, sedan åtta sekunders avslutning
KÄNSLA: Nyfiken, lugn, taktil
INSTRUMENT: Mjuk synthpad och dämpade träslag med luft mellan anslagen
TEMPO OCH PULS: Cirka 80 slag per minut, jämn och diskret puls
UTVECKLING: Samma låga nivå under talet, öppnar sig svagt efter sista ordet
LÄNGD: 35 sekunder så att början och slutet kan klippas

INTE MED: Sång, tal, framträdande melodi, plötsliga slag eller abrupt slut
Verifieringsregel för verktygsberoende fält. Lägg raden ”inte med” i ett separat negativfält bara när dokumentationen för den aktuella musikmodellen säger att fältet stöds. Annars är raden ett urvalskriterium: ett spår med sång eller ett abrupt slut underkänns även om resten låter bra. Skriv verktyg, modellversion och testdatum i ändringsloggen när ett negativfält används.

Den viktigaste raden är den första. Musik som ska ligga under tal behöver lämna plats i mellanregistret, frekvensområdet där mycket av talets tydlighet finns, och bör inte ha melodier som drar uppmärksamhet från orden. Musik som ska bära ett anslag får göra tvärtom. Beställer du utan att ange rollen riskerar du att få något som låter bra ensamt men kämpar mot rösten.

Räkna med att klippa. Ett spår som är trettio sekunder och ska vara tjugotvå klipps på en jämn punkt i pulsen och tonas ut — det är normal ljudläggning, inte ett misslyckande i beställningen.


Ljudnivåer: den detalj som avgör intrycket

Fler produktioner går sönder på nivåer än på materialval. Börja med örat, men sluta inte där: en leverans behöver också två mätvärden. LUFS beskriver upplevd ljudstyrka över tid. True peak, skrivet dBTP, uppskattar de högsta topparna efter digital omvandling och visar om exporten riskerar att slå i taket.

1
Rensa och sätt rösten först. Klipp bort fel tagning, klick och onödigt tomrum. Justera rösten till en jämn nivå innan musik eller miljö läggs på.
2
Gör plats med nivå och EQ. Sänk först musiken. Om orden fortfarande maskeras, minska försiktigt det frekvensområde i musiken där talets tydlighet sitter i stället för att bara höja rösten.
3
Dämpa musiken när talet börjar. Ducking är en tillfällig automatisk eller manuellt ritad nivåsänkning under talet. Omkring tre decibel är en startpunkt, inte ett krav. Om musiken hörbart pumpar upp och ner är sänkningen för stor eller för snabb.
4
Mät hela mixen. Formarkivets interna provmål är ungefär −16 LUFS integrerat och högst −1 dBTP. Det värdet gäller arbetsprovet; en beställares, radio- eller tv-kanals eller plattforms leveransspecifikation går alltid före.
5
Lyssna där materialet används. Prova hörlurar för småfel, mobilhögtalare för taluppfattbarhet och telefonen på armlängds avstånd i ett normalt rum för vardagslyssning.
Källbundet mätvärde — verifierat 15 augusti 2026. EBU R 128 version 5 använder −23 LUFS och true peak för broadcast. Formarkivets −16 LUFS är ett internt provmål för ett annat användningsfall. Poängen är inte att ett tal är universellt, utan att rätt leveransspecifikation ska stå nedskriven innan mixen godkänns. Kontrollera standardversion och mottagarens krav igen inför varje ny leverans.

Ljudmiljön: det tredje materialet

Mellan rösten och musiken ligger det som sällan beställs: rummet. En torr röst, oavsett hur den skapats, kan kännas frikopplad från bilderna. Ett tunt lager av rumsklang eller omgivningsljud kan placera den i samma miljö; prova med och utan lagret och behåll det bara om rösten fortfarande är tydlig.

Beställ ljudmiljön som en egen byggsten, i samma anda som musiken: vilket rum eller vilken plats, vilken tid på dygnet, och vad som absolut inte ska höras. Använd den sista raden som kontroll — enskilda händelser som en dörr eller ett skratt kan göra en annars jämn miljö omöjlig att loopa utan att händelsen upprepas.

Två praktiska regler. Miljöljud ska ligga så lågt att man märker det först när det försvinner. Och det ska aldrig innehålla något som kan förväxlas med information — ett telefonljud i bakgrunden får lyssnaren att titta upp från det du faktiskt säger.

Ljudmiljö för Formarkivet
PLATS: Ett stilla mindre utställningsrum på kvällen
RUM: Kort, mjuk rumsklang med dämpade väggar
BAKGRUND: Jämn mycket låg ventilationsluft och avlägsen stad utanför
RÖRELSE: Ingen enskild händelse ska dra uppmärksamhet
LOOP: Början och slutet ska kunna mötas utan hörbar skarv

INTE MED: Röster, steg, dörrar, telefonsignaler eller tydliga slag

Leveransen: mix, stammar och följesedel

Skicka inte bara den komprimerade filmfilen. Formarkivets ljudpaket innehåller en stereomaster i WAV, 48 kHz och 24 bitar, plus tre lika långa filer som börjar på samma tidskod: röst, musik och miljö. Då kan nästa person ändra musiknivån utan att försöka plocka isär en färdig mix. Om mottagaren anger ett annat format följer du den specifikationen i stället.

Följesedel för ljudpaketet
PROJEKT: Formarkivet — Ytor som minns
MIX: formarkivet-mix-v01.wav — stereo, 48 kHz, 24 bit
RÖST: formarkivet-rost-v01.wav — start 00:00:00
MUSIK: formarkivet-musik-v01.wav — start 00:00:00
MILJÖ: formarkivet-miljo-v01.wav — start 00:00:00
TRANSKRIPT: formarkivet-transkript-v01.txt
PROVMÅL: cirka −16 LUFS integrerat, högst −1 dBTP
RÖSTBESLUT/SAMTYCKE: [sökväg eller ärende-id, inte personuppgifter här]
GRANSKAD AV: [namn och datum]
Taluppfattbarhet. Namn, datum, tid och adress kan skrivas ner efter en lyssning i mobilhögtalare.
Uttal och tagning. Rätt rösttagning används genom hela filmen och inga fonetiska hjälpskrivningar har följt med till transkriptet.
Mix och toppar. Integrerad loudness och true peak ligger inom den dokumenterade leveransspecifikationen; ducking hörs inte som pumpning.
Början och slut. Ingen stavelse kapas, musiken får ett avsiktligt slut och miljöloopen har ingen hörbar skarv.
Paketet. Master, tre stammar, rättat transkript och följesedel har samma versionsnummer och går att öppna.
Definition av klart

Ljudet är klart när en godkänd rösttagning bär alla kontrollerade fakta, musik och miljö lämnar plats för varje ord, mixen klarar både lyssningsprov och dokumenterade mätmål och mottagaren får separata stammar, transkript och följesedel. Ett muntligt godkännande av en klonad röst räknas inte som en del av leveransen.


Ljud utan bild är otillgängligt

Allt tal som publiceras behöver finnas som text — för den som inte hör, för den som lyssnar utan ljud, och för den som söker. Det gäller poddavsnitt lika mycket som en trettio sekunder lång film.

Ett automatiskt transkript är ett utkast, inte en leverans: namn, fackord och siffror kan bli fel, och en text utan skiljetecken är svårläst även när orden stämmer. Undertexter och transkript går igenom vad som måste rättas för hand och i vilken ordning.

Nästa del
Text: enklast att generera, svårast att granska
→