Arbetsprovet: röst och ljud till Formarkivet
- Ingångsläge. Den klippta sekvensen och de fyra kontrollerade fakta som står på guideöversikten.
- Lärmål. Efter provet kan du regissera och välja en rösttagning, göra plats för tal i musik och lämna en mätbar mix som någon annan kan justera.
- Det som ändras. Manus skrivs för örat, röstens tempo och energi provas, och musik och rumsljud läggs under talet.
- Leverans. En vald rösttagning, stereomaster, separata stammar, rättat transkript och följesedel.
- Genomförandetid. Cirka 60–90 minuter efter att sekvensen är låst, utöver eventuell genereringstid.
- Godkänt när. Namn, datum och tid går att uppfatta i mobilhögtalare, musiken täcker inga ord och allt tal finns som kontrollerad text.
Röst är en identitetsfråga, musik är en hantverksfråga. En röst tillhör någon, och den som lånar ut sin röst ska veta till vad och hur länge. Musik och ljudmiljö handlar i stället om att beställa något som går att klippa: rätt längd, rätt uppbyggnad och utrymme för tal.
Rösten: samtycke före teknik
En syntetisk röst byggd på en verklig person är den enda delen av det här materialet där tekniken är den enkla halvan. Frågan är inte om det går utan om personen vet vad hen gått med på.
Praktiskt betyder ett användbart samtycke fyra saker: vad rösten får användas till, var den får publiceras, hur länge tillståndet gäller, och hur personen tar tillbaka det. Ett muntligt ”javisst, kör på” i en inspelningspaus är inget av detta. Det behöver inte vara ett tungt dokument, men det ska finnas skrivet och personen ska ha en kopia.
Två gränser är värda att sätta hårt, oavsett vad avtalet säger. En syntetisk röst ska aldrig läsa något som personen skulle kunna hållas ansvarig för — påståenden, löften, ställningstaganden. Och den ska aldrig användas där lyssnaren rimligen tror att det är en direkt inspelning av personen i en verklig situation.
Att klona en röst från publicerat material — en podd, en intervju, ett föredrag — är tekniskt enkelt och alltid fel utan personens vetskap. Det gäller också röster som ”bara” används internt, i ett utkast eller för att prova en idé. Ett utkast läcker.
Avtalsformuleringar, rättslig grund och märkning av syntetisk röst i arbetslivet behandlas i yrkesguiden för kommunikatörer på AI på svenska. Den här guiden stannar vid produktionens del: fråga först, skriv ner det och spara beslutet tillsammans med ljudfilerna.
Uppläsning: skriv för örat, inte för ögat
En text som fungerar på skärm behöver ofta skrivas om för uppläsning, och felet kan ligga i texten snarare än i rösten. Långa inskjutna satser kan tappa lyssnaren. Siffror och förkortningar behöver provlyssnas. Parenteser saknar en självklar hörbar motsvarighet.
Namn är en återkommande fälla: personnamn, ortnamn och produktnamn kan uttalas fel på samma sätt genom hela tagningen. Skriv namnet fonetiskt i manus om verktyget inte har ett uttalslexikon, och kontrollera just de raderna först.
SPRÅK: Svenska med neutral och konsekvent regional färgning RÖSTKARAKTÄR: Tydlig, varm och saklig; mellanregister utan press TEMPO: Jämnt, ungefär 135–145 ord per minut ENERGI: Inbjudande men inte reklammässig NÄRHET: Nära och ren studioröst, utan viskning UTTAL ATT PROVA: Formarkivet; Ytor som minns; Storgatan tolv PAUSER: Kort paus efter evenemangets namn och före tid och plats HÅLL FAST: Samma tempo, tonhöjd och avstånd genom hela tagningen
Från skärmtext till röstmanus
Faktaarket innehåller komprimerade uppgifter som fungerar på en affisch men inte i en uppläsning. Skriv först ut allt som örat annars behöver avkoda.
Underlag, inte uppläsningsklart
Formarkivet: kvällsvisning ”Ytor som minns”, tors 10/9 kl. 18–20, Storgatan 12. Fri entré. Boka via länken.
Manus för örat
På torsdag, den tionde september, öppnar Formarkivet kvällsvisningen Ytor som minns. Vi ses på Storgatan tolv, mellan klockan arton och tjugo. Entrén är fri. Boka din plats via länken i inlägget.
Om ”Formarkivet” uttalas som två felaktiga ord gör du en separat provrad med en fonetisk hjälpskrivning, exempelvis ”Form-arkivet”, eller lägger uttalet i verktygets uttalslexikon. Hjälpskrivningen används bara i röstverktyget och tas bort ur det publicerade transkriptet. Lägg inte in fonetik i hela manuset innan du har hört ett verkligt uttalsfel.
Välj röst med samma prov varje gång
Prova aldrig en röst med tre olika texter. Då vet du inte om skillnaden ligger i rösten eller i repliken. Använd hela Formarkivet-manuset och sätt ett betyg från ett till tre på fyra saker: begriplighet, uttal av namn och siffror, jämnhet mellan meningar och om tonen passar en informationsfilm. En etta på begriplighet eller uttal fäller rösten oavsett totalpoäng.
TAGNING A — PROV
Läs med hög energi och tydligt säljande betoning. Håll tempot uppe.
RESULTAT: Evenemangets namn hörs, men datumet pressas ihop och tonen
låter som reklam. Underkänd.
TAGNING B — VALD
Läs lugnt och sakligt med en lätt inbjudande ton. Gör en kort paus
efter ”Ytor som minns” och före ”mellan klockan arton och tjugo”.
RESULTAT: Namn, datum och tid går att skriva ner efter en lyssning.
Godkänd som röstspår.Musik: beställ en byggsten, inte ett verk
Musik till en produktion har ett annat jobb än musik man lyssnar på. Den ska rymma tal, tåla att klippas och gärna kunna sluta någorlunda där ditt material slutar.
ROLL: [bakgrund under tal / anslag / övergång / eftertext]
KÄNSLA: [två eller tre ord, inte fem]
INSTRUMENT: [det som ska höras, och det som inte ska höras]
TEMPO OCH PULS: [långsam jämn puls / ingen tydlig puls]
UTVECKLING: [håller samma nivå hela vägen / bygger mot slutet]
LÄNGD: [den längd du faktiskt behöver, plus marginal]
INTE MED: [sång eller ord, om musiken ligger under tal;
plötsliga slag; abrupt slut]ROLL: Bakgrund under berättarröst, sedan åtta sekunders avslutning KÄNSLA: Nyfiken, lugn, taktil INSTRUMENT: Mjuk synthpad och dämpade träslag med luft mellan anslagen TEMPO OCH PULS: Cirka 80 slag per minut, jämn och diskret puls UTVECKLING: Samma låga nivå under talet, öppnar sig svagt efter sista ordet LÄNGD: 35 sekunder så att början och slutet kan klippas INTE MED: Sång, tal, framträdande melodi, plötsliga slag eller abrupt slut
Den viktigaste raden är den första. Musik som ska ligga under tal behöver lämna plats i mellanregistret, frekvensområdet där mycket av talets tydlighet finns, och bör inte ha melodier som drar uppmärksamhet från orden. Musik som ska bära ett anslag får göra tvärtom. Beställer du utan att ange rollen riskerar du att få något som låter bra ensamt men kämpar mot rösten.
Räkna med att klippa. Ett spår som är trettio sekunder och ska vara tjugotvå klipps på en jämn punkt i pulsen och tonas ut — det är normal ljudläggning, inte ett misslyckande i beställningen.
Ljudnivåer: den detalj som avgör intrycket
Fler produktioner går sönder på nivåer än på materialval. Börja med örat, men sluta inte där: en leverans behöver också två mätvärden. LUFS beskriver upplevd ljudstyrka över tid. True peak, skrivet dBTP, uppskattar de högsta topparna efter digital omvandling och visar om exporten riskerar att slå i taket.
Ljudmiljön: det tredje materialet
Mellan rösten och musiken ligger det som sällan beställs: rummet. En torr röst, oavsett hur den skapats, kan kännas frikopplad från bilderna. Ett tunt lager av rumsklang eller omgivningsljud kan placera den i samma miljö; prova med och utan lagret och behåll det bara om rösten fortfarande är tydlig.
Beställ ljudmiljön som en egen byggsten, i samma anda som musiken: vilket rum eller vilken plats, vilken tid på dygnet, och vad som absolut inte ska höras. Använd den sista raden som kontroll — enskilda händelser som en dörr eller ett skratt kan göra en annars jämn miljö omöjlig att loopa utan att händelsen upprepas.
Två praktiska regler. Miljöljud ska ligga så lågt att man märker det först när det försvinner. Och det ska aldrig innehålla något som kan förväxlas med information — ett telefonljud i bakgrunden får lyssnaren att titta upp från det du faktiskt säger.
PLATS: Ett stilla mindre utställningsrum på kvällen RUM: Kort, mjuk rumsklang med dämpade väggar BAKGRUND: Jämn mycket låg ventilationsluft och avlägsen stad utanför RÖRELSE: Ingen enskild händelse ska dra uppmärksamhet LOOP: Början och slutet ska kunna mötas utan hörbar skarv INTE MED: Röster, steg, dörrar, telefonsignaler eller tydliga slag
Leveransen: mix, stammar och följesedel
Skicka inte bara den komprimerade filmfilen. Formarkivets ljudpaket innehåller en stereomaster i WAV, 48 kHz och 24 bitar, plus tre lika långa filer som börjar på samma tidskod: röst, musik och miljö. Då kan nästa person ändra musiknivån utan att försöka plocka isär en färdig mix. Om mottagaren anger ett annat format följer du den specifikationen i stället.
PROJEKT: Formarkivet — Ytor som minns MIX: formarkivet-mix-v01.wav — stereo, 48 kHz, 24 bit RÖST: formarkivet-rost-v01.wav — start 00:00:00 MUSIK: formarkivet-musik-v01.wav — start 00:00:00 MILJÖ: formarkivet-miljo-v01.wav — start 00:00:00 TRANSKRIPT: formarkivet-transkript-v01.txt PROVMÅL: cirka −16 LUFS integrerat, högst −1 dBTP RÖSTBESLUT/SAMTYCKE: [sökväg eller ärende-id, inte personuppgifter här] GRANSKAD AV: [namn och datum]
Ljudet är klart när en godkänd rösttagning bär alla kontrollerade fakta, musik och miljö lämnar plats för varje ord, mixen klarar både lyssningsprov och dokumenterade mätmål och mottagaren får separata stammar, transkript och följesedel. Ett muntligt godkännande av en klonad röst räknas inte som en del av leveransen.
Ljud utan bild är otillgängligt
Allt tal som publiceras behöver finnas som text — för den som inte hör, för den som lyssnar utan ljud, och för den som söker. Det gäller poddavsnitt lika mycket som en trettio sekunder lång film.
Ett automatiskt transkript är ett utkast, inte en leverans: namn, fackord och siffror kan bli fel, och en text utan skiljetecken är svårläst även när orden stämmer. Undertexter och transkript går igenom vad som måste rättas för hand och i vilken ordning.