Bestäm nivåerna i siffror innan du exporterar, inte efter att någon klagat. Skriv tre mätbara rader för hela mixen: en målnivå för integrerad loudness, ett tak för sant toppvärde och en gräns för högsta korttidsnivå. Lägg till två egna diagnosrader som mäter röststammen och musiken under talet var för sig. Mät sedan om värdena efter varje ändring, och avgör med ett samtidighetsprov om rösten fortfarande bär där musiken ligger som tätast.
Örat säger "för lågt" – kontraktet säger hur mycket
Det som gör nivåarbetet svårt är att felet uppstår på två ställen samtidigt. Dels ligger hela klippet på fel nivå i förhållande till nästa video i flödet, dels ligger rösten på fel nivå i förhållande till musiken inuti klippet. De två felen låter olika i hörlurar och nästan likadant på en telefon, och de rättas med helt olika åtgärder. Utan skrivna värden fastnar arbetet i en slinga där du höjer rösten, tycker att musiken blev tunn, höjer musiken och börjar om.
Ett nivåkontrakt bryter slingan genom att göra varje beslut till ett mätvärde som går att upprepa. Kontraktet skrivs innan mixen godkänns, gäller för det här klippet och den här mottagaren, och sparas tillsammans med projektet. Vad de enskilda måtten betyder – LUFS för upplevd ljudstyrka över tid, dBTP för det uppskattade toppvärdet efter digital omvandling – gås igenom i ljudguiden, som också ger sajtens interna provmål. Den här artikeln handlar om raderna i kontraktet och om hur de mäts.
Vad standarden faktiskt mäter – och vad den inte gör åt din röst
EBU R 128 i version 5 från november 2023, läst 8 september 2026, rekommenderar att ett programs loudnessnivå normaliseras till målnivån −23,0 LUFS, och att det sanna toppvärdet inte överstiger −1 dBTP under produktion av linjärt ljud. Mätningen ska göras med en mätare som följer ITU-R BS.1770 med nivågrindning enligt ekvation 7. Rekommendationen gäller EBU:s tillämpningsområde. Din uppdragsgivares eller plattformens skrivna leveransspecifikation går före, och tillägget R 128 s2 konstaterar självt att strömningstjänster typiskt använder en högre målnivå än broadcast-standarderna anger.
Den avgörande meningen för det här problemet står i punkt l: ljudsignalen ska generellt mätas i sin helhet, utan betoning på specifika förgrundselement som tal, musik eller ljudeffekter. Standarden ger alltså inget värde för förhållandet mellan röst och musik – och det är precis det förhållandet du hör som fel. Helhetsmätningen kan visa grönt på ett klipp där rösten är obegriplig. Därför behöver kontraktet både de mått som standarden definierar och egna, tydligt märkta diagnosmått.
Två gränsvärden till är värda att låna. Tillägget R 128 s1 för kort innehåll, som reklam och promor, säger att korttidsnivån inte ska överstiga −18,0 LUFS, vilket är +5,0 LU över målnivån −23,0 LUFS. Uttryckt relativt blir det en användbar regel även när din målnivå är en annan: ingen tresekundersperiod får ligga mer än fem enheter över målet. Samma tillägg säger att Loudness Range inte är användbart för kort innehåll, och R 128 anger i en fotnot att måttet inte rekommenderas för program kortare än en minut eftersom det bygger på för få tresekundersvärden. Sätt alltså inget dynamikkrav på ett klipp på trettio sekunder.
Skriv nivåkontraktet på fem rader
Kontraktet ska rymmas på en skärm och sluta med ett godkännandekriterium. De tre första raderna är de mått R 128 s1 räknar upp för kort innehåll: programmets loudness, högsta korttidsnivå och högsta sanna toppvärde. De två sista är AI-kreatörs egna diagnosrader och står utanför standarden, eftersom en stamvis mätning per definition inte är en mätning av programmet i sin helhet.
MOTTAGARE: kundens leveransspec, daterad och sparad i projektmappen
MÅLNIVÅ: -16,0 LUFS integrerat över hela klippet ±0,5 LU
TAK TOPP: -1,0 dBTP sant toppvärde, uppmätt på exportfilen
MAX KORTTID: målnivå +5,0 LU, alltså -11,0 LUFS korttid (3 s)
DIAGNOS (egen metod, inte en R 128-mätning av programmet):
RÖSTSTAM: integrerad nivå över enbart talpassagerna
MUSIK UNDER: musikstammen mätt över exakt samma passager
SKILLNAD: minst 10 LU röst över musik som arbetsvärde
GODKÄNT NÄR: alla fyra mätvärden ligger innanför sina gränser
och samtidighetsprovet nedan är avklarat.Målnivån −16,0 LUFS i exemplet är ljudguidens interna provmål, inte ett standardvärde – byt ut det mot mottagarens siffra så fort en sådan finns. Skillnaden på 10 LU mellan röst och musik är på samma sätt ett startvärde att pröva. Poängen med raden är inte talet utan att skillnaden blir mätt och nedskriven, så att nästa klipp kan börja på samma plats i stället för på en känsla. Notera också att korttidsraden räknas relativt din egen målnivå: R 128 s1:s absoluta −18,0 LUFS förutsätter målnivån −23,0 LUFS.
Mät i rätt ordning, annars mäter du din egen efterbehandling
Ordningen spelar roll, eftersom varje steg ändrar underlaget för nästa mätning. Mät först röststammen ensam, med musiken avstängd, över enbart talpassagerna. Mät sedan musikstammen ensam över samma passager, med samma automation och samma dämpning under talet som i den färdiga mixen. Skillnaden mellan de två värdena är den siffra som avgör om rösten har plats. Rätta den med musikens nivå och med dämpningen under talet, inte genom att skruva upp rösten mot taket.
Först därefter mäter du hela mixen: integrerad loudness över klippets fulla längd, högsta korttidsnivå och sant toppvärde. Mät på den exporterade filen, inte på tidslinjen, eftersom exporten kan lägga till en utgångsbegränsare eller ett format som ändrar topparna. Ligger ett värde nära sin gräns är det värt att mäta om: R 128 tillåter en tolerans på ±0,2 LU i kvalitetskontrollarbetsflöden just för att ta hänsyn till mätfel, och en avläsning två tiondelar från gränsen är inte ett besked.
Taket −1 dBTP gäller enligt R 128 för linjärt ljud under produktion. Samma punkt tillägger att tillåtna maximala sanna toppvärden kan vara lägre för olika distributionssystem och datareduktionsgrader. Antag alltså inte att −1 dBTP räcker efter att plattformen har komprimerat om ljudet, utan skriv in mottagarens tak i kontraktet när ett sådant finns.
Samtidighetsprovet: 20 sekunder där tal och musik ligger tillsammans
Ett godkänt mätprotokoll är ingen garanti för att rösten uppfattas. Välj därför ut den tuffaste passagen i klippet – där musiken är som tätast och rösten samtidigt säger något som lyssnaren måste förstå – och gör den till ett eget prov. Tjugo sekunder räcker. Provet ska köras i den ordning som ställer högst krav, och tillägget R 128 s2 beskriver varför det andra ledet behövs: det finns två uppspelningsfall med motstridiga krav, ett med tillräcklig uppspelningsförstärkning, headroom och låg bakgrundsnivå, och ett med begränsad förstärkning och headroom eller högre bakgrundsnivå, där smartphones nämns som exempel.
1 HÖRLURAR, normal nivå Skriv ner varje ord du inte uppfattar första gången. 2 TELEFONHÖGTALARE, armlängds avstånd, rummet som vanligt Samma passage. Skriv ner orden igen, utan att höja volymen. 3 JÄMFÖRELSE MOT NÄSTA KLIPP I FLÖDET Spela ditt klipp och ett referensklipp efter varandra utan att röra volymen. Noterar du en nivåskillnad? FÄLLER PROVET: - Ett eller flera ord faller bort i steg 2. - Referensjämförelsen i steg 3 kräver en volymjustering. ÅTGÄRD I DEN HÄR ORDNINGEN: sänk musiken -> fördjupa dämpningen under talet -> mät om allt.
Provet mäter samma sak som kontraktet beställer: om talet bär när musiken ligger under det. Faller något ord i steg 2 är musikens nivå eller dämpningen under talet den första misstänkta, inte röstens nivå. Faller steg 3 handlar det i stället om klippets integrerade nivå som helhet, och då ska du inte röra balansen mellan stammarna alls. Att hålla isär de två åtgärderna är hela poängen med att provet har tre steg.
Om orden faller bort även när nivåerna är rätt ligger felet någon annanstans. En AI-röst som säger ett namn eller en fackterm fel blir svår att uppfatta oavsett mix, och det problemet löses före mixen med en uttalslista för AI-rösten. Ligger repliken dessutom fel mot bilden är det ett timingproblem, inte ett nivåproblem, och hanteras i artikeln om läppsynk och dialog i AI-video. Undertexter ersätter inte en hörbar röst, men de gör klippet användbart för fler och fångar upp det som ändå går förlorat i ett bullrigt rum; arbetsgången finns i artikeln om undertexter och transkript.
Fyra fallgropar i själva mätningen
De fyra fallgroparna nedan är mätfel, inte smakfrågor. Kontrollera dem innan du skickar värdena vidare.
Att mäta ett utsnitt. Programmets loudness är den integrerade nivån över hela klippets längd. Mäter du bara de 20 sekunder du nyss arbetat med får du ett värde som ingen mottagare kommer att räkna fram, och som ändras varje gång du flyttar markören.
Att normalisera sist. Om du höjer hela mixen till målnivån efter att stammarna balanserats kan toppar hamna över taket, och en begränsare som fångar dem ändrar samtidigt talets hörbarhet. Sätt målnivån före den sista topprättningen och mät om båda värdena efteråt.
Att kalla en stammätning för en standardmätning. Diagnosraderna är dina egna. R 128 mäter programmet i sin helhet, och en röststam mätt för sig är inte ett värde som kan jämföras mot rekommendationens målnivå. Skriv ut skillnaden i kontraktet så att nästa person i kedjan inte missförstår siffran.
Att sätta ett dynamikkrav på ett kort klipp. Loudness Range bygger på tresekundersvärden och avråds för program kortare än en minut. Använd i stället korttidsraden, som fångar den enskilda topp i upplevd ljudstyrka som faktiskt får en lyssnare att sänka volymen.
Källor och kontrolltid
Fyra officiella EBU-sidor lästes den 8 september 2026. De stödjer uppgifterna om målnivå, toleranser, mätmetod, taket för sant toppvärde, korttidsgränsen för kort innehåll och de två uppspelningsfallen vid strömning. Nivåkontraktets form, ordningen mellan mätningarna, arbetsvärdet 10 LU och samtidighetsprovet är AI-kreatörs egna arbetsmetoder och står utanför standarden.
- EBU R 128 – publikationssidan – gällande version 5, november 2023, samt deskriptorerna.
- EBU R 128 (2023), fulltext – målnivån −23,0 LUFS, toleranserna, mätning av hela signalen och taket −1 dBTP.
- EBU R 128 s1 (2020) – de tre måtten för kort innehåll, korttidsgränsen −18,0 LUFS och varför Loudness Range utgår.
- EBU R 128 s2 (2023) – de två uppspelningsfallen och att strömningstjänster typiskt använder en högre målnivå.
Du har ett nivåkontrakt som namnger mottagaren och anger målnivå, tak för sant toppvärde och högsta korttidsnivå med enheter. Röststammen och musiken under talet är mätta över samma passager, och skillnaden mellan dem står nedskriven. De tre värdena för hela mixen – integrerad nivå, korttidsnivå och sant toppvärde – är mätta på exportfilen, och kontraktets samtliga fyra värden ligger innanför sina gränser. Samtidighetsprovets tätaste tjugo sekunder är lyssnade i hörlurar, på telefonhögtalare och mot ett referensklipp utan att du rört volymen. Först då är klippet klart att lämna.