ArtikelRörligt

Dialog och läppsynk i AI-video: beställ i rätt ordning och granska med tre prov

En person som ska säga en replik i bild är inte ett svårare klipp — det är ett annat arbetsflöde. Rösten ska vara godkänd innan munnen ritas, manuset ska vara låst innan ljudet renderas, och synken ska vara ett eget pass med en egen fil. Först därefter går klippet att granska, och då räcker tre prov för att fälla en synk som inte håller.

Publicerad · Senast granskad

En filmremsa löper vågrätt över en ljus pappskiva. En magentafärgad linje skär lodrätt genom remsan och en handritad ruta markerar just den punkten.
Tal och bild är två spår som ska mötas i ett bestämt läge. Läppsynkspasset är stället där avdriften uppstår — och där den går att mäta innan klippet lämnas vidare.

Kort sagt

Lägg aldrig repliken som en rad i den vanliga klippprompten. Beställ i fyra led: godkänd röst, låst manus, separat talkälla och ett eget synkpass. Granska sedan tre saker var för sig — munrörelsen mot konsonanterna, blicken och identiteten över hela klippet, och ljudsynken vid både början och slut. Ett fel i något av proven skickar klippet tillbaka till det led där felet uppstod, inte till en ny promptvariant.

Två vägar till en talande person — och de kostar olika

Den första vägen är att låta videomodellen skapa både bild och tal i samma generering. Googles utvecklardokumentation för Veo, läst 25 augusti 2026, anger att Veo 3.1 genererar ljud tillsammans med videon och att ljudet alltid är på, samt att dialog skrivs som citerad replik i prompten. Samma sida anger klipplängderna 4, 6 eller 8 sekunder, upplösningarna 720p, 1080p och 4K där de två högre bara finns vid 8 sekunder, och bildformaten 16:9 och 9:16. En replik som tar elva sekunder att säga får alltså inte plats i ett klipp, oavsett hur prompten skrivs.

Den andra vägen delar upp arbetet: bilden görs först, talet renderas separat och en synkmodell flyttar munnen till det färdiga ljudet. Vinsten är att du behåller rösten du redan godkänt. Priset är ett extra led med egna gränser. I API-referensen för Klings lipsync-modell, läst 25 augusti 2026, ska källvideon vara MP4 eller MOV på högst 100 MB, vara mellan 2 och 10 sekunder lång, ligga i 720p eller 1080p och ha sidor mellan 720 och 1920 pixlar, medan ljudfilen får vara högst 5 MB och mellan 2 och 60 sekunder. Ljudfönstret är alltså sex gånger längre än bildfönstret — den som skickar in hela speakerspåret mot ett tiosekundersklipp har byggt in felet redan i beställningen.

En tredje variant flyttar en inspelad prestation till en annan gestalt. Runways utvecklardokumentation för indata, läst 25 augusti 2026, anger exempelvis att karaktärsbilder och karaktärsvideor till Act-Two ska ha ett förhållande mellan bredd och höjd på 0,5 till 2,358, och att ljud lämnas som MP3, WAV, FLAC, M4A eller AAC. Poängen är inte den enskilda siffran utan att varje väg har ett eget indatakontrakt som avgör hur du klipper materialet innan du beställer synken. Läs kontraktet en gång och skriv in måtten i beställningen; upptäck dem inte genom ett avvisat jobb.

Tal i samma generering passar när

  • Repliken ryms i en klipplängd på 4–8 sekunder.
  • Rösten inte måste vara samma som i övriga filmen.
  • Personen inte återkommer i ett senare klipp.
  • Klippet bär stämning snarare än exakt information.

Separat synkpass krävs när

  • Rösten redan är godkänd och ska återanvändas.
  • Uttalet av namn eller siffror måste vara låst.
  • Samma person talar i flera klipp.
  • Manuset kan behöva rättas efter första granskningen.

Beställ i fyra led — och byt aldrig ordning

Ordningen är inte en smaksak. Varje led låser något som nästa led bygger på, och varje omkastning gör ett tidigare godkännande ogiltigt. Det är därför rörligt-guiden håller läppsynk utanför den vanliga klippbeställningen och behandlar den som ett eget arbetsflöde.

1
Godkänn rösten först. Röstval, regi och mix ägs av ljudguiden, och uttalet av namn, siffror och förkortningar låses med en uttalslista innan något renderas. Byter du röst efter synkpasset är passet förbrukat: munrörelserna är gjorda mot en annan tidsaxel.
2
Lås manuset per klipp, inte per film. Skriv ut repliken, läs den högt och ta tid. Ligger den över klipplängden delar du den vid en naturlig andningspaus och gör två klipp — du komprimerar inte talet. En replik på ungefär 25 ord tar omkring tio sekunder i lugnt taltempo och är därmed redan för lång för ett åttasekundersklipp.
3
Rendera talkällan som en fil per klipp. Klipp ljudet så att det börjar och slutar där klippet gör det, med högst några tiondelars tystnad i varje ände. Namnge filen efter klippet, inte efter scenen, och spara den tillsammans med prompten och inställningarna som gav den — samma spårbarhet som i ordning på genererat material.
4
Kör synken som ett eget pass med eget filnamn. Blanda aldrig ihop synkversionen med bildversionen. När ett prov faller ska du kunna gå tillbaka till den godkända bilden utan att generera om den, och det går bara om bild, tal och synk ligger som tre separata filer.
Beställningsblad för ett läppsynkat klipp
KLIPP-ID:        [scen-klipp, t.ex. formarkivet-03]
REPLIK:          [ordagrann text, en mening per rad]
UPPMÄTT LÄNGD:   [sekunder, uppläst högt]
KLIPPLÄNGD:      [modellens tillåtna längd för klippet]
RÖST:            [godkänd röstidentitet + uttalslista, version]
TALFIL:          [filnamn, en fil per klipp]
BILDKÄLLA:       [godkänd bild- eller klippfil, version]
SYNKPASS:        [eget filnamn, aldrig samma som bildkällan]
BILDFORMAT:      [bredd × höjd + bildrutor per sekund]
RÄTTIGHET:       [samtycke för ansikte och röst — dokumenterat var]

Prov 1: munrörelsen mot konsonanterna

Titta inte på om munnen rör sig. Titta på om den rör sig rätt. Spela klippet i kvartsfart och stega sedan bildruta för bildruta genom tre ställen: ett p, b eller m, ett f eller v, och ett långt o eller u. De tre grupperna är valda för att de har synliga och ofrånkomliga munformer. Vid p, b och m måste läpparna slutas helt i minst en bildruta; vid f och v ska övertänderna möta underläppen; vid o och u ska läpparna rundas och skjutas fram.

Den vanligaste fallgropen är en mun som hela tiden står halvöppen och rör sig i takt med ljudets styrka utan att någonsin slutas. Det ser rimligt ut i realtid och faller omedelbart i stegning. Saknar repliken helt p, b och m — lägg in ett sådant ljud i provremsan i stället för att lita på helhetsintrycket. Ett enda bilabialt ljud är det billigaste avgörandet du kan göra i hela passet.


Prov 2: blick och identitet över hela klippets längd

Frys första och sista bildrutan och lägg dem bredvid varandra. Jämför ögonavstånd, näsryggens bredd, hakans form, hårfäste och hudton. En synkmodell som arbetar på ansiktet kan låta identiteten glida långsamt genom klippet, och glidningen syns inte när du ser klippet i ett svep.

Var särskilt uppmärksam på klipp där personen vänder bort ansiktet och tillbaka. Klings API-referens beskriver ansiktsdata där samma persons ansikte räknas som ett nytt ansikts-id om det är borta ur bild i mer än en sekund — det som är en person för dig kan vara två för modellen. Kontrollera också blicken: ögon som står helt stilla under en hel replik läses som livlösa, och ögon som glider mot kameran mitt i en mening läses som riktat tilltal. Båda är regi och inte bara teknik, och båda kräver ett nytt pass.


Prov 3: ljudsynk vid klippets början och slut

Mät i två ändar, inte i mitten. Lägg ljudkurvan i klipprogrammet under bilden och sätt en markör vid den första tydliga plosivan — ett p eller t ger en skarp topp som går att peka på. Läppslutningen ska ligga inom en till två bildrutor från toppen. Gör sedan exakt samma mätning på den sista betonade stavelsen i klippet.

Skälet att mäta i båda ändarna är att avdrift ackumuleras. En synk som är rätt i början och två bildrutor fel i slutet är en avdrift, inte en förskjutning, och den går inte att rätta genom att flytta hela ljudspåret. Kontrollera samtidigt att modellen inte har bränt in en textremsa i bilden: en citerad replik i prompten kan tolkas som text som ska synas. Undertexter läggs som riktig text i redigeringen, med reglerna i undertexter och transkript.

Protokoll efter tre prov
KLIPP-ID: [scen-klipp]
1 MUNFORM:   godkänd / underkänd — [p/b/m, f/v, o/u]
2 IDENTITET: godkänd / underkänd — [första vs sista bildrutan]
3 LJUDSYNK:  godkänd / underkänd — [avvikelse i bildrutor, start / slut]

TEXT I BILD: ingen / inbränd → [kräver nytt pass]
FEL UPPSTOD I LED: 1 röst / 2 manus / 3 talfil / 4 synkpass
ÅTGÄRD: rätta i redigering / nytt synkpass / ny bildkälla
SPARAT BEVIS: bildfil, talfil, synkfil och protokollrad

Vad du kan rätta efteråt — och vad som kräver ett nytt pass

Skillnaden avgör om en anmärkning kostar fem minuter eller en ny generering. En jämn förskjutning mellan tal och bild rättas i klipprogrammet genom att flytta ljudet några bildrutor; nivåer, andetag och en för lång tystnad i slutet rättas också där. Klippet kan dessutom kortas i båda ändar så länge repliken är hel.

Fel munform, glidande identitet, död blick, tänder som byter antal eller form mitt i en replik och inbränd text är däremot bildfel. De uppstår i genereringen och går inte att rätta i redigeringen — de kräver ett nytt synkpass eller, om bildkällan är problemet, en ny bildkälla. Att lägga på oskärpa eller klippa bort de dåliga bildrutorna är en nödlösning som oftast syns mer än felet. Kontinuiteten mellan klipp, leveransformatet och slutkontrollen av hela sekvensen ägs fortfarande av rörligt-guiden; den här artikeln lämnar tillbaka klippet dit när de tre proven är gröna.

Om en person över huvud taget får framställas sägande något hen inte har sagt är en rättighets- och samtyckesfråga, inte en teknisk. Den hör hemma i avtalet med den medverkande och behandlas på AI på svenska. Här räcker regeln att beställningsbladet ska ha en rad som pekar ut var samtycket för ansikte och röst är dokumenterat, innan något synkpass körs.

Ordningen som kostar mest

Att köra synkpasset innan rösten är godkänd. Byter du röst efteråt ändras stavelsernas längd, och varje munrörelse i klippet är gjord mot fel tidsaxel — bilden går inte att rädda med en förskjutning. Samma sak gäller manusrättningar: ett ord som läggs till efter synken flyttar allt som kommer efter det. Godkänn röst och manus först, kör synken sist.


Definition av klart

Klippet är klart när beställningsbladet är ifyllt, talfilen hör till exakt ett klipp och protokollet visar godkänt i alla tre prov. Munformen är stegad mot minst ett bilabialt ljud, första och sista bildrutan visar samma person, och ljudsynken är mätt i både början och slutet med högst två bildrutors avvikelse. Bild, tal och synk ligger som tre separata filer med versionsnummer, och det finns en dokumenterad rad om samtycke för ansikte och röst. Först då går klippet tillbaka till sekvensen och den vanliga leveranskontrollen.