Fellowi

Så skriver du AI-videoprompter: beskriv rörelsen, inte bilden

Av Fellowi-teamet · · 7 min läsning

Abstrakta indigoblå och violetta bågar som sveper över en mörk ruta som kamerabanor, med en svag filmrutekontur i mitten.

Här är den enda tanke som fixar de flesta dåliga videoprompter: vid bild till video har bilden redan gjort halva jobbet. Det du laddar upp till Fellowi Video avgör vem som är i rutan, vad personen har på sig, var den står, hur ljuset faller. Modellen ser allt det. Så när din prompt lägger trettio ord på att upprepa det har du beskrivit utgångspunkten två gånger och de kommande fyra sekunderna inte alls. Bilden sköter vad. Prompten sköter hur det rör sig.

Har du läst vår guide till att skriva bildprompter, lägg märke till hur annorlunda uppgiften är. En bildprompt bygger en scen från ingenting, så detaljer är din vän. En videoprompt får en färdig scen och lägger till tid. Detaljer om scenen är nu brus; detaljer om rörelse är signalen.

De fem saker en videoprompt bör svara på

Du behöver inte alla fem i varje prompt. Men varje bra prompt svarar på minst två eller tre, och en svag svarar oftast på ingen.

1. Kameran: rör den sig, och hur?

Stilla, långsam åkning framåt, långsam åkning bakåt, mjuk panorering åt vänster eller höger, en lätt handhållen drift. Namnge en. En kamera som rör sig långsamt är det enklaste sättet att få en stillbild att kännas som film, även om ingenting annat förändras.

2. Motivets rörelse: vad gör personen eller föremålet?

Ett huvud som vänds, ett andetag, ett leende som kommer, hår som lyfter i en bris, fingrar som sluts kring en kopp. Litet och specifikt slår stort och vagt. ”Hon ser upp och ler” landar; ”hon rör sig naturligt” lämnar modellen att gissa.

3. Tempot: hur snabbt händer allt detta?

Slow motion, realtid, en lat drift, en snabb blick. Tempot avgör om fyra sekunder känns som ett ögonblick eller som ett montage. Är du osäker, skriv ”långsamt”. Långsamt läses som avsikt; snabbt läses som kaos.

4. Stämning och miljö: vad förändras i världen?

Ljus som flimrar, gardiner som rör sig, regn som börjar, ånga från kaffet, damm i en solstråle. En enda miljödetalj ger scenen en puls och hindrar bakgrunden från att se påklistrad ut.

5. Ljud: vad ska vi höra?

Fellowi Video genererar ljud till varje klipp, och det är i prompten du styr det. Mjukt regn, avlägsen trafik, ett tyst rum med en klocka, vind genom löv, lågmäld bakgrundsmusik. Säger du inget väljer modellen. Säger du en sak lyssnar den oftast.

Före och efter

Samma startbild i varje par. Bara prompten ändras.

Ett porträtt vid ett fönster

Före:”En vacker kvinna med långt mörkt hår i vit skjorta står vid ett fönster i en ljus lägenhet.”

Det är en bildtext. Modellen kan redan varje ord, och ingenting här säger vad som händer.

Efter:”Långsam åkning framåt. Hon vänder huvudet mot fönstret och andas mjukt ut; en hårslinga lyfter i en lätt bris. Gardinen svajar. Tyst rum, ett svagt stadsbrus utanför.”

Kamera, rörelse, miljö och ljud i ett andetag, och ingenting upprepat från bilden.

En fjällsjö i skymningen

Före:”Episk filmisk solnedgång över en sjö med berg, dramatiskt ljus, 4K, hyperrealistiskt.”

Adjektiv om kvalitet gör ingenting för rörelsen, och ”4K” är inget man kan be ett 720p-klipp att vara.

Efter:”Stilla kamera. Ringar sprider sig långsamt över vattnet; molnen driver åt höger; det sista ljuset på topparna mattas något. Vind över vatten, en ensam fågel i fjärran.”

Ett genererat foto från fliken Foto

Före:”Få det att röra sig. Realistiskt. Hon går över rummet, tar sin telefon, sätter sig i soffan, skrattar och vinkar mot kameran.”

Fyra handlingar på fyra sekunder. Modellen försöker med alla och avslutar ingen.

Efter:”Lätt handhållen drift. Hon kastar en blick mot kameran och brister ut i ett långsamt leende. Mjukt inomhusljus flimrar. Dämpad musik från ett annat rum.”

En handling med början och slut, och den får gott om plats i klippet. Vill du också ha promenaden till soffan är det ett andra klipp med en annan startbild, inte en längre mening. Vårt inlägg om att animera dina AI-foton visar hur man bygger en sekvens på det sättet.

Tre misstag som förstör ett klipp

Att beskriva bilden igen

Det vanligaste och det mest förlåtliga, eftersom bildpromptning tränar dig att göra exakt det här. Testa dig själv: täck över bilden och läs din prompt. Om den skulle kunna vara en bildtext till stillbilden har du inte skrivit någon videoprompt ännu. Stryk varje ord modellen redan kan se och lägg dem på rörelse i stället.

För många handlingar på fyra sekunder

Att vända på huvudet tar ungefär en sekund. Ett leende tar en till. Ett steg eller två tar resten. Det är hela klippet. Allt bortom två tydliga rörelser pressas ihop till en suddig massa eller stryks i tysthet. Välj den gest som ögonblicket handlar om och låt kameran och miljön bära resten.

Att motsäga bilden

Sitter personen, be den inte springa. Är det natt, be inte om starkt solljus. Står den med ryggen mot dig, be inte om en närbild på ögonen. Modellen måste respektera startbilden, så en prompt som slåss mot den ger förvrängningar, morfning eller ett ansikte som slutar likna det du laddade upp. Arbeta med det som finns i bilden: rörelsen du ber om ska vara en som just den här rutan trovärdigt kan leda in i.

En liten mall att utgå från

Fyll i det som passar och ta bort resten:

  • Kamera: stilla / långsam åkning framåt / långsam åkning bakåt / mjuk panorering / handhållen drift
  • Motiv: en gest med början och slut
  • Tempo: långsamt / realtid
  • Miljö: en sak som rör sig i bakgrunden
  • Ljud: en eller två ljudledtrådar

Utskrivet: ”Långsam åkning bakåt. Han sänker boken och ser ut på regnet. Lampljuset flimrar. Regn mot glas, sidor som lägger sig till ro.” Det är ungefär tjugo ord, och det är en komplett videoprompt.

Vanliga frågor

Hur lång ska en videoprompt vara?

En till tre korta meningar. Är du över fyrtio ord beskriver du troligen bilden eller staplar handlingar. Skär ner tills bara rörelse, tempo och ljud är kvar.

Ska jag nämna hur personen ser ut?

Bara om det är en del av rörelsen (”hennes hår lyfter”, ”hans halsduk fladdrar”). Utseendet är fastlagt av bilden; att upprepa det ändrar ingenting och tränger ut de användbara orden.

Vad händer om renderingen misslyckas?

En misslyckad rendering debiteras aldrig: coins återbetalas och en plats i Director-kvoten återförs. Den vanliga lösningen är att förenkla: färre handlingar, långsammare tempo och ingen instruktion som bråkar med startbilden. Försök igen med samma bild.

Kan jag be om explicit innehåll?

Fellowi är en 18+-plattform, och vuxet innehåll mellan vuxna är tillåtet. Allt som rör minderåriga eller saknar samtycke avvisas blankt. Reglerna ovan gäller på exakt samma sätt: beskriv rörelsen, håll dig till ett eller två slag och motsäg inte rutan.

Var provar jag det här?

Öppna studion från trollstavsikonen i sidhuvudet, eller gå direkt till fellowi.com/video. Välj en startbild, klistra in din prompt och se vad tjugo väl valda ord kan göra.

Testa själv

En varm, privat AI-följeslagare: 7 dagar gratis med 30 meddelanden, utan kort.

Priser och gränser

Läs vidare