Alle indsigter

Kan AI lave en videoannonce af jeres rigtige produkt? En guide efter materiale

Hvilke produkter AI-video gengiver godt, og hvilke den tager fejl af, sorteret efter materiale og handling, med et pointskema i seks spørgsmål, der fordeler briefet mellem AI og rigtige optagelser.

Marianne Larsen
AI-producer, AI Vidia

Ja, for de fleste produkter, men med grænser, der følger materialet og handlingen. AI-video gengiver mere pålideligt, hvordan et produkt ser ud, end hvordan det opfører sig. Matte, faste produkter i enkle scener bliver gode, mens klart glas, væsker, småt tryk, hænder på produktet og fine mønstre oftere går galt. Giv jeres produkt og optagelse point nedenfor, så ved I, hvad der skal genereres, og hvad der skal filmes.

Produkter i forskellige materialer på et studiebord i blødt lys, en parfumeflaske i glas, et mat keramikkrus, en strikket sweater og et stålur, med en lodret skærm ved siden af, der viser et nærbillede af glasflasken
Billedet er genereret med AI: produkter i fire materialer på et studiebord med en lodret skærm, der viser et billede af glasflasken.
På denne side7 afsnit
  1. 01Hvorfor rammer AI-video udseendet, men ikke fysikken?
  2. 02Hvilke materialer er nemme for AI-video, og hvilke er svære?
  3. 03Hvorfor går hænder og bevægelige dele oftere galt end selve produktet?
  4. 04Giv jeres produkt point, før I skriver briefet
  5. 05Hvornår bliver en AI-optagelse til en produktdemonstration?
  6. 06Hvad skal I sende, før produktionen går i gang?
  7. 07Hvordan gennemgår I et genereret klip billede for billede?

Nutidens AI-videomodeller gengiver langt bedre, hvordan et produkt ser ud, end hvordan det opfører sig. Et mat keramikkrus på et bord er en nem optagelse. En flaske i klart glas, der hældes af en hånd, med en ingrediensliste, der skal kunne læses, samler fire af de sværeste problemer på fire sekunder.

Stil derfor et skarpere spørgsmål. Hvilke dele af jeres produkt, og hvilke øjeblikke i jeres annonce, rammer en model rigtigt? Nedenfor er produkterne sorteret efter materiale og handling, forskningen viser, hvor modellerne fejler, og et pointskema med seks spørgsmål viser, hvordan I fordeler et brief mellem generering og rigtige optagelser.

Hvorfor rammer AI-video udseendet, men ikke fysikken?

Videomodeller lærer af, hvordan ting ser ud på film. De har ingen indbygget fornemmelse af vægt, friktion eller strømning, så overflader bliver overbevisende, mens samspillet mellem ting bliver ujævnt.

Forskningen peger samme vej på tværs af laboratorier. I sin tekniske rapport om Sora skrev OpenAI, at modellen ikke gengiver mange simple fysiske samspil korrekt, for eksempel glas, der knuses, og at maden ikke altid ændrer sig på skærmen, når nogen spiser af den. Google DeepMind og INSAIT testede derefter Sora, Runway, Pika, Lumiere, Stable Video Diffusion og VideoPoet på væskers bevægelse, optik, faste stoffers mekanik, magnetisme og varme i Physics-IQ-testen. Konklusionen var, at modellernes fysiske forståelse er stærkt begrænset og ikke hænger sammen med, hvor realistiske videoerne ser ud.

Den sidste del er vigtig, når I gennemgår et klip. Det kan se dyrt ud og alligevel vise en pumpe, der bøjer, når man trykker på den.

Modellerne bliver hurtigt bedre, og nyere udgaver klarer tilfælde, som disse studier ikke dækkede. Mønsteret har dog holdt ved hver ny udgave indtil nu: overflader først, samspil sidst.

Hvilke materialer er nemme for AI-video, og hvilke er svære?

Sortér jeres sortiment efter det, kameraet skal vise. Tabellen rangerer almindelige materialer fra det nemmeste til det sværeste at holde korrekt i bevægelse.

Sådan klarer produktmaterialer sig i genereret video. Vurderingerne er AI Vidias produktionsvejledning bygget på kilderne i artiklen, ikke en målt benchmark.
MaterialeEksempler på produkterDet, der typisk går galtVurdering
Mat og fastKeramik, sneakers, møbler, varer i æskeProportionerne glider en smule mellem optagelserneNem
Bløde varer og stofSengetøj, tøj på bøjle, bamserFolder og fald skifter form fra billede til billedeMiddel
Blanke overflader og metalUre, køkkengrej, metalliske lågRefleksioner springer eller viser et rum, der ikke findesMiddel
Trykt emballageHudplejeglas, kosttilskud, fødevarepakkerSmåt tryk tegnes om, staves forkert eller udtværesSvær
Fine gentagne detaljerStrik, kæder, facetslebne sten, flettede kurveMønstre flyder eller smelter sammen, når kameraet bevæger sigSvær
Klart glas og plastParfume, spiritus, vandflaskerKanter og lysbrydning flytter sig, og indholdet svæverSvær
Væsker og gelerDrikke, serummer, saucer, rengøringsmidlerHældninger bryder fysikken, og væskeniveauet ændrer sig af sig selvSværest

Vurdér optagelsen og ikke kun produktet. En parfumeflaske, der står på en sten, er til at håndtere, mens den samme flaske, der sprøjtes på et håndled, samler glas, væske og hænder i ét øjeblik.

Syv produkter på række på et gråt studiebord: et mat keramikkrus, en foldet hørskjorte, et stålur, et hudplejeglas med blank etiket, en strikket sweater, en parfumeflaske i klart glas og et glas appelsinjuice
Billedet er genereret med AI: de syv materialetyper fra tabellen, fra mat keramik til venstre til væske til højre.

Hvorfor går hænder og bevægelige dele oftere galt end selve produktet?

Et samspil er sværere end en genstand. Når en hånd griber om en pumpe, skal to faste ting mødes, trykke og bevæge sig sammen uden at gå igennem hinanden.

VideoPhy-testen målte netop det. Forskerne bag skrev 688 instruktioner, der beskriver fysiske samspil, lavede videoer med modeller som CogVideoX, Pika, Runway Gen-2 og Luma Dream Machine og lod mennesker vurdere, om hver video fulgte instruktionen og overholdt almindelig fysisk sund fornuft. Den bedste testede model, CogVideoX-5B, klarede begge dele i 39,6 procent af tilfældene. Ved samspil mellem to faste ting, den kategori, der dækker en hånd, der drejer et låg eller trykker på en knap, var tallet 24,4 procent.

Hænder og bevægelige dele går oftest galtAndel af genererede videoer, der fulgte instruktionen og overholdt fysikken, bedste testede model (CogVideoX-5B), efter type af interaktion
Hænder og bevægelige dele går oftest galt. Andel af genererede videoer, der fulgte instruktionen og overholdt fysikken, bedste testede model (CogVideoX-5B), efter type af interaktion
PunktVærdi
Alle instruktioner40%
Fast mod fast24%
Fast og flydende53%
Flydende mod flydende44%

VideoPhy, Bansal m.fl., arXiv 2406.03520v2, tabel 3: menneskelig vurdering af 688 instruktioner, oktober 2024

To forbehold holder billedet ærligt. Det er modeller fra 2024, og de nuværende rammer flere instruktioner rigtigt. Physics-IQ fandt den samme svaghed igen i januar 2025, så rækkefølgen af, hvad der går galt, har ikke vendt sig.

For jeres brief er konsekvensen praktisk. Planlæg færre øjeblikke med kontakt. Hold hvert af dem kort, og beslut inden produktionen, hvilke af dem I filmer.

Har I brug for nye annoncer?
Beskriv jeres produkt og det, I vil afprøve.
Send jeres brief

Giv jeres produkt point, før I skriver briefet

Svar på de seks spørgsmål for ét produkt og én planlagt optagelse. De fleste annoncer skal have to eller tre vurderinger, fordi åbningen, produktøjeblikket og beviset sjældent har samme risiko.

VurderingKan AI-video håndtere jeres produkt? Seks spørgsmålSvar for ét produkt og én planlagt optagelse. Summen viser, hvordan I skal fordele arbejdet mellem AI-generering og rigtige optagelser.
  1. Overflade

    Refleksioner og gennemsigtige materialer er svære at holde stabile fra billede til billede.

  2. Tekst, der skal kunne læses

    Hvert billede tegner bogstaverne igen, så småt tryk bliver stavet forkert eller udtværet.

  3. Væske eller forandring

    Hældning, skum, smeltning og damp er der, hvor fysikfejl viser sig først.

  4. Hænder på produktet

    En hånd, der griber, åbner eller påfører produktet, er et møde mellem to faste ting, den svageste kategori i VideoPhy-testen.

  5. Fine strukturer

    Gentagne detaljer flyder eller smelter sammen, når kameraet bevæger sig.

  6. Beviser optagelsen en påstand?

    Absorberer, renser, strækker sig, er vandtæt, passer: hvis optagelsen er beviset, skal produktet i billedet være ægte.

Score: 0 af 12 · 0 af 6 besvaret

Besvar alle spørgsmål for at se vurderingen.

Sådan læser du din score
ScoreVurderingHvad det betyder
0 til 3Generér hele annoncenByg hele annoncen ud fra en referencepakke. Hold shotlisten enkel, og tjek hvert billede for form og farve.
4 til 7Generér scenen, film produktets øjeblikkeLad AI lave omgivelser, åbninger og varianter. Film eller sammensæt de sekunder, hvor produktet berøres, hældes eller skal kunne læses tæt på.
8 til 12Film beviset, generér restenOptag de produktkritiske optagelser og påstandsoptagelserne med rigtigt kamera. Brug AI til åbninger, baggrunde og varianterne omkring dem.

En planlægningsguide bygget på forskningen og produktionsreglerne i artiklen. Den er ikke en målt benchmark.

En lav sum betyder, at I kan bygge hele annoncen ud fra en referencepakke. En sum i midten er det almindelige resultat for fysiske produkter: AI laver omgivelser, åbninger og varianter, og et kamera dækker de få sekunder, hvor produktet berøres eller skal kunne læses. En høj sum sætter rigtige optagelser i centrum, med AI omkring dem.

Hvornår bliver en AI-optagelse til en produktdemonstration?

En optagelse, der viser stemning, er illustration. En optagelse, der viser jeres produkt gøre det, I påstår, er bevis, og bevis har strengere regler.

Grænsen er ældre end AI. I sagen FTC mod Colgate-Palmolive fra 1965 gav USA's højesteret den amerikanske forbrugermyndighed FTC medhold mod en reklame for barberskum, der så ud til at barbere sandpapir, som i virkeligheden var sand limet på plexiglas. Retten skelnede mellem to måder at bruge en rekvisit på. Kartoffelmos i stedet for is i en scene, hvor folk nyder en dessert, var i orden. En opstilling, der blev præsenteret som en rigtig test, var vildledende.

Et genereret klip af et serum, der trænger ind i huden, en plet, der forsvinder fra en skjorte, eller en jakke, der afviser regn, er per definition en opstilling. Generér verdenen omkring produktet. Film selve påstanden med det rigtige produkt, og gem råfilen.

Platformene lægger deres egne regler ovenpå. Læs om AI-annoncer bliver mærket eller afvist for de gældende regler på Meta, TikTok, YouTube og Google Ads.

Hvad skal I sende, før produktionen går i gang?

Kvaliteten af det genererede starter med referencerne. Modeller, der tager referencebilleder, bruger dem til at holde fast i produktets udseende, og Googles dokumentation for Veo 3.1 angiver op til tre referencebilleder pr. klip samt styring af første og sidste billede.

  • Fire rene vinkler af hvert produkt: forfra, bagfra og begge sider, på en ensfarvet baggrund i jævnt lys.
  • Etiketten som flad fil i PDF eller PNG, så hvert ord i et genereret billede kan tjekkes mod kildefilen.
  • En størrelsesreference: produktet i en hånd eller ved siden af en hverdagsgenstand.
  • En liste over det, der aldrig må ændres: lågets farve, antallet af stropper, logoets placering, metallets finish.
  • Listen over påstande: alt, hvad annoncen må vise som bevis, så de optagelser planlægges som rigtige optagelser fra første dag.
En referencepakke lagt ud på et hvidt skrivebord: fire fotos af den samme ravfarvede hudplejeflaske forfra, bagfra og fra begge sider, et udprintet etiketark med tomme linjer i stedet for tekst og flasken holdt i en hånd som størrelsesreference
Billedet er genereret med AI: en referencepakke med fire rene vinkler, etiketten som flad fil og produktet i en hånd for at vise størrelsen.

I AI Vidias produktionsforløb godkendes stilreferencer, faste karakterer og shotlisten på dag 2, før første batch genereres på dag 3. Rækkefølgen er bevidst. En forkert reference koster et helt batch.

Vil I genbruge billeder fra videoen som stills i et Google Shopping-feed? Tjek først Merchant Centers regler for billeder. Produktbilleder skal vise produktet korrekt, og billeder lavet med generativ AI skal beholde de IPTC-metadata, der markerer dem som AI-genererede.

Hvordan gennemgår I et genereret klip billede for billede?

Se hvert klip én gang i fuld fart for at mærke helheden. Spol det derefter igennem i kvart fart med referencepakken åben ved siden af.

  1. Form. Sammenlign silhuetten i første, midterste og sidste billede, og notér afvigelser med tidskode: "låget bliver smallere ved 0:04".
  2. Tekst. Læs hvert synligt ord mod den flade etiketfil. Ét forkert bogstav, og klippet er afvist.
  3. Dele. Tæl det, der kan tælles: knapper, stropper, kløer i en lås, tabletter i en blisterpakning.
  4. Kontakt. Stop på hvert billede, hvor en hånd eller en overflade rører produktet. Fingrene skal blive uden for genstanden.
  5. Væske. Tjek, at niveauet i flasken falder, når der hældes, og at strålen lander, hvor den skal.
  6. Farve. Hold produktets farve op mod et rigtigt foto taget i lignende lys.

Skriv afvisninger som noter med tidskode, som en producer kan handle på. "Etikettens tekst tegnet om ved 0:02, afvist" bliver rettet i næste runde; "det ser forkert ud" starter bare en samtale.

Tjeklisten til kvalitetskontrol dækker hele godkendelsen, og faste brandrammer holder et godkendt udtryk stabilt gennem en hel måned med varianter. Under AI-videoannoncer kan I se, hvordan studiet arbejder fra brief til levering i 9:16.

Jeres næste skridt tager tyve minutter. Tag jeres bedst sælgende produkt og den ene optagelse i jeres bedste annonce, hvor produktet gør noget. Kør den optagelse gennem pointskemaet ovenfor, og summen viser, hvilke sekunder I skal filme.

Ofte stillede spørgsmål

01Kan AI lave en video af vores produkt ud fra fotos?
Ja. De fleste nuværende videomodeller kan tage udgangspunkt i jeres produktfotos, og det giver langt mere præcise resultater end en tekstinstruktion alene. Googles Veo 3.1 tager for eksempel op til tre referencebilleder for at holde fast i udseendet. Præcisionen falder stadig ved klart glas, småt tryk og øjeblikke, hvor en hånd rører produktet, så gennemgå de billeder grundigt.
02Hvilke produkter er sværest for AI-video?
Produkter, der kombinerer klart glas, væsker, småt tryk eller fine gentagne detaljer, er sværest, især i optagelser, hvor en hånd åbner, hælder eller påfører dem. Matte, faste produkter i enkle scener er nemmest. I VideoPhy-testen ramte den bedste testede model samspil mellem to faste ting, som en hånd, der drejer et låg, rigtigt i 24,4 procent af tilfældene.
03Kan vi bruge AI-video til at vise, at produktet virker?
Brug den til at vise produktet i en sammenhæng, og film det rigtige produkt til enhver optagelse, der beviser en påstand. Efter princippet fra sagen FTC mod Colgate-Palmolive er en opstilling, der præsenteres som en rigtig demonstration, vildledende, og et genereret klip af en plet, der forsvinder, er en opstilling. Genererede optagelser fungerer godt til åbninger, omgivelser og varianter omkring den rigtige bevisoptagelse.
04Hvorfor bliver teksten på emballagen forkert i AI-video?
Videomodeller tegner hvert billede på ny, og bogstaver er fine detaljer, som de gengiver efter udseende, så småt tryk bliver stavet forkert, udtværet eller skifter mellem billederne. Send etiketten som flad fil sammen med referencerne, og tjek hvert synligt ord mod den i kvart fart. Hvor etiketten skal kunne læses, er et sammensat billede med det rigtige packshot eller et filmet nærbillede det sikreste.
05Hvor langt kan et AI-genereret produktklip være?
De fleste modeller laver korte klip på få sekunder, som en klipper derefter sætter sammen til en hel annonce. Googles dokumentation for Veo 3.1 angiver klip på 4, 6 og 8 sekunder, hvor 8 sekunder er påkrævet ved 1080p, ved 4K eller ved brug af referencebilleder. Korte optagelser hjælper også præcisionen, fordi afvigelser i form og detaljer hober sig op i et længere klip.

Sådan har vi lavet artiklen

Kilderne er læst den 23. september 2026. Modellernes begrænsninger stammer fra den citerede forskning og Googles dokumentation for Veo. Materialevurderingerne og pointskemaet er AI Vidias produktionsvejledning bygget på de kilder, ikke en målt benchmark, og artiklen rapporterer ingen egne testresultater.

Vi researcher og skriver udkast med hjælp fra AI, og vi tjekker tallene mod kilderne herunder.

Kilder

  1. 01OpenAI: Video generation models as world simulators (Sora technical report), February 2024
  2. 02Motamed et al.: Do generative video models understand physical principles? (Physics-IQ), arXiv 2501.09038, January 2025
  3. 03Bansal et al.: VideoPhy, Evaluating Physical Commonsense for Video Generation, arXiv 2406.03520v2, October 2024
  4. 04US Supreme Court: FTC v. Colgate-Palmolive Co., 380 U.S. 374 (1965), full opinion via FindLaw
  5. 05Google AI for Developers: Generate videos with Veo 3.1 in the Gemini API (updated 17 September 2026)
  6. 06Google Merchant Center Help: Image link [image_link] requirements

Næste skridt

Få et forslag til jeres næste annoncer.

Fortæl os om jeres produkt, målgruppe og behov for annoncer. Vi læser jeres brief og vender tilbage med et forslag til næste skridt.

Send jeres brief

Læs videre