Nutidens AI-videomodeller gengiver langt bedre, hvordan et produkt ser ud, end hvordan det opfører sig. Et mat keramikkrus på et bord er en nem optagelse. En flaske i klart glas, der hældes af en hånd, med en ingrediensliste, der skal kunne læses, samler fire af de sværeste problemer på fire sekunder.
Stil derfor et skarpere spørgsmål. Hvilke dele af jeres produkt, og hvilke øjeblikke i jeres annonce, rammer en model rigtigt? Nedenfor er produkterne sorteret efter materiale og handling, forskningen viser, hvor modellerne fejler, og et pointskema med seks spørgsmål viser, hvordan I fordeler et brief mellem generering og rigtige optagelser.
Hvorfor rammer AI-video udseendet, men ikke fysikken?
Videomodeller lærer af, hvordan ting ser ud på film. De har ingen indbygget fornemmelse af vægt, friktion eller strømning, så overflader bliver overbevisende, mens samspillet mellem ting bliver ujævnt.
Forskningen peger samme vej på tværs af laboratorier. I sin tekniske rapport om Sora skrev OpenAI, at modellen ikke gengiver mange simple fysiske samspil korrekt, for eksempel glas, der knuses, og at maden ikke altid ændrer sig på skærmen, når nogen spiser af den. Google DeepMind og INSAIT testede derefter Sora, Runway, Pika, Lumiere, Stable Video Diffusion og VideoPoet på væskers bevægelse, optik, faste stoffers mekanik, magnetisme og varme i Physics-IQ-testen. Konklusionen var, at modellernes fysiske forståelse er stærkt begrænset og ikke hænger sammen med, hvor realistiske videoerne ser ud.
Den sidste del er vigtig, når I gennemgår et klip. Det kan se dyrt ud og alligevel vise en pumpe, der bøjer, når man trykker på den.
Modellerne bliver hurtigt bedre, og nyere udgaver klarer tilfælde, som disse studier ikke dækkede. Mønsteret har dog holdt ved hver ny udgave indtil nu: overflader først, samspil sidst.
Hvilke materialer er nemme for AI-video, og hvilke er svære?
Sortér jeres sortiment efter det, kameraet skal vise. Tabellen rangerer almindelige materialer fra det nemmeste til det sværeste at holde korrekt i bevægelse.
| Materiale | Eksempler på produkter | Det, der typisk går galt | Vurdering |
|---|---|---|---|
| Mat og fast | Keramik, sneakers, møbler, varer i æske | Proportionerne glider en smule mellem optagelserne | Nem |
| Bløde varer og stof | Sengetøj, tøj på bøjle, bamser | Folder og fald skifter form fra billede til billede | Middel |
| Blanke overflader og metal | Ure, køkkengrej, metalliske låg | Refleksioner springer eller viser et rum, der ikke findes | Middel |
| Trykt emballage | Hudplejeglas, kosttilskud, fødevarepakker | Småt tryk tegnes om, staves forkert eller udtværes | Svær |
| Fine gentagne detaljer | Strik, kæder, facetslebne sten, flettede kurve | Mønstre flyder eller smelter sammen, når kameraet bevæger sig | Svær |
| Klart glas og plast | Parfume, spiritus, vandflasker | Kanter og lysbrydning flytter sig, og indholdet svæver | Svær |
| Væsker og geler | Drikke, serummer, saucer, rengøringsmidler | Hældninger bryder fysikken, og væskeniveauet ændrer sig af sig selv | Sværest |
Vurdér optagelsen og ikke kun produktet. En parfumeflaske, der står på en sten, er til at håndtere, mens den samme flaske, der sprøjtes på et håndled, samler glas, væske og hænder i ét øjeblik.

Hvorfor går hænder og bevægelige dele oftere galt end selve produktet?
Et samspil er sværere end en genstand. Når en hånd griber om en pumpe, skal to faste ting mødes, trykke og bevæge sig sammen uden at gå igennem hinanden.
VideoPhy-testen målte netop det. Forskerne bag skrev 688 instruktioner, der beskriver fysiske samspil, lavede videoer med modeller som CogVideoX, Pika, Runway Gen-2 og Luma Dream Machine og lod mennesker vurdere, om hver video fulgte instruktionen og overholdt almindelig fysisk sund fornuft. Den bedste testede model, CogVideoX-5B, klarede begge dele i 39,6 procent af tilfældene. Ved samspil mellem to faste ting, den kategori, der dækker en hånd, der drejer et låg eller trykker på en knap, var tallet 24,4 procent.

