Sådan fungerer det, i ét afsnit
Du skriver en beskrivelse, og der dukker et billede op. Bag ved har værktøjet lært, hvordan ord ser ud, ud fra et enormt antal billeder med billedtekster. Det starter med tilfældig visuel støj og skubber gradvist den støj i retning af det, der matcher din beskrivelse.
En konsekvens forklarer det meste af begynderfrustrationen: modellen matcher din beskrivelse mod mønstre, den følger ikke instruktioner sådan som en person ville gøre. Hvis du skriver "ingen hund", er ordet hund stadig der, og en hund kan sagtens dukke op. Hvis du udelader noget, spørger modellen ikke, den fylder hullet ud med den mest gennemsnitlige version af den ting, den har set.
Det er hele kunststykket. Sig konkret hvad du vil have, og sig hvad du ikke vil have det sted, der er lavet til det.
Formlen i seks dele
Næsten alle gode billedprompts indeholder de samme seks ting. Dem der mangler, bliver fyldt ud med standardværdier, og det er netop dem, der får et billede til at se generisk ud.
| Del | Hvad du skal sige | Hvis du udelader det |
|---|---|---|
| Motiv | Den konkrete ting, med de detaljer der betyder noget | Den mest generiske version af det ord |
| Omgivelser | Hvor det befinder sig, og hvor meget du ser | En tom eller rodet baggrund |
| Lys | Tid på dagen, retning, kvalitet | Fladt, jævnt lys, livløst |
| Beskæring | Tæt på eller vidt, fra hvilken vinkel | Et centreret halvnært billede, hver gang |
| Stil | Fotografi, oliemaleri, 3D-render, illustration | Blank digital kunst |
| Stemning eller farve | Følelsen og paletten | Overmættet og høj kontrast |
En svag prompt: en hyggelig stue.
En stærk prompt: En lille stue med en tændt pejs og en stribet kat der sover i en slidt lænestol, sen eftermiddagslys gennem et vestvendt vindue, vidt billede fra døråbningen, realistisk fotografi, 35mm, varme brunfarver og blødt ravgult, roligt og beboet.
Begge tager omtrent samme tid at finde på. Den anden er et billede, den første er en kategori.
Tilføj så det, begyndere helt springer over: en negativliste. Negativ: tekst, vandmærke, ekstra fingre, rodet baggrund, stockfoto smil. Det meste af det, der får et billede til at se AI-genereret ud, kommer fra et lille sæt tilbagevendende artefakter, og ved at navngive dem fjerner du dem.
Tricket der gør det nemt
Du behøver ikke skrive disse prompts selv. Bed en tekst AI om at skrive dem for dig.
Skriv en billedgenereringsprompt til: [din grove idé]. Den skal bruges til [formål]. Strukturér den som motiv, omgivelser, lys, beskæring, stil, farve og stemning, og afslut med en negativliste. Giv mig tre versioner der varierer i beskæring frem for i tillægsord.
Sprogmodeller er markant bedre til at skrive billedprompts, end de fleste mennesker er, fordi formatet er kendt, og de har set enorme mængder eksempler. Det er derfor det giver reel mening at generere billeder inde i en chat frem for i en selvstændig billedboks: værktøjet der skriver prompten sidder lige ved siden af det, der tegner den.
Hvorfor dit billede blev forkert
En kort tjekliste, der dækker næsten alle begynderproblemer.
Kedeligt og generisk. Du angav ikke lys eller beskæring. De to gør mere arbejde end noget andet par.
De rigtige ting, placeret forkert. Sig beskæringen direkte: vidt billede nedefra, tæt på, motivet i venstre tredjedel. Modellen aner ikke, hvor du vil have tingene, medmindre du siger det.
Noget du bad om ikke at se, er alligevel med i billedet. At navngive det i hovedprompten gør det mere sandsynligt, ikke mindre. Flyt det til negativlisten.
Hænder, ansigter eller små gentagne detaljer er forkerte. Stadig det svageste område overalt. Prøv en tættere beskæring, en anden vinkel, eller at hænder ikke er synlige. Nogle gange er svaret bare at generere igen.
Teksten er volapyk. Forventeligt. Se næste afsnit.
Det ligner stockfoto. Tilføj candid, beskriv en handling frem for en positur, og skriv stockfoto smiler til kameraet i negativlisten.
Forkert format til dit formål. Bed om det billedformat, du faktisk skal bruge. At beskære et kvadrat til et banner smider den komposition væk, du bad om.
Sådan itererer du uden at gå i ring
Begyndere generer den samme prompt igen og igen i håb om et bedre udfald. Noget tilfældighed er uundgåelig, men de fleste spildte forsøg skyldes, at flere ting ændres på én gang.
- Skift kun én ting pr. forsøg. Lys, eller beskæring, eller stil. Ikke alle tre, for så ved du ikke, hvad der hjalp.
- Ret komposition før detaljer. At få beskæring og lys rigtigt først er langt mere effektivt end at perfektionere et motiv, der sidder i den forkerte del af billedet.
- Beskriv hvad der var rigtigt. Når et billede er tæt på, så sig det med ord i den næste prompt, i stedet for at antage at værktøjet husker det.
- Gem prompts der virkede. Seks eller otte pålidelige promptformer er mere værd end noget enkelt billede, og det er dem, der får et sæt billeder til at se ud, som om de hører sammen.
Hvad det stadig ikke kan
Tekst. Ord i billeder forbliver upålidelige overalt. Et kort ord virker nogle gange, en overskrift eller et logo virker som regel ikke. Generér billedet uden tekst og tilføj tekst i et hvilket som helst designværktøj, hvor du også får den rette skrifttype.
Præcise placeringer. "Præcis tre genstande, den røde til venstre" bliver ikke fulgt pålideligt. Hvis placeringen betyder noget, så generér delene hver for sig og sammensæt dem selv.
Samme figur to gange. At få en identisk person eller et identisk produkt på tværs af en serie er svært. Detaljerede, gentagne beskrivelser hjælper, men identiske resultater kan ikke garanteres.
At redigere et ægte foto præcist. Det kan justere baggrund, lys og stil godt. Det kan ikke pålideligt flytte en genstand fem centimeter til venstre.
Og om brugen af resultaterne: tjek reglerne, før noget genereret bruges kommercielt. Vær særligt forsigtig med billeder, der ligner en ægte person, et genkendeligt sted eller den karakteristiske stil hos en levende kunstner. Vilkårene varierer mellem værktøjer, og ansvaret ligger hos den, der offentliggør billedet.
- Inkludér alle seks dele: motiv, omgivelser, lys, beskæring, stil, stemning
- Skriv det du ikke vil have i en negativliste, aldrig i hovedbeskrivelsen
- Bed en tekst AI om at skrive billedprompten ud fra din grove idé
- Generér i det billedformat, du faktisk har brug for
- Skift én variabel pr. forsøg, så du lærer hvad der hjalp
- Tilføj tekst i et designværktøj i stedet for i billedmodellen
- Gem de prompts der virkede, så dine billeder ser konsistente ud
Ofte stillede spørgsmål
Skal jeg have kunstneriske evner for at generere AI billeder?
Nej, men du skal have beskrivende evner, og det er den del begyndere undervurderer. Forskellen mellem et skuffende billede og et godt et handler næsten udelukkende om, hvor konkret du beskrev lys, beskæring og stil. Hvis det ikke falder dig naturligt at beskrive en scene i detaljer, kan du bede en tekst AI om at udbygge din grove idé til en struktureret prompt.
Kan jeg bruge AI til at få idéer til billeder?
Ja, og det er mere nyttigt, end de fleste tror. Bed en chatbot om fem beskrivende koncepter, og bed den derefter om at omdanne din favorit til en fuld struktureret billedprompt med en negativliste. Sprogmodeller skriver bedre billedprompts end de fleste begyndere, hvilket er grunden til at det giver mere at generere billeder inde i en chat end i en selvstændig billedboks.
Hvorfor ligner teksten i mit billede volapyk?
Fordi gengivet tekst reelt er det svageste område på tværs af alle billedmodeller, og ingen prompt løser det pålideligt. Korte, enkelte ord kommer nogle gange rigtigt ud, overskrifter, logoer og labels gør som regel ikke. Generér billedet uden tekst, og tilføj typografi i et hvilket som helst designværktøj, hvor du også kan bruge den rette skrifttype og placere den korrekt.
Hvilken billedgenerator er bedst?
Det afhænger af motivet mere, end folk regner med. Flux er stærkest til fotorealisme og alt, der skal se ud som taget med et kamera. Stable Diffusion giver mere stilistisk kontrol og variation til illustration. Den hurtigste måde at afgøre det på er at køre samme prompt gennem to af dem og sammenligne resultaterne, for vinderen på portrætter er ofte ikke vinderen på interiør.
Skal jeg have et separat abonnement til billedgenerering?
Ikke nødvendigvis. Billedgenerering er inkluderet i Whizi på Pro og derover, sammen med tekstmodellerne, hvilket dækker almindeligt kreativt og indholdsmæssigt arbejde uden en ekstra regning. Et dedikeret billedværktøj giver stadig mening for folk, der arbejder professionelt med det hver dag og ønsker meget fin stilistisk kontrol.