Så fungerar det, på ett stycke
Du skriver en beskrivning och en bild dyker upp. Under ytan har verktyget lärt sig hur ord ser ut från ett enormt antal bildtextade bilder. Det börjar med slumpmässigt visuellt brus och putar upprepade gånger det bruset mot vad som helst som matchar din beskrivning.
En konsekvens förklarar det mesta av nybörjarfrustrationen: modellen matchar din beskrivning mot mönster, den följer inte instruktioner som en person skulle göra. Om du säger "ingen hund" finns ordet hund fortfarande där, och en hund kan mycket väl dyka upp. Om du utelämnar något frågar den inte, den fyller i luckan med den mest genomsnittliga versionen av den saken den har sett.
Det är hela konsten. Säg exakt vad du vill ha, och säg vad du inte vill ha på den plats som är gjord för det.
Formeln i sex delar
Nästan varje bra bildprompt innehåller samma sex saker. De som saknas fylls i med standardval, och de standardvalen är precis det som gör att en bild ser generisk ut.
| Del | Vad du ska säga | Om du utelämnar det |
|---|---|---|
| Motiv | Den specifika saken, med de detaljer som spelar roll | Den mest generiska versionen av det substantivet |
| Miljö | Var det är, och hur mycket du ser | En tom eller rörig bakgrund |
| Ljus | Tid på dagen, riktning, kvalitet | Platt, jämnt belyst, livlöst |
| Komposition | Närbild eller vidvinkel, från vilken vinkel | En centrerad halvbild, varje gång |
| Stil | Fotografi, oljemålning, 3D rendering, illustration | Glansig digital konst |
| Stämning eller färg | Känslan och paletten | Övermättad och hög kontrast |
En svag prompt: ett mysigt vardagsrum.
En stark prompt: Ett litet vardagsrum med en tänd öppen spis och en tabbykatt som sover i en sliten fåtölj, sent eftermiddagsljus genom ett västvänt fönster, vid vy från dörröppningen, realistiskt fotografi, 35mm, varma brunnyanser och mjuk bärnsten, lugnt och bebott.
Båda tar ungefär samma tid att komma på. Den andra är en bild, den första är en kategori.
Lägg sedan till det nybörjare helt hoppar över: en negativlista. Negativt: text, vattenstämpel, extra fingrar, rörig bakgrund, stockfoto-leende. Det mesta som får en bild att se AI genererad ut kommer från en liten uppsättning återkommande defekter, och att namnge dem tar bort dem.
Tricket som gör det här enkelt
Du behöver inte skriva dessa prompts själv. Be en text AI att skriva dem åt dig.
Skriv en bildgenereringsprompt för: [din grova idé]. Den är till för [syfte]. Strukturera den som motiv, miljö, ljus, komposition, stil, färg och stämning, och lägg sedan till en negativlista. Ge mig tre versioner som skiljer sig i komposition snarare än i adjektiv.
Språkmodeller är betydligt bättre på att skriva bildprompts än de flesta människor, eftersom formatet är känt och de har sett enorma mängder exempel. Det är därför att generera bilder inuti en chatt är genuint mer användbart än en fristående bildruta: verktyget som skriver prompten sitter precis bredvid det som ritar den.
Varför din bild blev fel
En kort diagnoslista som täcker nästan alla nybörjarproblem.
Tråkig och generisk. Du angav inte ljus eller komposition. De två gör mer nytta än något annat par.
Rätt saker, felplacerade. Säg kompositionen explicit: vidvinkel underifrån, närbild, motiv i vänstra tredjedelen. Modellen har ingen aning om var du vill ha saker om du inte säger det.
Något du bad om att inte se finns med i bilden. Att namnge det i huvudprompten gör det mer troligt, inte mindre. Flytta det till negativlistan.
Händer, ansikten eller små återkommande detaljer blir fel. Fortfarande det svagaste området överallt. Prova en tightare beskärning, en annan vinkel, eller att händer inte syns. Ibland räcker det att bara generera om.
Text är rappakalja. Förväntat. Se nästa avsnitt.
Det ser ut som stockfoto. Lägg till spontant, beskriv en handling snarare än en pose, och sätt stockfoto-leende mot kameran i negativlistan.
Fel form för där du behöver den. Be om det bildförhållande du faktiskt behöver. Att beskära en kvadrat till en banner slänger bort kompositionen du bad om.
Att iterera utan att gå runt i cirklar
Nybörjare genererar om samma prompt och hoppas på ett bättre resultat. Viss slump går inte att undvika, men de flesta bortkastade försök kommer från att ändra flera saker på en gång.
- Ändra en sak per försök. Ljus, eller komposition, eller stil. Inte alla tre, annars vet du inte vad som hjälpte.
- Fixa kompositionen före detaljerna. Att få kompositionen och ljuset rätt först är mycket mer effektivt än att förfina ett motiv som är i fel del av bilden.
- Beskriv vad som var rätt. När en bild är nära, säg det i ord i nästa prompt istället för att anta att verktyget minns.
- Spara prompts som fungerade. Sex eller åtta pålitliga promptformer är värda mer än en enda bild, och det är de som får en samling bilder att se ut som att de hör ihop.
Vad det fortfarande inte klarar
Text. Ord i bilder förblir opålitliga överallt. Ett kort ord fungerar ibland, en rubrik eller en logotyp gör det oftast inte. Generera bilden ren och lägg till text i valfritt designverktyg, vilket också ger dig rätt typsnitt.
Exakta arrangemang. "Exakt tre föremål, det röda till vänster" följs inte pålitligt. Om arrangemanget spelar roll, generera delarna och komponera dem själv.
Samma karaktär två gånger. Att få en identisk person eller produkt genom en serie är svårt. Detaljerade upprepade beskrivningar hjälper, men identiska resultat garanteras inte.
Att redigera ett riktigt foto exakt. Den kan justera bakgrund, ljus och stil bra. Den kan inte pålitligt flytta ett föremål två centimeter åt vänster.
Och om att använda resultaten: kontrollera reglerna innan något genererat går till kommersiellt bruk. Var extra försiktig med bilder som liknar en verklig person, en igenkännbar plats, eller en levande konstnärs distinkta stil. Villkoren skiljer sig mellan verktyg och ansvaret ligger hos den som publicerar bilden.
- Inkludera alla sex delar: motiv, miljö, ljus, komposition, stil, stämning
- Lägg det du inte vill ha i en negativlista, aldrig i huvudbeskrivningen
- Be en text AI att skriva bildprompten utifrån din grova idé
- Generera i det bildförhållande du faktiskt behöver
- Ändra en variabel per försök så du lär dig vad som hjälpte
- Lägg till text i ett designverktyg snarare än i bildmodellen
- Spara prompts som fungerade så dina bilder ser enhetliga ut
Vanliga frågor
Behöver jag konstnärlig skicklighet för att generera AI bilder?
Nej, men du behöver beskrivande förmåga, och det är den delen nybörjare underskattar. Skillnaden mellan en besvikande bild och en bra bild ligger nästan helt i hur specifikt du beskrev ljuset, kompositionen och stilen. Om det inte kommer naturligt att beskriva en scen i detalj, be en text AI att utveckla din grova idé till en strukturerad prompt.
Kan jag använda AI för att komma på bildidéer?
Ja, och det är mer användbart än de flesta inser. Be en chattbot om fem beskrivande koncept, be den sedan vända din favorit till en fullständig strukturerad bildprompt med en negativlista. Språkmodeller skriver bildprompts bättre än de flesta nybörjare gör, vilket är varför att generera bilder inuti en chatt slår en fristående bildruta.
Varför ser texten i min bild ut som nonsens?
Eftersom renderad text genuint är det svagaste området i varje bildmodell, och ingen prompt löser det pålitligt. Korta enstaka ord kommer ibland ut rätt, rubriker, logotyper och etiketter gör oftast inte det. Generera bilden utan text och lägg till typografi i valfritt designverktyg, vilket också låter dig använda rätt typsnitt och placera det korrekt.
Vilken bildgenerator är bäst?
Det beror mer på motivet än folk förväntar sig. Flux är starkast för fotorealism och allt som ska se ut som det kommer från en kamera. Stable Diffusion ger mer stilistisk kontroll och variation för illustration. Snabbaste sättet att avgöra är att köra samma prompt genom två av dem och jämföra resultaten sida vid sida, eftersom vinnaren på porträtt ofta inte är vinnaren på interiörer.
Behöver jag en separat prenumeration för bildgenerering?
Inte nödvändigtvis. Bildgenerering ingår i Whizi på Pro och uppåt, tillsammans med textmodellerna, vilket täcker vanligt kreativt arbete och innehållsarbete utan en andra räkning. Ett dedikerat bildverktyg är fortfarande vettigt för de som gör det här professionellt varje dag och vill ha mycket finjusterad stilistisk kontroll.