Hvordan lage AI-bilder for nybegynnere (en enkel guide)

Kort svar

For å lage AI-bilder skriver du en beskrivelse, og et bilde dukker opp. For å få et godt resultat må du nevne seks ting: motiv, omgivelser, lys, komposisjon, stil, og stemning eller farge. Alt du utelater blir fylt med en generisk standardversjon, og det du ikke vil ha med skal stå i en egen negativliste.

Slik fungerer det, i ett avsnitt

Du skriver en beskrivelse, og et bilde dukker opp. Under panseret har verktøyet lært hvordan ord ser ut ut fra et enormt antall bilder med tekst. Det starter med tilfeldig visuell støy og justerer den støyen gjentatte ganger mot det som passer beskrivelsen din.

Én konsekvens forklarer det meste av frustrasjonen nybegynnere opplever: modellen matcher beskrivelsen din mot mønstre, den følger ikke instruksjoner slik en person ville gjort. Hvis du skriver "ingen hund", er ordet hund fortsatt der, og en hund kan godt dukke opp likevel. Hvis du utelater noe, spør den ikke; den fyller hullet med den mest gjennomsnittlige versjonen av det den har sett.

Det er hele kunsten. Si spesifikt hva du vil ha, og si hva du ikke vil ha på stedet som er laget for det.

Formelen med seks deler

Nesten alle gode bildeprompter inneholder de samme seks tingene. Manglende deler blir fylt med standardverdier, og det er nettopp disse standardverdiene som gjør et bilde generisk.

DelHva du bør siHvis du utelater det
MotivDen konkrete tingen, med detaljene som betyr noeDen mest generiske versjonen av det substantivet
OmgivelserHvor det er, og hvor mye du serEn blank eller rotete bakgrunn
LysTid på døgnet, retning, kvalitetFlatt, jevnt belyst, livløst
KomposisjonNærbilde eller vidt, fra hvilken vinkelEt sentrert halvnært bilde, hver gang
StilFotografi, oljemaleri, 3D-rendring, illustrasjonBlank digital kunst
Stemning eller fargeFølelsen og fargepalettenOvermettet og høy kontrast

En svak prompt: en koselig stue.

En sterk prompt: En liten stue med en tent peis og en katt som sover på en slitt lenestol, sent ettermiddagslys gjennom et vestvendt vindu, vidt bilde fra døråpningen, realistisk fotografi, 35mm, varme brunfarger og myk rav, rolig og hjemmekoselig.

Begge tar omtrent like lang tid å komme på. Den andre er et bilde, den første er en kategori.

Legg så til delen nybegynnere hopper helt over: en negativliste. Negativt: tekst, vannmerke, ekstra fingre, rotete bakgrunn, glansbilde-smil. Det meste som får et bilde til å se AI-generert ut, kommer fra et lite sett med tilbakevendende feil, og å nevne dem fjerner dem.

Trikset som gjør dette enkelt

Du trenger ikke skrive disse promptene selv. Be en tekst-AI om å skrive dem for deg.

Skriv en bildeprompt for: [din grove idé]. Den er til [formål]. Strukturer den som motiv, omgivelser, lys, komposisjon, stil, farge og stemning, og legg til en negativliste. Gi meg tre versjoner som skiller seg i komposisjon fremfor i adjektiver.

Språkmodeller er betydelig bedre til å skrive bildeprompter enn de fleste mennesker, fordi formatet er kjent og de har sett enorme mengder eksempler. Det er derfor det å lage bilder inne i en samtale er genuint mer nyttig enn en frittstående bildeboks: verktøyet som skriver prompten sitter rett ved siden av det som tegner den.

Hvorfor bildet ditt ble feil

En kort diagnoseliste som dekker nesten alle nybegynnerproblemer.

Kjedelig og generisk. Du spesifiserte ikke lys eller komposisjon. De to gjør mer av jobben enn noe annet par.

De riktige tingene, feil plassert. Si komposisjonen eksplisitt: vidt bilde nedenfra, nærbilde, motivet i venstre tredjedel. Modellen aner ikke hvor du vil ha ting med mindre du sier det.

Noe du ba om å ikke se, er i bildet. Å nevne det i hovedprompten gjør det mer sannsynlig, ikke mindre. Flytt det til negativlisten.

Hender, ansikter eller små gjentatte detaljer er feil. Fortsatt det svakeste området overalt. Prøv et tettere utsnitt, en annen vinkel, eller at hendene ikke er synlige. Noen ganger holder det å generere på nytt.

Teksten er tull. Forventet. Se neste avsnitt.

Det ser ut som glansbildefotografi. Legg til candid, beskriv en handling fremfor en positur, og sett glansbilde-smil mot kamera i negativlisten.

Feil form for det du trenger. Be om det sideforholdet du faktisk trenger. Å beskjære et kvadrat til et banner ødelegger komposisjonen du ba om.

Å iterere uten å gå i ring

Nybegynnere genererer samme prompt om og om igjen i håp om et bedre resultat. Noe tilfeldighet er uunngåelig, men de fleste bortkastede forsøk kommer av å endre flere ting samtidig.

  • Endre én ting per forsøk. Lys, eller komposisjon, eller stil. Ikke alle tre, ellers vet du ikke hva som hjalp.
  • Fiks komposisjonen før detaljene. Å få komposisjonen og lyset riktig først er langt mer effektivt enn å perfeksjonere et motiv som er i feil del av bildet.
  • Beskriv hva som var riktig. Når et bilde er nære, si det med ord i neste prompt fremfor å anta at verktøyet husker det.
  • Ta vare på prompter som fungerte. Seks eller åtte pålitelige promptformer er verdt mer enn et enkelt bilde, og det er de som gjør at et sett med bilder ser ut til å høre sammen.

Hva det fortsatt ikke klarer

Tekst. Ord i bilder er fortsatt upålitelige overalt. Et kort ord fungerer noen ganger; en overskrift eller logo gjør det som regel ikke. Generer bildet uten tekst og legg til tekst i et hvilket som helst designverktøy, som også gir deg riktig skrifttype.

Nøyaktige oppsett. "Nøyaktig tre objekter, den røde til venstre" følges ikke pålitelig. Hvis oppsettet betyr noe, generer delene og sett dem sammen selv.

Samme karakter to ganger. Å få en identisk person eller et identisk produkt gjennom en serie er vanskelig. Detaljerte gjentatte beskrivelser hjelper, men identiske resultater er ikke garantert.

Å redigere et ekte foto presist. Det kan justere bakgrunn, lys og stil godt. Det kan ikke pålitelig flytte et objekt to centimeter til venstre.

Og om bruken av resultatene: sjekk reglene før noe generert havner et kommersielt sted. Vær ekstra forsiktig med bilder som ligner en ekte person, et gjenkjennelig sted, eller den særegne stilen til en levende kunstner. Vilkårene er forskjellige mellom verktøy, og ansvaret ligger hos den som publiserer bildet.

Sjekkliste
  • Ta med alle seks deler: motiv, omgivelser, lys, komposisjon, stil, stemning
  • Sett det du ikke vil ha i en negativliste, aldri i hovedbeskrivelsen
  • Be en tekst-AI skrive bildeprompten ut fra din grove idé
  • Generer i det sideforholdet du faktisk trenger
  • Endre én variabel per forsøk, så du lærer hva som hjalp
  • Legg til tekst i et designverktøy fremfor i bildemodellen
  • Ta vare på prompter som fungerte, så bildene dine ser konsistente ut

Vanlige spørsmål

Trenger jeg kunstneriske ferdigheter for å lage AI-bilder?

Nei, men du trenger beskrivende ferdigheter, og det er den delen nybegynnere undervurderer. Forskjellen mellom et skuffende bilde og et godt ett handler nesten utelukkende om hvor spesifikt du beskrev lyset, komposisjonen og stilen. Hvis det ikke faller naturlig å beskrive en scene i detalj, kan du be en tekst-AI utvide din grove idé til en strukturert prompt.

Kan jeg bruke AI til å komme på bildeidéer?

Ja, og det er mer nyttig enn de fleste tror. Be en chatbot om fem beskrivende konsepter, og be den deretter gjøre favoritten din om til en full strukturert bildeprompt med en negativliste. Språkmodeller skriver bedre bildeprompter enn de fleste nybegynnere, og det er derfor det å lage bilder inne i en samtale slår en frittstående bildeboks.

Hvorfor ser teksten i bildet mitt ut som tull?

Fordi tekst som gjengis, er genuint det svakeste området i alle bildemodeller, og ingen prompt løser det pålitelig. Korte enkeltord kommer noen ganger riktig ut; overskrifter, logoer og etiketter gjør det som regel ikke. Generer bildet uten tekst og legg til typografi i et hvilket som helst designverktøy, som også lar deg bruke riktig skrifttype og plassere den ordentlig.

Hvilken bildegenerator er best?

Det kommer mer an på motivet enn folk forventer. Flux er sterkest på fotorealisme og alt som skal se ut som det kommer fra et kamera. Stable Diffusion gir mer stilistisk kontroll og variasjon til illustrasjon. Den raskeste måten å bestemme seg på er å kjøre samme prompt gjennom to av dem og se resultatene side om side, siden vinneren på portretter ofte ikke er vinneren på interiør.

Trenger jeg et eget abonnement for bildegenerering?

Ikke nødvendigvis. Bildegenerering er inkludert i Whizi på Pro og oppover, sammen med tekstmodellene, noe som dekker vanlig kreativt og innholdsrelatert arbeid uten en ekstra regning. Et dedikert bildeverktøy gir fortsatt mening for folk som gjør dette profesjonelt hver dag og ønsker svært fin stilistisk kontroll.