Cum funcționează, într-un singur paragraf
Scrii o descriere și apare o imagine. Dedesubt, unealta a învățat cum arată cuvintele dintr-un număr uriaș de imagini cu descrieri. Începe cu zgomot vizual aleatoriu și împinge repetat acel zgomot spre orice se potrivește cu descrierea ta.
O consecință explică majoritatea frustrărilor de începător: modelul îți potrivește descrierea cu tipare, nu urmează instrucțiuni ca o persoană. Dacă spui "fără câine", cuvântul câine e tot acolo, iar un câine poate foarte bine să apară. Dacă lași ceva deoparte, nu întreabă; umple golul cu cea mai medie versiune a acelui lucru pe care a văzut-o.
Asta e toată abilitatea. Spune specific ce vrei, și spune ce nu vrei în locul creat pentru asta.
Formula în șase părți
Aproape fiecare prompt bun de imagine conține aceleași șase lucruri. Cele lipsă sunt umplute cu implicite, iar implicitele sunt exact ce face o imagine să arate generic.
| Parte | Ce să spui | Dacă o lași deoparte |
|---|---|---|
| Subiect | Lucrul specific, cu detaliile care contează | Cea mai generică versiune a acelui substantiv |
| Decor | Unde e, și cât de mult vezi | Un fundal gol sau aglomerat |
| Lumină | Momentul zilei, direcția, calitatea | Plată, luminată uniform, fără viață |
| Cadraj | De aproape sau larg, din ce unghi | Un cadru mediu centrat, de fiecare dată |
| Stil | Fotografie, pictură în ulei, randare 3D, ilustrație | Artă digitală lucioasă |
| Stare sau culoare | Senzația și paleta | Suprasaturat și contrast ridicat |
Un prompt slab: un living cald.
Un prompt puternic: Un living mic cu un șemineu aprins și o pisică tărcată adormită pe un fotoliu uzat, lumina de după-amiază târzie printr-o fereastră orientată spre vest, cadru larg din ușă, fotografie realistă, 35mm, maro cald și chihlimbar moale, calm și locuit.
Amândouă cer aproximativ același efort să te gândești la ele. Al doilea e o imagine; primul e o categorie.
Apoi adaugă partea pe care începătorii o sar complet: o listă negativă. Negativ: text, filigran, degete în plus, fundal aglomerat, zâmbet de fotografie stock. Majoritatea a ceea ce face o imagine să arate generată de IA vine dintr-un set mic de artefacte recurente, iar numirea lor le elimină.
Trucul care face asta ușor
Nu trebuie să scrii tu însuți aceste prompturi. Cere unei IA de text să ți le scrie.
Scrie un prompt de generare a imaginii pentru: [ideea ta brută]. E pentru [scop]. Structurează-l ca subiect, decor, lumină, cadraj, stil, culoare și stare, apoi o listă negativă. Dă-mi trei versiuni care diferă în cadraj, nu în adjective.
Modelele de limbaj sunt considerabil mai bune la a scrie prompturi de imagini decât majoritatea oamenilor, pentru că formatul e unul cunoscut, iar ele au văzut un număr uriaș de exemple. De aceea generarea de imagini în interiorul unui chat e cu adevărat mai utilă decât o casetă de imagine independentă: unealta care scrie promptul stă chiar lângă cea care îl desenează.
De ce a ieșit imaginea ta greșit
O listă scurtă de diagnostic care acoperă aproape fiecare problemă de începător.
Plictisitoare și generică. Nu ai specificat lumina sau cadrajul. Acestea două fac mai multă treabă decât orice altă pereche.
Lucrurile corecte, aranjate greșit. Spune cadrajul explicit: cadru larg de jos, de aproape, subiect în treimea stângă. Modelul nu are idee unde vrei lucrurile decât dacă spui.
Ceva ce ai cerut să nu vezi e în imagine. Numirea lui în promptul principal îl face mai probabil, nu mai puțin. Mută-l în lista negativă.
Mâinile, fețele sau detaliile mici repetate sunt greșite. Încă cea mai slabă zonă peste tot. Încearcă un cadru mai apropiat, un unghi diferit, sau mâini care nu sunt vizibile. Uneori doar regenerează.
Textul e neinteligibil. De așteptat. Vezi secțiunea următoare.
Arată ca fotografie stock. Adaugă spontan, descrie o acțiune în loc de o poziție și pune zâmbet de fotografie stock la cameră în negative.
Formă greșită pentru unde ai nevoie de ea. Cere raportul de aspect de care ai de fapt nevoie. Decuparea unui pătrat într-un banner aruncă compoziția pe care ai cerut-o.
Iterarea fără să te învârți în cerc
Începătorii regenerează același prompt sperând la un rezultat mai bun. O parte de aleatoriu e inevitabilă, dar majoritatea încercărilor irosite vin din schimbarea mai multor lucruri deodată.
- Schimbă un singur lucru per încercare. Lumina, sau cadrajul, sau stilul. Nu toate trei, altfel nu vei ști ce a ajutat.
- Repară compoziția înainte de detaliu. A obține cadrajul și lumina corecte întâi e mult mai eficient decât perfecționarea unui subiect care e în partea greșită a cadrului.
- Descrie ce a fost corect. Când o imagine e aproape, spune asta în cuvinte în următorul prompt în loc să presupui că unealta își amintește.
- Salvează prompturile care au funcționat. Șase sau opt forme fiabile de prompt valorează mai mult decât orice imagine singură, și ele sunt ce face un set de imagini să pară că aparțin împreună.
Ce încă nu poate face
Text. Cuvintele în imagini rămân nesigure peste tot. Un cuvânt scurt uneori funcționează; un titlu sau un logo de obicei nu. Generează imaginea curată și adaugă textul în orice unealtă de design, ceea ce îți oferă și fontul corect.
Aranjamente exacte. "Exact trei obiecte, cel roșu în stânga" nu e urmat fiabil. Dacă aranjamentul contează, generează piesele și compune-le tu însuți.
Același personaj de două ori. A obține o persoană sau un produs identic pe parcursul unei serii e dificil. Descrierile repetate detaliate ajută, iar rezultatele identice nu sunt garantate.
Editarea precisă a unei fotografii reale. Poate ajusta bine fundalul, lumina și stilul. Nu poate muta fiabil un obiect cu doi centimetri la stânga.
Și despre folosirea rezultatelor: verifică regulile înainte ca orice generat să meargă undeva comercial. Ai grijă în special cu imagini care seamănă cu o persoană reală, un loc recognoscibil, sau stilul distinctiv al unui artist în viață. Termenii diferă între unelte, iar responsabilitatea stă la cine publică imaginea.
- Include toate cele șase părți: subiect, decor, lumină, cadraj, stil, stare
- Pune ce nu vrei într-o listă negativă, niciodată în descrierea principală
- Cere unei IA de text să scrie promptul de imagine din ideea ta brută
- Generează la raportul de aspect de care ai de fapt nevoie
- Schimbă o singură variabilă per încercare ca să afli ce a ajutat
- Adaugă textul într-o unealtă de design, nu în modelul de imagine
- Salvează prompturile care au funcționat ca imaginile tale să arate consecvent
Întrebări frecvente
Am nevoie de abilități artistice ca să generez imagini cu IA?
Nu, dar ai nevoie de unele descriptive, iar aceasta e partea pe care începătorii o subestimează. Diferența dintre o imagine dezamăgitoare și una bună e aproape în întregime cât de specific ai descris lumina, cadrajul și stilul. Dacă descrierea unei scene în detaliu nu îți vine natural, cere unei IA de text să îți extindă ideea brută într-un prompt structurat.
Pot folosi IA ca să mă ajute să vin cu idei de imagini?
Da, și e mai util decât își dau seama majoritatea oamenilor. Cere unui chatbot cinci concepte descriptive, apoi cere-i să îți transforme favoritul într-un prompt structurat complet de imagine cu o listă negativă. Modelele de limbaj scriu prompturi de imagini mai bine decât majoritatea începătorilor, motiv pentru care generarea de imagini în interiorul unui chat bate o casetă de imagine independentă.
De ce arată textul din imaginea mea ca un nonsens?
Pentru că textul randat e cu adevărat cea mai slabă zonă la fiecare model de imagine, iar niciun prompt nu îl repară fiabil. Cuvintele scurte, singulare, uneori ies bine; titlurile, logourile și etichetele de obicei nu. Generează imaginea fără text și adaugă tipografia în orice unealtă de design, ceea ce îți permite și să folosești fontul corect și să îl plasezi corespunzător.
Care generator de imagini e cel mai bun?
Depinde de subiect mai mult decât se așteaptă oamenii. Flux e cel mai puternic pentru fotorealism și orice ar trebui să arate de parcă a venit dintr-o cameră. Stable Diffusion oferă mai mult control stilistic și varietate pentru ilustrație. Cel mai rapid mod de a decide e să rulezi același prompt prin două dintre ele și să te uiți la rezultate unul lângă altul, din moment ce câștigătorul la portrete de multe ori nu e câștigătorul la interioare.
Am nevoie de un abonament separat pentru generarea de imagini?
Nu neapărat. Generarea de imagini e inclusă în Whizi pe Pro și peste, alături de modelele de text, ceea ce acoperă munca obișnuită creativă și de conținut fără o a doua factură. O unealtă dedicată de imagini tot are sens pentru oamenii care fac asta profesional în fiecare zi și vor control stilistic foarte fin.