한 문단으로 보는 작동 원리
설명을 입력하면 그림이 나옵니다. 그 안에서 도구는 무작위 시각 노이즈에서 출발해, 당신의 말과 맞아떨어지는 쪽으로 그 노이즈를 조금씩 반복해서 밀어갑니다. 캡션이 달린 엄청난 수의 이미지를 통해 어떤 단어가 어떤 모습인지 학습해 두었기 때문에 가능한 일입니다.
여기서 따라오는 한 가지 결과가 초보자의 좌절 대부분을 설명합니다. 모델은 사람처럼 지시를 따르는 것이 아니라, 당신의 설명을 패턴과 맞춰보고 있습니다. "강아지는 빼줘"라고 쓰면 강아지라는 단어는 여전히 그 안에 남아 있고, 강아지가 그대로 등장할 수도 있습니다. 무언가를 빼먹으면 모델은 되묻지 않습니다. 그 빈칸을 지금까지 본 것 중 가장 평범한 버전으로 채웁니다.
이것이 기술의 전부입니다. 원하는 것을 구체적으로 말하고, 원하지 않는 것은 그것을 위해 마련된 자리에 적으세요.
여섯 부분으로 된 프롬프트 공식
좋은 이미지 프롬프트는 거의 언제나 같은 여섯 가지를 담고 있습니다. 빠진 항목은 기본값으로 채워지는데, 이미지가 뻔해 보이게 만드는 것이 바로 그 기본값입니다.
| 항목 | 무엇을 쓸까 | 빼먹으면 |
|---|---|---|
| 대상 | 구체적인 사물과 중요한 세부 | 그 명사의 가장 평범한 버전 |
| 배경 | 어디인지, 어디까지 보이는지 | 텅 비거나 어수선한 배경 |
| 조명 | 시간대, 방향, 빛의 성질 | 밋밋하고 생기 없는 빛 |
| 구도 | 클로즈업인지 와이드인지, 각도 | 매번 중앙에 놓인 미디엄 샷 |
| 스타일 | 사진, 유화, 3D 렌더, 일러스트 | 반들거리는 디지털 아트 |
| 분위기와 색 | 느낌과 색감 | 과한 채도와 센 대비 |
약한 프롬프트: 아늑한 거실.
강한 프롬프트: 벽난로에 불이 켜진 작은 거실, 낡은 안락의자에서 잠든 고등어 무늬 고양이, 서향 창으로 들어오는 늦은 오후의 빛, 문간에서 본 와이드 샷, 사실적인 사진, 35mm, 따뜻한 갈색과 부드러운 앰버, 차분하고 사람 손이 탄 느낌.
둘 다 떠올리는 데 드는 수고는 비슷합니다. 두 번째는 한 장의 그림이고, 첫 번째는 그저 분류명입니다.
그다음, 초보자가 통째로 건너뛰는 부분을 더하세요. 네거티브 목록입니다. 네거티브: 글자, 워터마크, 손가락 개수 오류, 어수선한 배경, 스톡 사진 같은 미소. 이미지에서 AI로 만든 티가 나게 하는 요소는 대부분 되풀이되는 몇 가지 흔적에서 나오고, 그것들을 이름 붙여 적어주면 사라집니다.
이 일을 훨씬 쉽게 만들어 주는 요령
이런 프롬프트를 직접 쓸 필요는 없습니다. 텍스트 AI에게 대신 써달라고 하세요.
다음 아이디어로 이미지 생성 프롬프트를 써줘: [대략의 아이디어]. 용도는 [용도]야. 대상, 배경, 조명, 구도, 스타일, 색과 분위기 순서로 구성하고 마지막에 네거티브 목록을 붙여줘. 형용사가 아니라 구도가 서로 다른 세 가지 버전을 줘.
언어 모델은 대부분의 사람보다 이미지 프롬프트를 훨씬 잘 씁니다. 형식이 이미 정해져 있고, 엄청난 수의 예시를 봐왔기 때문입니다. 채팅 안에서 이미지를 만드는 편이 이미지 전용 입력창보다 실제로 더 쓸모 있는 이유가 여기 있습니다. 프롬프트를 쓰는 도구가 그림을 그리는 도구 바로 옆에 앉아 있으니까요.
이미지가 엉뚱하게 나온 이유
초보자가 겪는 문제를 거의 다 아우르는 짧은 진단 목록입니다.
밋밋하고 뻔합니다. 조명이나 구도를 지정하지 않았습니다. 이 둘이 다른 어떤 조합보다 많은 일을 합니다.
필요한 것은 다 있는데 배치가 이상합니다. 구도를 분명하게 말하세요. 아래에서 올려다본 와이드 샷, 클로즈업, 대상은 왼쪽 3분의 1 지점처럼요. 말해주지 않으면 모델은 무엇을 어디에 두길 원하는지 전혀 알지 못합니다.
보고 싶지 않다고 한 것이 그림에 들어 있습니다. 본문 프롬프트에서 그것을 언급하면 확률이 줄기는커녕 오히려 올라갑니다. 네거티브 목록으로 옮기세요.
손, 얼굴, 작게 반복되는 디테일이 어긋납니다. 어느 도구에서든 여전히 가장 약한 영역입니다. 더 가까운 크롭, 다른 각도, 또는 손이 보이지 않는 구성을 시도해 보세요. 그냥 다시 생성하면 해결될 때도 있습니다.
글자가 알아볼 수 없게 나옵니다. 예상된 일입니다. 다음 섹션을 보세요.
스톡 사진처럼 보입니다. 꾸미지 않은 순간을 넣고, 포즈 대신 동작을 묘사하고, 네거티브에 카메라를 보고 웃는 스톡 사진을 넣으세요.
쓸 자리에 맞지 않는 비율입니다. 실제로 필요한 화면 비율을 지정해서 만드세요. 정사각형을 잘라 배너로 만들면 애써 요청한 구도를 버리는 셈입니다.
제자리를 맴돌지 않고 다듬는 법
초보자는 같은 프롬프트를 계속 다시 돌리며 더 나은 결과가 걸리기를 기다립니다. 어느 정도의 무작위성은 피할 수 없지만, 헛되이 날리는 시도의 대부분은 여러 가지를 한꺼번에 바꾸는 데서 나옵니다.
- 한 번에 하나만 바꾸세요. 조명이든 구도든 스타일이든 하나입니다. 셋을 다 바꾸면 무엇이 효과가 있었는지 알 수 없습니다.
- 디테일보다 구도를 먼저 잡으세요. 구도와 빛을 먼저 맞추는 편이, 화면에서 엉뚱한 자리에 놓인 대상을 정교하게 다듬는 것보다 훨씬 효율적입니다.
- 잘된 점을 말로 적으세요. 결과가 거의 맞았다면, 도구가 알아서 기억하겠거니 넘겨짚지 말고 다음 프롬프트에 그 점을 글로 써주세요.
- 잘 통한 프롬프트를 저장하세요. 믿을 만한 프롬프트 골격 예닐곱 개가 잘 나온 이미지 한 장보다 값어치가 큽니다. 여러 장의 그림이 한 세트처럼 보이게 만드는 것도 바로 그것입니다.
아직은 할 수 없는 일
글자. 이미지 속 문자는 어느 도구에서나 여전히 믿기 어렵습니다. 짧은 단어는 될 때도 있지만 헤드라인이나 로고는 대개 실패합니다. 그림은 글자 없이 깨끗하게 만들고 글자는 디자인 도구에서 얹으세요. 그러면 원하는 서체도 함께 얻습니다.
정확한 배치. "물체는 정확히 세 개, 빨간 것은 왼쪽에" 같은 요구는 안정적으로 지켜지지 않습니다. 배치가 중요하다면 요소를 따로따로 만들어 직접 합치세요.
같은 인물을 두 번. 여러 장에 걸쳐 동일한 사람이나 제품을 유지하기는 어렵습니다. 같은 묘사를 자세하게 반복하면 도움이 되지만, 결과가 똑같이 나온다는 보장은 없습니다.
실제 사진을 정밀하게 수정하기. 배경, 조명, 스타일은 잘 조정합니다. 하지만 어떤 사물을 왼쪽으로 5센티미터 옮기는 일은 안정적으로 해내지 못합니다.
결과물을 쓸 때는 이 점을 기억하세요. 생성한 이미지를 상업적인 용도로 내보내기 전에 규정을 확인해야 합니다. 실존 인물이나 알아볼 수 있는 장소, 살아 있는 작가의 고유한 화풍을 닮은 이미지는 특히 조심하세요. 약관은 도구마다 다르고, 책임은 그 이미지를 게시하는 사람에게 있습니다.
- 여섯 부분을 모두 넣으세요: 대상, 배경, 조명, 구도, 스타일, 분위기
- 원하지 않는 것은 본문 설명이 아니라 반드시 네거티브 목록에 적으세요
- 대략의 아이디어를 텍스트 AI에게 주고 이미지 프롬프트를 대신 쓰게 하세요
- 실제로 필요한 화면 비율로 생성하세요
- 한 번에 한 가지만 바꿔서 무엇이 효과가 있었는지 알아내세요
- 글자는 이미지 모델이 아니라 디자인 도구에서 넣으세요
- 잘 통한 프롬프트를 저장해 두면 이미지들의 결이 일관되게 유지됩니다
자주 묻는 질문
AI 이미지를 만들려면 그림 실력이 있어야 하나요?
아닙니다. 다만 묘사하는 능력은 필요하고, 초보자가 과소평가하는 부분이 바로 그것입니다. 실망스러운 이미지와 괜찮은 이미지를 가르는 것은 거의 전적으로 조명과 구도, 스타일을 얼마나 구체적으로 묘사했는지입니다. 장면을 자세히 묘사하는 일이 익숙하지 않다면, 텍스트 AI에게 대략의 아이디어를 주고 짜임새 있는 프롬프트로 늘려달라고 해보세요. 잘 통합니다.
이미지 아이디어를 떠올릴 때도 AI를 쓸 수 있나요?
네, 그리고 사람들이 생각하는 것보다 훨씬 쓸모 있습니다. 챗봇에게 묘사가 담긴 콘셉트 다섯 개를 달라고 한 뒤, 그중 마음에 드는 것을 네거티브 목록까지 갖춘 완전한 프롬프트로 만들어 달라고 하세요. 언어 모델은 대부분의 초보자보다 이미지 프롬프트를 잘 씁니다. 채팅 안에서 이미지를 만드는 편이 이미지 전용 입력창보다 나은 이유입니다.
이미지 속 글자가 왜 알아볼 수 없게 나오나요?
모든 이미지 모델에서 문자 렌더링이 실제로 가장 약한 영역이고, 어떤 프롬프트로도 안정적으로 해결되지 않기 때문입니다. 짧은 단어 하나는 제대로 나올 때가 있지만 헤드라인이나 로고, 라벨은 대개 실패합니다. 글자 없이 이미지를 만들고 디자인 도구에서 타이포그래피를 얹으세요. 그래야 정확한 서체를 쓰고 위치도 원하는 대로 잡을 수 있습니다.
어떤 이미지 생성기가 가장 좋나요?
사람들이 예상하는 것보다 주제에 따라 갈립니다. Flux는 사실적인 표현, 그리고 카메라로 찍은 것처럼 보여야 하는 결과물에 가장 강합니다. Stable Diffusion은 일러스트 쪽에서 스타일 조절과 다양성이 더 좋습니다. 가장 빠른 판단 방법은 같은 프롬프트를 두 도구에 돌려 결과를 나란히 보는 것입니다. 인물 사진에서 이긴 쪽이 실내 사진에서는 지는 경우가 흔하기 때문입니다.
이미지 생성 때문에 구독을 따로 해야 하나요?
꼭 그렇지는 않습니다. Whizi는 Pro 이상 요금제에서 텍스트 모델과 함께 이미지 생성을 제공하므로, 결제를 하나 더 늘리지 않고도 일반적인 창작과 콘텐츠 작업을 감당할 수 있습니다. 매일 전문적으로 작업하면서 아주 세밀한 스타일 제어가 필요한 사람이라면 전용 이미지 도구도 여전히 의미가 있습니다.