Llama 3가 무엇인가
Llama는 Facebook과 Instagram을 만든 회사 Meta가 개발한 AI 모델 제품군입니다. ChatGPT나 Claude처럼 질문을 입력하면 답을 돌려줍니다. 흥미로운 부분은 무엇을 하느냐가 아니라 어떻게 배포되느냐에 있습니다.
대부분의 AI 모델은 만든 회사의 제품 안에 갇혀 있습니다. ChatGPT는 OpenAI를 통해서만 쓰고, 모델 자체는 그 회사 서버를 벗어나지 않습니다. Meta는 Llama의 가중치, 즉 학습된 모델을 이루는 숫자들을 공개해서 누구나 내려받아 직접 돌릴 수 있게 합니다.
쓸 만한 비유가 있습니다. 대부분의 AI는 식당입니다. 주문하면 그쪽에서 요리해 줍니다. Llama는 레시피를 공개하는 쪽에 가깝습니다. 여전히 그 식당에서 먹어도 되고, 직접 만들어 보거나, 입맛에 맞게 고치거나, 자기 주방을 열 수도 있습니다.
온라인에서 논쟁이 오가는 지점을 하나 짚고 갑니다. Llama는 보통 오픈소스라고 소개되지만, 엄밀히 말하면 몇 가지 조건이 붙은 라이선스를 가진 "오픈 웨이트"입니다. 아주 큰 규모의 상업적 이용에 대한 제한도 여기에 들어갑니다. 개인 사용자에게는 실질적인 차이가 없습니다. 다만 이것을 기반으로 제품을 만드는 회사라면 라이선스를 읽어볼 가치가 있습니다.
아무것도 내려받지 않아도 이 점이 중요한 이유
일반 사용자에게까지 닿는 결과가 세 가지 있습니다.
저렴해서 어디에나 있습니다. 누구나 호스팅할 수 있으니 경쟁이 비용을 끌어내립니다. Llama 계열 모델은 이름이 드러나지 않은 채로 다른 제품 속 AI 기능을 상당 부분 돌리고 있고, 어떤 서비스가 빠른 등급이나 경제적인 등급이라고 부르는 것은 대체로 이 모델입니다.
인터넷 없이도 돌아갑니다. 내 기기에 올린 모델은 비행기 안에서도, 보안이 걸린 환경에서도, 데이터가 건물 밖으로 나가면 안 되는 곳에서도 작동합니다. 어떤 호스팅 서비스도 이것만은 제공할 수 없습니다.
시장을 건전하게 유지합니다. 쓸 만한 무료 선택지가 있으면 폐쇄형 모델이 매길 수 있는 가격에 상한이 생깁니다. 당신이 무엇을 쓰든 이득인 부분입니다.
실제로 잘하는 일
여기서는 열광보다 솔직함이 더 쓸모 있습니다. Llama는 여러 크기로 나오고, 맞바꿈은 늘 일관됩니다. 작은 모델은 대단히 빠르고 저렴하며, 큰 모델은 더 유능하지만 돌리는 비용이 더 이상 싸지 않습니다.
| 작업 | Llama | 다른 곳이 더 나음 |
|---|---|---|
| 간단한 사실 질문 | 빠르고 충분함 | 아니요 |
| 짧은 목록, 아이디어 내기, 간단한 다듬기 | 아주 좋고 즉각적 | 아니요 |
| 항목이 많은 반복 작업 | 최적, 건당 비용이 관건 | 아니요 |
| 오프라인이나 비공개로 돌려야 할 때 | 사실상 유일한 선택지 | 아니요 |
| 사람이 끝까지 읽을 글 | 쓸 만함 | Claude, 눈에 띄게 |
| 복잡한 다단계 추론 | 최상위보다 약함 | GPT 또는 Claude |
| 아주 긴 문서 | 제한적 | Gemini |
| 최근 몇 주 사이의 일 | 알지 못함 | 웹에 연결된 모델 |
정리하면 이렇습니다. 분량과 속도에서는 훌륭하고, 일상적인 질문에서는 경쟁력이 있으며, 어려운 추론과 잘 다듬은 글쓰기에서는 최상위 모델에 뒤집니다. 무료인 것치고는 공정한 거래이고, 그래서 "어느 쪽이 더 낫냐"는 애초에 잘못된 질문입니다. 속도와 비용이 중요한 곳에 쓰고, 작업이 어려워지면 바꾸세요.
쓰는 세 가지 방법
1. 작업 공간에서, 설정 없이. 가장 간단한 방법입니다. Llama는 GPT, Claude, Gemini와 함께 Whizi에 들어 있어서, 가벼운 질문은 Llama에 보내다가 작업이 어려워지면 같은 대화 안에서 더 강한 모델로 바꿀 수 있습니다. 설치할 것은 없습니다.
2. 내 컴퓨터에서. Ollama나 LM Studio 같은 도구가 모델을 내려받아 로컬에서 실행해 줍니다. 현실적인 기대치는 이렇습니다. 메모리가 넉넉한 비교적 최신 기기가 필요하고, 편하게 돌아가는 쪽은 작은 모델이며, 좋은 GPU가 없다면 답변 속도는 호스팅 서비스보다 느립니다. 대신 입력한 내용이 기기 밖으로 나가지 않고, 인터넷을 꺼도 작동합니다. 개인정보나 오프라인 사용이 조건이라면 정말 해볼 만하고, 그렇지 않다면 굳이 필요 없습니다.
3. API로. 소프트웨어를 만드는 중이라면, 여러 제공사가 아주 낮은 토큰당 비용으로 Llama를 호스팅합니다. 대량 작업에서 최상위 모델 대신 이 모델을 고르는 이유가 대체로 이것입니다.
좋은 답을 끌어내는 법
작은 모델은 최상위 모델과는 다른 프롬프트 방식에 더 잘 반응합니다. 습관 세 가지가 큰 차이를 만듭니다.
직접적이고 구체적으로. 카페 이름 아이디어 10개, 한 줄씩, 설명 없이가 대화하듯 던지는 요청보다 잘 통합니다. 작은 모델은 단순하고 명시적인 지시를 잘 따르고, 복잡한 지시에서는 흐트러집니다.
한 번에 하나씩. 최상위 모델은 프롬프트 하나에 조건 여섯 개가 들어가도 처리합니다. 작은 모델은 하나짜리 요청을 차례로 주는 편이 결과가 낫습니다.
형식을 말해 주세요. 한 문장으로 답해 또는 번호 목록만 반환해라고 하면, 확신이 없을 때 작은 모델이 늘어놓는 군더더기를 막을 수 있습니다.
그리고 언제 갈아탈지 아는 것이 중요합니다. 답이 두루뭉술하거나, 앞뒤가 맞지 않거나, 뻔한 것을 놓쳤다면, 표현을 계속 바꿔 볼 때가 아니라 같은 질문을 더 강한 모델로 옮기라는 신호입니다. 여러 모델을 한곳에 모아 둔 작업 공간이라면 클릭 한 번이면 되고, 대화 내용도 그대로 이어집니다.
조심해야 할 것
최근에 일어난 일은 모릅니다. 지식은 학습 시점에서 멈춰 있고, 검색에 연결되어 있지 않다면 지난달 일에 대한 질문에도 일반 지식만으로 자신 있게 답합니다.
모든 모델이 그렇듯 지어냅니다. 작은 모델은 그 정도가 조금 더 심합니다. 구체적인 사실, 날짜, 숫자는 확인하세요.
호스팅된 서비스라면 무료가 곧 비공개는 아닙니다. 내 기기에서 Llama를 돌리면 비공개입니다. 누군가의 서비스를 통해 쓴다면 그쪽의 데이터 정책이 적용되며, 이는 다른 모델과 똑같습니다.
버전 혼동. Llama 3는 하나의 세대였고, 그 뒤로 더 새로운 버전이 나왔습니다. 중요한 사안이라면 지금 쓰는 버전이 무엇인지 물어보세요. 세대 사이의 성능 차이는 큽니다.
- 속도가 중요한 간단한 질문, 짧은 목록, 반복 작업에 쓰세요
- 꼼꼼한 추론이나 잘 다듬은 글이 필요하면 더 강한 모델로 바꾸세요
- 프롬프트는 직접적으로, 한 번에 하나씩, 원하는 출력 형식을 밝혀서 쓰세요
- 오프라인이나 비공개 사용이 정말 필요할 때만 로컬로 돌리세요
- 다른 모델과 마찬가지로 구체적인 사실, 날짜, 숫자는 확인하세요
- 세대별 차이가 크니 지금 쓰는 버전이 무엇인지 물어보세요
자주 묻는 질문
Llama 3를 쓰려면 프로그램을 설치해야 하나요?
아닙니다. 내려받아 로컬에서 돌리는 것은 선택지 중 하나이고, 오프라인이나 완전한 비공개 사용이 필요하다면 그 방법이 맞습니다. 다만 성능이 괜찮은 기기가 필요하고 답변도 호스팅 서비스보다 느립니다. 대부분은 브라우저에서 플랫폼을 통해 쓰는데, 여기서는 다른 모델들과 나란히 놓여 있고 설정할 것이 전혀 없습니다.
Llama 3가 ChatGPT보다 빠른가요?
작은 Llama 모델은 눈에 띄게 빠르고, 그래서 짧은 질문, 빠른 목록 만들기, 반복적인 일에 아주 좋습니다. 맞바꾸는 것은 성능입니다. 복잡한 추론과 잘 다듬은 글쓰기에서는 최상위 모델이 분명히 낫습니다. 현명한 방법은 속도가 필요할 때 Llama를 쓰고, 질문이 생각보다 어려워지면 갈아타는 것입니다.
Llama는 정말 무료인가요?
모델 가중치는 무료로 내려받을 수 있고 라이선스도 대부분의 용도를 허용합니다. 붙어 있는 조건은 주로 아주 큰 규모의 상업적 배포에 해당합니다. 다만 실제로 돌리는 것은 공짜가 아닙니다. 내 하드웨어와 전기가 들거나 호스팅 제공사의 토큰당 요금이 들며, 그 요금이 최상위 모델보다 훨씬 낮을 뿐입니다.
내 컴퓨터에서 돌리면 비공개인가요?
네, 그것이 로컬로 돌리는 가장 큰 이유입니다. 입력한 내용이 기기 밖으로 나가지 않고, 인터넷을 끊어도 작동하며, 제공사가 개입하지 않으니 제공사 정책도 적용되지 않습니다. 대가는 설정에 드는 수고, 메모리가 넉넉한 기기, 좋은 GPU가 없을 때의 느린 응답, 그리고 편하게 돌아가는 작은 모델로 선택이 좁혀진다는 점입니다.
ChatGPT나 Claude 대신 Llama를 써야 하나요?
대신 쓰는 경우는 드물고, 함께 쓰는 경우는 많습니다. 빠르고 단순한 질문, 양이 많은 반복 작업, 비공개나 오프라인으로 돌려야 하는 일에는 Llama가 맞는 선택입니다. 누군가 꼼꼼히 읽을 글, 어려운 다단계 추론, 아주 긴 문서에는 최상위 모델이 의미 있게 낫습니다. 둘 다 손에 두면 선택은 한 번의 약속이 아니라 작업마다 하는 결정이 됩니다.