Что такое Llama 3
Llama, это семейство моделей ИИ, которое делает Meta, компания за Facebook и Instagram. Как и в ChatGPT или Claude, вы пишете вопрос и получаете ответ. Интересно здесь не то, что она делает, а то, как её распространяют.
Большинство моделей ИИ заперты внутри продукта своего создателя. Вы пользуетесь ChatGPT через OpenAI, и сама модель никогда не покидает их серверы. Meta же выкладывает веса Llama, то есть числа, из которых состоит обученная модель, чтобы любой мог их скачать и запустить.
Полезная аналогия: почти любой ИИ, это ресторан, где вы делаете заказ, а готовят за вас. Llama ближе к опубликованному рецепту. Вы по-прежнему можете поесть в ресторане, а можете приготовить сами, изменить рецепт под себя или открыть собственную кухню.
Одно уточнение, вокруг которого в интернете идут споры. Llama обычно называют моделью с открытым исходным кодом, хотя строго говоря это «открытые веса»: лицензия несёт ряд условий, включая ограничения на коммерческое использование в очень больших масштабах. Для частного человека разницы на практике нет. Компании, которая строит на ней свой продукт, лицензию стоит прочитать.
Почему это важно, даже если вы ничего не скачиваете
До обычного пользователя доходят три следствия.
Она дешёвая, поэтому она везде. Разместить её у себя может кто угодно, и конкуренция сбивает цену. На моделях Llama работает изрядная часть того ИИ, с которым вы сталкиваетесь в других продуктах, без всякой этикетки, и обычно именно их сервис имеет в виду, когда говорит о быстром или экономичном режиме.
Она может работать без интернета. Модель на вашем компьютере работает в самолёте, в защищённом контуре и вообще везде, откуда данные не должны уходить. Ни один облачный сервис такого предложить не может.
Она удерживает рынок в честных рамках. Способный бесплатный вариант ставит потолок тому, сколько могут просить закрытые модели, и это хорошо для вас независимо от того, чем вы пользуетесь.
В чём она действительно хороша
Честность здесь полезнее восторгов. Llama выходит в нескольких размерах, и компромисс всегда один: маленькие модели крайне быстрые и дешёвые, большие способнее, но запускать их уже недёшево.
| Задача | Llama | Где лучше другие |
|---|---|---|
| Быстрые фактические вопросы | Быстро и достаточно | Нет |
| Короткие списки, идеи, простые переписывания | Очень хорошо, и мгновенно | Нет |
| Однотипная работа по множеству элементов | Идеально, потому что важна цена за элемент | Нет |
| Всё, что должно работать офлайн или приватно | Единственный реальный вариант | Нет |
| Текст, который человек прочитает от начала до конца | Сойдёт | Claude, заметно лучше |
| Сложные многошаговые рассуждения | Слабее передовых моделей | GPT или Claude |
| Очень длинные документы | Ограниченно | Gemini |
| Всё, что произошло за последние недели | Не знает | Модель с доступом в интернет |
Картина такая: отлично для объёма и скорости, конкурентоспособно для повседневных вопросов и позади передовых моделей в сложных рассуждениях и отточенном тексте. Для чего-то бесплатного это честная сделка, и именно поэтому «что лучше», это неправильный вопрос. Берите её там, где важны скорость и цена, и переключайтесь, когда задача становится сложной.
Три способа ей пользоваться
1. Через рабочее пространство, без всякой настройки. Самый простой вариант. Llama есть в Whizi рядом с GPT, Claude и Gemini, поэтому быстрые вопросы можно отправлять ей, а когда задача усложнится, переключиться на более сильную модель прямо в том же разговоре. Устанавливать нечего.
2. На своём компьютере. Инструменты вроде Ollama и LM Studio скачивают модель и запускают её локально. Реалистичные ожидания: нужен достаточно современный компьютер с приличным объёмом памяти, комфортно идут именно маленькие модели, а ответы будут медленнее, чем у облачного сервиса, если у вас нет хорошей видеокарты. Взамен ничего из написанного вами не покидает компьютер, и всё работает с выключенным интернетом. Это действительно стоит усилий, когда требование, это приватность или работа офлайн, и не нужно во всех остальных случаях.
3. Через API. Если вы разрабатываете софт, провайдеры размещают Llama с очень низкой ценой за токен, и часто именно это склоняет выбрать её вместо передовой модели на задачах с большим объёмом.
Как получать от неё хорошие ответы
Маленькие модели вознаграждают не тот стиль промптов, что передовые. Три привычки дают большую разницу.
Пишите прямо и конкретно. Дай 10 идей названия для кофейни, по одной в строке, без пояснений работает лучше, чем разговорная просьба. Маленькие модели хорошо следуют простым явным инструкциям и теряются на витиеватых.
По одному делу за раз. Передовые модели удерживают шесть ограничений в одном промпте. Маленькие лучше справляются с цепочкой одиночных просьб.
Называйте формат. Ответь одним предложением или верни только нумерованный список убирает воду, которую маленькие модели наливают, когда не уверены.
И понимайте, когда пора переключаться. Если ответ размытый, противоречит сам себе или упускает очевидное, это сигнал перенести тот же вопрос на более сильную модель, а не переформулировать его снова и снова. В рабочем пространстве, где собрано несколько моделей, это один клик, и разговор переходит вместе с вами.
С чем нужно быть осторожным
Она не знает, что случилось недавно. Её знания заканчиваются на дате обучения, и если она не подключена к поиску, то на вопрос о прошлом месяце ответит из общих соображений, причём уверенно.
Она выдумывает, как и любая модель. Маленькие делают это чуть чаще. Проверяйте любой конкретный факт, дату или число.
Бесплатно не значит приватно, если это облако. Запуск Llama на своём компьютере приватен. Использование её через чей-то сервис означает, что действует политика данных этого сервиса, ровно как и с любой другой моделью.
Путаница с версиями. Llama 3, это одно поколение, и с тех пор вышли более новые версии. Если для вас это важно, спрашивайте, какую версию вы используете, потому что разница в возможностях между поколениями большая.
- Берите её для быстрых вопросов, коротких списков и однотипных задач, где важна скорость
- Переключайтесь на более сильную модель, когда нужны аккуратные рассуждения или отточенный текст
- Пишите промпты прямо, по одной просьбе за раз, и указывайте нужный формат ответа
- Запускайте её локально, только если вам действительно нужна работа офлайн или приватность
- Проверяйте любой конкретный факт, дату или число, как и с любой моделью
- Спрашивайте, какую версию вы используете, потому что поколения различаются сильно
Частые вопросы
Нужно ли что-то скачивать, чтобы пользоваться Llama 3?
Нет. Скачать и запустить её локально, это один из вариантов, и он правильный, если вам нужна работа офлайн или полная приватность, но он требует достаточно мощного компьютера и даёт более медленные ответы, чем облачный сервис. Большинство пользуется ею через платформу в браузере, где она стоит рядом с другими моделями и не требует вообще никакой настройки.
Llama 3 быстрее, чем ChatGPT?
Маленькие модели Llama заметно быстрее, и поэтому они отлично подходят для коротких вопросов, быстрых списков и всего однотипного. Компромисс, это возможности: в сложных рассуждениях и отточенном тексте передовые модели явно лучше. Разумный подход, это брать Llama ради скорости и переключаться, когда вопрос оказывается сложнее, чем выглядел.
Llama действительно бесплатная?
Веса модели можно скачать бесплатно, и лицензия разрешает большинство сценариев, с несколькими условиями, которые важны в основном для очень крупных коммерческих внедрений. Запуск на практике бесплатным не выходит: он стоит либо вашего железа и электричества, либо платы за токены облачному провайдеру, просто эта плата намного ниже, чем берут передовые модели.
Приватно ли это, если запускать её на своём компьютере?
Да, и это самая веская причина запускать её локально. Ничего из написанного вами не покидает компьютер, всё работает с отключённым интернетом, и никакая политика провайдера не действует, потому что провайдера просто нет. Плата за это, это возня с настройкой, компьютер с достаточным объёмом памяти, более медленные ответы без хорошей видеокарты и ограничение маленькими моделями, которые идут комфортно.
Стоит ли пользоваться Llama вместо ChatGPT или Claude?
Вместо, редко. Вместе с ними, часто. Она правильный выбор для быстрых простых вопросов, однотипной работы большого объёма и всего, что должно работать приватно или офлайн. Для текста, который кто-то будет читать внимательно, для сложных многошаговых рассуждений и для очень длинных документов передовые модели ощутимо лучше. Когда доступно и то и другое, выбор делается под каждую задачу, а не раз и навсегда.