Llama是什么
Llama是Meta(Facebook和Instagram背后的公司)做的一系列AI模型。和ChatGPT、Claude一样,你打出问题,它给出回答。有意思的地方不在于它能做什么,而在于它是怎么分发出来的。
大多数AI模型都被锁在自家产品里。你通过OpenAI使用ChatGPT,模型本身从不离开他们的服务器。Meta则把Llama的权重公开出来,也就是构成这个训练好的模型的那些数字,任何人都能下载下来自己跑。
打个好懂的比方:大多数AI是餐厅,你点菜,他们做饭。Llama更像是把菜谱公开了。你依然可以去餐厅吃,也可以自己在家做、按口味改,甚至自己开一家。
有一点在网上常被争论,这里说清楚。人们通常把Llama称作开源,严格来说它是“开放权重”,附带的许可协议有一些条件,其中包括对超大规模商业使用的限制。对个人用户来说没有任何实际差别。但如果一家公司要基于它做产品,那份许可协议值得读一读。
就算你从不下载任何东西,这为什么也重要
有三个后果会落到普通用户身上。
它便宜,所以无处不在。 因为任何人都能托管它,竞争把成本压了下来。你在其他产品里遇到的大量AI功能,其实是由Llama系列模型驱动的,只是没打上标签,而各家服务所说的“快速版”或“经济版”,通常指的就是它。
它可以在没有网络的情况下运行。 跑在你自己电脑上的模型,在飞机上能用,在封闭环境里能用,在任何数据不许离开办公楼的地方也能用。任何在线服务都做不到这一点。
它让市场保持诚实。 一个能力过关的免费选项,给封闭模型的定价设了上限,不管你最后用哪个,这对你都是好事。
它到底擅长什么
在这件事上说实话,比一味夸它更有用。Llama有好几种尺寸,取舍是一致的:小模型极快极便宜,大模型能力更强,但运行成本就不便宜了。
| 任务 | Llama | 更适合别的模型 |
|---|---|---|
| 快速的事实性提问 | 又快又够用 | 不需要 |
| 短清单、头脑风暴、简单改写 | 很好,而且秒出 | 不需要 |
| 大量条目的重复性工作 | 最合适,因为单条成本很关键 | 不需要 |
| 需要离线或私密运行 | 唯一真正的选择 | 不需要 |
| 写给人从头读到尾的文字 | 能用 | Claude,差别明显 |
| 复杂的多步推理 | 弱于顶尖模型 | GPT或Claude |
| 超长文档 | 有限 | Gemini |
| 最近几周的信息 | 它不知道 | 能联网的模型 |
规律是:在量大和求快上非常出色,在日常提问上有竞争力,在硬推理和精细写作上落后于顶尖模型。对一个免费的东西来说这个交换很公道,也正因如此,“哪个更好”是个提错了的问题。在速度和成本重要的地方用它,任务变难时就换。
三种用法
1. 通过一个工作区,不用任何配置。 最省事的做法。Whizi里包含了Llama,和GPT、Claude、Gemini放在一起,所以你可以把快速提问发给它,等任务变难时在同一段对话里切到更强的模型。没有任何东西要安装。
2. 在自己的电脑上。 Ollama和LM Studio这类工具可以把模型下载下来在本地运行。说点实际的:你需要一台相对新、内存充足的机器,能舒服跑起来的是那些小尺寸模型,而且除非你有一块好显卡,否则回答会比在线服务慢。作为交换,你输入的任何内容都不会离开这台机器,断网也能用。如果隐私或离线是硬性要求,这确实值得;否则就没必要。
3. 通过接口调用。 如果你在开发软件,各家服务商托管的Llama按token计费的价格非常低,这往往正是高频任务选它而不选顶尖模型的理由。
怎么从它这里问出好答案
小模型吃的提示词风格和顶尖模型不一样。有三个习惯能带来很大差别。
直接、具体。 列出10个咖啡馆名字创意,每行一个,不要解释比一句聊天式的请求好用得多。小模型很能执行简单明确的指令,遇到复杂交织的指令就会跑偏。
一次只说一件事。 顶尖模型能在一个提示词里处理六项约束。小模型更适合一连串单一请求。
把格式说出来。 用一句话回答或者只返回一个带编号的列表,能挡住小模型在不确定时惯有的注水。
还要知道什么时候该换。如果一个答案含糊、前后矛盾,或者漏掉了明显的东西,那就是信号:把同一个问题挪到更强的模型上,而不是继续换措辞重问。在一个同时装着好几个模型的工作区里,这只是点一下,对话内容也会带过去。
需要留心的地方
它不知道最近发生了什么。 它的知识停在训练截止日期,除非接入了搜索,否则它会凭通用知识回答关于上个月的问题,而且语气很笃定。
它会编内容,所有模型都会。 小模型编得稍微多一些。任何具体的事实、日期或数字都要核对。
如果是托管服务,免费不等于私密。 在你自己的机器上跑Llama是私密的。通过别人的服务使用它,就适用他们的数据政策,和其他任何模型一样。
版本容易搞混。 Llama已经迭代过好几代,新版本一直在发布。如果这一点对你重要,就直接问清楚你用的是哪个版本,因为不同代之间的能力差距很大。
- 拿它做快速提问、短清单,以及看重速度的重复性任务
- 任务需要细致推理或精细写作时,换成更强的模型
- 提示词保持直接,一次只提一个请求,并且写明输出格式
- 只有在你确实需要离线或私密使用时,才在本地运行它
- 和用任何模型一样,核对每一个具体的事实、日期和数字
- 问清楚你用的是哪个版本,因为不同代之间差别很大
常见问题
使用Llama需要下载软件吗?
不需要。下载到本地运行只是其中一个选项,如果你需要离线或完全私密的使用方式,那它是对的选择,但这要求一台性能不错的机器,回答也比在线服务慢。大多数人是在浏览器里通过某个平台使用它的,它和其他模型并排放着,完全不用配置。
Llama比ChatGPT更快吗?
尺寸较小的Llama模型明显更快,这让它们非常适合短问题、快速清单和各种重复性工作。代价是能力:在复杂推理和精细写作上,顶尖模型明显更好。合理的做法是求快时用Llama,等发现问题比看上去难时再换。
Llama真的免费吗?
模型权重可以免费下载,许可协议允许绝大多数用途,只有一些主要针对超大规模商业部署的条件。但实际运行并不免费,成本要么是你自己的硬件和电费,要么是托管服务商按token收的费用,只不过后者比顶尖模型的价格低得多。
跑在我自己的电脑上就是私密的吗?
是的,这也是本地运行最有力的理由。你输入的任何内容都不会离开这台机器,断网也照常工作,而且不适用任何服务商政策,因为根本没有服务商参与。代价是配置要花工夫、机器内存要够、没有好显卡时响应偏慢,以及只能用那些跑得动的小尺寸模型。
我应该用Llama代替ChatGPT或Claude吗?
代替,很少;并用,很常见。它适合快速的简单提问、大批量重复性工作,以及任何必须私密或离线运行的场景。而要写给人认真读的文字、要做困难的多步推理、要处理超长文档时,顶尖模型明显更好。两边都在手边,意味着你按任务来选,而不是一次性押注。