Meta Llama是什么(写给新手的通俗解释)

了解Meta的Llama是什么、它背后是怎么回事,以及新手可以怎样用这个飞快的AI应付日常的快速提问。

Llama是什么

Llama是Meta(Facebook和Instagram背后的公司)做的一系列AI模型。和ChatGPT、Claude一样,你打出问题,它给出回答。有意思的地方不在于它能做什么,而在于它是怎么分发出来的。

大多数AI模型都被锁在自家产品里。你通过OpenAI使用ChatGPT,模型本身从不离开他们的服务器。Meta则把Llama的权重公开出来,也就是构成这个训练好的模型的那些数字,任何人都能下载下来自己跑。

打个好懂的比方:大多数AI是餐厅,你点菜,他们做饭。Llama更像是把菜谱公开了。你依然可以去餐厅吃,也可以自己在家做、按口味改,甚至自己开一家。

有一点在网上常被争论,这里说清楚。人们通常把Llama称作开源,严格来说它是“开放权重”,附带的许可协议有一些条件,其中包括对超大规模商业使用的限制。对个人用户来说没有任何实际差别。但如果一家公司要基于它做产品,那份许可协议值得读一读。

就算你从不下载任何东西,这为什么也重要

有三个后果会落到普通用户身上。

它便宜,所以无处不在。 因为任何人都能托管它,竞争把成本压了下来。你在其他产品里遇到的大量AI功能,其实是由Llama系列模型驱动的,只是没打上标签,而各家服务所说的“快速版”或“经济版”,通常指的就是它。

它可以在没有网络的情况下运行。 跑在你自己电脑上的模型,在飞机上能用,在封闭环境里能用,在任何数据不许离开办公楼的地方也能用。任何在线服务都做不到这一点。

它让市场保持诚实。 一个能力过关的免费选项,给封闭模型的定价设了上限,不管你最后用哪个,这对你都是好事。

它到底擅长什么

在这件事上说实话,比一味夸它更有用。Llama有好几种尺寸,取舍是一致的:小模型极快极便宜,大模型能力更强,但运行成本就不便宜了。

任务Llama更适合别的模型
快速的事实性提问又快又够用不需要
短清单、头脑风暴、简单改写很好,而且秒出不需要
大量条目的重复性工作最合适,因为单条成本很关键不需要
需要离线或私密运行唯一真正的选择不需要
写给人从头读到尾的文字能用Claude,差别明显
复杂的多步推理弱于顶尖模型GPT或Claude
超长文档有限Gemini
最近几周的信息它不知道能联网的模型

规律是:在量大和求快上非常出色,在日常提问上有竞争力,在硬推理和精细写作上落后于顶尖模型。对一个免费的东西来说这个交换很公道,也正因如此,“哪个更好”是个提错了的问题。在速度和成本重要的地方用它,任务变难时就换。

三种用法

1. 通过一个工作区,不用任何配置。 最省事的做法。Whizi里包含了Llama,和GPT、Claude、Gemini放在一起,所以你可以把快速提问发给它,等任务变难时在同一段对话里切到更强的模型。没有任何东西要安装。

2. 在自己的电脑上。 Ollama和LM Studio这类工具可以把模型下载下来在本地运行。说点实际的:你需要一台相对新、内存充足的机器,能舒服跑起来的是那些小尺寸模型,而且除非你有一块好显卡,否则回答会比在线服务慢。作为交换,你输入的任何内容都不会离开这台机器,断网也能用。如果隐私或离线是硬性要求,这确实值得;否则就没必要。

3. 通过接口调用。 如果你在开发软件,各家服务商托管的Llama按token计费的价格非常低,这往往正是高频任务选它而不选顶尖模型的理由。

怎么从它这里问出好答案

小模型吃的提示词风格和顶尖模型不一样。有三个习惯能带来很大差别。

直接、具体。 列出10个咖啡馆名字创意,每行一个,不要解释比一句聊天式的请求好用得多。小模型很能执行简单明确的指令,遇到复杂交织的指令就会跑偏。

一次只说一件事。 顶尖模型能在一个提示词里处理六项约束。小模型更适合一连串单一请求。

把格式说出来。 用一句话回答或者只返回一个带编号的列表,能挡住小模型在不确定时惯有的注水。

还要知道什么时候该换。如果一个答案含糊、前后矛盾,或者漏掉了明显的东西,那就是信号:把同一个问题挪到更强的模型上,而不是继续换措辞重问。在一个同时装着好几个模型的工作区里,这只是点一下,对话内容也会带过去。

需要留心的地方

它不知道最近发生了什么。 它的知识停在训练截止日期,除非接入了搜索,否则它会凭通用知识回答关于上个月的问题,而且语气很笃定。

它会编内容,所有模型都会。 小模型编得稍微多一些。任何具体的事实、日期或数字都要核对。

如果是托管服务,免费不等于私密。 在你自己的机器上跑Llama是私密的。通过别人的服务使用它,就适用他们的数据政策,和其他任何模型一样。

版本容易搞混。 Llama已经迭代过好几代,新版本一直在发布。如果这一点对你重要,就直接问清楚你用的是哪个版本,因为不同代之间的能力差距很大。

操作清单
  • 拿它做快速提问、短清单,以及看重速度的重复性任务
  • 任务需要细致推理或精细写作时,换成更强的模型
  • 提示词保持直接,一次只提一个请求,并且写明输出格式
  • 只有在你确实需要离线或私密使用时,才在本地运行它
  • 和用任何模型一样,核对每一个具体的事实、日期和数字
  • 问清楚你用的是哪个版本,因为不同代之间差别很大

常见问题

使用Llama需要下载软件吗?

不需要。下载到本地运行只是其中一个选项,如果你需要离线或完全私密的使用方式,那它是对的选择,但这要求一台性能不错的机器,回答也比在线服务慢。大多数人是在浏览器里通过某个平台使用它的,它和其他模型并排放着,完全不用配置。

Llama比ChatGPT更快吗?

尺寸较小的Llama模型明显更快,这让它们非常适合短问题、快速清单和各种重复性工作。代价是能力:在复杂推理和精细写作上,顶尖模型明显更好。合理的做法是求快时用Llama,等发现问题比看上去难时再换。

Llama真的免费吗?

模型权重可以免费下载,许可协议允许绝大多数用途,只有一些主要针对超大规模商业部署的条件。但实际运行并不免费,成本要么是你自己的硬件和电费,要么是托管服务商按token收的费用,只不过后者比顶尖模型的价格低得多。

跑在我自己的电脑上就是私密的吗?

是的,这也是本地运行最有力的理由。你输入的任何内容都不会离开这台机器,断网也照常工作,而且不适用任何服务商政策,因为根本没有服务商参与。代价是配置要花工夫、机器内存要够、没有好显卡时响应偏慢,以及只能用那些跑得动的小尺寸模型。

我应该用Llama代替ChatGPT或Claude吗?

代替,很少;并用,很常见。它适合快速的简单提问、大批量重复性工作,以及任何必须私密或离线运行的场景。而要写给人认真读的文字、要做困难的多步推理、要处理超长文档时,顶尖模型明显更好。两边都在手边,意味着你按任务来选,而不是一次性押注。