Google Gemini是什么,怎么用(新手入门指南)

了解Google Gemini是什么、它怎么工作,以及新手可以怎样用它节省时间、找灵感和读懂长文档。

Gemini是什么,它有什么不一样

Gemini是Google的AI助手。你用日常语言打出问题,它就回答。如果你用过ChatGPT,大约十秒钟就会觉得熟悉。

有两点让它真正与众不同,而且都比听起来更有用。

它知道当下正在发生什么。 因为出自Google,它和Google搜索联系紧密。问它上周的事情,它真的会去查,给你链接,并告诉你答案的出处。大多数助手只能凭训练时学到的内容回答,于是你会得到一个语气笃定但其实早已过时的说法。

它一次能读的量非常大。 这一点常被低估。每个助手在一段对话中能同时记住的文字量都有上限,而Gemini的上限比大多数模型高得多。一份三百页的报告、一整套合同,或者一学期的课件,都能整份文件丢进去。

“一次读得更多”为什么会改变你能做的事

当一份文档超出助手能承载的量时,它只能一段一段地处理。这对于只问某一节的问题没问题,但对于关于整份文档的问题就不可靠了。

当全部内容真的都在视野里时,下面这些才成立:

  • 这份合同里有没有哪两个条款互相矛盾?
  • 在这十五份文档中,结论在哪些地方彼此不一致,为什么?
  • 这个术语在文档里有定义吗?定义和后文的用法一致吗?
  • 正文细节里有哪些内容是执行摘要没有提到的?

工具一次只读一小块时,这些问题都做不好,因为每一个都需要整份文档同时在场。如果你经常要处理长PDF、报告或会议记录,光是这一项能力,对你的意义可能就超过这个模型的其他所有特点。

值得复制的提示词

读一份长文档

阅读附件文档,然后告诉我:最重要的五件事;任何会让我承担义务或产生成本的内容;任何含糊带过的地方;以及摘要部分遗漏的重要内容。每一条都给出确切引文和页码。

一定要让它给引文。核对只要几秒钟,而这是唯一可靠的办法,让你确认答案来自你的文档,而不是来自它对“这类文档”的一般印象。

查一件正在发生的事

查一下[主题]在过去六个月里发生了哪些变化。每条结论都给出来源链接和日期。来源之间说法不一致时,两边都列出来,不要只挑一个。如果有内容你无法核实,请明确说出来。

对比文档

对比附件里的两份文件。做一张表,列出每一处有实质意义的差异:主题、第一份怎么说、第二份怎么说。忽略排版差异。另外单独列出只在其中一份里出现、另一份缺失的内容。

看懂一张图片

这是一张[某物]的照片。先准确描述你能看到什么,然后再做任何解读。接着回答我:[你的问题]。 先要描述,能在误读变成错误答案之前就把它抓出来。

它并不是最擅长的事

这里说实话,能让你以后少些失望。

写给人从头读到尾的文字。 Gemini写得合格。Claude写得更好,而且在邮件、消息,以及任何对语气有要求的内容上,一个提示词之内你就能看出差别。

大批量的严格格式。 如果你要两百行格式完全一致的内容,ChatGPT在保持严格格式上更可靠。

与其说这是弱点,不如说是专长分工。Gemini负责读和查,其他模型负责写和搭结构。大多数真实任务两半都需要,所以好用的套路是:在Gemini里查完,再把结果交给别的模型。

它的价格

有免费版本,而且真的够用,包括联网能力,只是使用更强模型的额度有限。

付费方案大约每月20美元(美元计价),它以Google One AI Premium的形式打包,附带2TB云存储。这个打包值得认真看一看。如果你本来就会买2TB的Google存储,比如你有很大的照片库,或者一家人共用Drive,那AI等于是便宜捎带来的,这笔账很划算。如果你现在用的是免费存储,还只用了一小部分,那你订阅费的一部分就是在买你永远填不满的空间。

付费方案还带来另一样东西:Gmail、Docs和Drive里的Gemini。如果你的工作就在这些工具里,那是任何外部工具都复制不了的实打实的优势。

另外值得知道的替代方案:Whizi用比Google方案更低的价格把Gemini系列模型和ChatGPT、Claude一起包含进来,只是不含存储空间。直接对比可以看Whizi与Gemini Advanced对比

需要留心的地方

能联网不等于一定正确。 有来源可查确实大幅减少了凭空编造。但它消除不了更难发现的那种错误:附上了一个真实来源,而这个来源其实并不支持那个说法。把链接点开看。

它不是每次都会去搜。 取决于你怎么问,它可能凭记忆回答而不去查。凡是涉及最新情况的,都要确认它确实引用了来源。

它太容易顺着你。 你一反驳,它常常就放弃了原本正确的答案。先问它怎么看,再说你怎么想。

长不等于细。 对一份很长的文档要“所有重要内容”,你会拿到一份平淡的清单。问具体问题,才能得到有用的答案。

上传什么要谨慎。 这里不适合放他人的个人信息,也不适合放你公司有保密规定的内容。去掉人名很少会影响分析结果。

操作清单
  • 凡是涉及近期信息的都交给Gemini,并且把它给的链接点开看
  • 长文档直接以文件形式上传,而不是粘贴摘录
  • 每次都要求它给出支撑答案的确切引文
  • 对长文档提具体问题,而不是笼统地要摘要
  • 需要写给人从头读到尾的文字时,换一个模型
  • 算一算:那2TB存储如果单独买,你到底会不会买
  • 处理图片时,先要描述,再要解读

常见问题

用Google Gemini需要会编程吗?

完全不需要。你就用日常语言打字,和给同事发消息一模一样,没有东西要安装或配置。唯一真正的技巧是把话说具体:说清楚答案是给谁看的、你想要什么格式、哪些内容不要写,这比任何技术知识都更能改善结果。

Google Gemini免费吗?

有一个真的够用的免费版本,包括联网能力,只是重度使用更强模型时有额度限制。付费方案大约每月20美元,打包附带2TB的Google One存储,以及Gmail和Docs里的集成。这笔钱值不值,主要取决于你本来会不会买那份存储。

和ChatGPT相比,Gemini最强在哪里?

明显有两点。一是涉及近期信息的内容,因为它能搜索并给出你可以点开核对的链接,而大多数助手只能按一个固定的训练截止时间回答。二是长文档,因为它一次能承载的文字多得多,所以横跨整份报告或一整套文件的问题才真的问得成。ChatGPT在结构和格式化输出上更好,Claude在写作上更好。

Gemini能读PDF和图片吗?

两样都能,而长PDF正是它最强的地方,因为你可以上传整份文件而不是摘录。图片方面,它能读照片、图表、截图和示意图。处理图片时一个好习惯是:先让它准确描述看到了什么,再做任何解读,这能在误读变成一个语气笃定的错误答案之前就把它拦下来。

我该用Gemini还是别的?

如果条件允许就都用,因为它们的强项几乎不重叠。阅读和调研用Gemini,写作用Claude,结构和格式化输出用ChatGPT。常见套路是在Gemini里做调研,再把结论交给另一个模型来成文,效果比只用其中一个更好。当它们在同一段对话里时,这就是一步,而不是两个标签页。