Whizi支持的文件类型:你可以上传什么

快速解答

Whizi支持上传图片、PDF、Word文档、Excel表格、PowerPoint幻灯片,以及大约四十种纯文本和源代码格式。文件上传功能在所有套餐上都可以使用,包括Starter套餐,上传文件也不消耗额度。PDF、Word、Excel和PowerPoint会先在你的浏览器中提取成文本,之后才会被发送出去。

简短答案

Whizi支持上传图片、PDF、Word文档、Excel表格、PowerPoint幻灯片,以及大约四十种纯文本和源代码格式。文件上传功能在所有套餐(包括Starter套餐)上都能使用,上传文件不消耗任何额度。

这四大类文件,以及Whizi对每一类的处理方式:

类别扩展名Whizi的处理方式
图片.png、.jpg、.jpeg直接作为图片传给模型,模型能直接看到内容
文档.pdf、.docx、.doc在你的浏览器中提取成文本,再以文本形式发送
表格.xlsx、.xls提取单元格内容并以结构化文本发送;旧版.xls格式会提示你另存为.xlsx
演示文稿.pptx、.ppt逐页提取幻灯片文字、表格和演讲者备注;旧版.ppt格式会提示你另存为.pptx
文本和代码40多种扩展名,见下文原样以文本形式发送

完整的扩展名列表

图片。 .png.jpg.jpeg

文档、表格和演示文稿。 .pdf.docx.doc.xlsx.xls.pptx.ppt。基于zip的新版格式可以直接在浏览器中解析;旧版二进制.xls.ppt文件也能被选择器接受,但会提示你另存为.xlsx.pptx后再重新上传。

源代码。 .js.ts.jsx.tsx.py.java.cpp.c.cs.rb.php.go.rs.swift.kt.kts.scala.lua.pl.pm.r.m.sql.graphql

标记语言和样式表。 .html.css.scss.sass.less.xml.md

配置和数据。 .json.yaml.yml.env.ini.conf.csv.txt

Shell脚本。 .sh.bash.zsh.fish

如果你的文件格式不在这份列表里,最快的办法通常是先把它导出或另存为PDF、CSV或纯文本。Google Doc可以另存为.docx或PDF,Keynote演示文稿可以另存为.pptx或PDF,几乎任何数据导出都能变成.csv

提取功能到底是怎么工作的

对于PDF、Word、Excel和PowerPoint文件,文本会先在你的浏览器中提取出来,然后才发送出去。模型接收到的是提取出的文本,而不是原始的二进制文件。这带来两个值得了解的后果。

第一个后果是,扫描版PDF没有文本层可供提取。Whizi会根据页面中能提取到的文本量过少来判断这是一份以图片为主的PDF,转而把文件送去做一次服务器端的视觉识别,得到逐页的文字记录,之后这份记录会走和提取文本一样的处理路径。如果这次识别无法生成文字记录,始终有效的备用方案是把这些页面当作图片上传,因为具备视觉能力的模型可以直接读取页面图片。

第二个后果是版面会部分丢失。文本提取保留的是文字内容和阅读顺序,而不是视觉排版,所以一份复杂的多栏报告或格式繁复的表格,到手后可能会比屏幕上看到的更扁平。就表格而言,上传.csv.xlsx能让模型获得比同一张表格嵌在PDF里干净得多的结构。表格上传之后该怎么用,是一整套独立的工作方式,详见如何用AI分析表格

图片则不一样:它们会直接传给模型,而不经过文本提取,所以只要你选择的模型具备识图能力,图表、示意图、截图和手写内容都能正常识别。

保留和删除

上传的附件和生成的媒体文件设定为最长保留30天后过期。你也可以自己提前删除,账号注销时会连同其他所有内容一起删除它们。

Whizi不会使用你的提示词、文件、对话、语音转录内容或生成内容来训练Whizi自有的AI模型,也不会把这些内容作为训练数据出售。完整说明见Whizi如何处理你的数据

操作清单
  • 支持图片、PDF、Word、Excel、PowerPoint,以及40多种文本和代码格式
  • 所有套餐(包括Starter套餐)都支持文件上传
  • 上传文件不消耗额度
  • PDF、Word、Excel和PowerPoint会先在你的浏览器中提取成文本
  • 扫描版PDF会通过服务器端视觉识别逐页转录
  • 表格以.csv或.xlsx格式上传,效果远好于嵌在PDF里
  • 上传的文件最长保留30天后过期

常见问题

我可以给Whizi上传PDF吗?

可以,所有套餐(包括Starter套餐)都支持,而且不消耗额度。文本会在你的浏览器中提取出来,发送给你选择的模型,所以你可以先问GPT关于这份PDF的问题,再把同一段对话切换到Claude继续追问,无需重新上传。如果是扫描版或以图片为主的PDF,Whizi会根据页面中可提取的文本量过少来识别,转而通过服务器端视觉识别逐页转录。

Whizi能读取Excel文件吗?

对.xlsx格式可以。旧版二进制.xls格式无法在浏览器中解析,所以Whizi会要求你另存为.xlsx后再重新上传。单元格内容会被提取并以结构化文本发送,这比把同一张表格粘贴进消息或嵌在PDF里得到的数据干净得多。对于任何分析类任务,表格上传都是能得到最可靠答案的格式。

文件大小有限制吗?

实际的限制来自你所选模型的上下文窗口,而不是一个固定的上传上限。一份很长的文档会占用大量上下文,导致模型无法把这部分容量用于其他内容,所以超大文件最好拆分成你真正想分析的那几部分。如果文档对你选择的模型来说太长,在同一段对话中切换到上下文窗口更大的模型通常就能解决。

我可以一次上传多个文件吗?

可以,这也是多模型工作区里比较实用的一种用法:把一份表格和它对应的PDF报告一起上传,让模型帮你核对两者是否一致。拖放上传在聊天窗口的任何位置都能用,不局限于附件按钮上。

我上传的文件会被用来训练AI模型吗?

Whizi不会使用你的提示词、文件、对话、语音转录内容或生成内容来训练Whizi自有的AI模型,也不会把这些内容作为训练数据出售。上传的文件设定为最长保留30天后过期,你可以提前删除,也可以通过注销账号删除全部内容。