今年
最新一条是GLM-5.3,来自Z.ai,发布于2026年8月14日。这张表按最新排在最前,收录范围至2026年8月。
| 日期 | 模型 | 厂商 | 为什么重要 |
|---|---|---|---|
| 2026年8月14日 | GLM-5.3 | Z.ai | GLM系列在开放权重扎堆的8月带来的更新。 |
| 2026年8月13日 | Gemini 3.7 Flash | 快速档位在两次Pro发布之间持续吸收能力。 | |
| 2026年8月6日 | Grok 4.6 | xAI | 专注于长时间运行的智能体,上下文窗口达到50万token。 |
| 2026年8月2日 | Qwen3.8 Max | Qwen | 阿里巴巴这个夏天规模最大的Qwen发布。 |
| 2026年7月16日 | Grok 4.5 | xAI | xAI年中在编程和成本上的一次发力。 |
| 2026年7月16日 | Kimi K3 | Moonshot | 一款2.8万亿参数的开放权重旗舰模型,权重已于7月27日跟进发布。 |
| 2026年7月9日 | GPT-5.6(Sol、Terra、Luna) | OpenAI | 三个命名分支取代了单一旗舰模型的老模式。 |
| 2026年6月30日 | Claude Sonnet 5 | Anthropic | 5系列的主力担当:接近旗舰的水准,配上Sonnet档位的价格,成为Anthropic各产品线的默认模型。 |
| 2026年6月9日 | Claude Fable 5 | Anthropic | 首款Mythos级模型,在Opus档位之上开启了Anthropic的5系列。 |
| 2026年5月28日 | Claude Opus 4.8 | Anthropic | Opus系列春季的收官之作。 |
| 2026年4月24日 | DeepSeek V4 | DeepSeek | DeepSeek新一代主力系列,在GPT-5.5发布一天后落地。 |
| 2026年4月23日 | GPT-5.5 | OpenAI | 号称OpenAI最聪明、最懂用户意图的模型;即时版在5月面向免费用户开放。 |
| 2026年4月16日 | Claude Opus 4.7 | Anthropic | 8天内三次前沿发布中的第一次。 |
| 2026年3月5日 | GPT-5.4 | OpenAI | 5系列的发布节奏稳定在大约每季度一次。 |
| 2026年2月19日 | Gemini 3.1 Pro | 谷歌春季旗舰模型的更新。 | |
| 2026年2月5日 | GPT-5.3-Codex | OpenAI | 一款专攻代码的旗舰模型,瞄准智能体式的软件开发工作。 |
2025年:推理竞赛与价格雪崩
这一年,DeepSeek R1让便宜的推理模型成了一次市场事件,推理模型变成了前沿模型的默认形态,而11月更是把四次前沿发布塞进了短短13天:GPT-5.1、Grok 4.1、Gemini 3 Pro和Claude Opus 4.5。Grok 4.1是一次小版本更新,所以它算在这个窗口期内,却没能在表格里单独占一行。
| 日期 | 模型 | 厂商 | 为什么重要 |
|---|---|---|---|
| 2025年12月11日 | GPT-5.2 | OpenAI | OpenAI在12月对5系列做的一次更新。 |
| 2025年12月1日 | DeepSeek V3.2 | DeepSeek | 稀疏注意力版本转正为稳定版,推理模式下支持工具调用。 |
| 2025年11月24日 | Claude Opus 4.5 | Anthropic | Anthropic以旗舰档位的一次大幅降价,为11月这波发布收尾。 |
| 2025年11月18日 | Gemini 3 Pro | 谷歌在这个行业有史以来发布最密集的月份里交出的11月答卷。 | |
| 2025年11月12日 | GPT-5.1 | OpenAI | 即时版和思考版两个分支,拉开了拥挤11月的序幕。 |
| 2025年9月29日 | DeepSeek V3.2-Exp | DeepSeek | 开放权重里的稀疏注意力实验,后来演变成了V3.2。 |
| 2025年8月7日 | GPT-5 | OpenAI | 千呼万唤的旗舰模型,在快速模式和思考模式之间自动路由。 |
| 2025年7月11日 | Kimi K2 | Moonshot | 来自中国月之暗面(Moonshot)的万亿参数开放权重模型,在智能体任务上表现强劲。 |
| 2025年7月9日 | Grok 4 | xAI | xAI跻身前沿档位,差异化优势是实时的X平台数据。 |
| 2025年5月22日 | Claude Opus 4 and Sonnet 4 | Anthropic | 精准定位于编程和长时间运行的智能体工作。 |
| 2025年4月16日 | o3 and o4-mini | OpenAI | 推理模型用上了工具调用:一边思考,一边搜索、写代码、读图片。 |
| 2025年4月5日 | Llama 4(Scout、Maverick) | Meta | Meta的开放权重系列升级为多模态,上下文长度也大幅拉长。 |
| 2025年3月25日 | Gemini 2.5 Pro | 谷歌拿下跑分领先地位,头号卖点是100万token的上下文窗口。 | |
| 2025年2月24日 | Claude 3.7 Sonnet | Anthropic | 混合推理:同一个模型自己决定什么时候该多想一会儿。 |
| 2025年1月20日 | DeepSeek R1 | DeepSeek | 这次发布搅动了整个市场:开放权重的推理模型,价格大约只有西方API的十分之一。 |
铺垫期:2022年到2024年
塑造出今天这个格局的那些发布:ChatGPT的问世、第一轮前沿竞赛,以及多模态和推理模型的登场。
| 日期 | 模型 | 厂商 | 为什么重要 |
|---|---|---|---|
| 2024年12月26日 | DeepSeek V3 | DeepSeek | 开放权重模型逼近前沿水准,训练成本却只是一小部分。为1月的那次发布铺好了舞台。 |
| 2024年12月11日 | Gemini 2.0 Flash | 快速档位的模型第一次真正变得能干,预示了后来廉价模型的价格雪崩。 | |
| 2024年9月12日 | o1-preview | OpenAI | 第一款进入主流视野的推理模型:回答变慢了,但会先想清楚再作答。 |
| 2024年6月20日 | Claude 3.5 Sonnet | Anthropic | 一款中端模型打败了上一代旗舰,重新定义了Sonnet档位该有的水准。 |
| 2024年5月13日 | GPT-4o | OpenAI | 语音和视觉原生融进同一个模型,免费档位也能用上前沿能力。 |
| 2024年3月4日 | Claude 3(Opus、Sonnet、Haiku) | Anthropic | 沿用至今的档位命名法:一个旗舰、一个主力、一个又快又便宜的模型。 |
| 日期 | 模型 | 厂商 | 为什么重要 |
|---|---|---|---|
| 2023年12月6日 | Gemini | 谷歌对GPT-4的回应,三强前沿竞赛由此打响。 | |
| 2023年7月11日 | Claude 2 | Anthropic | Anthropic向公众开放Claude,当时10万token的上下文窗口堪称巨大。 |
| 2023年3月14日 | GPT-4 | OpenAI | 大多数专业人士用上的第一款前沿模型,付费AI订阅从此开始规模化。 |
| 日期 | 模型 | 厂商 | 为什么重要 |
|---|---|---|---|
| 2022年11月30日 | ChatGPT | OpenAI | 这次发布让对话式AI变成了一款大众消费产品。 |
发布节奏告诉你什么
间隔越来越短。 GPT-4占据前沿位置超过一年。到2025年末,四个实验室在同一个月里发布了前沿模型,而到了2026年4月,三次发布挤进了短短8天。“哪个模型最好”这种订阅决策,保质期现在是用星期来算的。
| 时期 | 发生了什么 | 对订阅意味着什么 |
|---|---|---|
| GPT-4时代 | 一个模型占据前沿位置超过一年 | “哪个模型最好”这个选择能管好几个月 |
| 2025年11月 | 13天内四次前沿发布 | 发布周的跑分图表不再能说明任何问题 |
| 2026年4月 | Claude Opus 4.7、GPT-5.5和DeepSeek V4在8天内相继发布 | 前沿位置能在两个账单周期之间就换了主人 |
| 2024年到2026年 | DeepSeek、Kimi、Qwen、GLM和Llama从脚注变成了争夺前沿的选手 | 拉大的差距是价格,不是能力 |
发布扎堆是故意的。 各家实验室会特意赶在彼此的发布窗口里出手:2026年4月,DeepSeek V4在GPT-5.5发布一天后就落地;2025年11月,GPT-5.1打开了一个窗口期,12天后由Gemini 3 Pro和Claude Opus 4.5收尾。发布周的跑分图表在这些窗口期里就是营销弹药,这也是为什么它们几乎说明不了任何问题。
开放权重这条赛道已经不再落后。 两年时间里,DeepSeek、Kimi、Qwen、GLM和Llama从脚注变成了争夺前沿的选手,价格通常只是别人的一小部分,每种任务的最佳模型追踪的正是这些发布里谁目前占着每个任务的头把交椅。实际带来的结果,就是AI模型成本指数追踪的那道越拉越大的价格差。
从GPT-4开始,实用的结论就没变过:一次发布落地时,不要看到公告就换模型。把自己三个真实任务同时丢给新模型和你现在用的模型跑一遍;发布评估指南就是一套刚好一个小时能做完的方法。在Whizi里,新的前沿模型会出现在和旧模型同一个选择器里,所以这个对比只是一次对话,不是再订一份新订阅。
方法、来源与勘误
日期采用的是公开的发布公告日期,每加一条记录之前都会对照厂商公告和当天的媒体报道核实。如果只有月份能确切核实,词条就只显示月份,不会编造一个具体日子。预览版、等候名单和分阶段发布,日期一律按首次公开可用的公告日算。
这张表刻意只追踪重大发布,而不是每一个检查点:一次发布只有在改变了普通用户或开发者能买到、能运行、能拿来对比的东西时,才会拿到一个条目。小版本更新和悄悄的模型替换不算数。
欢迎指正,一经核实会尽快修正:如果这里的某个日期和一手来源对不上,请通过支持页面上的联系方式告诉我们,并附上来源。这个页面本来就是打算被引用的,所以准确性就是它的产品本身。
- 引用这个页面之前,先看一眼最新那条记录的日期是不是当前的。
- 发布周的跑分图表,在第三方复现出来之前都当作营销来看待。
- 换任何东西之前,先拿自己的三个任务测一遍新发布的模型。
- 预期前沿位置会在几周内就换主,选能让你跟得上这种变化的工具。
- 引用时用词条本身的日期,而不是报道日期;分阶段发布这两个日期常常不一样。
常见问题
最近一次重大AI模型发布是什么?
这份时间线里最新的一条是Z.ai的GLM-5.3,发布于2026年8月14日。这份时间线收录范围到2026年8月为止,所以在把最上面那一行当作最新之前,先确认一下这个日期。
新的AI模型多久出一次?
又快又在加速:截至2026年8月的这12个月里,前沿实验室和开放权重生态一共有22次重大发布,而且这只算得上被记进这张表的那些足够重要的发布。实际的启示是:别再为了找一个永久的赢家而费心。
ChatGPT是什么时候发布的?
2022年11月30日。那一刻,大语言模型变成了一款消费产品,这份时间线上的每一条记录,都发生在它开创的那个订阅市场之后。
每次有新东西出来,我都该换模型吗?
不用。该换模型的时机,是新模型在你反复要做的那些任务上真的赢了,而不是发布时的跑分赢了。上面链接的发布评估指南里那套一小时的评估方法,足够告诉你答案,而在一个多模型工作区里做这个测试,代价只是一次对话,不是一份新订阅。