全网都在吹的Kimi K3到底是“走个面”,还是真的强?
时间:26-07-22 来源:Kuzen笔记
全网都在吹的Kimi K3到底是“走个面”,还是真的强?
对于国内的 AI 厂商我最喜欢的是 Kimi,因为我感觉 kimi 是一个非常安静的 AI 厂商。就在今天凌晨,Kimi 搞出了一个大动作发布了自己的最新模型 K 3。时间线上全是关于 K 3 的讨论,下面我给大家分析分析,顺便谈谈我对K3的看法。
在Kimi 的技术博客明确的表示了 K 3 模型的整体性,仍然落后于最强大的专有型号 Claude Fable 5 和 GPT 5.6 Sol。(这就是我喜欢 Kimi 的地方,非常朴实低调)
首先kimi 的关于 K 3 的这个发布动画让我感觉非常有意思 ,浓浓的硅谷复古风格,充满了 Anthropic 味道。
官方对 kimi K 3 明确宣传了四个卖点

和上代比较(kimi 2.7 Code)同样为多模态模型,但总参数从 1 T 上升到 2.8 T 提升 2.8 倍,上下文窗口从 262 K 提升到 1 M 提升整整 4 倍。大总是好的!
在长度方向:引入新的注意力机制 Kimi Delta Attention 对比上一代 MLA 在百万上下文的输出速度最高提升 6.3 倍
改进的 Attention Residuals 在<2% 额外成本下提供约 25%更高的训练效率 由于上面的三个改进更加适合长时程代理式编码和自我演化工作流
简单的来说就是,能力变强了,速度可能会慢一点。
并且 kimi 将在 7 月 27 日把成品 k 3 进行开放权重,可供任何人可以下载、自己部署、微调。但这基本对个人没有意义,因为在极限量化的情况下你也需要 20 张 5090 才可能跑动这个大模型,但是介于 Deepseek R 1 开放后,蒸馏出来的 Deepseek R1 32B 等一系列的小模型先例,几个月后可能有很多 K3 蒸馏出来的小模型。
通过跑分和别的模型对比
首先是 AI 综合能力排名中,最保守的 Artificial Analysis 都对 K 3 给出了很高的排名。从图中可以看出 K 3 的这次更新直接上涨了 13 分,仅次于 GPT 5.6 SOL 、 Claude Fable 5,且差距很小就差 2 - 3 分。

在前端方面,Arena 给出的排名 K 3 已经位居第一

那么你准备好上车了么?但先别急,先看一看价格。
价格方面对比 kimi 的上一代模型 k 2.7 code 大概是涨价了 3~4 倍,是 Deepseek v 4 pro 的 16 倍,感觉有点贵,好在 Kimi 开启了限时充值活动。

当然你还可以选择 kimi Plan,我是从今年 3 月份就开始订阅了

官方明确表示对于 K 3 的模型只有 Allegretto 才能完美使用,如果是Moderato上下文仅可以达到262K。

这点对国内外的限制一样的 Moderato 上下文窗口限制均为 256k
这里又有一个有趣的现象,就是在订阅页面出现了这样一个横幅,不知道会出什么新的订阅方式。(但愿别像 GLM 那样)

如果你想尝试一下 Kimi 会员现在官方出了一个拉新活动,公众号页面发送 Kimi 获得邀请码,最高可获得 1 年的等值额度。
今天使用了一天 K 3 的实际感受,确实变得好用了,但是当上下文使用到 50% 左右时就开始出现明显的性能衰减,对比 Claude Fable 5 则通常要到 80–90% 左右,退化才变得明显。
休息的时候,看了看网上的讨论,大多数都在说 K 3 太厉害了,当然也能看到一些反对的声音。所以到底是 K 3 真的很厉害还是,K 3 商单太厉害了?不过我感觉这并不重要,从 Deepseek 到 GLM 再到今天的 K 3,可以肉眼的看到国内 AI 正在和国外的 AI 的距离正在不断的减小,相信不久的将来,国内的 Ai 一定可以和国外的 Ai 达到同一水平,甚至反超。
源自--Kuzen笔记
| 上一篇 | 下一篇 |
|---|---|
| 独家| Kimi K3震荡美股,有望最快6个月内港股... | 没有上一篇 |