
7 月 11 日,月之暗面发布了 Kimi K2。看完技术报告和社区评测,我的第一感受是:中国大模型终于到了能和全球顶级选手正面竞争的阶段。
硬核参数
Kimi K2 采用 MoE(Mixture of Experts)架构: - 总参数:1T(1 万亿) - 激活参数:32B - 上下文窗口:原生支持 128K
MoE 架构的精髓在于:模型很大(1T 参数),但每次推理只激活一小部分专家(32B)。这样既保持了强能力,又控制了推理成本和延迟。DeepSeek V3/V4 用的也是这个思路。
K2 同步开源了两个模型版本——这是最让我惊喜的。不是"开源上个版本的阉割版",而是直接把最新的 K2 放出来。
Benchmark 表现
官方给出的数据(和社区初步验证):
- 代码生成(HumanEval+):追平 GPT-5,略微领先 Claude Opus 4.8
- 数学推理(MATH 500):接近 GPT-5 水平
- 中文理解(C-Eval/CMMLU):明显领先所有美国模型
- Agent 任务:在 Tool-Use 相关的 benchmark 上表现亮眼,这得益于 MoE 架构对 instruction following 的天然优势
HuggingFace 上一个开发者评论被顶了很高:"I just ran K2 on my local setup and the code generation quality is insane for an open model."
MoE 为什么重要
我在之前的文章里写过,MoE 可能是接下来几年最重要的模型架构方向。简单说:
- Dense 模型(GPT-5 等):所有参数参与每次推理。能力上限高,但成本高。
- MoE 模型(K2、DeepSeek V4):每次推理只激活一部分参数。能力接近 Dense,但成本低得多。
Kimi K2 的 MoE 实现有几点做得特别好: 1. 专家负载均衡:没有出现某些专家过载、某些闲置的问题 2. 推理效率:32B 激活参数的推理成本,对标 GPT-5 的 400B+ Dense 推理 3. 训练稳定性:1T 参数的 MoE 训练不出 bug 本身就是实力
和 Fable 5 管制的对比
有意思的时间线:Fable 5 被管制(6 月中)→ 7 月 1 日受限回归 → Kimi K2 开源(7 月 11 日)。
这两件事没有直接关系,但放在一起看很有意思。Fable 5 代表着"最强但受限"的闭源路线,Kimi K2 代表着"接近最强且完全开放"的开源路线。
对于全球开发者来说,选择正在变得清晰:如果你不想被地缘政治和身份验证绑架,开源是唯一的路。
一个但是
Kimi K2 在 Agent 场景下的真实表现还需要更多验证。Benchmark 是一回事,在真实项目中连续运行 30 分钟不出错是另一回事。
另外,K2 的训练数据截止到什么时间、对英文任务的表现是否真的稳定、生态工具(LangChain 集成、Function Calling 兼容性)是否完善——这些问题都需要时间回答。
但不管怎么说,7 月 11 日是中国大模型的一个重要节点。从"追赶者"到"竞争者",K2 给出了一个明确的信号:差距在缩小,而且比很多人预期的更快。
参考来源:
评论
评论已关闭。