aiwillknow.AI 前沿观察每日 08:00 开始整理
大模型RESEARCH BRIEF

Kimi K3

原生视觉与百万级上下文的开放模型

IN A NUTSHELL

原生多模态 K3 将 Kimi Delta Attention 与跨层 Attention Residuals 结合,以稀疏 MoE 扩展到 2.8T 参数。公开材料既讨论长程编程能力,也明确了大规模部署与缓存方面的工程要求。

01

方法与关键变化

KDA 处理注意力扩展,Attention Residuals 改变跨深度信息聚合;Stable LatentMoE 从 896 个专家中激活 16 个,并配套负载平衡和优化改进。

官方从 SFT 阶段使用量化感知训练,讨论 MXFP4 权重、MXFP8 激活及 KDA 前缀缓存。稀疏计算与低比特格式缓解成本,但总体仍是超大模型。

02

实验与证据

官方 Kernel 优化竞技场给每个模型独立 GPU 沙箱、最多 24 小时,涉及不同硬件上的多种内核。结果受推理强度、验证机制和时间预算影响,不能直接对应日常短问答表现。

03

开放情况与使用许可

官方模型页已提供权重,代码和权重采用 Kimi K3 License。日期采用中文发布页更新时间。

LICENSEKimi K3 License

04

我的判断

独立分析 · 未复现实验

正方 · 为什么值得投入

开放权重使超大模型的架构与长任务行为至少具备可研究的入口。更值得关注的是它如何分配计算和保存跨步骤信息,而非将参数规模本身当作创新。

反方 · 哪些结论还不够

稀疏激活降低的是部分计算成本,不能抹去权重存储、通信和缓存开销。长时间成功案例也可能依赖工具栈与大量尝试,无法单独归因于模型架构。

综合判断

对有分布式资源的团队有研究价值;对普通应用团队,应先用可获得的服务验证任务收益,再决定是否承担自部署复杂度。

我会先做的验证

使用同一任务集和工具栈,按墙钟时间与总花费设双重预算;比较长任务完成率、失败后恢复、峰值内存与通信瓶颈,而不是只比每秒 token。

继续探索大模型