
开源消息公布后,华为昇腾CANN迅速宣布,趋境科技基于开源推理引擎SGLang完成了Kimi K3在昇腾Atlas A3上的Day0推理适配。

其中,Kimi的技术报告也提到了“可替代的GPGPU”,这意味着K3模型本身就可以在国产通用GPU上部署。
同时,海外平台也迫不及待了。
Modal、Together AI、Nebius、DigitalOcean等六家海外推理平台已完成Day 0适配,vLLM和SGLang两大开源推理框架同步支持。

对用户来说,Day 0适配意味着有更多的选择。不一定非要用官方服务,以后在各家云平台的订阅里都能轻松买到。
与此同时,K3的47页技术报告、训练基础设施、核心算子,三件套同步公开。
根据官方资料显示,Kimi K3是一个2.8万亿参数的混合专家(MoE)模型,每个token激活1042亿参数,具备原生视觉理解能力,支持100万token的上下文窗口。
相比前代K2.5,参数规模翻了约3倍,但规模化效率提升了2.5倍。简单来说,就是同样的算力,产出的智能是原来的2.5倍。

开源协议:自定义许可,小开发者零门槛
这次Kimi K3采用自定义协议,允许研究、部署、微调和二次开发。
小开发者和研究者可以零门槛使用,只有年收入超过2000万美元的模型API服务商需要另行签署商业协议。
对于开源社区来说,Kimi K3开源的意义不止是一个更强大的模型。
它相当于把3万亿参数模型的细节摆到了明面上。任何团队都可以基于这套方法论,用自己的数据、自己的算力、自己的场景,训练出自己的前沿模型。
技术报告详细披露了四大核心架构创新:
KDA与Gated MLA混合注意力。每4层为一个block,前3层用Kimi Delta Attention(KDA)线性注意力,第4层用Gated MLA全局注意力,3:1的比例贯穿整个backbone。
KDA负责跑得快:计算量从平方级降到线性级,百万token解码速度提升6.3倍。
MLA负责看得全:保留全局token-to-token检索能力。两者互补,既解决了长上下文的效率问题,又不丢失细节。

Attention Residuals跨层信息流动。把注意力机制从序列维度扩展到了深度维度,使得每一层都可以选择性读取嵌入层和所有前置层的输出,而不是像传统残差连接那样均匀累积。
为了降低开销,Kimi K3用了Block AttnRes:93层分成8个block,block内压缩后再做全注意力,内存和通信开销从O(Ld)降到O(Nd)。
Stable LatentMoE稳定稀疏专家架构。896个路由专家,每个token只激活16个,稀疏度高达56。这正是开源模型里最大的专家池。极端稀疏下很容易出问题:激活爆炸、负载不均。
Stable LatentMoE用三个组件解决:RMSNorm归一化抑制爆炸、SiTU-GLU新激活函数加软上限、Quantile Balancing分位数负载均衡。不用辅助损失,靠动态调整专家偏置就能让每个专家精确收到目标负载。

MoonViT-V2从零训练的视觉编码器。跟行业惯例不一样,Kimi K3的视觉编码器完全从零开始,和文本一起用next-token prediction联合训练,而不是从SigLIP等对比预训练模型初始化。
原因是要训练稳定性,预训练编码器接到LLM上时梯度范数偏高还经常尖峰,从零训练反而全程平稳。结果也很有意思:在所有视觉评测上和SigLIP初始化基线持平,这说明对比预训练初始化对大规模多模态模型来说并不是必须的。
架构只是骨架,真正让模型能力强大起来的是Kimi的训练。
技术报告披露了完整的后训练三阶段范式:
第一阶段:SFT监督微调。用前一代Kimi系列的领域专用模型合成数据轨迹,多阶段验证加人工标注,为后续RL建立高质量冷启动策略。从SFT阶段就开始量化感知训练(QAT),MXFP4权重加MXFP8激活。
第二阶段:多力度强化学习。在三个大领域上扩展RL,通用任务、通用Agent、编码Agent,每个领域在三个推理力度级别(low/high/max)各训练一个专家,一共9个专家模型。RL FLOPs的缩放持续提升知识、推理、视觉、通用Agent和编码等各方面能力。
第三阶段:MOPD多教师在线蒸馏。把9个领域专用、不同推理力度的专家能力,蒸馏 consolidated 成一个统一模型。per-token OPD奖励信号无缝集成到RL框架里,自然支持部分rollout训练等基础设施优化。
硅谷反应:新一轮"DeepSeek时刻"
过去十天,从Kimi K3官宣开源到正式发布,美国媒体称之为新一轮“DeepSeek时刻”。
海外开发者大规模测试后,普遍认可其推理和代码能力。马斯克曾公开评价其“令人印象深刻”。
最近,近200家硅谷初创企业联合致信白宫,强烈反对限制中国开源模型。英伟达CEO黄仁勋也公开力挺Kimi K3。
就在前两天,老黄在X上发出人生第一推,25家企业联合署名阐述开源的重要性,名单里包括英伟达、微软、Meta、IBM、a16z、YC等,几乎囊括了硅谷的半壁江山。
现在,名单已经扩至77家。

评测表现:摸到闭源前沿
技术报告里的评测数据覆盖四大能力轴、50多个基准,对比对象包括Claude Fable 5、GPT-5.6 Sol、Claude Opus 4.8、GPT-5.5等闭源旗舰。

总体结论很明确。Kimi K3紧跟着最强闭源模型Claude Fable 5和GPT-5.6 Sol,同时全面超过Claude Opus 4.8、GPT-5.5和GLM-5.2。

这是开源模型第一次在如此全面的基准上紧跟闭源前沿的步伐。
(转载自:AI普瑞斯)
扫码下载app 最新资讯实时掌握
