返回
查看原链接原链接
Bilibili2小时4分20秒 · —

Kimi K3 技术拆解 | 长图笔记

K3技术报告深度解析核心结论K3是Kimi团队推出的2.8T参数MoE模型,融合多种架构创新,在规模、上下文和推理效率上实现提升。模型概览模型规模总参数2.8T,激活参数约100B有效scaling,参数大小决定智能上限上下文长度原生支持1M token结构创新综合Hybrid Attention、Gated MLA等与K2差异:K2沿用DeepSeek架构,K3新设计注意力机制演进线性注意力历史从简单累加到RetNet、Mamba、DeltaNet、Gated DeltaNet引入位置衰减、块递归计算K-Delta-Attention使用channel-wise衰减,能力更强Lower Bound Decay保证数值稳定性Gated MLA结合Gated Attention与MLA,提升训练稳定性MLA与MQA等价,有计算冗余ResiAttention残差连接与深层-浅层连接Hyper Connection思想,推理几乎免费DenseNet与Block AttentionMoE优化与负载均衡Latent MoE减少token dispatch通信开销降维后提升参数量弥补Q-Bal负载均衡基于bias的无损方案无需调参,使用直方图统计C-to-G激活函数控制中间激活爆炸将clip升级为GELU训练策略学习率调度WSD vs Cosine,K3选择CosineCosine更好调参位置编码采用NoPE取代RoPE长上下文易于扩展权重初始化从零训练,不使用已有checkpoint原生方式更稳定低精度训练高精度预训练,SFT阶段引入低精度推理与分布式优化MTP与Draft Model利用中间层Hidden State提升接受率与预训练强关联Context Parallelism线性注意力chunk可任意拆分双重chunk构建大规模CPExpert ParallelismMoE-JP动态EP,冗余专家卡间与专家间均衡权衡Memory Offloadingbit存储,overlap通信满足不等式条件工程化实践Vision Encoder优化放在PP中间或尾部规避负载不均衡RL优化Gradient Buffer复用Docker管理KV Cache管理Block-based Prefix Cache混合架构需兼容处理评价与展望与V4对比K3更注重规模,价格更贵技术发展观技术持续进步,无跳跃未来方向模型规模继续扩大可能转向世界模型