CuteNote
颜值笔记
价格
反馈
中 / EN
登录
中 / EN
登录
← 返回
生成耗时 2分37秒
耗时
查看原链接
原链接
导出脑图
导出
Bilibili
2小时4分20秒 · —
Kimi K3 技术拆解 | 长图笔记
长图
脑图
Markdown
原文
AI 问答
K3技术报告深度解析
核心结论
K3是Kimi团队推出的2.8T
参数MoE模型,融合多种架构创新
,在规模、上下文和推理效率上实现
提升。
模型概览
模型规模
总参数2.8T,激活参数约10
0B
有效scaling,参数大小决
定智能上限
上下文长度
原生支持1M token
结构创新
综合Hybrid Attent
ion、Gated MLA等
与K2差异:K2沿用DeepS
eek架构,K3新设计
注意力机制演进
线性注意力历史
从简单累加到RetNet、Ma
mba、DeltaNet、Ga
ted DeltaNet
引入位置衰减、块递归计算
K-Delta-Attentio
n
使用channel-wise衰
减,能力更强
Lower Bound Dec
ay保证数值稳定性
Gated MLA
结合Gated Attenti
on与MLA,提升训练稳定性
MLA与MQA等价,有计算冗余
ResiAttention
残差连接与深层-浅层连接
Hyper Connectio
n思想,推理几乎免费
DenseNet与Block
Attention
MoE优化与负载均衡
Latent MoE
减少token dispatc
h通信开销
降维后提升参数量弥补
Q-Bal负载均衡
基于bias的无损方案
无需调参,使用直方图统计
C-to-G激活函数
控制中间激活爆炸
将clip升级为GELU
训练策略
学习率调度
WSD vs Cosine,K
3选择Cosine
Cosine更好调参
位置编码
采用NoPE取代RoPE
长上下文易于扩展
权重初始化
从零训练,不使用已有check
point
原生方式更稳定
低精度训练
高精度预训练,SFT阶段引入低
精度
推理与分布式优化
MTP与Draft Model
利用中间层Hidden Sta
te提升接受率
与预训练强关联
Context Parallel
ism
线性注意力chunk可任意拆分
双重chunk构建大规模CP
Expert Paralleli
sm
MoE-JP动态EP,冗余专家
卡间与专家间均衡权衡
Memory Offloadin
g
bit存储,overlap通信
满足不等式条件
工程化实践
Vision Encoder优化
放在PP中间或尾部
规避负载不均衡
RL优化
Gradient Buffer
复用
Docker管理
KV Cache管理
Block-based Pre
fix Cache
混合架构需兼容处理
评价与展望
与V4对比
K3更注重规模,价格更贵
技术发展观
技术持续进步,无跳跃
未来方向
模型规模继续扩大
可能转向世界模型
首页
登录
我的