跳转至

1-AI Model Architecture

Kimi K3 Report

导言

Kimi K3 是一个面向长时程智能体任务的原生多模态混合专家模型:总参数量 2.78T,每个词元激活 104.2B 参数,训练上下文最长 100 万词元。它把 Kimi Delta Attention(KDA)、Block Attention Residuals(AttnRes)和 Stable LatentMoE 放进同一套训练系统,并进一步连接原生多模态预训练、分档推理投入强化学习、量化感知后训练与大规模并行基础设施。

本文按照论文的段落和小段落顺序进行逐句翻译,保留全部 16 幅图、5 张表、编号公式、交叉引用和技术附录。为帮助第一次接触相关概念的读者,额外说明均放在明确标记的“小白提示”中,不与原论文观点混写。

Attention Architecture Evolution

导言

Attention 的发展并不是从 Full Attention 排成一条单向淘汰链。更准确的结构是三条并行路线:共享或压缩 KV cache、把历史压入固定状态、对历史 token 做稀疏选择。MQA、GQA 与 MLA 仍然读取全部历史;GDN 与 KDA 改写了记忆算法;DSA 则在 MLA 前增加轻量索引器,只让主注意力读取 top-k。

本文以首个公开论文或官方发布日为时间点,并把每种结构落到版本固定的开源代码:Q/K/V 从哪里产生、什么对象进入 cache、score 如何形成、复杂度到底被搬到了哪里。

Scaling Law

导言

Scaling Law 不只是“模型越大越好”的经验总结,而是一套算力预算分配语言:在固定训练预算下,参数量、训练数据、序列长度和训练时长互相竞争;在固定推理预算下,模型大小、生成 token、采样策略、工具调用和 agent rollout 也互相竞争。本文只记录论文中可追溯的公开披露;没有披露的数据明确标为“未披露”,不从参数规模反推训练成本。